Prompt Asset & Evaluation Platform
正式版 v1.0PromptDeck
PromptDeck 是面向 AI 团队的提示词资产与评测平台。今天大多数团队的 prompt 散落在代码常量、笔记软件和聊天记录里:改一个字没有回归测试,效果好坏靠手感,上线即赌博。PromptDeck 把 prompt 升级为受版本管理的工程资产——每次修改都有 git 式 diff,每个版本都能在自建 case 集上跑评测,评分下降直接在 CI 阻断合并。支持本地 Ollama 与云端 Claude API 多模型对比,全套可私有化部署。
进入控制台 →正式版 v1.0
我们解决的问题
- ✗Prompt 散落在代码 / 笔记 / 聊天记录里,没有单一事实源
- ✗改动无回归测试,「感觉变好了」就上线
- ✗换模型 / 升级模型后效果回退无法量化
- ✗评测数据涉密,不能上传第三方 SaaS
核心功能
Prompt 版本管理
git 式历史与逐字 diff,每个 prompt 是一等公民资产,支持分支与回滚。
数据集驱动评测
自建 case 集(输入 + 期望行为),LLM Judge 自动打分,输出可追溯的评测报告。
多模型对比
同一 prompt 同一数据集,本地 Ollama(qwen / deepseek-r1)与云端 Claude API 并排跑分。
回归门禁
CI 集成:PR 触发评测,总分低于基线即阻断合并,prompt 改动从此有安全网。
评测 Worker 队列
评测任务异步排队执行,大 case 集不阻塞控制台,进度与失败重试可观测。
私有化部署
Docker Compose 一键起,全部数据落在你自己的 PostgreSQL,推理可全程走内网 GPU。
系统架构
自上而下的请求路径
控制台层
Next.js
Prompt 编辑、diff 视图、评测报告与对比看板
↓
API 层
FastAPI
版本管理 / 评测编排 / CI Webhook 门禁接口
↓
推理层
Ollama (RTX 5090 本地) + Claude API
本地模型私有评测,云端模型对照基线
↓
数据层
PostgreSQL + Worker 队列
prompt 版本、case 集与评测记录持久化;评测任务异步执行
技术栈
Next.js 15 控制台FastAPI 服务端PostgreSQL 数据存储Ollama 本地推理(qwen / deepseek-r1)Claude API 云端对照评测 Worker 队列
定价方向
内测期
免费
受邀团队全功能使用,换取真实评测场景反馈
团队订阅
按席位订阅(规划中)
托管版按团队席位计费,含评测额度
私有化授权
年度授权(规划中)
部署进客户内网,对接客户自有 GPU 与模型