Prompt Asset & Evaluation Platform

正式版 v1.0

PromptDeck

PromptDeck 是面向 AI 团队的提示词资产与评测平台。今天大多数团队的 prompt 散落在代码常量、笔记软件和聊天记录里:改一个字没有回归测试,效果好坏靠手感,上线即赌博。PromptDeck 把 prompt 升级为受版本管理的工程资产——每次修改都有 git 式 diff,每个版本都能在自建 case 集上跑评测,评分下降直接在 CI 阻断合并。支持本地 Ollama 与云端 Claude API 多模型对比,全套可私有化部署。

进入控制台正式版 v1.0

我们解决的问题

  • Prompt 散落在代码 / 笔记 / 聊天记录里,没有单一事实源
  • 改动无回归测试,「感觉变好了」就上线
  • 换模型 / 升级模型后效果回退无法量化
  • 评测数据涉密,不能上传第三方 SaaS

核心功能

Prompt 版本管理

git 式历史与逐字 diff,每个 prompt 是一等公民资产,支持分支与回滚。

数据集驱动评测

自建 case 集(输入 + 期望行为),LLM Judge 自动打分,输出可追溯的评测报告。

多模型对比

同一 prompt 同一数据集,本地 Ollama(qwen / deepseek-r1)与云端 Claude API 并排跑分。

回归门禁

CI 集成:PR 触发评测,总分低于基线即阻断合并,prompt 改动从此有安全网。

评测 Worker 队列

评测任务异步排队执行,大 case 集不阻塞控制台,进度与失败重试可观测。

私有化部署

Docker Compose 一键起,全部数据落在你自己的 PostgreSQL,推理可全程走内网 GPU。

系统架构

自上而下的请求路径

控制台层
Next.js

Prompt 编辑、diff 视图、评测报告与对比看板

API 层
FastAPI

版本管理 / 评测编排 / CI Webhook 门禁接口

推理层
Ollama (RTX 5090 本地) + Claude API

本地模型私有评测,云端模型对照基线

数据层
PostgreSQL + Worker 队列

prompt 版本、case 集与评测记录持久化;评测任务异步执行

技术栈

Next.js 15 控制台FastAPI 服务端PostgreSQL 数据存储Ollama 本地推理(qwen / deepseek-r1)Claude API 云端对照评测 Worker 队列

定价方向

内测期
免费

受邀团队全功能使用,换取真实评测场景反馈

团队订阅
按席位订阅(规划中)

托管版按团队席位计费,含评测额度

私有化授权
年度授权(规划中)

部署进客户内网,对接客户自有 GPU 与模型

你的 prompt 值得有回归测试

内测名额有限,优先开放给已有线上 LLM 业务的团队。

申请内测