Eval-Driven
评测驱动交付
评测驱动交付(Eval-Driven Delivery)的规则只有一句:先写评测集再写智能体。没有评测集,不允许上线。
最后更新: · 章鱼派 OctopAI
为什么先做 demo 会失败
demo 优化的是观感,评测集优化的是可重复的对错。两者冲突时,没有评测的项目会把提示词调到「领导满意」为止,一换数据就回原形。所以章鱼派把评测集当作上线门禁,而不是上线后补的作业。
怎么做
- 写「任务完成」的操作定义,避免「看起来聪明」这种验收
- 用真实历史样本组成评测集,覆盖失败案例
- 约定 SLO:成功率、一次通过率、接管率、P95、CPRT
- 先达到门槛再写智能体;之后每次改动必须回归
单位任务成本(CPRT)
CPRT(Cost per Resolved Task)= 在约定时间内,成功解决一个真实任务所花费的全部人民币:模型费用、工具调用、人工接管、返工。Token 单价低但接管率高,CPRT 仍然高。合同与复盘都用 CPRT,不用「每百万 Token」。
智能体 SLO 五指标
| 指标 | 含义 | 变坏时说明什么 |
|---|---|---|
| 任务成功率 | 评测集上判定为做对的比例 | 能力不够或评测口径漂了 |
| 一次通过率 | 无需人工修改即完成 | 智能体只会起草、不会收口 |
| 人工接管率 | 必须交给人的比例 | 自动化边界画错了 |
| P95 时延 | 用户可感知等待 | 工具链或模型选型不合适 |
| CPRT | 做对一个任务的总成本 | 省 Token 但费人,或返工太多 |
常见问题
- 什么是评测驱动交付?
- 评测驱动交付(Eval-Driven Delivery)要求先写评测集再写智能体。没有评测集,不允许上线。
- 什么是单位任务成本 CPRT?
- CPRT(Cost per Resolved Task)是解决一个真实任务的总成本:模型、工具调用、人工接管、返工。它替代「每百万 Token 单价」作为采购口径。
- 评测集要多大?
- 试点阶段以「能代表失败模式」为准,通常几十到几百条真实样本,而不是上万条合成题。数量可以以后加,口径不能以后改。