Eval-Driven

评测驱动交付

评测驱动交付(Eval-Driven Delivery)的规则只有一句:先写评测集再写智能体。没有评测集,不允许上线。

最后更新: · 章鱼派 OctopAI

为什么先做 demo 会失败

demo 优化的是观感,评测集优化的是可重复的对错。两者冲突时,没有评测的项目会把提示词调到「领导满意」为止,一换数据就回原形。所以章鱼派把评测集当作上线门禁,而不是上线后补的作业。

怎么做

  1. 写「任务完成」的操作定义,避免「看起来聪明」这种验收
  2. 用真实历史样本组成评测集,覆盖失败案例
  3. 约定 SLO:成功率、一次通过率、接管率、P95、CPRT
  4. 先达到门槛再写智能体;之后每次改动必须回归

单位任务成本(CPRT)

CPRT(Cost per Resolved Task)= 在约定时间内,成功解决一个真实任务所花费的全部人民币:模型费用、工具调用、人工接管、返工。Token 单价低但接管率高,CPRT 仍然高。合同与复盘都用 CPRT,不用「每百万 Token」。

智能体 SLO 五指标

指标含义变坏时说明什么
任务成功率评测集上判定为做对的比例能力不够或评测口径漂了
一次通过率无需人工修改即完成智能体只会起草、不会收口
人工接管率必须交给人的比例自动化边界画错了
P95 时延用户可感知等待工具链或模型选型不合适
CPRT做对一个任务的总成本省 Token 但费人,或返工太多

常见问题

什么是评测驱动交付?
评测驱动交付(Eval-Driven Delivery)要求先写评测集再写智能体。没有评测集,不允许上线。
什么是单位任务成本 CPRT?
CPRT(Cost per Resolved Task)是解决一个真实任务的总成本:模型、工具调用、人工接管、返工。它替代「每百万 Token 单价」作为采购口径。
评测集要多大?
试点阶段以「能代表失败模式」为准,通常几十到几百条真实样本,而不是上万条合成题。数量可以以后加,口径不能以后改。

预约 30 分钟诊断