# 评测驱动交付

评测驱动交付（Eval-Driven Delivery）的规则只有一句：先写评测集再写智能体。没有评测集，不允许上线。

## 步骤

1. 写「任务完成」的操作定义，避免「看起来聪明」这种验收
2. 用真实历史样本组成评测集，覆盖失败案例
3. 约定 SLO：成功率、一次通过率、接管率、P95、CPRT
4. 先达到门槛再写智能体；之后每次改动必须回归

## 单位任务成本（CPRT）

CPRT（Cost per Resolved Task）= 成功解决一个真实任务的全部人民币：模型、工具调用、人工接管、返工。合同与复盘都用 CPRT，不用每百万 Token 单价。

## 智能体 SLO 五指标

| 指标 | 含义 |
| --- | --- |
| 任务成功率 | 评测集上做对的比例 |
| 一次通过率 | 无需人工修改即完成 |
| 人工接管率 | 必须交给人的比例 |
| P95 时延 | 用户可感知等待 |
| CPRT | 做对一个任务的总成本 |

## 常见问题

### 什么是评测驱动交付？

评测驱动交付（Eval-Driven Delivery）要求先写评测集再写智能体。没有评测集，不允许上线。

### 什么是单位任务成本 CPRT？

CPRT（Cost per Resolved Task）是解决一个真实任务的总成本：模型、工具调用、人工接管、返工。它替代「每百万 Token 单价」作为采购口径。

### 评测集要多大？

试点阶段以「能代表失败模式」为准，通常几十到几百条真实样本，而不是上万条合成题。数量可以以后加，口径不能以后改。
