# 博客

评测、落地与交付过程里值得公开写下来的判断。

- [演示过了、生产挂了：最后一公里通常死在哪](/blog/last-mile-why-demos-die)：演示环境没有真实权限、没有回归、没有人接管。上线当天这三件事一起出现。最后一公里清单就是把它们在试点结束前逐条过完。
- [用 AI-LMM 判断自己在哪一级，再决定先做什么](/blog/ai-lmm-self-check)：L0 还在试用，L2 才把智能体嵌进流程。跨级采购会买错东西：L0 企业去买多智能体平台，通常变成又一次演示。先评分，再选服务。
- [采购智能体不要看 Token 单价，看 CPRT](/blog/cprt-not-token-price)：每百万 Token 便宜，解决不了一个真实任务也可能更贵。单位任务成本（CPRT）把模型、人工接管、返工和基础设施算进同一口径，才能写进合同。
- [企业场景评测集怎么写：样本、失败类、门槛](/blog/how-to-write-an-eval-set)：评测集不是提示词合集。它要有真实历史样本、业务不能错的失败类，以及可以重复跑的通过门槛。写不清楚这三样，智能体就没有验收口径。
- [FDE、项目制外包和直接买 SaaS 怎么选](/blog/fde-vs-outsourcing-vs-saas)：要的是席位就买 SaaS，要的是一次交付物就找外包，要把智能体留在自己流程里并持续评测，才需要 FDE。选错了会在试点中途换合同。
- [为什么必须先写评测集再写智能体](/blog/why-eval-set-first)：没有评测集的智能体只能演示，不能上线。评测集先冻结失败样本和通过门槛，智能体才能按同一口径被验收、回归和移交。
