FDE 实战方法
第六步:使用真实样本评测
FDE 八步法第六步:用真实业务样本评测效果,用数据说话,而不是凭感觉。
先说结论
Demo 里跑通 3 个例子不算数。要收集几十上百个真实样本,测出完成率和错误率,才知道方案到底行不行。
企业工作示例
合同审查助手项目。团队收集了 80 份历史合同做测试,发现:常见条款问题 AI 识别率很高,但"补充协议与主合同冲突"这类问题经常漏检。于是调整方案:AI 负责常规条款筛查,补充协议必须人工复核。如果不做真实样本评测,这个坑要到出事故才会暴露。
操作步骤
- 收集真实样本:向业务部门要 30-100 个历史真实案例,覆盖常见情况和典型边界情况。
- 标注标准答案:请业务专家给出每个样本的正确结果。
- 跑批量测试:让 MVP 处理所有样本,记录每一个的结果。
- 算指标:完成率、错误率、节省时间,和第四步定的成功指标对照。
- 分析错误:把错误分类——是数据问题、规则问题,还是 AI 能力边界问题。
评测要看什么
| 看什么 | 为什么 |
|---|---|
| 完成率 | AI 能独立处理的比例 |
| 错误率 | 出错的比例,以及错误的严重程度 |
| 错误类型 | 决定是改 prompt、改流程,还是加人工环节 |
| 节省时间 | 和基准值对比,验证业务价值 |
模板见 真实样本评测表。
常见错误
- 用编造的数据测试:编的数据太干净,测不出真问题。
- 只测成功案例:专挑 AI 答得好的例子,自欺欺人。
- 没有标准答案:没法判断对错,评测就失去意义。
- 测完不改进:评测的目的是找到改进方向,不是给自己打分。
检查清单
- 测试样本来自真实业务,数量足够(至少 30 个)
- 每个样本有业务专家确认的标准答案
- 记录了完成率、错误率和错误分类
- 评测结果和预先定义的成功指标做了对照
- 根据错误分析制定了改进措施