FDE← 返回知识文章

KNOWLEDGE NOTE 02 · QUALITY · 5 MIN

验收一个 Agent:别只盯着准确率

离线评估中的高分,不能自动换来现场的可用性。真正进入工作流的 Agent,还必须同时经受任务、采用和风险三层考验。

FDE KNOWLEDGE NOTESQUALITYUPDATED 2026.07

准确率只是开始

准确率回答的是“模型对不对”;用户真正关心的却是“我能不能靠它把工作做完”。例如,一个客户分级助手即使判断大多数样本正确,如果用户还要花五分钟找来源、核对规则、重写结论,它就没有真正减少工作。

因此,验收要从任务出发。挑选一个有明确完成条件的工作单元:是否生成了一份能直接提交的摘要?是否正确路由了一张工单?是否让用户在既定时间内完成了原本的判断?这些比泛泛的“回答得好不好”更接近交付价值。

第一层:任务

定义一个真实的完成标准,并在真实样本与真实使用者中验证它是否达成。

采用率告诉你它有没有进入工作

用户打开过工具,不等于用户依赖它。请记录建议被查看、接受、修改、忽略和覆盖的比例,并结合具体场景讨论原因。高频修改可能表示信息不完整;从不打开则可能意味着入口放错了位置;全盘接受也需要检查是否存在盲目信任。

采用数据最好跟着工作流走,而不是单独做一份调查问卷。用户在何时看到建议、是否能一键带入原系统、需要几步才能纠正,往往比“满意吗”的答案更有行动意义。

风险不是上线后的补丁

在第一版中就明确人工边界:哪些类型的请求禁止自动处理,证据不足时如何表达不确定性,用户怎样快速纠正,以及被纠正的记录如何进入复盘。风险控制不是把模型变得什么都不说,而是让它在不该替人做决定时清楚地让出位置。

这三项放在一起,才能形成一个最小的 Agent 验收看板:价值是否出现、用户是否愿意使用、风险是否被妥善管理。