准确率只是开始
准确率回答的是“模型对不对”;用户真正关心的却是“我能不能靠它把工作做完”。例如,一个客户分级助手即使判断大多数样本正确,如果用户还要花五分钟找来源、核对规则、重写结论,它就没有真正减少工作。
因此,验收要从任务出发。挑选一个有明确完成条件的工作单元:是否生成了一份能直接提交的摘要?是否正确路由了一张工单?是否让用户在既定时间内完成了原本的判断?这些比泛泛的“回答得好不好”更接近交付价值。
第一层:任务
定义一个真实的完成标准,并在真实样本与真实使用者中验证它是否达成。
采用率告诉你它有没有进入工作
用户打开过工具,不等于用户依赖它。请记录建议被查看、接受、修改、忽略和覆盖的比例,并结合具体场景讨论原因。高频修改可能表示信息不完整;从不打开则可能意味着入口放错了位置;全盘接受也需要检查是否存在盲目信任。
采用数据最好跟着工作流走,而不是单独做一份调查问卷。用户在何时看到建议、是否能一键带入原系统、需要几步才能纠正,往往比“满意吗”的答案更有行动意义。
风险不是上线后的补丁
在第一版中就明确人工边界:哪些类型的请求禁止自动处理,证据不足时如何表达不确定性,用户怎样快速纠正,以及被纠正的记录如何进入复盘。风险控制不是把模型变得什么都不说,而是让它在不该替人做决定时清楚地让出位置。
- A任务完成率:用户是否完成了要做的实际工作?
- B建议采纳率:推荐有没有成为最终动作的一部分?
- C人工升级率:哪些情况必须由人接手,是否可控?
这三项放在一起,才能形成一个最小的 Agent 验收看板:价值是否出现、用户是否愿意使用、风险是否被妥善管理。