AI 落地中,多少人工监督才是最优解?
- 2026-09-07 09:00:00
- 翰德恩咨询 原创
- 82
审视各类 AI 部署中的人工参与程度
已有研究发现
企业与个人的使用模式并不相同。 Anthropic 的经济指数发现,个人用户在 Claude.ai 上的使用中,52% 属于”人机协作”,45% 属于”完全自动化”;而企业 API 调用呈现出相反的模式:77% 为自动化。这说明企业与个人使用 AI 的方式存在差异,但最优的平衡点目前仍不明确 。
结构化的人工监督与成功高度相关。 麦肯锡的报告显示,65% 的 AI 高绩效组织已经建立起明确的”人机协同(human-in-the-loop)“流程,用以判断模型输出在何时、以何种方式需要人工核验,而其他组织中这一比例仅为 23%——差距近三倍 。
我们的发现
采用”升级式”运营模式(AI 自主处理80%以上的工作,人工只审核例外情况)的项目,生产率提升幅度最高,中位数达到 71%。这在一定程度上也反映了任务本身的选择差异:升级模式通常应用于高频、可容错的任务,而审批制和协作制模式则更多用于受监管或高风险的工作。人工监督的程度,取决于容错空间、监管要求和任务复杂度,往往是一种战略性的设计选择,而不是能力上的局限。
发现1:适度的人工监督,往往对应着最高的生产率提升
我们基于人工参与程度,将每个案例划分为三个层级:
- 升级式(Escalation)—— AI 自主处理80%以上的工作;人工只审核例外情况,或抽样审核不超过20%
- 审批式(Approval)—— AI 完成工作,人工在每次行动前审核并批准每一项输出
- 协作式(Collaboration)—— 人与 AI 就每项任务持续协同工作
“现在90%到95%的工单已经由智能体全自动处理了。如果有人反馈说他们的食物没送到,或者订单出了什么问题,其中90%到95%的问题都是全自动处理的。” ——某外卖平台公司 AI 负责人
发现2:最优的监督程度,因职能而异
合适的人工监督程度(HITL,人机协同)取决于容错空间、监管要求和任务复杂度。
| 职能 | 典型 HITL 层级 | 平均提升幅度 |
| IT 运维 | 升级式 | 90% |
| 客户支持 | 升级式 | 71% |
| 理赔处理 | 升级式 | 50% |
| 现场服务 | 审批式 | 80% |
| 临床文档记录 | 审批式 | 66% |
| 编码开发 | 协作式 | 54% |
在客户支持领域,一家科技公司通过围绕 AI 首次响应解决率重新设计工作流,实现了 82% 的工单拦截率。在临床文档记录领域,由于涉及法律文件,医生必须审批每一份 AI 生成的病历。在编码开发领域,工程师的角色已经从”编写代码”转变为”审核 AI 生成的改动”。
“与其让工程师完成整个迁移任务,不如让他们直接审核改动、做些微调,然后合并他们的 PR(拉取请求)。” ——某拉美金融科技公司工程负责人
发现3:什么情况下,人工监督显然是更优选择
人工监督并不代表 AI 还不够成熟。在许多场景下,它恰恰是战略上正确的设计选择。我们发现了四种人工参与能创造明确价值的模式:
零容错场景: 当一次失误的代价,远远超过成千上万次正确输出所带来的收益时,人工审核就是不可或缺的。面向大品牌的营销内容、法律文件、面向客户的沟通材料,都属于这一类别。
“我不能容忍一场有错误的营销活动。我不能在触达数百万客户的大规模营销活动中,容忍任何不确定性。” ——某企业级 AI 公司战略负责人
监管要求:在医疗、金融等受监管行业,无论 AI 能力如何,人工审核都是法律强制要求。问题不在于 AI 能不能胜任这项工作,而在于监管机构是否接受由 AI 来完成这项工作。
“医生审核、批准之后,病历才会被送回电子病历系统(EMR)。出于法律要求,医生必须审核每一份病历。” ——某医疗 AI 公司高管
企业风险管理:即便全自动化在技术上完全可行,大型组织仍然更倾向于选择人机协同的方案——自主 AI 的感知风险,往往超过了效率提升所带来的收益。
持续改进:人工审核者能识别出 AI 出错的模式,并将其反馈进模型优化,这种反馈闭环所带来的学习加速效果,是完全自动化系统无法比拟的。
案例研究 :一家金融服务公司的营销内容生产
他们如何校准人工监督的比例 金融服务 | 市场营销 | 企业级
公司背景
一家金融服务公司面临内容生产瓶颈:他们拥有支持高度个性化营销所需的客户数据,却始终无法以足够快的速度生成内容来充分利用这些数据。传统代理商的工作流程,做一次营销活动就要耗时七周。
解决方案
公司部署了一套 AI 平台,能够在保持品牌一致性的同时生成多渠道内容。团队选择了 80/20 的模式:AI 负责80%的内容生成,人工负责20%的精修与质量把关。随着技术不断成熟、经验持续积累,交给 AI 处理的比例最终会趋向100%。
人工监督如何促成了这次成功
这个划分是刻意为之的——企业级营销内容面向客户,绝不能容忍任何差错。
“要在企业级规模上运转,你需要80%的技术加上20%的人工精修。AI 行业目前还没有成熟到能独立搞定最后那20%。” ——某企业级 AI 公司战略负责人
人工这一环发挥了三个作用:
- 品牌保护——防止出现可能损害多年品牌建设成果的错误。
- 边缘案例处理——处理需要主观判断的不寻常组合情况。
- 反馈闭环——审核人员识别出的规律,被用于持续改进 AI 的输出质量。

成果
| 指标 | 结果 |
| 上市时间 | 从7周降至6小时 |
| 点击率 | 提升2倍 |
| 生产效率 | 时间节约超过80% |
关键经验
人工监督并不是对生产率的一种”税负”。80/20 模式在保持零容错标准的同时,将上市时间缩短了97.6%。
监督程度应当与风险高低相匹配。该公司将20%的人工环节视为一种”过渡性安排”,预计会随着 AI 能力的提升而逐步缩减,但他们选择的是”先用行之有效的方案起步”,而不是坐等”完美自动化”的到来。
相关课程:
| 联系人: | 田老师 |
|---|---|
| 电话: | +86 135 5227 9573 |
| Email: | clientservice@hardenx.cn |
| 地址: | 北京市朝阳区福码大厦B座17层1705 |
加微领1G资料