AI 落地中,多少人工监督才是最优解?

2026-09-07 09:00:00
翰德恩咨询
原创
83
摘要:本章基于 51 个落地案例探讨 AI 部署中的人工监督尺度:企业 API 调用 77% 为自动化,与个人使用偏好相反。最优人机配比并无定式,需按任务风险与价值主动设计——监督太少易出错,太多又拖慢效率。

审视各类 AI 部署中的人工参与程度

已有研究发现

企业与个人的使用模式并不相同。 Anthropic 的经济指数发现,个人用户在 Claude.ai 上的使用中,52% 属于”人机协作”,45% 属于”完全自动化”;而企业 API 调用呈现出相反的模式:77% 为自动化。这说明企业与个人使用 AI 的方式存在差异,但最优的平衡点目前仍不明确 。

结构化的人工监督与成功高度相关。 麦肯锡的报告显示,65% 的 AI 高绩效组织已经建立起明确的”人机协同(human-in-the-loop)“流程,用以判断模型输出在何时、以何种方式需要人工核验,而其他组织中这一比例仅为 23%——差距近三倍 。

我们的发现

采用”升级式”运营模式(AI 自主处理80%以上的工作,人工只审核例外情况)的项目,生产率提升幅度最高,中位数达到 71%。这在一定程度上也反映了任务本身的选择差异:升级模式通常应用于高频、可容错的任务,而审批制和协作制模式则更多用于受监管或高风险的工作。人工监督的程度,取决于容错空间、监管要求和任务复杂度,往往是一种战略性的设计选择,而不是能力上的局限。

发现1:适度的人工监督,往往对应着最高的生产率提升

我们基于人工参与程度,将每个案例划分为三个层级:

  • 升级式(Escalation)—— AI 自主处理80%以上的工作;人工只审核例外情况,或抽样审核不超过20%
  • 审批式(Approval)—— AI 完成工作,人工在每次行动前审核并批准每一项输出
  • 协作式(Collaboration)—— 人与 AI 就每项任务持续协同工作
划分层级
“现在90%到95%的工单已经由智能体全自动处理了。如果有人反馈说他们的食物没送到,或者订单出了什么问题,其中90%到95%的问题都是全自动处理的。” ——某外卖平台公司 AI 负责人

发现2:最优的监督程度,因职能而异

合适的人工监督程度(HITL,人机协同)取决于容错空间、监管要求和任务复杂度。

职能 典型 HITL 层级 平均提升幅度
IT 运维 升级式 90%
客户支持 升级式 71%
理赔处理 升级式 50%
现场服务 审批式 80%
临床文档记录 审批式 66%
编码开发 协作式 54%

在客户支持领域,一家科技公司通过围绕 AI 首次响应解决率重新设计工作流,实现了 82% 的工单拦截率。在临床文档记录领域,由于涉及法律文件,医生必须审批每一份 AI 生成的病历。在编码开发领域,工程师的角色已经从”编写代码”转变为”审核 AI 生成的改动”。

“与其让工程师完成整个迁移任务,不如让他们直接审核改动、做些微调,然后合并他们的 PR(拉取请求)。” ——某拉美金融科技公司工程负责人

发现3:什么情况下,人工监督显然是更优选择

人工监督并不代表 AI 还不够成熟。在许多场景下,它恰恰是战略上正确的设计选择。我们发现了四种人工参与能创造明确价值的模式:

零容错场景: 当一次失误的代价,远远超过成千上万次正确输出所带来的收益时,人工审核就是不可或缺的。面向大品牌的营销内容、法律文件、面向客户的沟通材料,都属于这一类别。

“我不能容忍一场有错误的营销活动。我不能在触达数百万客户的大规模营销活动中,容忍任何不确定性。” ——某企业级 AI 公司战略负责人

监管要求:在医疗、金融等受监管行业,无论 AI 能力如何,人工审核都是法律强制要求。问题不在于 AI 能不能胜任这项工作,而在于监管机构是否接受由 AI 来完成这项工作。

“医生审核、批准之后,病历才会被送回电子病历系统(EMR)。出于法律要求,医生必须审核每一份病历。” ——某医疗 AI 公司高管

企业风险管理:即便全自动化在技术上完全可行,大型组织仍然更倾向于选择人机协同的方案——自主 AI 的感知风险,往往超过了效率提升所带来的收益。

持续改进:人工审核者能识别出 AI 出错的模式,并将其反馈进模型优化,这种反馈闭环所带来的学习加速效果,是完全自动化系统无法比拟的。

案例研究 :一家金融服务公司的营销内容生产

他们如何校准人工监督的比例 金融服务 | 市场营销 | 企业级

公司背景

一家金融服务公司面临内容生产瓶颈:他们拥有支持高度个性化营销所需的客户数据,却始终无法以足够快的速度生成内容来充分利用这些数据。传统代理商的工作流程,做一次营销活动就要耗时七周。

解决方案

公司部署了一套 AI 平台,能够在保持品牌一致性的同时生成多渠道内容。团队选择了 80/20 的模式:AI 负责80%的内容生成,人工负责20%的精修与质量把关。随着技术不断成熟、经验持续积累,交给 AI 处理的比例最终会趋向100%。

人工监督如何促成了这次成功

这个划分是刻意为之的——企业级营销内容面向客户,绝不能容忍任何差错。

“要在企业级规模上运转,你需要80%的技术加上20%的人工精修。AI 行业目前还没有成熟到能独立搞定最后那20%。” ——某企业级 AI 公司战略负责人

人工这一环发挥了三个作用:

  • 品牌保护——防止出现可能损害多年品牌建设成果的错误。
  • 边缘案例处理——处理需要主观判断的不寻常组合情况。
  • 反馈闭环——审核人员识别出的规律,被用于持续改进 AI 的输出质量。
作用

成果

指标 结果
上市时间 从7周降至6小时
点击率 提升2倍
生产效率 时间节约超过80%

关键经验

人工监督并不是对生产率的一种”税负”。80/20 模式在保持零容错标准的同时,将上市时间缩短了97.6%。

监督程度应当与风险高低相匹配。该公司将20%的人工环节视为一种”过渡性安排”,预计会随着 AI 能力的提升而逐步缩减,但他们选择的是”先用行之有效的方案起步”,而不是坐等”完美自动化”的到来。


相关课程:

联系我们
联系人: 田老师
电话: +86 135 5227 9573
Email: clientservice@hardenx.cn
地址: 北京市朝阳区福码大厦B座17层1705

加微领1G资料