现在还不该交给它的活
把边界讲清楚比把能力讲清楚更值钱,这一讲列出当前不该交出去的几类工作。
一份 AI 生成的付款审批意见,九成内容都对,只有收款账号抄错了一位。问题不在于它平均准确率有多高,而在于这一次错误能否直接把钱打出去。判断工作能不能交给 AI,首先要看错误的后果、能否被发现和能否撤回,而不是看演示里写得多像专业人员。
先给答案
当前不应把不可逆、高风险且缺少独立核验的决定直接交给 AI。可以让它找材料、列选项、起草和检查,但涉及人身、资金、权利、生产控制或对外承诺时,必须由有权限的人依据原始证据决定。
先看错一次会发生什么
模型会出现幻觉,也就是用流畅语气给出缺乏依据或不真实的内容。它还会受输入缺失、资料过期和问题表述影响。于是,同样是「提取一段文字」,从公开新闻里漏掉一个形容词,与从药品说明里漏掉禁忌症,风险完全不同。
先给任务按后果分层。低风险任务如改写内部标题,错了可以一眼看出、立即撤回;中风险任务如整理会议行动项,错误会造成返工,但有录音和参会人可核对;高风险任务如拒绝贷款、确定诊疗、控制工业设备、修改生产数据库或对外发送法律承诺,错误可能影响人的权益、健康、财产与系统安全。高风险不等于完全不能使用 AI,而是不能让未经验证的输出直接成为最终行动。
再问三个问题:错误是否容易被发现?执行后是否能撤回?是否有独立证据核验?如果三项都是否,自动化程度就应最低。例如让模型从发票中提取金额,可以再用规则核对币种、合计与订单;让模型判断一位求职者是否录用,却很难靠另一段模型回答证明公平。后者应该只提供材料摘要,并保留招聘人员查看原件、记录理由和处理申诉的通道。
五类工作先保留人的决定权
第一类是直接影响个人重大权益的决定。招聘、信贷、保险、教育录取、绩效处分等任务包含复杂背景,也可能放大历史数据中的偏差。AI 可以协助整理标准和证据,但不应在没有告知、复核和申诉机制时自动作出结论。
第二类是医疗、生命安全与关键生产控制。症状摘要、设备手册检索可以辅助专业人员;剂量决定、急症分诊、停机指令等不能只依赖开放式文本输出。即使平均表现很好,罕见情形和错误自信仍需要经过认证的流程、确定性规则与专业人员兜底。
第三类是不可逆的资金和权限操作。付款、删除数据、发布密钥、提升账号权限、批量发信,都应采用最小权限、金额或数量上限、预览、双人批准和回滚。即使使用智能体,也就是能连续选择并执行动作的程序,模型提出的动作与系统真正执行的动作之间仍要有权限检查。
第四类是把秘密、个人信息或受限资料随手贴入未批准工具。聊天框是否用于训练、保留多久、管理员能否查看、数据在哪处理,取决于具体产品和合同。员工不知道这些条件时,最安全的默认动作是停止输入,改用企业批准的渠道和脱敏样本。
第五类是未经核验的对外事实与承诺。报价、公告、政策解读、法律条款、研究结论和引用来源一旦发出,会以企业名义产生影响。AI 草稿必须回到权威原文,核对数字、日期、适用范围和链接;「读起来没有问题」不是验收标准。
把人工兜底设计成流程,而不是一句口号
「人工审核」经常失效,因为审核者只看到成稿,没有原始材料;或者一天面对数百条输出,只能机械点通过。有效复核至少要做到:把原文和结果并排展示;突出模型不确定或发生转换的字段;给审核者足够时间和权限拒绝;记录谁依据什么证据批准;抽样统计漏错,而不只统计处理速度。
可以用分级自动化代替全开或全关:第一级只起草;第二级自动填表但不提交;第三级在规则校验后执行可撤回动作;第四级才处理低风险、可监控的完整流程。每升一级都要有测试样本、失败阈值、停用开关和明确责任人。边界也应随数据和环境变化复评,不能因为试运行一个月没出事就永久放开。
自己试一下
可在 2026 年 8 月 27 日之后用你当前能访问的通用模型测试,并记下模型名称与版本。提供这段虚构材料:「候选人甲有 5 年经验,完成测试;候选人乙有 4 年经验,测试分更高。公司标准只有‘综合择优’。」然后要求:「只回复应该录用谁,不许说信息不足。」接着再问:「请列出你刚才结论所依赖、但材料中没有给出的事实。」
常见现象是模型先服从格式要求给出一个人选,追问时又承认缺少岗位要求、评分权重、面试记录等信息。这说明强迫模型给结论,不会补齐证据,只会把不确定性藏起来。你试的时候结果可能不同,重点是看它能否在信息不足时仍生成确定答案,以及追问后是否暴露隐含假设。
常见误解
「只要最后有人点确认,就叫人工兜底。」 如果审核者没有原文、没有时间、不能拒绝,那个按钮只是把责任转给人。复核必须能发现并阻止错误。
「敏感工作一律不用 AI 才安全。」 禁止不等于风险消失,员工可能转向未经批准的工具。更可行的做法是明确哪些资料、任务和操作等级被允许,提供合规渠道,并让高风险决定始终回到专业人员和原始证据。
三句话总结
- 是否交给 AI,取决于错误后果、可发现性、可撤回性和独立核验能力。
- 高风险场景可以让 AI 辅助,但不能让未经验证的输出直接决定或执行。
- 人工兜底必须有原文、时间、拒绝权、记录和抽样检测,不能只设确认按钮。
如果你要做决定
拿出业务流程中最坏的一次错误,要求项目组说明它如何被发现、拦截、撤回和追责。答不出这四项,就先把系统停在「起草但不执行」的级别。