生成式 AI 三十讲第 23 讲 / 共 30 讲怎么用起来

当前公开研究较多的几类应用

哪些任务已有较多公开研究,以及为什么试验结果仍不能当作稳定生产证明。

一段演示里,AI 能在十秒内写方案、看合同、答客户;到了企业现场,它却要面对过期文档、权限隔离、例外流程和无法承受的错误。判断证据不能看视频有多惊艳,而要分清受控实验、限期试点、局部上线和稳定生产。公开材料显示,目前研究较多的主要是边界清楚、输入已经数字化、结果方便复核的任务;这不等于它们在每家企业都已经“跑住”。

先给答案

公开研究相对较多的不是“整家公司自动运行”,而是四类任务:文字整理与起草、内部知识检索、客服辅助、软件开发辅助。证据强度并不相同,既包括受控实验和限期试点,也包括现场研究与厂商案例;它们通常只覆盖人机协作的一段流程,不能直接证明长期净收益。

先看任务证据:文字工作与知识检索

生成式 AI能根据输入生成新文字、图片或代码。它在文字任务上先跑起来,是因为邮件、会议记录、制度文件本来就是数字文本,结果又能由员工快速查看。

英国政府数字服务部门在 2024 年末组织了涉及 12 个机构、2 万名员工的 Microsoft 365 Copilot 试验。2025 年发布的官方报告称,参与者自报平均每天节省 26 分钟,常见用途是搜索、摘要和处理日常文字;报告也明确说,复杂数据和需要语境的工作仍有限制,且无法在该试验中确认省下的时间最终如何使用。这个数字说明大规模办公辅助值得测,不等于每家企业采购后都会省 26 分钟。

内部知识问答往往使用检索增强生成:先从获准资料中找出相关片段,再让模型据此回答。相比让模型凭记忆回答,它更容易给出处,也更容易随制度更新。适合的问题是“差旅报销需要哪三份材料”,不适合的问题是“这次违规该怎么处罚”——后者需要完整事实与责任判断。

再看现场结果:客服辅助与软件开发

客服辅助已有较强的现场研究。Brynjolfsson、Li 和 Raymond 研究了 5172 名客服人员分阶段使用生成式 AI 助手的情况;2025 年发表于《经济学季刊》的论文报告,每小时解决问题数平均提高 15%。收益并不平均:经验较少、原本表现较低的员工改善更明显,最有经验员工的质量还有小幅下降。它支持的结论是“助手能传播优秀话术与问题处理经验”,不是“客服可以全部撤掉”。

软件开发辅助也有多项实验,常见用途包括补全代码、解释旧代码、生成测试和查找错误。OECD 2025 年对实验研究的综述认为,写作、客服、软件开发和咨询等任务观察到的平均生产率提升从 5% 到 25% 以上不等,同时强调效果取决于任务匹配、使用者能力和检查输出的能力。实验中的明确小任务,不等于维护多年旧系统、处理安全缺陷或做架构决策也会得到同样提升。

最后看边界:采用率不等于收益率

Stanford HAI 的2025 AI Index汇总调查称,2024 年有 71% 的受访组织在至少一个业务职能中使用生成式 AI。报告同时指出,多数企业仍在早期阶段:即使报告节省成本或增加收入,最常见的幅度也分别低于 10% 和 5%。采用很广与回报很大,是两件不同的事。

厂商案例可以帮助理解做法,却不能单独证明普遍效果。例如 Google Cloud 公布的 SIGNAL IDUNA 案例称,20 名员工的对照试验中,知识助手让信息搜索和回复起草时间约降 30%,一次解决率从 73% 升至接近 98%。这是一个有样本和指标的官方案例,但参与者少、供应商参与叙述,也没有公开足够材料供外部复现,所以只能当场景线索,不能外推为保险行业平均水平。

ILO 与 NASK 的2025 全球指数还提醒:约四分之一岗位存在某种生成式 AI 暴露,但“暴露”是任务可能被改变,不是实际裁员,更不是整份职业已经能自动化。广泛落地更可能先改变岗位中的若干步骤,再慢慢改变分工。

自己试一下

选一份已经公开、约 1000 字的制度说明,准备五个能从原文找到答案的问题,其中两个故意问原文没有的信息。把原文和问题交给聊天模型,要求“逐题回答并引用原句;找不到就写资料未说明”。记录五题中答对几题、引用能否对应、两道缺失题是否承认不知道。再去掉“引用”和“承认不知道”的要求重跑,对比编造数量。

本实验于 2026-08-27 用 deepseek-v4-flash 试跑。两组都答对三道可回答题,也都把两道缺失题标为“未说明”;加入证据约束的可见收益,是多了可定位引用和一致格式,而不是本次试跑中更高的拒答率。你试的时候结果可能不同,重点是观察答案能否回到原文核查。

常见误解

“多数企业在用,说明技术已经成熟。” 调查中的“使用过”可能只是一个团队试点,和持续生产、覆盖全员、产生净收益不是同一口径。

“一个知名企业提升 30%,我们也能提升 30%。” 案例同时受到流程、人员、数据质量、基线和统计方式影响。厂商发布的数字可以提出假设,不能代替本单位的对照测试。

三句话总结

  1. 当前公开研究较多的任务集中在文字整理、知识检索、客服辅助和软件开发辅助。
  2. 可靠结果多来自边界明确、材料数字化、输出可复核的人机协作任务。
  3. 调查采用率、单个厂商案例和受控实验都不能直接当作本企业的收益承诺。

如果你要做决定

要求方案方把每个“成功案例”拆成样本人数、试验周期、对照基线、质量指标、人工投入和失败率。然后用本单位材料做小规模盲测;拿不出这些口径,就把案例当介绍,不当采购依据。