生成式 AI 三十讲第 24 讲 / 共 30 讲怎么用起来

怎么挑第一个场景

用一套可按业务校准的四项示例评分,筛出适合先试的任务。

第一次选 AI 场景,会议上最容易胜出的往往是“最痛”的问题:投诉最多、积压最久、老板最关注。但它之所以多年没解决,常常正因为数据散、例外多、责任重。把第一个试点押在这种问题上,会同时测试模型、数据、流程和组织协作,失败后没人知道究竟卡在哪里。更稳妥的起点,是价值看得见、输入拿得到、结果验得出、出错接得住的任务。

先给答案

先列出一批候选任务,用“价值、数据、可验收、低风险”四项逐项摆证据。下面的 0 至 5 分和入选线只是便于启动讨论的示例,使用前必须按本单位工作量、风险容忍度和历史基线校准;涉及人身、重大资金或不可逆决定的任务不做首个场景。

先把“场景”缩成可重复的一项任务

“提升客服效率”不是场景,因为没有起点和终点。“根据知识库为售后人员生成回复草稿,由坐席审核后发送”才是。合格的场景描述应写清五件事:谁在什么时点触发,输入是什么,系统做哪一步,输出交给谁,最后由谁负责。

先用一句模板统一候选项:“当___发生时,使用___资料生成___,由___在___分钟内审核。”例如:“收到退换货咨询时,使用已发布的售后政策生成 150 字回复草稿,由坐席在 2 分钟内审核。”这样才能数清每周有多少次、目前花多久、错误是什么。

不要把多个任务绑在一起。“读邮件、判断投诉级别、查订单、决定赔偿并发信”至少包含五步。第一个试点只取其中结果容易检查的一步,例如“把来信归入已有的六个类别,并给出引用句”。切小不是回避价值,而是让失败原因可定位。

四项各打 0 到 5 分

请业务负责人、实际操作人、技术或数据负责人各自独立打分,再讨论差异。不要先求平均;同一项有人打 5、有人打 1,往往意味着关键事实尚未核实。以下档位是一套可校准示例,不是 NIST、OECD 或任何行业的通用标准。

一、价值。 先统一按“每月次数 × 每次可减少的人工分钟”估算每月可释放工时,再用实际数据改档位。例如:0 分为无法量化或少于 1 小时;1 分为 1 至 4 小时;2 分为 5 至 19 小时;3 分为 20 至 49 小时;4 分为 50 至 99 小时;5 分为至少 100 小时。若时间不能转成减少积压、缩短响应或增加产出,应下调一档。这里的小时边界只是示例,但同一轮候选必须使用同一公式,不能一项看频次、另一项看“战略意义”。

二、数据就绪。 0 分:材料不存在或无权使用;1 分:主要在个人脑中;2 分:已获授权且能收集;3 分:再加一批有代表性的可用样本;4 分:再加稳定格式、版本和维护人;5 分:再加明确的更新规则与敏感信息处理。若要依赖检索增强生成,还要抽查检索出的原文是否真的相关。

三、可验收。 0 分:只能凭“感觉不错”;1 分:有人能判断但意见经常相反;2 分:已写出统一评分规则;3 分:再加明确答案或评分锚点;4 分:再加可计算的质量、耗时和人工修改量;5 分:再加未使用 AI 的基线与未参与调试的盲测样本。试点不是演示,必须能说清多少算过。

四、低风险。 这里 5 分代表安全。0 分:错误可能造成人身伤害、重大资金损失或法律后果且难追回;1 分:会直接对外执行高影响决定;2 分:有人复核但缺少充足时间或原始证据;3 分:只生成草稿且审核者能拦截;4 分:再加输入脱敏、数量上限和可恢复设计;5 分:只读或沙盒内运行,错误影响很小。

总分为四项相加,满分 20。团队可以先试用“16 至 20 分优先、14 至 15 分补齐短板后试、13 分及以下暂缓”,但必须记录为什么这些分界适合本单位,并在首轮结果后重校。任一项低于 2 分可作为示例硬门槛;无权使用数据、无法验收或风险不可接受则不受总分补偿,直接暂缓。

用一轮小样本决定去留

入选后先冻结一批代表性样本,按常见、困难和不应回答等类型分层。若缺少历史数据,可以把 20 至 50 份、两周作为探索性起点,但它不是统计保证;高风险或差异较大的任务需要扩大样本和周期。记录人工基线,再让现有人员在同类样本上使用 AI,并尽量盲评。通过线也应写成可校准示例,例如“中位处理时间下降至少 25%,质量不低于人工基线,测试集中观察到的严重错误为 0”;每个阈值都要注明基线、风险理由和批准人。

一轮结束后只做三种决定:通过,扩大样本;有条件通过,只修一个已定位短板后复测;不通过,归档结果并换场景。不要在没有终止条件的试验里不断改提示词,也不要因为已经投入费用就降低通过线。

自己试一下

把“会议纪要整理、合同风险审查、客服回复草稿”三个候选任务及上述四项评分规则交给任意聊天模型,要求它先逐项列“需要补问的事实”,在你没有回答前不许打分。观察它是否会追问每月次数、数据来源、验收人和错误后果。再给出你的真实信息,让它引用你的原话说明每个分数。

本实验于 2026-08-27 用 deepseek-v4-flash 试跑。模型能帮助暴露信息缺口,但在真实盲测尚未完成时,仍把会议纪要和客服草稿四项都打到 5 分,评分偏乐观。你试的时候结果可能不同,重点是看它能否把分数绑定到事实;最终评分仍由任务负责人共同确认。

常见误解

“先做最痛的问题,价值才大。” 最痛的问题也可能最不可控。首个试点的任务是建立可复用的评估和协作方法,不是一次解决全部历史积压。

“总分最高就一定先做。” 分数用于暴露事实,不替代硬门槛。数据无权使用、结果无法验收或风险不可接受时,其他项再高也不能启动。

三句话总结

  1. 第一个场景要缩成有触发、输入、输出、审核者和时限的单项任务。
  2. 用价值、数据、可验收、低风险四项评分,硬短板不能由其他高分抵消。
  3. 先按风险校准样本、周期和通过线,再用盲测数据决定扩大、整改或停止。

如果你要做决定

下次场景评审会要求每个提案提交一页卡片:任务句、四项分数及证据、分层样本来源、人工基线、阈值理由和责任人。缺其中任一项,不进入采购或开发排期。