生成式 AI 三十讲第 01 讲 / 共 30 讲导读

导读:这几年到底发生了什么

用一篇的篇幅串完从猜下一个字到智能体的整条线索,并按你的身份给出三条阅读路径。

你在一次会议上可能同时听到这些说法:模型会写方案,知识库能减少瞎编,智能体还能自己打开文件、调用系统。这里的知识库,是产品可以检索并交给模型参考的一组指定资料;只有取到的材料正确、相关,它才可能减少无依据回答。智能体则是会多次选择并执行操作的程序。这些说法听起来像几种互不相干的技术,其实沿着同一条线就能串起来:先学会接着写,再补资料、接工具,最后把多次操作连成循环。问题不在于记住多少缩写,而在于知道每往前一步,能力从哪里来,新的风险又落在哪里。

先给答案

这几年最重要的变化,不是计算机突然“理解了一切”,而是生成式 AI 中预测下一段文字的模型变得足够大、足够好用,再被接上资料、工具和执行循环。也就是说,这类程序可以现场写出新内容。三十讲会逐层拆开这条链。

第一层变化:程序从挑答案变成了写答案

过去很多文字程序做的是分类、检索和填槽。收到一封邮件,程序判断它是不是垃圾邮件;在客服页面输入“退货”,系统从预先写好的十条回答中挑一条;在合同里寻找“违约金”,搜索程序把含有这三个字的段落标出来。它们很有用,但答案的边界通常由规则、标签或已有资料决定。

生成式 AI 改变的是输出方式。它不是只从答案库里选一句,而是可以现场写出一段此前并不存在的文字。一份 20 页的产品说明可以被改写成 300 字摘要,同一批要点也可以被整理成邮件、表格说明或代码。这里的“生成”只描述内容怎样产生,不等于内容自动正确。

聊天框背后通常是大语言模型。也就是说,这是一类从大量文字中学习语言规律、根据已有文字预测后续内容的程序。你输入的问题并没有钻进一个装满标准答案的抽屉;模型把问题当作开头,连续预测后面的文字。第 02 讲会先回看旧方法,第 03 讲再把“连续预测”拆到每一步。

模型能写出新内容,带来了过去的分类程序不常见的麻烦:它也能写出新的错误。一条规则匹配失败,通常是“没找到”;生成模型失败时,却可能给你一段语气笃定、格式齐全的错答案。流畅度和可靠性不是同一个指标,这条界线会贯穿整套专题。

第二层变化:从“会接话”到“能回答”

只练习接着写,模型未必知道怎样听从问题。给它一句“请列出三项风险”,它也可能续写成一篇网页里的评论区。训练者还需要用问答示例和人类偏好,让模型更愿意按要求回答、拒绝部分危险请求,并把内容排成读者熟悉的样子。这一步会在第 06 讲展开。

日常使用时,你发出的那段问题、背景和格式要求叫提示词。也就是说,提示词是本次生成的输入条件,不是能强制程序服从的法律条文。你把一份会议记录贴进去,要求“只按原文列出负责人和日期”,通常比只说“整理一下”更容易得到可检查的结果,因为模型可用的依据和输出边界都更清楚。

连续聊天又增加了一层外观:它似乎记得你上一轮说过什么。实际工程通常会把前面的对话随新问题再次提交,让模型在一次可见范围内继续回答。这个范围叫上下文窗口。也就是说,它一次只能处理有限数量的文字片段;一份过长的 PDF 加上十几轮聊天,可能把前面的关键要求挤出去。第 09、10、11 讲会分别讲容量、多轮请求和外部记忆。

第三层变化:给模型资料、工具和循环

仅靠训练时学到的文字规律,模型不知道你公司今天更新的库存,也不能保证记得最新制度。工程上常见的补法,是先从指定资料中找出相关片段,再连同问题一起交给模型,这叫检索增强生成。也就是说,模型回答前先拿到几段可引用的材料。比如员工问“差旅住宿上限是多少”,系统先取出制度 PDF 的第 4 页,再要求模型只按该页回答。资料找错了,回答也会跟着错,所以第 12 讲重点不只是“接知识库”,还包括怎样检查检索结果。

模型本身只会输出内容。要查询数据库、运行计算或修改文件,外层程序必须允许它提出结构化请求,再执行对应操作,这叫工具调用。也就是说,模型可以说“请查询订单 4821”,真正访问订单系统的是受控程序。若它只能调用“读取订单”接口,就不该因此获得“退款”权限。第 13 讲会把模型的建议与程序的执行分开看。

当程序让模型反复经历“决定下一步、调用工具、读取结果、再决定”,就形成了智能体。它不是一个新的神秘模型,而是模型、工具、状态和停止条件组成的任务流程。让它整理一个文件夹时,可能依次列目录、打开 6 份文档、写出索引,再检查遗漏。循环越长,早期误判越可能影响后续动作,因此权限、步数上限、人工确认和操作日志都不能省。第 16 到 21 讲专门处理这类系统。

这三层并不是“后一层淘汰前一层”。一个企业问答页面可能同时使用语言模型、检索和两项只读工具,却根本不需要智能体循环。多加一层就多一类故障点;能用一次检索完成的事,没有必要硬拆成十步自动操作。

自己试一下

打开任意 AI 聊天框,分两次发送同一项任务。第一次只写:“帮我整理一份会议纪要。”第二次写:“把下面记录整理成三栏:事项、负责人、日期;原文没有的信息填‘未提及’,不要猜。”再附上这段材料:“周五前交初稿。小陈负责核对合同。复盘时间另约。”

观察两点:第一次是否主动补出你没要求的栏目,第二次是否能把“小陈”和“周五前”放到有依据的位置,并把复盘日期标成“未提及”。这个实验不证明模型掌握了事实,只说明输入边界会改变输出。本文编辑于 2026-08-27,并用当前会话模型核对了提示词的可执行性。你试的时候结果可能不同,重点是看它的行为模式。

常见误解

误解一:这些能力来自一个无所不知的程序。 实际产品常把语言模型、搜索、企业资料库和业务接口放在一起。回答里出现当天新闻,可能是搜索工具刚查到的,不代表内容早已存进模型。

误解二:技术路线按年份整齐替换。 分类、规则和搜索没有消失。付款拦截、权限判断这类要求结果稳定的环节,明确规则往往比自由生成更合适。真正需要判断的是每一环该生成、该检索,还是该用确定程序。

三句话总结

  1. 生成式 AI 的基础能力,是根据已有文字连续预测后续内容。
  2. 资料检索和工具调用补上了新信息与执行能力,但也增加了新的故障点。
  3. 智能体是模型、工具和循环组成的系统,不是一个自动可靠的新物种。

如果你要做决定

听到一个 AI 方案时,先问清四件事:哪一步由模型生成,资料从哪里取,能调用哪些工具,什么操作必须由人确认。不要只看演示里的最终回答,要看中间依据、权限和失败处理。