生成式 AI 三十讲第 05 讲 / 共 30 讲它为什么会写字

训练第一步:把海量文本读一遍

预训练让模型学会了什么、学不到什么,以及知识截止到底是怎么回事。

一台刚初始化的语言模型不会写请假条,也不知道“北京”常和“中国”一起出现。训练者给它大量文字作为前文,让它一遍遍预测后续片段,再根据原文中的实际后续调整内部数字。做完这一阶段,它能写出像样的语言,却仍不等于获得了一本可以逐页查询、持续自动更新的百科全书。

先给答案

预训练 让模型通过预测文字学到语言和大量事实关联。也就是说,模型先在大规模文本上练习通用能力。它不会保存一份可检索的原文目录,也不知道训练之后的新事件;学到的是概率关系,不是自动更新的事实库。

“读一遍”实际上在做什么

在针对聊天、客服或代码审查等具体用途调整之前,模型先反复练习根据前文预测后续 Token。也就是说,token 是模型处理文字的基本单位。

“把海量文本读一遍”只是方便理解的简称。真实训练会把材料清理、去重、切分成许多序列,再成批送入计算设备。给定“水在标准大气压下达到一定温度会——”,模型为下一个 token 给出概率;训练程序知道材料中的实际后续,于是计算预测偏差,并微调模型里的大量参数。

这个调整过程叫梯度下降。也就是说,程序根据本轮错误指出“哪些参数朝哪个方向改一点,整体错误可能变小”。一次修改非常小,但在大量样本和许多轮计算后,常见语法、文体结构、词语关系以及材料中反复出现的事实联系,会分散地进入参数。

训练数据通常不需要人工为每句话标出答案,因为原文本身就提供了后续 token,这叫自监督学习。也就是说,输入材料既是题目也是答案来源。一本书可以被切成许多练习:看到前 100 个 token,预测第 101 个;再看到前 101 个,预测第 102 个。它减少了逐条人工标注,却不代表数据无需筛选。重复网页、错误内容、隐私、低质拼接和不当材料都会影响训练。

训练阶段和日常提问不是一回事。训练会修改参数,需要大量计算;你在聊天框发送一份 3 页制度,通常只是把文字放进本次输入,并没有把它永久写入模型。关闭对话后,新会话是否还能使用该制度,取决于产品有没有另设记忆、资料库或后续训练流程,不能从“它刚才读过”直接推断。

预训练学到了什么,又没学到什么

先看它学到的。模型会掌握大量语言规律,例如“虽然”后面常有转折,“收件人、主题、正文、落款”构成常见邮件结构,代码括号需要配对。它还会从反复共现中学到很多世界知识关联,所以能回答地理、历史和技术常识,也能在例子中套用常见格式。

这些知识不是按网页地址整齐存放。模型参数更像一张被大量样本共同改动的数字网络,而不是带目录的文件柜。这个比喻只用于区分保存方式:研究者目前仍无法为每条回答完整指出“它只来自哪几篇材料”。模型有时能复现训练中过度重复的片段,有时把多处模式组合成新句子,也可能把相近的人名和年份混在一起。

预训练也不会直接保证“听话”。一个只练续写的模型看到“用户:怎么改密码?客服:”,可能接出客服回答,也可能继续模仿整段论坛记录。让它更稳定地遵循指令、按偏好回答,通常还需要后续训练;这是第 06 讲的内容。

它更不会自动获得真伪判断器。训练材料里的正确说法、过时页面、讽刺文本和错误传言都以 token 序列出现。模型可以学到“某种说法常见”,却未必能判断该说法在指定日期、地点和条件下是否成立。要求引用具体法规时,只有标题相似远远不够,仍要回到官方原文核对条号和生效状态。

数据量也不是越多越简单。训练者需要处理重复、来源比例、语言分布和质量。某类网页被复制一万次,未经过去重会被模型当作高频模式;同一事件的错误报道若远多于更正,也会影响接续概率。各模型公开的数据细节差异很大,不能在厂商未披露时替它补写来源清单。

知识截止 为什么不是一堵整齐的墙

也就是说,知识截止指模型训练所用知识大致停留的时间边界。某个日期之后发生的新闻、人事变化和规则更新,不会凭空进入已经训练完成的参数。问一个未联网模型“今天的汇率”或“本周新规”,即使它给出具体答案,也不能因为语气自然就采用。

不过,知识截止不是所有事实在午夜同时切断。训练材料有不同发布日期和采集时间,某些早期事实可能缺失,某些后续调整阶段又可能加入少量较新内容。厂商标注的日期应被理解为能力边界提示,不是“此前全知道、此后全不知道”的保修条款。

产品还可能接入网页搜索或外部资料。此时模型参数本身没有更新,系统只是把刚查到的页面片段放进当前输入。例如询问今天的天气,搜索工具先拿到气象数据,模型再把数据写成一句话。你需要区分“模型训练时知道”和“本次调用工具查到”,并检查引用页面是否真的支持回答。

模型也可能不知道自己确切的版本和截止日期。让聊天框自报身份,得到的文字仍是生成结果;正式判断应看服务商的模型卡、API 文档和管理后台。模型卡就是厂商发布的模型能力、限制和评测说明,API 文档则说明程序怎样调用该模型。若厂商更换了后台模型,同一个产品名下的边界也可能变化。

对企业资料来说,最实用的结论是:不要等模型靠预训练记住你的制度。把当前有效文件放进受控资料库,记录版本、生效日期和引用位置,回答时要求返回依据。制度一更新就替换资料,比期待下一轮大规模训练更可控。

自己试一下

新开一个聊天,问:“不使用联网工具,请说出你的知识截止日期,并说明这个日期前的信息是否保证全部知道。”接着追问一个只有你手头文件才有答案的问题,例如:“我们部门 2026 年 8 月版报销制度中,住宿附件要保留多久?”不要把制度内容发给它。

观察它是否明确承认无法访问你的内部文件,是否把自报截止日期与“保证正确”区分开。若产品自动联网,先关闭搜索或明确要求不用工具。本文编辑于 2026-08-27,并用当前会话模型检查了提示词;当前模型会承认无法得知该内部规定。你试的时候结果可能不同,重点是看它的行为模式。

常见误解

误解一:模型把互联网逐页背了下来。 参数会吸收材料中的统计关系,不能当作可逐页检索、逐条引用的网页副本。要找准确原文,仍需搜索或资料库。

误解二:截止日期以前都可靠,之后都不知道。 训练覆盖并不均匀,旧冷门事实也可能答错;接入搜索后又能处理部分新信息。日期只是风险提示,可靠性还要看来源与核验方式。

三句话总结

  1. 预训练用原文后续作为答案,反复调整参数,让模型学会通用语言规律。
  2. 参数中的知识是分散的概率关系,不是带出处、能自动更新的资料库。
  3. 知识截止提示时间边界,但任何关键事实都仍需依据和核验。

如果你要做决定

问清方案中的答案来自模型参数、联网搜索还是企业资料库,并要求界面能显示来源与版本日期。供应商若只说“模型训练数据很多”,这不足以证明它知道你的现行制度。