核心机制:它只是在猜下一个字
一次完整回答其实是几百次猜下一个字连起来的,理解了这句话,后面的一切都好解释。
你问 AI:“为什么雨后有时会看到彩虹?”它可能先给定义,再解释光的折射和反射,最后补一句观察条件。如此完整的结构,很容易让人以为它先在脑中写好了全文,再逐字展示。实际过程更朴素:它每次只计算下一小段文字该是什么,把选中的结果接回去,再算下一段。
先给答案
聊天模型生成回答时,会根据你给的文字和它已经写出的部分,反复预测下一个 Token。也就是说,token 是模型处理文字的基本单位。几百次局部预测连起来,就成了一段看似经过整体规划的回答。
“猜下一个”具体在猜什么
大语言模型 是从大量文字中学习接续规律的程序。也就是说,它接收一串已有内容,计算后面各种文字片段出现的可能性。这里说“猜”不是随手蒙,而是一次数值计算。
模型处理的单位通常不是严格的一个汉字或一个英文单词,而是词表中的一个文字片段。为了先讲清主线,本讲仍用“猜下一个字”作白话简称,第 04 讲再专门拆 token。
假设开头是“天空是”,模型可能给候选项分配不同概率:“蓝色的”较高,“晴朗的”其次,“方形的”很低。程序按一套选取规则拿到一个候选,例如“蓝色的”,再把输入扩成“天空是蓝色的”,重新计算下一项。下一项可能是“,”“。”或“因为”。每写一步,后续条件就多一项。
这种生成方式叫自回归生成。也就是说,模型把自己刚写出的内容当作下一步输入,按先后顺序继续。若一段回答有 500 个 token,推理阶段就要进行大约 500 轮这样的选取;训练时可以并行计算许多位置,真正输出时仍需依次产生。
你看到的“逐字冒出”通常不只是界面特效。流式接口可以在模型生成一批新 token 后先传给界面,不必等整段完成;具体是一枚一枚传还是分批发送,由服务实现决定。也正因为后文依赖前文,一开始选错一个人名,后面可能围绕这个名字继续写出职务、年份和事件,文字越接越顺,事实却越走越远。
它为什么能接出像样的长文
只统计两个词挨在一起的次数,写不出稳定长文。现代模型的关键基础是 Transformer。也就是说,这是一种能让文字位置彼此计算关联的网络结构。处理“李明把文件交给王芳,因为她负责归档”时,模型可以利用上下文判断“她”更可能指王芳,而不只盯着前一个字。
其中的注意力机制会为上下文中的不同位置分配不同权重。也就是说,预测当前 token 时,模型能按需要多看某些已有片段。写合同摘要时,“付款日期”可能更依赖前文第 6 条,而不是紧挨着的标点;回答代词指谁时,人名和语法位置会更重要。注意力不是人类意义上的专心,也不保证找到正确证据,它只是模型内部的一组加权计算。
模型参数则是在训练中调整出的数字。也就是说,语言规律没有以“彩虹定义.txt”的形式整齐保存,而是分散在大量数值关系里。训练材料中反复出现“彩虹、阳光、水滴、折射”等联系,参数会逐渐让这些接续在相应上下文中更可能出现。问法变了,模型仍可能沿着学到的关系组织出回答。
这也解释了为什么同一个模型能做摘要、翻译和写代码。对模型而言,这些任务最终都能写成“给定前面一串 token,后面最合适的 token 是什么”。你给一段中文并写“翻译成英文:”,后续模式偏向英文;给出函数注释和代码开头,后续模式偏向程序语句。任务外观不同,生成接口仍是续写。
不过,“只猜下一个”不等于能力很浅。每一步虽然局部,预测所依据的上下文和参数却很复杂。一盘棋也是一次走一步,但每一步可以考虑局面中的许多关系。这个比喻到此为止:语言模型并不天然拥有棋类程序那样明确的胜负目标,它训练时优化的是对训练文字中下一 token 的预测。
为什么每次回答可能不一样
模型算出的通常是一组概率,不是唯一答案。如果永远选概率最高的一项,文字可能重复、僵硬;如果允许从多个高概率候选中抽取,表达会有变化。控制随机程度的参数常叫温度。也就是说,温度较低时选择更集中,较高时低概率候选更容易被选中。
例如让模型给咖啡店取 10 个名字,保留一些随机性有助于得到不同方案;让它从制度原文抄出报销期限,随机变化没有价值。即便温度设得很低,不同服务端设置或模型版本也可能带来差异,不能把“我问三次都一样”当作形式证明。
局部预测还有一个根本限制:模型首先在优化“后面像什么”,不是在外部数据库里核实“这件事是真的吗”。真实陈述和虚构陈述都可能有流畅的语言形式。它知道论文引用通常包含作者、标题、期刊和年份,于是缺少依据时也可能拼出一条格式漂亮的假引用。第 07 讲会专门解释这种幻觉。
因此,理解生成机制不是为了贬低模型,而是为了正确分工。改写语气、提出备选标题,可以允许多个合理答案;核对法规条文、银行账号和药品剂量,就必须引入原始资料、确定计算或人工复核。语言通顺只能说明生成过程顺利,不能替事实签字。
自己试一下
先发送:“补完这句话,只写后半句:会议改到周五,因为——”连续新开三次对话,记录答案。再发送:“给出三个可能的后半句,并说明哪一个只凭现有信息无法确认。”观察它是否会生成“人员冲突”“材料未齐”等合理但未经提供的原因。
这个实验显示的是候选接续与事实依据的区别:一句话很像真实通知,不代表原因来自已知记录。本文编辑于 2026-08-27,并用当前会话模型检查了提示词的可执行性;当前模型会列出多种可能并提醒无法确认。你试的时候结果可能不同,重点是看它的行为模式。
常见误解
误解一:“猜下一个”就是从训练资料里复制。 模型确实可能复现常见或重复出现的片段,但一般生成是根据学到的数值关系逐步组合,不能把每句话都追溯到某一页原文。
误解二:概率最高的答案就最真实。 高概率表示它在当前上下文中更像常见接续,不是经过事实核验。一个常见误传可能比冷门真相更容易被接出来。
三句话总结
- 一段回答是模型连续预测下一个 token 的结果,不是先写好全文再显示。
- Transformer 让每次预测能利用较远的上下文关系,参数保存的是分散的语言规律。
- 接续概率不等于事实概率,流畅答案仍需要按用途核验。
如果你要做决定
验收生成系统时,把“表达质量”和“事实正确”分开评分。凡是答案只有一个的关键字段,都要求供应商说明依据从哪里来、怎样核对,以及模型猜错后由哪一层拦住。