大模型发展纪第 00 篇 · 史前史前

史前:聊天框出现之前

从 Transformer 到 GPT-3.5,技术铺垫在 2022 年 11 月 30 日之前已经走完,但还没有人人能打开的聊天框。

2017 年 6 月,Google 研究人员发表《Attention Is All You Need》,提出 Transformer 架构。此后七年,大语言模型的能力曲线几乎沿着这条论文展开,但公众注意力长期停留在学术圈和少数 API 用户手里。要理解 2022 年底 ChatGPT 为何一夜改变认知,需要先看清出圈之前已经到位、却尚未被大众触摸的那几层能力。

先给答案

2022 年 11 月 30 日之前,关键链条已经闭合:Transformer 解决了规模化训练问题,GPT-3 证明了「只预测下一个词」在足够数据与算力下能涌现通用语言能力,InstructGPT 与 GPT-3.5 把「会接话」调校成「会按要求回答」。缺的不是模型,而是一个零门槛、能连续对话的产品外壳。机制原理见 《生成式 AI 三十讲》导读

当时现场

如果你 2021 年走进一家普通公司的技术部门,「大模型」多半还不是会议常用词。工程师可能用过 BERT 做文本分类,产品经理听过 GPT-3 写文案的演示,但大多数人从未亲手与一个大语言模型连续对话超过三轮。OpenAI 在 2020 年 6 月发布 GPT-3 论文,参数量约 1750 亿;API 于 2020 年 11 月开放,按 token 计费,用户主要是开发者和研究机构。

同一时期,Google 的 T5、Meta 的 OPT、后来的 BLOOM 都在验证同一路线:用自回归方式在大规模文本上预训练,再针对任务微调。区别主要在算力、数据清洗和工程细节,而不是「要不要用 Transformer」这一层架构选择。

2022 年 1 月,OpenAI 公布 InstructGPT 论文,核心做法是用人类标注的示范与偏好排序,让模型更愿意遵循指令、减少有害输出。3 月,OpenAI 陆续推出 GPT-3.5 系列 API 模型(如 text-davinci-003),开发者已能在 Playground 里体验明显强于 GPT-3 的指令跟随能力。但对公众而言,Playground 仍是需要注册、理解 token、自己写提示词的工具界面,不是「打开网页就能聊」的产品。

发生了什么

2017—2019:架构定型。 Transformer 用自注意力机制并行处理序列,摆脱了 RNN 的长程依赖瓶颈。OpenAI 沿此路线推出 GPT-1(2018 年 6 月,1.17 亿参数)与 GPT-2(2019 年 2 月,15 亿参数)。GPT-2 曾因「生成假新闻」担忧而分阶段发布,但已显示出规模扩大带来的零样本任务能力。

2020:GPT-3 与规模定律。 GPT-3 在约 45TB 文本上训练,展示少样本学习:不给梯度更新,只在提示里放几个例子,模型就能完成翻译、问答、简单算术等任务。这改变了行业对「预训练加提示」的预期,也把竞争焦点推向数据、算力和推理成本。

2021—2022:从能力到可用性。 Codex(2021 年 8 月)在代码数据上微调,成为 GitHub Copilot 的技术底座,说明同一套语言模型可迁移到垂直领域。InstructGPT 则回答了一个产品问题:用户要的不是续写小说,而是按格式、按约束回答问题。RLHF(基于人类反馈的强化学习)成为此后主流对齐路径。

2022 年 11 月 29 日: 技术社区已在讨论 GPT-3.5 与即将发布的对话产品,但全球主流媒体尚未进入「人人都在聊 AI」的节奏。次日,局面改变。

谁的工作因此变了

出圈前,直接受影响的是 NLP 研究员、机器学习工程师和少数接入 GPT-3 API 的创业公司。标注员与对齐团队的工作量在 InstructGPT 之后显著上升——模型越大,越需要人类示范「什么是好回答」。云厂商开始储备 GPU 与推理集群,但销售话术仍偏「AI 基础设施」,尚未到「每个部门都要买 Copilot」的阶段。

内容创作、客服、法律与医疗等行业的从业者,在 2022 年上半年大多只把大模型当作新闻里的概念。代码领域稍早:GitHub Copilot 技术预览自 2021 年 10 月启动,2022 年 6 月向个人开发者开放订阅,让一部分程序员第一次日常依赖「补全下一行代码」的模型,但这仍是 IDE 插件,不是通用聊天框。

当时看错的地方

误判一:「GPT-3 已经够用了,对话产品只是包装。」 事实上,GPT-3 基座在开放式对话中容易跑偏;InstructGPT 式的监督微调与 RLHF 对「像助手一样说话」至关重要。没有这层对齐,聊天产品体验会差一个数量级。

误判二:「只有 OpenAI 在做这件事。」 2022 年,Google 已有 LaMDA 对话模型,Anthropic 正在构建 Constitutional AI 路线,Meta 推进 LLaMA 开源生态。竞争早已开始,只是产品化节奏不同。

误判三:「大模型会取代搜索。」 2020—2022 年的模型幻觉严重、知识截止于训练数据,无法替代实时检索。这一误判在 ChatGPT 上线后因「流畅的错误答案」被放大,直到 RAG 与搜索增强成为标配才被部分纠正。

今天还能核对什么

  • OpenAI 论文与博客:GPT-3(2020)、InstructGPT(2022)原文仍可在 openai.com/research 检索。
  • 《Attention Is All You Need》arXiv:1706.03762,发表日期 2017 年 6 月 12 日。
  • GPT-3 API 发布公告(2020 年 11 月)与 GPT-3.5 模型卡可查历史版本说明。
  • GitHub Copilot 官方文档记载技术预览(2021-10)与个人版 GA(2022-06-29)时间线。

延伸阅读