在它之前,计算机是怎么处理文字的
过去许多文字程序主要按规则挑选和判断,今天的大语言模型则把开放生成变成了通用能力。
假设你要让程序处理 1000 封客户邮件:找出投诉,分给售后,再为每封邮件生成一句摘要。前两项早已能用规则、分类和检索做好,第三项过去通常需要更专门的生成系统。今天的生成式 AI 则能按不同要求现场写出新内容。理解这个差别,才能看清大语言模型扩展了什么,也能避免把所有旧方法都误认成落后的东西。
先给答案
过去许多常见的文字程序主要靠规则、关键词、统计特征或已标注样本做匹配和分类。它们擅长从有限选项中判断;今天的大语言模型则把按要求生成开放答案变成了更通用的能力。
最早的办法:把人的判断写成规则
文字进了计算机,起初只是字符编码和字符串。程序可以判断一段文字里有没有“退款”,也可以把所有“2026/08/27”替换成统一日期,但它不知道这些字对业务意味着什么。工程师于是把判断过程写成条件:邮件同时出现“退款”和订单号,就转售后;出现“发票”和“抬头”,就转财务。
这种做法常被称为规则引擎。也就是说,人先明确写出“如果出现 A,再检查 B,然后执行 C”。一个客服路由规则可能只有 8 条,一个合规检查系统却可能积累几千条。规则的长处是可以追问:这封邮件为什么被拦截?系统能回答“命中了第 17 条,包含禁用字段”。它也容易做硬约束,例如身份证号必须是规定长度,审批金额超过某数就必须增加一级签字。
规则的麻烦来自语言变化。同一件事,客户可能写“我要退钱”“不想要了”“取消订单”,也可能讽刺地说“这服务真让人省心,我等了两周”。为了覆盖表达差异,维护者不断增加同义词、排除项和优先级。一条新规则还可能撞上旧规则:含“并非不能退款”的邮件到底算肯定还是否定?规则不是不能处理,而是维护量会随边界情况增加。
后来出现了更多统计方法。程序不再要求人写完所有条件,而是从一批带标签的样本里学习哪些特征常与结果一起出现。比如给它 5000 封已标成“投诉”或“非投诉”的邮件,它可以统计“失望”“一直没人处理”等词和投诉标签的关系,再判断下一封邮件属于哪类。
统计方法怎样把文字变成可计算的数字
常见做法之一是“词袋”。也就是说,程序先不管完整句意,只记录一段文字出现了哪些词、各出现几次。句子“产品便宜但物流慢”可以变成一张计数表:产品 1 次、便宜 1 次、物流 1 次、慢 1 次。训练出的分类器再根据这些数字判断它更像好评还是差评。
词袋会丢掉顺序。“物流不慢”和“物流慢”包含大量相同词,仅看计数很容易混淆。加入相邻两个词或三个词的组合可以保留一小部分顺序,但组合越多,特征表越大,没见过的表达也越多。另一类序列模型会按先后读取词语,比词袋更能利用顺序;它们仍然通常围绕明确任务训练,例如分类、命名实体识别或翻译。命名实体识别,就是从原文中圈出人名、日期、地点等特定信息。
这里最重要的不是背算法名称,而是看输出空间。垃圾邮件分类器面对两项选择:是或否。情感分析可能面对五个星级。实体识别是在原文里圈出人名、日期和地点。即使模型内部很复杂,最后仍是在一组预先规定的标签里作判断。
搜索也属于另一条重要路线。用户输入“差旅报销”,系统可以按关键词、词频和相关度从 300 份文件里排出最可能的 10 份。搜索返回的是已有材料,不负责现场写一份新制度。今天的 AI 产品仍大量使用搜索,只是常在搜索结果后面再加一层生成,把几个片段组织成回答。
生成式方法到底多做了哪一步
生成式 AI 面对的不是几个固定标签,而是数量极大的文字组合。它可以根据输入逐段写出新内容。一封投诉邮件可以生成摘要“客户反映包裹逾期两周且三次联系未获回复”,也可以按指定格式起草回复。这个句子不需要事先存放在答案库中。
支撑聊天产品的通常是大语言模型。也就是说,它从大量文字里学到词语在各种上下文中如何接续,再用这种能力完成摘要、改写、问答等任务。它与旧分类器并非简单的“更聪明版本”:两者任务定义不同。分类器输出一个标签,语言模型输出一串接一串的文字片段。
生成的优势是适应开放表达。给它一份 900 字记录,它能按“问题、证据、待办”重新组织,不必为每种句式单写规则。代价是结果不再完全确定:同一输入可能出现不同措辞,也可能补进原文没有的因果关系。你若要求它判断发票号码是否符合固定格式,自由生成反而比一行确定规则更难审计。
所以,旧方法并没有退出工作现场。可靠系统常把它们组合起来:正则表达式先遮住手机号,分类器判断邮件去向,搜索找出对应制度,语言模型最后生成摘要。让擅长判断的程序去判断,让擅长组织文字的模型去组织文字,通常比把所有事情都塞进聊天框稳妥。
自己试一下
把下面 6 条短句贴进任意 AI 聊天框:“我要退款”“物流太慢”“请开发票”“怎么修改地址”“东西坏了”“谢谢,已经收到”。先要求它只分成“售后、财务、其他”三类,再要求它为每条写一句不超过 20 字的处理建议。
第一轮观察它是否只能在三个标签里选择;第二轮观察措辞是否变得开放,以及它会不会给“东西坏了”补出原文没有的处理步骤。前者接近分类任务,后者是生成任务。本文编辑于 2026-08-27,并用当前会话模型检查了任务是否可执行。你试的时候结果可能不同,重点是看它的行为模式。
常见误解
误解一:以前的程序完全不处理语义。 早期统计模型和序列模型早已能做翻译、分类与信息抽取,只是多数系统面向一个明确任务,输出边界也更窄。
误解二:生成模型一定优于规则。 如果要求是“金额超过 10 万必须复核”,规则清楚、便宜、可测试。让模型自由判断反而会引入波动。生成能力适合开放文字,不是每个判断环节的默认答案。
三句话总结
- 传统文字程序擅长按规则、特征或样本完成搜索、抽取和分类。
- 今天的大语言模型显著扩展的能力,是按不同要求现场写出不在答案库里的开放内容。
- 固定判断继续交给确定程序,开放表达再考虑生成,系统通常更可靠。
如果你要做决定
先把需求拆成“固定判断”和“开放生成”两类。请供应商分别说明每一步的输入、允许输出和验收办法;如果一个硬规则也要靠模型猜,要求解释为什么不用可审计的程序。