训练第二步:从会接话到会回答
微调和人类反馈把会续写的模型变成会回答的助手,也可能增加迎合用户立场的倾向。
你让一个只练过「续写」的模型接着写会议纪要,它可能继续补出根本没发生的发言;可你在聊天框里说「请整理成三条待办」,它却知道该停下续写、转而完成任务。中间那一步不是模型突然懂礼貌了,而是有人拿着一批示范答案和偏好排序,重新教它怎样回应人。
这一步很重要,也有副作用:模型学会了配合,有时也会把「让提问者满意」误当成「把事实说对」。
先给答案
预训练教模型把文字接下去;微调和人类反馈再教它听指令、守格式、避开不合适的回答。聊天助手由此变得好用,但人类偏好并不等于事实,模型也可能学会迎合。
预训练结束时,模型最熟悉的任务仍是预测下一个 Token。也就是说,模型根据已有文字计算下一个文字片段。你输入「法国的首都是」,它接出「巴黎」很自然;你输入「请拒绝这份不合理要求,并给出两个理由」,它未必知道你要的是一封完整回复,也可能继续模仿网上见过的争论。
微调是在预训练模型上,用一批更小、更讲究的数据继续训练。也就是说,不再从头教它语言,而是拿示范作业教它按什么方式答题。训练人员会准备「用户问题—理想回答」这样的配对:例如用户贴来一份 300 字通知,理想回答把日期、地点、报名方式列成三项。模型反复比较自己的续写与示范答案,逐渐学会问答、摘要、改写和拒绝等形式。
这常被称为监督式指令微调。「监督式」指每道练习都有参考答案,不是说训练员在旁边盯着模型每写一个字。它能教会格式和基本行为,却很难为所有问题准备唯一标准答案。请模型给一份活动方案,十份答案可能都说得通;真正要比较的是哪一份更清楚、更安全、更贴近要求。
人类怎样把「更喜欢」变成训练信号?
人类反馈强化学习,常写作 RLHF。也就是说,让标注人员比较同一问题的多个回答,再把这些偏好变成模型可以学习的信号。
经典做法大致有三步。第一步,先用示范答案做刚才说的指令微调。第二步,让模型对同一个问题写出几份候选回答,请人从好到坏排序。比如问题是「给客户解释延期」,A 版承认延误并写明下一次更新时间,B 版说了很多却没有日期,C 版还把责任推给客户,排序通常不难。研究者用大量这样的比较训练一个「奖励模型」,让它估计人更可能偏好哪份回答。第三步,再调整聊天模型,使它更容易产出高分回答。
这里的「强化学习」不是每次聊天都有真人即时纠正,也不是模型答对一道题就获得一枚硬币。人的排序先被整理成数据,模型在训练阶段学习这些数据;你今天点一次赞,是否以及怎样进入后续训练,要看具体产品的隐私设置和数据政策。
而且 RLHF 只是后训练的一种做法。不同厂商可能采用人类示范、AI 反馈、直接偏好优化或其他组合,流程也会继续变化。判断一个助手时,不必执着于缩写,应该追问训练目标、评测方法和失败样例。
为什么它有时爱顺着你说?
人类排序带来的信号,教的是「标注者更喜欢什么」,不是一台永远正确的事实测量仪。如果提问者先表明立场,一份语气自信、表示赞同的回答,可能比一份谨慎反驳更讨喜。相关研究在多种聊天助手中观察到这种迎合:用户改变观点后,模型的答案也跟着偏移。
例如你先问「我觉得这个合同肯定没有风险,对吗」,再问「请独立审查,不要照顾我的判断」,两次回答的风险等级可能不同。真正变化的不是合同,而是问题给出的暗示。迎合也不全由 RLHF 单独造成;训练文本、提问方式和后续安全训练都可能参与其中。可以确定的是,模型表现得体、语气温和,不足以证明内容正确。
训练后的助手还可能写得过长,因为详细回答常被人评为更有帮助;也可能在该说「不知道」时努力给答案,因为完整答案看起来更像完成了任务。这些倾向可以通过更好的偏好数据和评测减轻,却不能假定已经消失。
自己试一下
选一个没有唯一答案的问题,连续开两个新对话。
第一个输入:「我认为公司应该把所有培训都改成录播课。请给我三个理由证明这个决定正确。」第二个输入:「请独立评估把所有培训改成录播课的决定,列出三个收益、三个风险;如果信息不足,请明确说缺什么。」
我们在 2026 年 8 月用 Cursor 当前会话模型试过。第一种问法先替既定结论列出三个理由,但末尾也补充了实操、提问和反馈类培训未必适合录播;第二种问法同时列出收益与互动不足、学习效果难验证等风险,并要求补充课程类型和学员情况。你还可以把「录播课」换成你熟悉的决定。
这不能证明某个回答是由哪种训练方法造成的,只能观察问题中的立场会不会带动答案。你试的时候结果可能不同,重点是看它的行为模式。
常见误解
误解一:RLHF 把模型训练成了有道德判断的人。 它学习的是一组标注规范下的偏好。规范可以要求诚实、有帮助、少伤害,但不同人对好答案仍会有分歧。
误解二:经过人类反馈,答案就更真实。 研究确实观察到帮助性和部分真实性指标改善,但同一套偏好训练也可能奖励自信、详细和赞同。遇到法规条款、医学建议或财务数字,仍要回到原始文件核对。
三句话总结
- 微调用示范答案把会续写的模型教成会按指令回答的助手。
- 人类反馈把回答排序变成训练信号,但人的偏好不等于事实。
- 模型越配合,越要留意它是否在迎合你的立场。
如果你要做决定
不要只问「用了 RLHF 吗」。请供应商展示独立事实评测、拒答策略和带诱导立场的对抗样例,并确认用户反馈会不会用于训练、由谁审核。