news 2026/8/21 21:28:10

LLM那些事(二):LLM训练三阶段——从会接龙,到会听话,到会思考

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
LLM那些事(二):LLM训练三阶段——从会接龙,到会听话,到会思考

1. 两个困惑

上一篇《LLM 是什么?——它不是查资料,是在接龙》的结尾,我留了一句话:训练这件事,够单独写一整篇。

你是否已到过这两个困惑。第一个:它明明不会,为什么装会?你让它写一个冷门知识点,它能面不改色地给你编出一整段,语气还特笃定,事后一查,全是幻觉。第二个:它为什么突然不听话?你问一个再正常不过的问题,它却像被谁掐住了喉咙,丢回一句「我不能回答」——明明跟安全八竿子打不着。

这俩症状,我在上一篇里其实埋了一半:它只会接龙,只保证「说得像」,不保证「说得对」。但「装会」和「不听话」具体怎么来的,得把它怎么被教出来的讲完才能说清。

答案一句话:训练不是一回事,是三道工序——先教会它接龙,再教会它听话,最后教会它规矩和思考。往下,慢慢道来~

2. 三阶段总览:从会接龙,到会听话,到会思考

先立骨架,后面每章都是给这三个框装细节。

  • 预训练(pretraining):把海量文本喂进去,学会接龙。这是能力上限的来源,也是最贵的一道工序。
  • SFT(监督微调):拿「问题 + 理想回答」的样例,教会它答题格式,学会听话。
  • 对齐 / 强化学习:教它规矩(什么能说、怎么答更好),2026 年还加上教它思考(怎么把题做对)。

三道工序不是三选一,是流水线,依次叠上去:

① 预训练
读万卷书,学会接龙
(能力上限 · 成本 80-90%)

② SFT
语文老师教答题格式
(学会听话)

③ 对齐 / 强化学习
评卷老师判偏好
数学考试练思考
(学会规矩与思考)

这张图你后面可以一直回来对。第 3 章讲第一框,第 4 章讲第二框,第 5 章讲第三框——那是最热闹的一框。

3. 预训练:读万卷书,学会接龙

先看第一道工序。预训练,就是它「会接龙」的本事从哪来。

做法一句话:把几乎能搞到的文本全喂进去——网页、书、代码、论文、维基百科、论坛帖子——反复练同一件事:看前面的文字,猜下一个 token。猜错了,就把参数往「对」的方向拧一点点。就这么拧几万亿次。

先给数字。Meta 的 LLaMA 3 用了 15 万亿个 token。四年前的 GPT-3 是 3000 亿,四年涨了 50 倍。到 2026 年,新一代已经往 20 万亿以上的量级冲。15 万亿什么概念?上一篇那个 Excel 里 104 字的语料,得放大几亿亿倍。

这些数据不是平均分的。网页里低质量的会被滤掉,代码、数学、多语言这类「高质量」语料会被反复上采样——数据配比,是预训练团队抠得最细的地方。你最后用到的「会写代码」「会推理」,很大程度是这个配比决定的。

这一道工序产出什么?我称它「升级版自动补全」。它在接龙这件事上炉火纯青,语法、事实、逻辑、常识全藏在参数里。但它还不会「听话」——你丢给它一句「巴黎是哪个国家的首都?」,它不会停下来回答,而是顺着话头继续编。要它停下来回答问题,是下一道工序的事。

预训练也是三阶段里最贵的。行业里普遍的说法是占总成本八成到九成,有的口径算到九成五。它像盖一栋楼的主体结构,后面所有工序都是装修。

这也解释了一件事:为什么绝大多数公司不从头训,而是拿开源基础模型(LLaMA、Qwen、DeepSeek 那批)直接往下做。从零预训练是几十亿人民币量级的烧法,拿现成基础模型微调是装修费。除非你要「连骨架都自己定」,否则没人自己盖楼。

4. SFT:语文老师教答题格式

预训练完,它还是个补全工具。第二道工序叫 SFT,监督微调。我的类比:语文老师教答题格式。

做法也一句话:攒一批「问题 + 理想回答」的样例——「巴黎是哪个国家的首都?」配「法国。」——让模型照着练。看问题,学着自己答,答得越像标准答案越好。注意一个细节:损失只在「回答」那部分 token 上算,题目本身不算。题目只是触发条件。

它学到的是「格式」。什么时候用问好、什么时候分段、怎么收尾,以及「当别人提问时,我该以回答者的姿态接话」——这就是「会听话」。它不是懂道理,是学会了「提问之后该走答题的流程」。

SFT 数据贵精不贵多。Meta 那篇 LIMA,只用 1000 条精挑细选的样例做监督微调,就做到跟一堆用了 RLHF 的大模型在人类评估里不相上下。2026 年更狠:一个 3 万条高质量合成数据的模型,压过了用千万条级专有数据训练、还叠了偏好优化的旗舰开源模型。1000 条好样例胜过 10 万条平庸的——这不是鸡汤,是 2026 年的主流共识。

但 SFT 有天花板:它教不出「偏好」。给模型看「巴黎→法国」,它学会了标准答案,但它说不清「为什么 A 回答比 B 回答好」。SFT 只会模仿样例,不会判断好坏——「这个回答更礼貌」「那个回答更准确」「这是垃圾」,这些判断它学不会。

教偏好,得换一种方法。这就是第三道工序出场的理由。

5. 对齐 / 强化学习:学规矩 + 学思考

第三道工序最热闹,也分两半:一半教规矩,一半教思考。2026 年变化最快的也是这一道。

教规矩:RLHF 和它的继任者

先教规矩。方法迭代了几代,2026 年的谱系大致是:RLHF → DPO → GRPO/RLVR。

RLHF(人类反馈强化学习)是 ChatGPT 那一波带火的。做法是请「评卷老师」:让标注员给同一个问题的多个回答打分排序——A 比 B 好,B 比 C 好——再用这些偏好训练一个奖励模型当裁判,用强化学习把模型的输出往「高分段」推。

评卷老师判的是偏好。这个回答更友好,那个更准确,这个冒犯了人、扣分。注意,「拒绝」就是在这时候被焊上去的——标注员给「我拒绝回答这个问题」打了高分,模型就学会了拒绝。

RLHF 贵。奖励模型要额外烧一遍算力,经典实现(PPO)还要一个跟策略网络差不多大的价值网络,内存直接翻倍。2026 年更主流的是 DPO(直接偏好优化):不用训练奖励模型,直接把「A 好 B 差」这个偏好对变成训练信号,让模型自己在参数里学会「往 A 靠、离 B 远」。业界的说法是能拿到 RLHF 约八成的效果,成本低一个量级。

教思考:RLVR 和 2026 的推理浪潮

2026 年真正的变化在另一半——教思考。方法是 RLVR(可验证奖励的强化学习)。它换了个裁判,不再是人给偏好,而是机器能验的客观对错:数学题,答案对不对?代码,测试跑没跑过?对就是对,错就是错,验证器一判,不需要人标。

这个转变我打个比方:SFT 是语文老师教格式,RLVR 是数学老师只发对错答案、不发解题过程,让你自己在题海里琢磨出套路。题海战术真能练出解题思路——R1 证明强化学习能长出新能力。这句话我要立成判断,往下用 R1 当证据。

DeepSeek-R1:题海长出来的思考

DeepSeek-R1 是这个判断的实锤。它直接在基础模型上上强化学习(方法叫 GRPO,是 R1 带火的,特点是省掉了价值网络),只给两类奖励:答案对不对、格式对不对。没有人工标注的解题过程,模型全靠自己在题海里试。

结果长出了谁都没教过它的东西。训练过程中,模型的「思考」越变越长,从几千 token 长到上万 token;它会自己停下来检查、怀疑、回头改,甚至冒出过「Wait, wait. Wait. That’s an aha moment」这种自我修正的瞬间。AIME 2024 数学竞赛,通过率从基础模型的百分之十几拉到七十多。能力不是教出来的,是「题海 + 对错反馈」逼着长出来的。

这翻转了一个旧认知。以前强化学习在 LLM 里只是「薄薄一层对齐」——OpenAI 联合创始人 Ilya Sutskever 有个流传很广的比喻,预训练像受教育,RLHF 之后那层调教像入职培训。培训教规矩,但改不了能力底子。R1 打破了这个分工:强化学习不只是教规矩,它能长出推理、自我修正这种实打实的新能力。

更吓人的是成本。按 R1 的数据,RL 只占预训练成本的几个百分点,约 5%。又便宜,又能长能力,2026 年没人敢再小看这道工序。

6. 困惑①的答案:它明明不会,为什么装会?

回到引言第一个困惑:它明明不会,为什么装会?现在能答了。

能力上限在预训练就定死了,后面所有的调教都是在挖和表演。这是这篇文章最核心的一句判断。

理论依据叫 Superficial Alignment Hypothesis(浅对齐假说),出自 LIMA 那篇。它的主张:模型几乎所有的知识和能力,在预训练阶段就学完了;后面 SFT、RLHF 这些,主要是在教「用什么格式把已有的东西说出来」——是挖掘和表演,不是注入新知识。

「装会」就是这么来的。预训练里它见多了「XX 是什么」这类句子,学到的不是「我知道 XX」,而是「这类问题后面该跟一段像样的话」。SFT 又教了它「被提问时答得笃定、完整」。于是当它遇到训练语料里根本没有的知识点,它不会说「我不知道」——它没有这个选项——它只会顺着「问题 → 像样回答」的格式,把见过的词汇、句式拼成一段听起来特专业的话。这就是幻觉。

幻觉跟「能力上限」的关系,本系列后面会专门拆一篇,这里先埋个引子。你只要先记住一句话:幻觉不是它学坏了,是它只会按格式表演——它背不出「我不会」这个答案。

7. 困惑②的答案:它为什么突然不听话?

再答引言第二个困惑:它为什么突然不听话?

拒绝不是它本来的性格,是后来被教出来的规矩。预训练完的基础模型,其实什么都会接,包括那些不该接的。拒绝是 SFT 先教了「这类问题要说『我不能』」的格式,再被偏好强化焊上去的。

它内部怎么装的?2026 年研究得很细。拒绝不是一个复杂的决策系统,而是藏在参数空间里的一个低维「方向向量」。研究者的做法很粗暴:把模型在某一层的激活值,往这个方向的反方向推一点,模型当场「解锁」,什么都能答——像个开关。有人把它做成了 95% 成功率、1 秒出结果的工具。

更意外的是这个开关装得有多浅。有篇 ICLR 论文的标题直接就是这个意思:安全对齐不应该只做「几个 token 深」。拒绝主要作用在生成的前几个 token 上——模型先吐出个「我不能」把路堵死,后面就放开了。这就是为什么套个「角色扮演」的壳,把前几个 token 绕过去,后面它往往就顺着接了。越狱之所以容易,很大程度是因为这个开关太浅。

2026 年「过度拒绝」成了实打实的问题,论文扎堆。模型分不清「该拒的」和「不该拒的」,你问个无害的问题,它也像被狼来了吓过的小孩。学者进一步发现:真正的安全拒绝是一个「全局方向向量」,但过度拒绝复杂得多——它跟任务绑定、是高维的。所以「一刀切关掉拒绝」行不通,会把安全一起关掉。厂商现在头疼的,就是「有用」和「无害」这两个目标打架,2026 年把它叫对齐悖论——大家已经接受这是个此消彼长的帕累托边界,而不是能一次性解决的分歧。

说到底,它「不听话」,是因为有人给它装了个「这句话不能说」的开关。开关是后装的,不是天生的。

8. 技术深挖(可跳过)

这节写给想看机制细节的开发者,跳过不影响主线。

RLHF:奖励模型 + PPO

RLHF 三步走。第一步 SFT 让模型会说人话。第二步,用人类标注的偏好数据训一个奖励模型,给任何回答打分。第三步,用强化学习(经典实现是 PPO)让模型在生成时优化这个分数,同时加一个 KL 约束,防止模型为了刷高分脱离人类语言、答得怪。

贵在哪?奖励模型要单独训,PPO 还要一个价值网络估计状态值,内存直接翻倍。偏好对还得人逐条标,慢、贵。

DPO:把偏好对直接变成训练信号

DPO 的关键洞察:奖励模型那一步可以省。给定偏好对「A 好、B 差」,DPO 直接把它翻译成训练损失,让模型自己在参数里学会偏好,不需要显式的奖励模型。离线训练,稳定、便宜。这是 2026 年做偏好对齐的主流。

GRPO:省掉价值网络的组内相对优势

GRPO 由 DeepSeekMath 提出、R1 带火。PPO 需要价值网络估计「这个状态值多少」,GRPO 不要。它对同一个问题采样一组回答(常见 8 到 64 个),算每个回答的奖励,再用组内均值、标准差归一化——「比组内其他回答好多少」就是优势。省掉一整张价值网络,内存少一半,数学上还等价于一个理想价值网络。

RLVR:验证器当裁判

RLVR 把奖励从「人」换成「验证器」。数学题比对最终答案,代码跑测试用例,结构化任务校验输出格式。对就是对,错就是错,客观、不怕被刷分。代价是只适用于「答案可验证」的任务——「写一段打动人的产品文案」没有验证器,还得回到偏好那套。

9. 收束:上限是读出来的,性格是教出来的

把三道工序的账总一下。预训练让它会接龙——能力上限在这定死;SFT 让它会听话——答题格式在这学会;对齐/强化学习让它会规矩、会思考——什么能说、怎么答更好、难题怎么解,在这焊上。这就是标题那句:从会接龙,到会听话,到会思考。

如果你还没动手,回去打开上一篇那个 Excel,把「语料」Sheet 的 A1 整段换掉。上一篇我说这是「换语料等于重新训练」。现在你知道了,那只是三阶段里的第一步——预训练。真实世界里,换完语料后面还有两道工序:SFT 补答题格式,对齐补规矩。那个 Excel 只模拟了第一格,后面两格它模拟不了——但你现在知道它们存在了。

下一篇,本系列第 3 篇《Transformer 与注意力》。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/21 21:26:37

DCBA:在连通支配集中使用诱饵过程检测协作黑洞攻击

大家读完觉得有帮助记得关注和点赞!!! 摘要 移动自组织网络(MANET)是一种临时且动态的网络拓扑,其中节点具有移动性,并随机分布在网络区域中。在MANET中,节点相互协作,…

作者头像 李华
网站建设 2026/8/21 21:25:17

如何用 Awakened PoE Trade 快速查询 PoE 物品价格

如何用 Awakened PoE Trade 快速查询 PoE 物品价格 【免费下载链接】Awakened-PoE-Trade-Simplified-Chinese :heavy_dollar_sign: :hammer: Path of Exile trading app for price checking 项目地址: https://gitcode.com/gh_mirrors/aw/Awakened-PoE-Trade-Simplified-Chin…

作者头像 李华
网站建设 2026/8/21 21:24:58

机会信号导航建模:从TOA/TDOA原理到数维杯A题实战解析

1. 赛题核心拆解:从“源机会信号”到“导航分析”的建模链路 看到“2024年数维杯数学建模A题”这个标题,很多同学的第一反应可能是去找现成的代码和思路。但作为一名带过多次建模竞赛的“老鸟”,我得说,直接奔着代码去&#xff0c…

作者头像 李华
网站建设 2026/8/21 21:24:54

Python桌面通知工具开发:仿环世界风格的非侵入式告警系统

大家好,我是专注于分享实用开发工具和项目实战的博主。在日常开发或运维工作中,你是否遇到过这样的困扰:服务器监控告警、自动化脚本执行结果、CI/CD构建状态等关键信息,只能通过频繁刷新网页或查看日志文件来获取,不仅…

作者头像 李华
网站建设 2026/8/21 21:24:48

3 步免费下载电子课本 PDF:tchMaterial-parser 开源工具完全实用指南

3 步免费下载电子课本 PDF:tchMaterial-parser 开源工具完全实用指南 【免费下载链接】tchMaterial-parser 国家中小学智慧教育平台 电子课本下载工具,帮助您从智慧教育平台中获取电子课本的 PDF 文件网址并进行下载,让您更方便地获取课本内容…

作者头像 李华
网站建设 2026/8/21 21:21:48

1-8-希尔排序-ShellSort

希尔排序 (Shell Sort):分组插入的增量缩减 摘要:插入排序在小数据和近乎有序场景下表现出色,但面对完全逆序数据时退化为 O(n)——每个元素都要移动到底。希尔排序的核心洞察是:先做大跨度的粗排,再做小跨度的细排。通…

作者头像 李华