最近这道题在网上传得挺多。“为什么大模型先做 SFT、再做 RL性能会先下降、再爬上来”你要是搜一搜网上答案不少而且基本都对——这道题本来也不难大家心里多半都有个谱。今天我想做的不是再给一个更对的答案而是顺着这些答案一层一层往下挖看看背后到底在发生什么。挖到最后还会顺手牵出一件挺反直觉的事SFT 练得越好的模型做完 RL 之后反而可能越差。先把两个词说人话后面整篇都用得上SFT监督微调拿一堆别人写好的标准答案让模型照着抄、照着背。输入是题、输出是标准答案模型学的是模仿。RL强化学习不给标准答案了让模型自己动手做一遍做完看结果好不好好就鼓励、差就惩罚让它自己慢慢调。输入是题、输出是模型自己摸索着做出来的答案反馈是分数。说白了SFT 是抄答案RL 是自己做题对答案。这俩的差别是后面所有事情的根。━━━━━━━━━━━━━━━━━━━━◆ 先把网上的 4 种答案从浅到深排一遍━━━━━━━━━━━━━━━━━━━━这部分我们走快点。常见的解释大概是这 4 个我顺着从表面现象往底层机制的次序排一下——不是说前面的错、后面的对而是它们看问题的层次不太一样。解释一最朴素探索是要交学费的。RL 一上来要探索——它得主动偏离 SFT 教它的那条稳妥走法去试试别的路万一更好呢试的过程里输出就变野了啥都敢往外蹦。这时候指标当然掉。等它试得够多、攒够了哪条路有奖励的经验、慢慢收敛指标就回来了。这就是强化学习教科书第一章的探索 vs 利用你想找到更好的就得先放弃眼前确定的。解释二格式稳定假说先把腔调焊死再优化内容。SFT 的作用是先把输出的格式和腔调焊稳——回答长啥样、用什么口吻、分几段。格式稳了RL 才好在这个稳定的地基上去抠内容质量。但SFT 要是练过头把模型的潜力榨干了RL 接手时能捞的油水就少了。解释三进阶分布错配模型把自己练得太自信了。这条开始有意思了。SFT 是拿离线数据别人写好的标准答案硬灌RL 是模型在线采样自己当场做题。这俩喂给模型的东西根本不是同一个分布。更要命的是SFT 练得越狠模型对标准答案就越自信——用人话说它把答案就该这么写的概率压得越来越尖、越来越死。结果 RL 一上手让它自己采样做题它采出来的东西和 SFT 死磕的那个尖峰对不上早期的调整方向全是乱的 → 指标掉等它慢慢调出一片自己也认、分数也高的区域 → 回升。解释四最深OOD 遗忘 RL 修复泛化能力被练丢了RL 去捞回来。先说个词OODOut-Of-Distribution分布外。说人话就是举一反三的能力见过的题会做不算本事没见过的新题型也能做这才叫泛化。研究发现一件扎心的事SFT 的举一反三能力在训练很早期就到顶了之后你越练它反而越往下掉——像一个学生背标准答案背上瘾背到最后只会这一种解法换个题型就懵。那 RL 干了啥RL 不是去发明新能力它干的是把 SFT 练丢的那个举一反三能力给捞回来。学术叫 restoration修复不是 discovery发现。这一点其实和我们之前两期能接上。187 期【RLHF】豆包型人格—后训练的功与过工作增强 vs 伦理约束和 198 期【RLVR 后训练的天花板】花 10 倍算力微调换不到 2 倍提升都讲过RL 不会给模型灌新本事它干的是把概率重新分配——base 模型本来就会的那些路径里有的被压下去、有的被抬上来。你品一下“压下去一些、抬上来一些”这本身就是个方向上的变化不是调大调小。哪条路被抬、哪条路被压决定的是模型往哪个方向倾斜——而不是把某种能力整体放大或缩小。这个方向到底是啥下一节会用一个数学工具拆给你看这里先记住是在换路、不是在调音量就够了。一个反差挺有意思SFT 边练边丢RL 边练边捡。━━━━━━━━━━━━━━━━━━━━◆ 点破一层③和④其实是同一件事━━━━━━━━━━━━━━━━━━━━上面 4 个解释前两个是表象真正的肉在③和④。而③和④说的根本是同一件事SFT 把模型的能力方向拧偏了——拧到只对标准答案有效RL 又动了一次这个方向把丢掉的举一反三能力找补了回来。先埋个伏笔找补回来这四个字后面我得跟你纠正一下——RL 到底把方向转去了哪其实没那么简单。先按这个朴素版本往下读。分布错配是从数据角度看这件事OOD 遗忘修复是从能力角度看这件事一体两面。到这儿常见的几种解释就大致聊完了。下面这部分是我读论文时自己觉得挺有意思的一层顺手分享给你。━━━━━━━━━━━━━━━━━━━━◆ 关键的一层不是调大调小是整个转向━━━━━━━━━━━━━━━━━━━━要讲清这件事得先给你一个工具的直觉。别怕就在大学线性代数的范围里我尽量讲人话。这个工具叫 SVD奇异值分解。先垫一句背景大模型的知识很大一部分存在一堆叫权重矩阵的大表格里。SVD 干的事是把一个权重矩阵拆成两样东西一组方向数学上叫奇异向量——你可以粗略理解成这个模型有哪些能力维度比如识别语气“做数学”“讲笑话”每个能力是一个方向。严格说一个方向不完全等于一个具体技能但对咱们理解这事这么想足够了。每个方向上的强度数学上叫奇异值——这个能力使多大劲、占多大比重。 翻译成人话想象一把刻刀。SVD 告诉你两件事这把刀朝着哪个方向方向以及你用了多大力气去刻强度。一个权重矩阵可以拆成一堆方向 每个方向上使多大劲。好现在有个特别自然、特别朴素的猜想我一开始也是这么猜的估计大部分人都会这么猜“SFT 训练时八成是把某些能力方向的强度调大了——比如把’背答案’这个方向的劲使得特别足RL 再训练时又把这个强度压回去。先降后升就是强度被拉高又拉低的过程。”听起来挺合理对吧但翻了翻论文这个猜想是错的。这一节的说法出自 2025 年的一篇论文《RL Fine-Tuning Heals OOD Forgetting in SFT》arXiv:2509.12235后面那些数字也都来自它做的实验。而且论文证明猜错了的办法特别干净是个控制变量实验值得讲一下——不然你凭啥信我方向变了、强度基本没变这句话既然权重矩阵能拆成方向 强度两部分那就一次只动一个看模型表现怎么变实验一只把强度换回训练前的样子方向保持不动。结果——模型的举一反三能力几乎没变化。说明强度不是关键。实验二反过来只把方向换回训练前的样子强度保持不动。结果——模型丢掉的举一反三能力明显回来了。说明真正起作用的是方向。一动强度没反应一动方向就见效。这就把是方向在变不是强度在变给坐实了——不是猜的是控制变量测出来的。再补一个数字论文直接量了强度在训练前后的变化差值只在 0 到 0.005 之间晃——基本等于没动跟噪声一个量级。而方向那边论文用一个叫主夹角的几何工具量了量确实转出了实打实的角度。所以这件事可以浓缩成一句话强度基本没变方向转了。 翻译成人话还是那把刻刀。你以为 SFT 干的是把刻刀使的劲调大调小——不是。SFT 干的是力度基本没变但把刻刀的朝向给拧偏了——拧到死死对着标准答案那个方向换个题型就够不着了。而 RL 阶段刀的朝向又转了一次——也是只转方向、不动力度。模型丢掉的那点举一反三能力差不多就是伴着这次转动一起回来的。你的能力刀的力度大体还在。丢的不是能力本身而是朝向。这里得补充一个属于高维空间的几何直觉为什么只转了一点点方向能力就会丢得这么干净在 2D 或 3D 的现实世界里你把刀的角度转偏 5 度它切下去的位置差别不大。但大模型住在一个 12288 维的超级几何空间里。高维空间有个极度反直觉的性质随便挑两个方向它们几乎总是彼此垂直正交的——维度越高这事越铁。正因为对得上在高维里这么稀罕对准某个能力方向就成了一件很苛刻的事刀稍微一拧它和原来那条能力方向就几乎搭不上了。SFT 这一拧等于把刀转出了预训练沉淀下来的那条能力路径输出对不准下一层神经网络该接的位置。所以不是能力被抹掉了是它偏出射程了——刀还是那把刀只是没对着靶子。这就是为什么调大调小那个朴素猜想是错的至少在论文分析的那些注意力和 MLP 权重矩阵里主要变化不是某个能力被放大又缩小而是方向发生了旋转。这是两件完全不同的事——一个是音量旋钮一个是方向盘。SFT 和 RL主要拧的是方向盘几乎没碰音量。其实你顺着想一层会觉得只转方向这事本该如此强度音量管的是这个能力重不重要——你把某个方向的强度调小等于把这项本事削弱了。方向方向盘管的是走这条路还是那条路——转方向主要是在换路走不是把那项本事本身砍掉。那训练的时候我们想干嘛我们根本不想削弱模型任何一项能力——那些本事都是预训练辛辛苦苦攒下的丢一个少一个。我们要的只是让它在该用的时候走对路。这么一看主要转方向、少碰强度就不是什么巧合了——这才是最划算的做法尽量保住预训练攒下来的能力只调整什么时候该走哪条路。━━━━━━━━━━━━━━━━━━━━◆ 现在先降后升这条曲线大致说通了━━━━━━━━━━━━━━━━━━━━知道了方向在转那条让人困惑的曲线就好理解多了RL 一上来就开始转刀的朝向。但转向不是瞬移——训练是靠梯度下降一小步一小步挪的每步只能按学习率挪那么一丁点刀得一点一点转过去。这中间必然要经过一段尴尬的过渡地带——这段过渡里刀既离开了旧的朝向原来对着标准答案那套扔了又还没在新的落点站稳。两头不靠。这时候你拿它去答题当然答不好 →指标下降。等它转着转着站稳了 →指标慢慢涨回来有些设置里还能超过原来。先降是转到一半的两头不靠后升是转动停下、站稳了。这里我得老实交代一件事免得你以为我把一切都讲圆了——其实没有。这道题往深里走有一部分是测出来的实锤有一部分是猜的还有一部分连论文都没答上来。我一层层给你分清楚。第一层实锤测出来的。论文能确认在它分析的参数矩阵里SFT 和 RL 这两个阶段关键变化都是转方向不是调强度。这个有控制变量实验撑着前面讲过了。第二层推测有地基但还是猜。论文卡了个壳它量出来 SFT 和 RL 两阶段的旋转曲线几乎重叠愣是没分辨出这两次转动到底差在哪。这地方我们斗胆补个猜想——而且这个猜想不是凭空来的。我的直觉是SFT 把模型的采样盆地压窄了RL 一上来先把这个盆地打散所以会先掉等新的奖励地形重新把概率质量聚起来就回升。这其实能接上我们很早以前第 45 期周末漫谈高维流形上的神经网络收敛——Transformer 的数学本质里那套说法预训练长出来的是一个本我流形 M后训练不是重造一个脑子而是在这个流形上挖坑、修坡、改路。当时我们讲 RLHF 的安全训练说它是在 M 表面挖了一个安全盆地 R让模型默认蹲进作为一个 AI 模型……那种僵尸态里。这篇换个角度看SFT 挖的不是安全坑而是标准答案坑。它把模型往人类答案就长这样的区域里压让模型默认蹲进一个很窄的模仿盆地。这个坑不一定让模型变傻甚至短期看会让它更稳、更像样但代价是坑外面那些原本能走的泛化路径被压低了。base 模型原本像一大片高维山地很多路都能走。SFT 拿标准答案反复压它把很多本来能走的侧路压低只留下像标准答案的那条沟。模型变得顺、稳、格式好但概率分布也变尖了探索半径变小了。RL 开始探索时模型得从 SFT 挖的那个又深又陡的答案坑里往外爬。爬出坑口的路上大概率要翻过一些高维地形里的鞍点——你可以想象成两座山之间那个低凹的豁口顺着山脊走是下坡横着穿过去却是上坡是这么一个两头别扭的夹缝地带。在这种豁口附近地形又平又散模型一时找不到明确的下坡方向输出就容易变野——旧的模仿确定性丢了新的高奖励确定性还在前方的高地上没够着。这段翻山口的过程差不多就对应着指标崩塌的 dip 区旧沟被破坏了新沟还没成形模型卡在两头不靠的地方。这一段是顺着前面那个盆地比喻往下推的画面不是论文测出来的别当实锤。把这条翻山路画出来大概长这样看这张图有个地方要拐个弯它的纵轴是损失越低越好——所以小球是往低处滚的山顶鞍点反而是它最难受、要费劲翻越的地方。这跟文章开头那张性能曲线正好上下颠倒那张越高越好。别被两张图的方向绕晕一个量还差多少损失往下走一个量已经多好性能往上走说的是同一件事的正反面。所以我更愿意把它看成一次确定性迁移SFT 给的是外部确定性标准答案长这样。RL 要的是内部确定性我自己试出来这样能拿分。dip 是两种确定性交接时的真空期。再往下接我们之前 200 期【AI的子空间】满秩是假象——48个抽屉撑开了一个柜子讲过的一件事大模型的能力不是糊成一团的是按一组近似正交的子空间分格存放的格子和格子之间互不打扰就像 48 个抽屉各装各的。顺着这个分格结构想那把主夹角的尺子其实只量了一件事——刀转了多少度它量不出另一件更关键的事——刀是在哪个抽屉里转的。顺着这个思路斗胆猜一把会不会 SFT 拧的主要是格式与模仿那个抽屉就叫抽屉 A里的方向而 RL 找补的主要是逻辑与推理那个抽屉抽屉 B里的方向如果真是各转各的抽屉那两次转动碰的就是不同的能力分格——这样一来RL 既能不碰 SFT 已经规范好的格式腔调又能把丢掉的推理泛化能力隔空捡回来而尺子只量转了多少度、量不出在哪个抽屉里转也就难怪两条曲线角度看着重叠、结果却天差地别。得说清楚200 期讲的那个48 个抽屉实验量的是抽屉和抽屉之间的隔离没去量单个矩阵内部那种更精细的方向——那是这次这篇论文干的活而且那个实验测的是训练完成后的静态快照不是先降后升这个训练过程本身。所以拿它来接今天这事只是个有地基的猜别当成已经被测出来了。第三层未知谁也没答上来。RL 到底把方向转去了哪是把 SFT 拧偏的方向原路转回去了还是转去了一片全新的、碰巧也能举一反三的高地论文把它留成了有待将来研究的开放问题。甚至还有另一个角度的测量暗示RL 转完之后离那个举一反三最强的旧位置反而更远了一点——像是没回老家而是另寻了一片新天地。所以别被我前面那个顺口的刻刀比喻骗了方向在转是测出来的靠得住但RL 把方向精确转回正位只是个好懂的说法连写论文的人都还没真把这一步看清楚。一道看着像送分题的面经背后其实杵着个顶尖研究者都没拍板的问号——我倒觉得这才是它最有意思的地方。最后把这一节用到的几个关键事实出处给你交代清楚免得你觉得我在编故事——这些都不是脑补是论文里的真数据dip 这个现象本身是真的。《Beyond Two-Stage TrainingCooperative SFT and RL for LLM Reasoning》arXiv:2509.06948在 Qwen2.5-3B 上看到了一个很直观的信号SFT→RL 进入第二阶段后响应长度先 sharply decline再 gradually recover——正是前面说的先乱一下、再慢慢恢复。举一反三能力很早到顶后衰退是测出来的。前面那篇讲方向旋转的《RL Fine-Tuning Heals OOD Forgetting in SFT》用 LLaMA-3.2-11B 跑出来大约第 140 步就见顶之后一路往下。还有一篇先替下一节埋个伏笔。《Quagmires in SFT-RL Post-Training》arXiv:2510.01624在 Mistral-NeMo-12B、Qwen3 等模型上发现SFT 分数高不等于 RL 之后更强有些设置里 post-RL 表现也会先 dip 再回升。SFT 看起来越好、RL 之后就一定越好这个直觉本身就靠不住——这正是下一节要展开的反常识发现。━━━━━━━━━━━━━━━━━━━━◆ 反直觉钩子为啥好学生做完 RL 反而更差━━━━━━━━━━━━━━━━━━━━这里还有个挺反常识的发现。按常理你会想SFT 练得越好的模型checkpoint拿去做 RL最后应该越强吧地基打得越牢楼盖得越高天经地义。另一篇论文《Good SFT Optimizes for SFT Better SFT Prepares for RL》arXiv:2602.01058在 19 个模型上实测结论是反的SFT 分数更高的那个 checkpoint做完 RL 之后排名经常反而往下掉甚至不如一个 SFT 练得将将够的弱模型。排序反转了。为啥用我们刚建立的刀的直觉一句话就通了SFT 练得越狠刀就被拧得越偏、越死、越自信。这背后大致对应着一个叫局部曲率的东西说人话就是这个坑的坑壁有多陡。多解释一句它咋来的你高中学过一阶导数管往哪走、走多快二阶导数管弯得有多厉害——二阶导越大碗就越尖越陡。到了大模型这种几百亿参数的高维曲面“二阶导数不再是一个数而是一张两两求二阶导排成的方阵这就是Hessian 矩阵把它拆开还是上半篇那套分解的近亲每个方向配一个数这个数就告诉你沿这个方向弯得多狠”。所谓坑壁陡不陡量的就是它。说准确点这里弯来弯去的那个地形横轴是模型的权重参数、纵轴是损失值——是参数挪一下、损失涨多猛的那张曲面不是前半篇那种输出向量的方向。两处都用了弯但量的不是同一样东西别串了。SFT 练过头相当于在某个高维坐标上刨出一口又深又陡的重力井井壁立得几乎是垂直的曲率极大。RL 的奖励信号强度有限像一股不大的牵引力根本没法把模型从这么深的坑里拽出来。反过来一个 SFT 练得刚刚好的弱模型它待的坑是浅而平缓的曲率低。RL 轻轻一带就能把它从旧坑里滑出来挪向更开阔的泛化地带。这就是薄冰易融死结难解的几何本质。顺带说一句边界SFT 练得太短也不行刀还没立起来RL 也救不回只有落在中间那个不多不少的甜区RL 才接得住。太短太长都白搭。说到底这里藏着一句很硬的话记忆不等于能力。把标准答案背得越熟记忆不代表你越会做题泛化——有时候恰恰相反背得太死反而把举一反三的本事盖住了刀拧得越死临场越难再转动它。━━━━━━━━━━━━━━━━━━━━◆ 总结一道面经一个世界观━━━━━━━━━━━━━━━━━━━━把今天的链条捋一遍“SFT 后做 RL 先降后升”网上 4 个答案从浅到深探索学费 → 格式焊稳 → 分布错配 → OOD 遗忘后被 RL 修复最深那两个其实是同一件事SFT 把能力方向拧偏了只对标准答案RL 又动了一次这个方向再往里一层这个拧来拧去不是把能力调大调小强度/奇异值几乎不变而是让能力方向发生旋转方向/奇异向量在旋转——强度基本没变方向转了换成更直观的话SFT 把概率盆地压窄RL 先打散旧盆地再按奖励地形重新聚起来dip 就是旧确定性没了、新确定性还没长出来的真空期“先降后升”刀转向时中间那段既离了旧朝向、又没在新落点站稳的两头不靠最反直觉的SFT 分数越高不代表越适合接 RL练太狠时刀会被拧得太死RL 越难再转动它还有个诚实的尾巴方向在转是测出来的但 RL 到底把方向转去了哪、是不是转回正位连论文都还没搞清——一道面经背后杵着个开放问题一句话记住记忆不等于能力——把标准答案背得太死反而会把举一反三的本事盖住所以下次再碰到这道题除了探索导致性能波动那句标准答案你心里其实还可以多一层理解那不是模型变笨了那是它在转向。它正在松开自己被 SFT 焊死的那点确定性去够一个原先够不着的地方。━━━━━━━━━━━━━━━━━━━━◆ 参考资料━━━━━━━━━━━━━━━━━━━━二阶段 SFT→RL 的训练动态Beyond Two-Stage TrainingCooperative SFT and RL for LLM ReasoningarXiv:2509.06948——Qwen2.5-3B 上观察到 SFT→RL 第二阶段响应长度 sharp decline 后 gradual recovery高 SFT 分数不等于 post-RL 更强Quagmires in SFT-RL Post-TrainingarXiv:2510.01624——Mistral-NeMo-12B、Qwen3 等模型上显示高 SFT 分数不能可靠预测 RL 后表现奇异向量旋转 / OOD 修复 / 训练区间边界RL Fine-Tuning Heals OOD Forgetting in SFTarXiv:2509.12235——奇异值幅度几乎不变Δσ 仅 0–0.005变的是奇异向量的旋转LLaMA 约第 140 步 OOD 见顶SFT 太短或太长 RL 都救不回强 SFT 反而更差 / 分布错配Good SFT Optimizes for SFT Better SFT Prepares for RLarXiv:2602.01058——19 个模型上排序反转根因是离线 SFT 分布 vs 在线 RL 策略分布的错配学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】