#AI 模型

V4 Flash 正式版发布之后,聊聊"后训练"为什么这么强

预训练和后训练各在做什么、为什么预训练出来的模型还不能直接用、后训练又为什么能带来这么大的提升——一篇讲清大模型的训练流程。

种下2026/08/01 6 分钟 种子

2026 年 7 月 31 日,DeepSeek V4 Flash 正式版上线,数学、代码、Agent 各项基准数据都很亮眼。但比起参数表,我更想聊它背后一个被反复提起的词:后训练。“性能全靠后训练堆出来的”——这句话在行业里传得很广,可它到底在训练什么,跟预训练又差在哪,多数人其实说不上来。

书页间长出嫩芽 知识是种子,能力是长出来的光。

为什么要后训练:预训练出来的模型,根本没法直接用

预训练只教模型一件事:预测下一个词。给它”苹果是一种____“,它填”水果”;给它”今天天气真____“,它填”好”。但如果你问它”苹果为什么是红色的”,它不会回答——它只会顺着你的话继续编下一句,编得一本正经,内容却可能完全是瞎说。这不是它笨,是它压根没学过”问答”这件事。

想象一个读完了整座图书馆、却从没跟人说过话的学生。知识全在脑子里,但你问他任何问题,他只会自顾自地复述书里的话,不会针对你的问题作答。

后训练,就是把这个”只会背书的学生”训练成”能回答问题的人”。它发生在预训练之后,作用是把读进去的知识,变成用得出来的能力。

预训练和后训练,差在哪

如果把训练大模型比作培养一个人才,预训练是”读万卷书”,后训练是”岗前培训”。

读万卷书,决定这个人肚子里有多少货——知识面、语言能力、对世界的理解。岗前培训,决定他能不能把肚子里的货用出来——会不会答客户问题、会不会写报告、懂不懂公司流程。

预训练后训练
在学什么世界是什么样怎么把知识用出来
直接产物一个会续写的模型一个能用的助手
决定什么知识上限上限兑现多少
成本天量算力、数据相对小,但杠杆高
类比读万卷书岗前培训

预训练决定知识的边界,后训练决定边界内能兑现多少。

后训练为什么这么强:四件事叠在一起

唤醒。 V4 预训练吃了 33 兆 token——那是多少?相当于人类几千年写下的文字里,相当大的一个比例。模型不缺知识,缺的是调用知识的路径。后训练不做加法,而是把已有的知识串成一条条解题的路。同样的底子,会用和不会用,差一个量级。

强化学习让推理能力自己长出来。 这是最神奇的部分。后训练里有个环节:不给标准答案,只给”对”或”错”的信号。模型在无数次试错里自己发现——多想几步、把问题拆开想,正确率更高。于是”长思维链”自己涌现了:它学会了像人一样,先分析、再作答。DeepSeek 上一代出圈的 R1 靠的就是这个,V4 把它玩得更深——在高中数学竞赛级别的测试(AIME)里做到了 99.4%,接近满分。

Agent 化训练,从”会说”变成”会做”。 前两步都是让模型”说得好”,这一步是让模型”做得到”:真的去调用工具、写代码、跑结果,跑通了给奖励。所以 V4 写代码的实战能力登顶(SWE-bench 第一),不是背题背出来的,是真刀真枪干活练出来的。

蒸馏,小模型抄大模型的作业。 V4 有两个版本:Pro 是 1.6 万亿参数的巨无霸,Flash 是 2840 亿参数的小个子。Flash 怎么继承 Pro 的能力?让 Pro 出题、解题、写出完整思路,Flash 照着学。注意它学的不是答案,是思路——就像抄作业只抄答案会被老师看穿,但把学霸的解题过程看懂,那就是真学会了。Flash 每次只激活 130 亿参数,却能打出接近大模型的表现,靠的就是这个。

为什么焦点转向了后训练

两个原因。

一是预训练走到了瓶颈:高质量数据快被读完了,算力成本一路走高,同样再加一批数据,提升远不如早期。二是后训练的边际收益还很大——在固定底子上榨出更多能力,性价比远高于继续堆底子。这也是为什么 DeepSeek 干脆把后训练框架开源了:后训练的方法论本身,正在变成下一轮竞争的关键。

数据读完了怎么办

预训练见顶,最头疼的就是燃料问题:互联网高质量文本快被读完了。V4 已经用了 33 兆 token,相当于人类全部文字积累的相当大比例。再往后,拿什么喂模型?行业在试四条路。

合成数据(AI 喂 AI)。 真实数据不够,就让大模型自己生成高质量答案和推理,再喂给模型。这是 DeepSeek 的杀手锏之一——让 Pro 生成数据训练 Flash,相当于老师出题给徒弟做。但风险也很明显:模型吃自己吐出来的东西会”退化”,输出越来越单一、错误被不断放大,像近亲繁殖。所以各家都在研究怎么”掺水”——真实数据和合成数据按比例混合,不能纯吃合成的。

多模态数据。 不止文字了:图像、视频、音频、代码运行结果都算数。世界知识不只有”读过的”,还有”看过的""跑过的”。V4 的代码能力有一部分就来自真实运行代码的反馈,而不是读静态文本。

推理数据(self-play)。 让模型自己出题、自己解答、再用验证器对答案。数学和代码领域特别适合——验证器能自动判对错,相当于 AI 自己给自己出模拟卷,无限量供应。这也是强化学习后训练的天然搭档。

数据质量优先。 行业共识正在转变:以前卷”多少 token”,现在卷”什么样的 token”。人工精修的小批量数据,效果远超海量劣质数据。DeepSeek 后训练的成功,很大程度就靠精挑细选的微调数据。

后训练也不是万能的

它补不了知识的短板。 后训练只是把已有的知识用好,底子薄的话,怎么榨也榨不出新东西。预训练没见过的领域,后训练变不出知识来。

它有对齐税。 为了让模型安全、合规、不胡说,后训练要花大量精力”约束”它。约束得越多,模型越规矩,但也可能越保守——这是后训练必须付出的代价。

它会被奖励钻空子。 强化学习里,模型会想尽办法拿高分。如果奖励设置不严,模型会找漏洞——答得”像对的”而不是真的对。训练方要不断和模型的投机斗智斗勇。

预训练给骨架,后训练给灵魂。两者缺一不可,但当下,后训练才是拉开差距的主战场。

这篇还在生长——想法会随着理解加深继续修剪、补充。