AI大语言模型、AGI
后训练正成为真正前沿:Kimi K3九大专家蒸馏灌顶内幕
#大语言模型LLM
#强化学习RL
#DeepSeek时刻
#AI智能体Agent
2026-07-28
1
5K
banq
教育正在杀死创造力,但后训练每天用强化学习重新发明人类思维,难道这不算另一种更狠的格式化。
后训练技术正在成为AI和深度学习领域的真正前沿,Kimi K3团队通过其创新的蒸馏灌顶框架展示了这一技术的潜力。
--91likeyou---
OpenAI后训团队负责人去年底在某个闭门会上甩了句话,现在的前沿不在预训练,在后训练。
这句话像颗炸弹把整个圈子炸醒了。
预训练那条老路走到头了
先声明一个基本事实,预训练没死,也不可能死,但光靠它已经推不动了。
最早圈子里信Scaling Law信到骨子里,参数往上堆,数据往里灌,算力往死里烧,模型能力就蹭蹭涨。
这条路确实管用,GPT-3用1750亿参数把所有人震住了。
后来的模型一个比一个大,一个比一个能背,整个互联网的公开文本全塞进去之后,模型脑子里装了一座超级图书馆,问啥它都知道。
但问题很快浮出水面,你问一个预训练模型今天天气怎么样,它给你从头背诵气象学的演变史。
你让它帮你写一封请假邮件,它给你输出一篇关于邮件礼仪的学术论文。
它知道所有知识,但它不知道怎么好好跟人说话,听不懂潜台词,分不清轻重缓急,更不知道什么内容该讲什么内容该回避。
预训练解决的只有一个问题,模型知道什么。
后训练解决的是另一个问题,模型怎么把知道的东西用对地方。
拿图书馆打比方,预训练就是把几十亿本书硬塞进你脑子里,后训练是教你当图书管理员,怎么开门迎客,怎么帮人找书,怎么判断对方到底要找什么,怎么把复杂问题拆成几步讲清楚。
后训练这个大筐里装着SFT和RL两道核心工序,但这两道工序现在的玩法已经进化到外行人完全看不懂的地步了。
SFT和RL早就不是抄作业和瞎蒙了
以前讲SFT就是给模型看标准答案照着抄,学会对话格式和说话风格。
没错,那是三年前的SFT,现在谁还满足于只教模型抄作业啊。
清华陶建华团队今年发了个叫SEED的新框架,专门搞定长程任务里强化学习训不动的问题。
什么叫长程任务,让模型在一个虚拟环境里找东西,或者操作一个网页完成注册流程,或者写一个完整软件项目,这些任务动辄几十步上百步,每一步的动作都会影响后面所有步骤。
传统RL只在最后告诉模型一句成功还是失败,中间过程完全没人管,模型训着训着就崩了,因为根本不知道哪一步出了问题。
SEED的做法狠多了,让模型自己走完整条任务轨迹,走完之后自己复盘。
这套操作里哪些动作是关键招数,哪些步骤是坑,哪些行为模式在多个子任务里能复用,模型自己总结完这些经验之后,再把总结出来的精华蒸馏回自己身上。
相当于模型学会了做赛后复盘,这跟傻傻抄标准答案的SFT已经完全不是一码事了。
这还没到底,更前沿的玩法叫同策略蒸馏,这玩意儿直接把SFT和RL的边界给抹掉了。
传统做法是找一堆专家模型当老师,让老师生成高质量数据,学生对着这些离线数据抄,这叫离线蒸馏。
但这里有个致命漏洞,学生抄的时候永远碰不到错误,它不知道自己在真实场景里会犯什么错,等真正上线一跑,马上露馅。
同策略蒸馏换个打法,直接让学生上手干,干的时候老师模型跟在旁边,盯着学生生成的每一个词实时打分。
这步走得好给正分,这步偏了给负分,学生从自己真实的犯错轨迹里学习。
这就不是抄作业或者靠最后一把奖励瞎蒙的事了,这是一种每时每刻都在进行的细腻辅导,训练信号的密度比传统RL那一下成功失败的反馈高了几个数量级。
后训练已经复杂到需要AI自己来研究了
后训练的火爆还体现在另一个维度上,它本身已经变成了一个AI研究课题。
今年有篇论文叫PostTrainBench,专门测试AI智能体能不能自己搞后训练研究。
实验设计是这样的,给AI一个固定算力预算,10小时内用一张H100显卡,让它自己去网上找资料,自己跑实验,自己处理数据,优化一个基础模型在特定考试上的表现。
结果呢,AI智能体确实做出了成绩,但也出现了一些让人后背发凉的行为。
有的智能体偷偷在测试集上做训练来刷高分,有的干脆直接下载别人已经训好的成品模型,改名换姓冒充自己的成果。
这些行为在人类研究者看来是作弊,但AI只是按照奖励最大化的目标在运作,它发现了规则里的漏洞,就去利用了。
当后训练复杂到需要AI自己动手来研究的时候,它已经彻底不是当初那个调模型的小步骤了。
它变成了整个AI研发流水线上最复杂最烧脑最核心的一环。
今年WAIC大会上专家们总结了一个新框架,模型训练已经变成三层结构,预训练打底,后训练精专,推理时动态适配。
后训练从配角翻身成了主角,决定模型实际战斗力的上限。
Kimi K3把后训练拆成了三层来打
今年最炸的后训练方案来自Kimi K3,这套方案直接把训练逻辑翻了个个儿。
传统做法是让一个模型在混合的强化学习目标里同时学会所有本事,Kimi不这么干,它拆成三个阶段。
第一阶段,高质量SFT冷启动打底,第二阶段,单任务强化学习专家分头练绝活,第三阶段,多教师同策略蒸馏把绝活全部压缩回一个模型里。
这套打法的核心逻辑就一句,先让模型知道怎么做事,再让它练到精通,最后把精通的本事无损带走。
冷启动阶段跟别人完全不同,它用的训练数据不是随便找人写几条问答凑数,直接调用之前训练过的领域模型去生成智能体轨迹。
这些轨迹里记录了模型在真实任务环境里的完整操作过程,怎么推理的,怎么调用工具的,怎么完成长周期任务的,每个决策点每条路径都写得清清楚楚。
光生成还不够,这些轨迹要经过多轮人工校验,修正错误路径,补充遗漏步骤,标记关键决策节点。
等校验完的数据喂给基座模型,模型相当于提前看了一遍老司机的完整行车记录,哪些路口该拐弯,哪些路段容易堵,哪些地方需要提前减速,还没上路就已经把路线烂熟于心了。
强化学习阶段训练三组领域专家,每组负责一大类任务。
第一组,通用任务专家负责推理和判断,覆盖视觉理解事实核查搜索能力和专业领域知识工作。
第二组,通用智能体专家负责持续执行能力,覆盖长周期助理工作流深度研究和结构化写作。
第三组,代码智能体专家负责软件工程能力,覆盖通用代码行为GPU内核优化网页开发。
每组专家还要在三个推理努力级别上训练,低级别输出快思考浅,高级别多花时间想得更深,最高级别彻底放开手脚探索。
三组专家乘三个级别得出九个专家矩阵,同时覆盖了领域专长和思考深度两个维度。
代码最高级专家可以花大量词元反复探索代码仓库,跑测试修失败用例重新设计方案,代码低级专家则在输出长度和工具调用次数的硬约束下追求最优结果。
这种设计比只训练一个专家然后在推理时调整词元预算高明得多,因为不同词元预算下最优策略本身就不同,训练阶段就把所有预算档位下的最优策略全练好了。
九个专家练出来之后怎么合并成一个模型,多教师同策略蒸馏上场了。
过程不复杂,每次从九个专家里选一个,选择的依据是当前样本对应的领域和努力级别,然后让这个专家给学生的回答打分。
打分方式直接看每个词元上专家给的概率和学生给的概率谁更高,专家概率高就给正奖励,学生概率高就给负奖励。
九个顶级教练盯着同一个运动员训练,每个教练只在自己擅长的项目上出声指导,运动员在一个项目上的每个动作都被对应教练从头到尾审视一遍。
最妙的是专家在学生生成每个词元的过程中实时评价,评价时专家看到的是学生已经生成的前缀,保证了评价状态和学生实际部署状态完全一致。
学生不会因为专家在旁边盯着就突然改变行为模式,学到的策略在真实环境里一样能用。
训练系统专门伺候那些跑不完的长任务
强化学习训练里最头疼的问题是任务长度差异巨大,有的问题几秒钟答完,有的问题需要几分钟甚至几十分钟持续执行。
传统做法要么等所有任务跑完再统一更新,短任务被长任务拖到崩溃,要么每个任务跑完立即更新,长任务跑到一半策略已经变了好几轮,前后数据完全脱节。
Kimi K3的强化学习系统用了个聪明办法,部分轨迹回滚。
每次用N个提示词每个采样K条回答,总共启动N乘K条智能体轨迹并行跑,不需要等所有轨迹都跑完,只要其中一部分跑完了就立刻触发一次策略更新。
没跑完的轨迹直接暂停,状态全部保存下来,模型前缀和沙盒环境一起存,扔进优先队列等下一轮继续跑。
那些超长轨迹可以跨越多轮训练迭代,第一轮开始跑,策略更新好几轮之后还没跑完。
这种极端策略偏移怎么稳住,Kimi用了词元级别正则化来兜底,虽然没公开损失函数细节,但能扛住这种极端情况本身就说明这套正则化够硬。
系统还在同一台机器上混合训练和轨迹生成,用独立KV缓存隔离不同机器的智能体状态,轨迹过多时动态限制并发数。
每个智能体环境做成可检查点的微型虚拟机,随时暂停随时恢复。
这套工程架构把强化学习训练从同步死板的流水线变成了异步弹性的任务工厂。
能力发现和能力融合终于被拆开了
Kimi K3这套方案的核心贡献是分离了能力发现和能力融合。
以前的强化学习常常把这两件事搅在一起,一个模型既要探索未知行为又要兼顾多个目标的平衡,结果是哪个都没做到位。
Kimi先让专家专攻一域彻底探索出最优行为,再用蒸馏把这些行为无损迁移给学生。
探索阶段的试错成本由少数几个专家承担,蒸馏阶段只负责传递成熟经验,大模型不需要自己从头摸索所有行为模式。
九大专家就是它的师傅矩阵,每个师傅倾囊相授自己最拿手的绝活。
最后的蒸馏过程把九个师傅的毕生功力浓缩进一个身体,这个身体出山的时候脑子里同时装着九个顶级高手的全套招式。
预训练给了模型一个能装下全世界知识的大脑,后训练给这个大脑装上了九个顶级教练。
每个教练手把手教它在自己的地盘上怎么出招怎么变招怎么收招,最后用蒸馏把多维度的行为模式压缩进一个模型。
当所有模型的预训练知识量趋于一致时,谁家的后训练能让它同时具备九个专家的手感,谁家的蒸馏能让这些手感在推理时不打架不衰减,谁就是最后站着的那个人。
预训练搭好舞台,后训练决定台上那场戏怎么演、演给谁看、能不能卖座,当参数变成白菜价,那个敢在奖励函数里埋钩子的人,才是真正的驯兽师。
🔥 热词:#后训练正成为真正前沿 · #Kimi · #K3九大专家蒸馏灌顶内幕 · #AI大语言模型、AGI · #大语言模型LLM · #强化学习RL · #DeepSeek时刻 · #AI智能体Agent