这项研究由韩国互联网公司NAVER旗下的AI研究机构NAVER AI Lab发布论文于2026年7月16日以预印本形式公开编号为arXiv:2607.15161有兴趣深入了解技术细节的读者可通过该编号查询完整论文。**一个你可能从没想过的问题**每当你和手机上的AI助手对话时背后运行的往往是一个经过精心培训的语言模型。但这个模型究竟是怎么变聪明的它又是如何在有限的计算资源下尽量接近那些庞大、昂贵的顶级AI模型的水平NAVER AI Lab的研究团队提出了一种全新的训练思路把整个问题描述得非常直观与其让学生照抄老师的一切不如让学生只学老师后天努力学来的部分——也就是老师通过专门训练才获得的推理能力而非老师天生自带的语言习惯和风格偏好。这个思路看似简单但背后蕴含了对AI学习本质的深刻理解并且在大量实验中取得了显著优于现有方法的成绩。这套方法被命名为在线策略差值蒸馏On-Policy Delta Distillation简称OPD?。别被这个名字吓到我们接下来会用一个贯穿全文的比喻把它讲得清清楚楚把AI训练过程类比成一场武侠小说里的武功传授。**一、AI的武功传授从大师到弟子**在武侠世界里一位大师想把毕生武功传给弟子有几种方式。最粗暴的一种是让弟子每天观看大师的招式录像然后照猫画虎地模仿——这叫监督微调SFT弟子学的是大师的动作但动作是大师自己打出来的弟子只是跟着练。还有一种方式是让弟子实战出招大师在旁边打分这一招出得好加分那一招出得差扣分。这叫强化学习RL弟子在自己的实战中慢慢摸索什么是对的。这种方式更贴近弟子自己的实际水平但需要大师不断打分耗时费力而且打分本身也可能打偏。现在有了第三种方式叫在线策略蒸馏OPD弟子自己出招大师看着这套招数对每一个动作给出反馈——哪个动作我会这样打哪个动作我不会这样打。这样一来弟子既在练自己的招数又得到了大师对每个细节的实时指导兼顾了实战性和精细度。NAVER的研究团队发现OPD这种方式虽然已经很不错但还有一个根本性的问题没有解决大师给弟子的反馈夹杂了太多大师天生的习惯和风格而不是纯粹的武功精髓。**二、大师的天生习惯是什么**任何一位顶级AI模型都经历了两个阶段的训练。第一阶段是预训练在海量的互联网文本上学习语言本身学会怎么组词造句、理解上下文这就像一个人从小学语文、读书看报培养出了基本的语言直觉。第二阶段是推理调优专门针对数学题、科学问题、编程任务进行强化训练让模型学会一步一步推导答案这就像一个语文基础扎实的学生开始专门学习逻辑推理和解题技巧。问题在于当大师顶级大模型经历了第一阶段之后它已经形成了很多根深蒂固的语言偏好——比如它特别喜欢用perhaps也许这个词来表达不确定喜欢用verify验证一下、see看看这样的词来表达探索过程。这些习惯是大师在漫长的语言学习阶段自然形成的并不是推理能力的体现。当传统OPD训练弟子时大师给出的反馈不加区分地包含了这两类信息哪些推理步骤是对的以及哪些词汇符合大师的语言风格。弟子照单全收既学了推理方法也学了很多和推理无关的语言癖好。这就相当于你去学厨师师傅教你的不只是炒菜技术还包括他吃饭时习惯先喝一口汤、筷子要斜着拿的个人习惯——这些习惯跟炒出好菜没啥关系。**三、差值信号只学大师努力得来的部分**NAVER团队的核心突破就在这里与其让弟子学大师的全部输出不如让弟子学大师通过推理训练额外获得的部分。具体来说他们引入了大师的初始版本——也就是大师在经过推理训练之前的样子称为基础模型base model。然后他们计算这样一个差值大师训练后对某个词语的判断减去大师基础版训练前对同一词语的判断这个差值就叫做差值信号delta signal。用武侠比喻来说大师在学武之前已经是个普通的江湖人有自己的行走坐卧习惯。学武之后大师在原有基础上新增了独门功夫。弟子真正需要学的是那套独门功夫而不是大师的整个人生阅历。差值信号就是这套独门功夫的提炼。从数学角度看传统OPD的反馈信号是大师的概率减去弟子的概率而差值信号是大师的概率减去大师基础版的概率。两者的区别在于传统OPD的参照系是弟子自己而差值信号的参照系是大师尚未专门训练时的状态。**四、词云实验差值信号到底强调什么**为了直观展示差值信号和传统信号的区别研究团队做了一个非常有意思的可视化实验。他们用小模型Qwen3-1.7B在一万道数学题上生成回答然后分别计算传统OPD信号和差值信号把信号最强的词语以词云形式呈现出来词语越大代表该信号越倾向于强化这个词。结果非常说明问题。传统OPD信号强化的词语里出现了大量verify验证、see看看、try试试、confirm确认一下这样的探索性、犹豫性词汇。而差值信号强化的词语则明显不同出现的是hence因此、however然而、note注意、instead而是这样逻辑连接性强的词汇。这个区别反映了两种完全不同的推理风格。探索性词汇代表的是东摸摸西试试的漫无目的思考而逻辑连接词代表的是由此得出、进一步推断的有序推理链。差值信号通过对比推理前后的变化精准抓住了推理训练到底教了模型什么这个本质问题。**五、用错误答案检验信号质量**研究团队还设计了一个更直观的测试他们故意构造了三道包含错误推理过程的简单题目分别来自数学、科学和编程领域然后把这些错误的推理过程输入系统观察传统OPD信号和差值信号各自如何反应。以一道数学题为例题目是一个箱子里有3个红球和2个蓝球共有多少个球正确答案显然是5个但构造的错误推理声称把两个数字相乘3×26所以有6个球。面对这个错误推理理想中的信号应该在相乘和×26这些地方给出强烈的负面反馈告诉训练系统这里错了要压制这种表达。实验结果显示差值信号确实在这些关键错误节点给出了更一致的负面反馈而传统OPD信号在这些地方的表现则摇摆不定有时甚至给出了正面反馈。原因是这样的在传统OPD中大师和弟子都对乘法这个概念有很强的语言偏好毕竟乘法在数学文本中很常见两者的差值可能因此偏小甚至为正而差值信号对比的是大师推理后和推理前的差异推理训练让大师在遇到这道题时专门学会了32才是正确操作因此大师基础版对乘法并无特别偏好差值信号能更清晰地展现推理训练带来的方向性改变。**六、统计分析三个领域的全面验证**除了可视化实验研究团队还做了大规模统计分析使用了更大的模型Qwen3-8B作为弟子Qwen3-30B-A3B-Thinking-2507作为大师分别在数学、编程和科学三个领域各随机抽取一万道题目生成推理回答后分析两种信号的差异。分析结果在三个领域呈现出高度一致的规律。被差值信号强化的词语跨领域都包括hence因此、thus所以、however然而和regardless不管怎样这类明确的逻辑连接词这些词代表推理过程中的逻辑跳转和转折判断。被差值信号压制的词语则包括perhaps也许、tackle着手处理、look看看、consider考虑一下、analyze分析一下等这些词往往出现在漫无目的的思考描述中而非真正的推理跳转。在数学领域差值信号还特别强化了note注意、why为什么和depending取决于这些词在数学推理中代表对关键前提的观察和条件判断。在编程领域imagine假设、oh哦、hmm嗯这类反思性表达也得到了强化说明推理训练让大模型在编程问题上发展出了更强的反思和自我纠错能力。**七、OPD?的完整设计两个关键机制**确定差值信号是个好信号之后研究团队还需要解决一个工程问题直接用差值信号来训练可能会导致训练不稳定。具体来说传统OPD信号中包含了弟子自己的概率这意味着当弟子的输出越来越接近大师时信号会自然减弱训练会趋向稳定收敛。但差值信号里没有弟子的成分理论上即使弟子已经和大师一样好了信号仍然存在可能导致弟子被过度训练。为此团队设计了两个配套机制就像给差值信号配备了两个安全阀。第一个机制叫中心化把信号减去它的期望值让信号围绕零点波动。这样做的好处是让信号的方向更清晰哪些词要强化正信号哪些词要压制负信号一目了然。传统OPD信号有一个天然的优势当弟子的概率等于大师的概率时信号恰好为零不产生任何梯度。差值信号没有这个性质中心化处理部分弥补了这个缺陷。第二个机制叫联合条件在使用差值信号更新弟子参数时只有当差值信号和传统OPD信号方向一致时才执行更新如果两者方向相反就跳过这次更新不做任何修改。这个机制的意义是差值信号告诉弟子大师学到了什么传统OPD信号告诉弟子你距离大师还差什么只有当这两个方向对齐时才说明这次更新既符合学习目标又符合追赶目标。当弟子的输出已经完全等同于大师时两个信号方向自然一致且都为零训练自动停止实现了稳定收敛。这两个机制组合起来就构成了OPD?的完整损失函数以差值信号为主要驱动力以中心化和联合条件为约束确保训练既有方向性又有稳定性。**八、实验验证覆盖三大领域、多个模型规模**理论设计之后研究团队构建了一个相当全面的实验验证体系。他们选择了当时最前沿的开源推理模型作为实验对象阿里云的Qwen3系列1.7B、4B、8B三个规模和谷歌的Gemma4系列E4B规模涵盖了从十亿量级到百亿量级的多种规模。训练数据来自三个领域的公开问题集数学推理用OpenMathReasoning科学推理用OpenScienceReasoning-2编程推理用OpenCodeReasoning。三个领域各抽取均等数量的问题混合成一个多领域训练集共十万道题目每道题目在整个训练过程中最多使用一次相当于不足一个训练轮次。评估则更为全面覆盖14个基准测试数学方面包括AIME24、AIME25、AMC23、HMMT25、MATH500、OlympiadBench和ReasoningGym Math七个编程方面包括CodeContests、CodeForces、LiveCodeBench和ReasoningGym Algorithm四个科学方面包括GPQA、SuperGPQA和SciBench三个。同时研究团队还特别考察了Qwen3模型的两种工作模式非思考模式直接给出答案不展示推理过程和思考模式逐步推导类似于让模型把草稿写出来。这是因为Qwen3在非思考模式下推理能力相对薄弱而在思考模式下已经处于顶尖水平两种模式代表了截然不同的挑战。**九、非思考模式大幅超越现有方法**在非思考模式下结果非常令人振奋。以Qwen3-1.7B最小的那个模型为例原始模型在数学平均分只有34.8分经过传统OPD训练后提升到51.0分经过ExOPD现有最先进方法训练后是51.4分而经过OPD?训练后达到了54.6分。这种差距在更大规模的模型上依然持续。Qwen3-4B经过OPD?训练后数学平均分达到70.3而ExOPD只有66.4传统OPD只有64.0。有一个特别值得注意的现象4B模型经过OPD?训练后成绩超过了8B模型经过OPD和ExOPD训练后的成绩分别是65.9和67.8。换句话说更好的训练方法可以让小模型超越用一般方法训练的更大模型这在实际应用中具有重要的成本意义。编程和科学领域的结果同样一致。在编程上Qwen3-1.7B经过OPD?训练后平均分从10.5提升到29.4比ExOPD高出4.8分。在科学上三个规模的模型经过OPD?训练后均达到各自规模的最高分分别是38.8、50.5和51.6。**十、思考模式在顶尖水平上继续提升**思考模式的挑战要难得多这些模型原本已经是世界上推理能力最强的开源模型之一想在此基础上进一步提升就像让奥运冠军继续提高成绩一样困难。而且实验表明传统OPD在这个模式下经常适得其反平均分反而低于原始模型。OPD?在这个高难度任务上表现出了独特的稳定性。以Qwen3-8B为例原始模型数学平均分73.7传统OPD训练后降至72.2ExOPD训练后勉强维持在73.6而OPD?训练后提升到75.9。在最难的几个竞赛级别测试上提升尤为显著HMMT25一个面向高中生的国际数学竞赛从44.3分提升到52.3分而传统OPD和ExOPD分别只能达到43.3和46.3分。在编程领域Qwen3-8B的思考模式经过OPD?训练后四个编程基准测试全部得到提升平均分从50.8提高到57.8。科学领域同样呈现类似规律OPD?在所有规模的模型上都取得了最佳成绩而传统OPD和ExOPD则经常让科学成绩低于原始水平。**十一、跨越模型家族在Gemma4上的验证**为了确认OPD?不只是针对Qwen3定制的技巧研究团队还在完全不同的模型家族Gemma4上进行了验证。结果非常能说明问题传统OPD在Gemma4-E4B上几乎让所有指标大幅下降数学平均分从60.6跌至58.9编程平均分从55.2暴跌至36.9这说明直接把传统OPD应用到一个新的模型家族可能相当危险。ExOPD在数学上有所改善但在编程上依然严重下降45.1仍远低于原始55.2。OPD?则展现出更强的鲁棒性。数学平均分从60.6提升到67.8其中AIME24美国数学邀请赛2024从51.7大幅提升到69.2而ExOPD只能达到59.6。在编程上虽然所有方法都未能超过原始模型的55.2但OPD?保住了49.5分远好于传统OPD的36.9和ExOPD的45.1说明OPD?至少在保持现有能力方面更加稳健。**十二、训练过程的动态变化**除了最终成绩研究团队还观察了整个训练过程中性能的变化曲线揭示了三种方法在训练机制上的根本差异。所有方法在训练的前二三十步都会经历快速提升说明在线策略蒸馏的收益主要集中在训练早期。但之后的走势出现了分化传统OPD和ExOPD往往在某个中间步骤达到峰值然后随着训练继续反而开始下滑最终成绩低于中途峰值。OPD?虽然也有波动但整体保持在更高的水平上最终成绩依然稳定领先。这个发现有一个重要的实践意义论文中所有的成绩都是在训练第100步最后一步时记录的而不是选最佳检查点。这意味着OPD?的优势是系统性的而不是某个偶然的好时机。**十三、消融实验哪个改动最重要**研究团队还系统分析了OPD?中每个设计选择的贡献通过逐一拆掉某个部件来观察成绩的变化。结果非常清晰三个改动中差值信号是最核心的。把差值信号换回传统OPD信号非思考模式数学成绩从54.6下降到50.5思考模式从62.7下降到57.4降幅最大。联合条件方向一致才更新和中心化操作各自贡献了相对较小但仍然正向的提升。这个结果告诉我们OPD?的关键创新是学什么差值信号而不是怎么学联合条件和中心化尽管后两者也起到了辅助稳定的作用。**十四、计算成本额外开销值不值**OPD?需要额外运行一遍大师基础版来计算差值信号这意味着它比传统OPD需要更多计算资源。实验数据显示Qwen3系列模型的训练时间增加了24%到28%Gemma4增加了8%。与现有最先进的ExOPD相比OPD?的额外开销非常接近几乎可以忽略不计OPD?增加27%ExOPD增加24%对于Qwen3-8B。考虑到OPD?换来的是显著更好的效果这个额外开销是完全合理的投入。而且团队指出他们当前的实现方式并没有针对差值信号计算做专门优化实际上还有进一步降低开销的空间。**十五、与相关工作的关系**在这个领域最相近的前人工作是ExOPDLearning Beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation这个方法同样引入了大师基础版模型但用法完全不同。ExOPD计算的是大师比大师基础版好多少然后把这个差距乘以一个大于1的系数论文中λ1.25目的是让弟子学到比大师更厉害的能力——相当于老师已经学会了1.0版本的武功但要求弟子练出1.25版本的水平。OPD?的目标则不是超越大师而是更精准地学到大师推理训练的成果。差值信号代表的是大师在推理训练中获得的知识增量弟子通过学习这个增量来提升自己的推理能力而不是盲目追赶大师的全部输出。事实上实验结果显示OPD?的这种精准蒸馏策略在实际效果上全面优于ExOPD的外推超越策略尤其是在模型已经很强的思考模式下以及跨越模型家族的Gemma4实验中。---说到底NAVER AI Lab这项研究的价值在于重新定义了好的老师应该传授什么。不是照搬老师的一切而是精准提取老师经过努力学到的部分——这个道理不只适用于AI在人类教育中同样成立。一个好的乒乓球教练不会让学生模仿自己的每个动作而是着重教导那些经过多年摸索才掌握的发球技巧和步法节奏。从实际意义上来看这项研究意味着同等规模的小模型可以通过更好的训练方法获得更强的推理能力这在计算资源有限的应用场景下比如手机端AI、边缘设备推理具有切实的工程价值。同时OPD?的训练只需要100步左右就能收敛远比完整的强化学习训练廉价这让频繁更新AI能力的应用场景变得更加可行。值得进一步思考的是差值信号的概念是否可以推广到更多训练场景比如当模型需要学习多种不同技能时是否可以分别计算每种技能对应的差值信号并加以组合此外如果一个模型经历了多轮推理训练如何定义基础版这个参照系这些都是未来值得探索的方向。有兴趣深入了解技术细节的读者可以通过arXiv编号2607.15161查阅完整论文代码也将在github.com/naver-ai/opd2上公开。---QAQ1OPD?和普通AI蒸馏训练有什么区别A普通蒸馏训练OPD让小模型直接模仿大模型的全部输出包括大模型天生的语言习惯和后天学到的推理能力。OPD?则计算大模型推理训练前后的差值只让小模型学习大模型通过推理专项训练额外获得的能力避免了无关语言习惯的干扰因此在推理任务上效果更好。Q2OPD?训练需要哪些额外资源AOPD?需要同时加载三个模型学生模型被训练的小模型、教师模型大模型和教师基础版大模型在推理训练之前的版本。相比普通OPD计算时间增加约24%到28%与现有最先进方法ExOPD的开销基本持平但换来了更好的训练效果。Q3差值信号为什么能更准确地识别错误推理A传统信号比较的是大模型和小模型对同一词语的偏好两者都对常见词语有偏好导致即使推理出错信号也可能是正的。差值信号比较的是大模型推理训练前后的变化推理训练专门强化了逻辑正确的表达模式因此差值信号能更敏锐地识别哪些推理步骤是错误的给出更准确的负反馈。