ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

NAVER AI实验室发现:让AI数学家“同时说多国语言“的秘密武器

NAVER AI实验室发现:让AI数学家“同时说多国语言“的秘密武器 这项由韩国NAVER AI实验室完成的研究以预印本形式发布于2026年8月6日的arXiv平台论文编号为arXiv:2608.05802题为《On-Policy Delta Distillation for Multilingual Math Reasoning》。对该领域感兴趣的读者可通过上述编号查阅完整原文。如果你曾经用中文问过一个AI助手一道数学题却发现它用英语回答你那你大概能感受到这项研究试图解决的核心痛点。人工智能在做数学题这件事上越来越厉害但它说人话——尤其是说非英语的人话——依然是一个被严重忽视的问题。NAVER AI实验室的研究者们把目光投向了韩语和日语这两种东亚语言试图搞清楚一个关键问题有没有办法让AI在数学推理能力变强的同时也能用你提问时用的语言来回答你这个问题看起来简单背后却牵扯着AI训练领域一场正在发生的技术变革。一、AI学数学靠的是什么老师在理解这项研究的核心之前我们得先弄清楚AI是怎么学会做数学的或者说它是怎么从一个只会复读机式背诵的工具进化成能真正推理解题的助手的。传统上AI学做数学靠的是一种叫做强化学习的方法。可以把它理解成这样一个场景老师给学生出了一道题学生写完整个解答过程后老师只看最终答案然后说对或者错给出一个总评分。这种方式虽然有效但有一个显而易见的缺陷——学生做了很多步骤老师只评价了最后一步中间到底哪里做对了、哪里做错了完全不知道。这种一锤子买卖式的反馈导致训练效率低下AI需要做大量的题才能有明显进步。于是研究者们开始探索一种更精细的替代方案叫做在策略蒸馏英文缩写是OPDOn-Policy Distillation。这个名字听起来很复杂但背后的逻辑其实相当直观。换一个场景来理解一位经验丰富的数学老师我们叫他师傅和一位正在学习中的学生坐在一起。学生先自己做一道题写下整个解题过程。然后师傅对着学生写的每一步逐字审阅在每个关键节点上给出反馈这一步你选了这个词我会选那个词因为……这种逐词逐句的细致指导显然比最后只给一个总分要有效得多。在OPD框架下AI学生自己先生成一段解答然后把这段解答送给师傅模型一个更强大、已经经过充分训练的AI师傅会对学生生成的每一个词打一个分数——这个词是否符合师傅自己的偏好。学生模型则根据这些逐词的分数来调整自己的行为让自己未来的输出越来越接近师傅的水平。这种机制的精妙之处在于它提供的是词元级别token-level的监督信号远比强化学习那种序列级别sequence-level的笼统评分精细得多。二、从模仿师傅到学习师傅的成长OPD已经很好用了但研究团队在这个基础上进了一步提出了一个名为OPD?On-Policy Delta Distillation在策略增量蒸馏的改进版本。这个改进的关键在于一个颇具哲学意味的转变与其让学生去模仿师傅现在的样子不如让学生去学习师傅究竟成长了什么。具体来说任何一个强大的AI师傅在成为师傅之前都经历过两个阶段第一阶段是大规模的基础训练产生一个基础模型这个基础模型已经掌握了大量语言知识但还不太会深度推理第二阶段是专项的后训练通过强化学习等手段让基础模型蜕变成擅长数学推理的师傅模型。OPD?的核心思路是把师傅模型在每个词上的打分减去基础模型在同一个词上的打分得到一个差值——这个差值代表的就是后训练阶段为师傅带来的纯粹的推理能力增量。用一个更生动的类比来说假设你想学烹饪你可以模仿一位大厨做的整道菜普通OPD的思路也可以专门学习大厨在成为大厨之前和成为大厨之后他的做法究竟发生了哪些具体变化——哪些步骤是新加的、哪些手法是精进的OPD?的思路。后者让你学到的是更纯粹、更精华的功夫进阶秘诀而不会被大厨一直以来的个人习惯和风格所干扰。这个差值信号被研究者称为delta信号它的目的是过滤掉师傅模型中那些来自基础训练阶段就已存在的、与推理能力无关的语言偏好和风格倾向只保留后训练过程中真正习得的推理能力精华。此前OPD?在英语的数学、科学和编程推理任务上已经证明了自己比普通OPD更胜一筹。而这项研究要解答的是同样的优势能否延伸到韩语和日语这样的非英语世界。三、实验室里的多语言数学考场为了回答这个问题研究团队搭建了一个颇具规模的实验环境。他们构建了一个包含十万道数学题的训练数据集英语、韩语和日语各占三分之一彼此之间没有重叠题目。韩语和日语题目从NVIDIA发布的一个多语言数学数据集中抽取英语题目则来自另一个专门的英语数学数据集。除了这套混合语言数据集他们还单独准备了一套纯英语的十万道题用于后续的对比实验。学生模型选用了Qwen3家族中的两个版本参数量较小的Qwen3-1.7B和参数量较大的Qwen3-8B——这两个数字大体上可以理解为模型的脑容量大小。师傅模型则是更强大的Qwen3-30B-A3B-2507。所有模型都在思考模式thinking mode类似于让AI在回答前先列出推理过程和非思考模式non-thinking mode直接给出答案两种状态下分别训练和评测。评测所用的基准测试覆盖多个维度PolyMath是一个专门评测多语言数学推理的基准Global-MGSM是另一个多语言数学测试HRM8K则是包含GSM8K、MATH、Omni、KSM、M-MMLU五个子集的韩语为主的综合测试日语方面还额外使用了MAWPS基准。四、韩语和日语的成绩单实验结果相当清晰。先看非思考模式下的核心数据——研究者用PolyMath和Global-MGSM两个基准的平均分来呈现整体趋势。对于较小的Qwen3-1.7B模型基础版本未经任何OPD训练在英语上的平均分是55.1在韩语上是40.9在日语上是37.2。经过普通OPD训练后这三个数字分别提升到61.5、48.8和48.0。而经过OPD?训练后进一步提升到63.6、51.9和52.0。这意味着OPD?在韩语上比普通OPD高出3.1分在日语上高出4.0分在英语上高出2.1分——非英语语言的进步幅度反而更大。对于较大的Qwen3-8B模型同样的规律继续成立。基础版本的英语、韩语、日语平均分分别是62.8、57.0和57.1。OPD训练后变为69.8、61.1和61.9。OPD?训练后达到70.5、64.4和65.0。OPD?相对OPD在韩语和日语上分别多出3.3分和3.1分在英语上只多出0.7分。从完整的基准测试数据来看OPD?在Qwen3-1.7B上将非思考模式下英语平均分从47.6拉升到65.7韩语从37.4拉升到56.5日语从55.5拉升到65.4。在思考模式下由于基础模型本身已有相当强的推理能力提升幅度相对较小但OPD?依然将英语平均分从70.4提升到73.4韩语从63.7提升到68.2日语从68.5提升到71.2而普通OPD的对应成绩分别是71.4、66.2和70.5——OPD?的优势依然稳定存在。对于更大的Qwen3-8B非思考模式下OPD?将英语平均分从58.7提升到75.3韩语从55.4提升到72.2日语从70.2提升到75.2。在思考模式下普通OPD出现了一个耐人寻味的现象它的英语平均分从80.9反而下降到79.9韩语从78.0下降到75.7——也就是说对于本身已经很强的模型普通OPD的训练信号反而可能帮倒忙。OPD?则没有这个问题它将英语推至83.2韩语推至80.4日语推至78.9全面超越基础模型。五、英语和韩语之间的成绩差距能缩小吗研究者还专门观察了一个现实中颇为突出的现象AI在处理英语数学题时普遍比处理韩语数学题表现更好这种系统性的差距究竟有多大又能通过OPD训练缩小多少以Qwen3-1.7B在思考模式下的数据为例基础模型在各个基准上的英韩差距触目惊心PolyMath上差6.4分Global-MGSM上差13.4分HRM8K的GSM8K子集上差12.1分。经过普通OPD训练后这些差距有所收窄PolyMath降到4.4分Global-MGSM降到8.6分KSM子集上的差距从3.3分大幅缩小到仅0.4分。但OPD的效果并不稳定M-MMLU子集上的差距反而从1.1分扩大到了4.6分。OPD?的表现更为一致。它将PolyMath上的差距压缩到5.0分Global-MGSM上压缩到9.3分HRM8K-GSM8K差距从12.1分降至9.2分。MATH、Omni、KSM三个子集的差距也全部收窄而M-MMLU上的差距保持在1.1分不变。归根结底在七个报告的基准中OPD?在六个上缩小了英韩差距在剩余一个上维持了现状——没有一个出现恶化。这说明多语言联合训练往往对韩语推理能力的提升幅度更大因此在不损害英语表现的前提下实际上拉近了两种语言之间的能力鸿沟。六、只学英语能走多远整个研究中最出乎意料的发现来自一组对比实验如果把多语言训练数据换成纯英语数据韩语和日语的表现会发生什么答案令人惊讶纯英语训练的OPD?居然也能大幅提升韩语和日语的数学推理成绩。在非思考模式下英语专训的OPD?将韩语平均分从37.4提升到59.3将日语平均分从55.5提升到66.5。这两个数字不仅远高于基础模型甚至在有些情况下还略高于多语言训练版本多语言OPD?的对应成绩分别是56.5和65.4。在思考模式下英语专训OPD?将韩语平均分提升到65.1日语提升到69.9多语言训练版本则达到68.2和71.2——多语言版本整体略优但英语专训版本依然相当接近。这个发现在直觉上有些违反常识明明没有看过任何韩语或日语训练题AI的韩语和日语数学能力怎么还提升了研究者认为这背后的逻辑是数学推理本身是一种语言无关的抽象能力当AI通过英语题目练就了更强的逻辑推理能力之后这种能力在面对非英语输入时也能被调用产生迁移效应。然而这里藏着一个关键的陷阱。七、测试分高不等于说对语言仅仅看测试分数会产生一种虚假的乐观。研究团队做了一项补充调查当AI用韩语或日语被提问时它究竟用什么语言来回答结果揭示了纯英语训练的真实代价。在非思考模式下多语言训练的OPD?给出韩语回答的比例高达90.5%给出日语回答的比例高达90.9%——也就是说九成以上的时间里模型能用提问语言来作答。而英语专训的OPD?这两个数字分别骤降到48.3%和29.6%——超过一半的韩语问题和超过七成的日语问题模型选择用英语来回答尽管题目是韩语或日语写的。思考模式下只统计最终答案部分不含中间推理过程因为思考过程本来就主要用英语多语言OPD?的韩语目标语言回答率是97.6%日语是95.2%。英语专训OPD?则分别跌到36.1%和30.8%。普通OPD的情况也值得单独关注。在思考模式下英语专训的普通OPD韩语目标语言率是83.1%看起来还不错但日语仅有36.9%。多语言训练的普通OPD韩语是72.9%日语是70.1%——多语言训练同样改善了语言保持能力但幅度不如OPD?明显。非思考模式下多语言普通OPD的韩语目标语言率达到99.7%日语达到99.8%几乎完美英语专训普通OPD的韩语是83.6%日语是40.5%。这组数据清晰地揭示了一个重要区分数学推理能力可以跨语言迁移但用对语言回答这件事是需要专门训练的。一个AI可以读懂韩语题并在内心用英语把它做出来然后用英语把答案说出来——这在基准测试上可能得分不错但对于真实用户来说这是一种令人沮丧的体验。多语言训练数据的存在是保证模型不仅能做而且会用对语言做的关键。归根结底这项研究的发现可以用一句话来概括OPD?是一种比普通OPD更有效、更稳定的AI数学训练方式它在韩语和日语上的提升幅度甚至超过英语英语数据训练出的推理能力确实能跨语言传播但如果你真正在意AI能不能用你的语言跟你交流多语言的训练数据就不是可有可无的选项而是不可或缺的基础。这对未来开发面向多语言用户群体的AI系统是一个务实且重要的参考信号。想深入了解技术细节的读者可通过arXiv编号2608.05802查阅NAVER AI实验室的完整论文研究使用的OPD?代码也已开源。QAQ1OPD?和普通OPD有什么区别A普通OPD让AI学生去模仿师傅模型的输出分布而OPD?改为利用师傅模型和师傅的基础版本之间的概率差值作为训练信号专门提取师傅在后训练阶段习得的推理能力精华过滤掉基础语言偏好的干扰。实验结果显示这个简单修改带来了稳定且显著的性能提升。Q2只用英语数据训练AI为什么韩语和日语数学成绩也会变好A数学推理是一种抽象逻辑能力和具体语言有一定程度的解耦。AI通过英语题目强化了推理能力后这种能力在面对其他语言的数学题时也能被调用产生跨语言迁移效应。但这种迁移只影响做题能力不影响模型用哪种语言回答所以英语专训的AI经常用英语回答韩语或日语问题。Q3多语言OPD训练会不会损害英语的数学推理能力A根据实验结果不会。多语言OPD?在英语基准上的表现与纯英语训练的OPD?相当甚至更好同时还显著提升了韩语和日语的推理能力并有效保持了模型用目标语言回答的能力。总体来看是一种各方面损耗都很小的联合提升方案。
返回列表