中文推理训练:与英文推理的性能差距已收窄到约1个百分点

行业分析中文推理训练openstarry.com

一、研究的核心发现:中文推理训练的性能差距有多大

一项由多方机构联合完成的大规模对照实验,覆盖了9个开源基座模型、参数规模从1B到8B,横跨11种训练语言,完成了超过200组GRPO强化学习推理训练实验。

实验的关键结论按语言拆分后很清晰:

中文在所有被测语言中属于差距最小的一档。这一数字与此前多项研究中"强制非英语推理会导致准确率下降10个百分点甚至更多"的结论形成显著反差。

差距明显拉大的是低资源语言:孟加拉语约5.7、泰卢固语约4.6、斯瓦希里语约4.5个百分点。语言本身在预训练阶段积累的语料厚度,直接决定了母语推理训练的性价比。

二、为什么这个数字对中文AI从业者重要

在GRPO强化学习训练中,存在一个关键设计选择:奖励模型使用英语推理,还是使用提问者的母语推理。选英语奖励,即便模型收到中文问题也会切到英语思考;选母语奖励,模型则可以全程用中文完成推理。

在此次研究之前,主流认知是母语推理的性能代价过高,非英语团队只能默认走英语推理路线。这条结论一旦成立,意味着中文推理模型始终要在英语模型的翻译适配层下游运行,无法独立成型。

新的数据表明,对中文来说,这个代价只有约1个百分点,属于工程可接受范围。这意味着中文推理模型有条件从训练阶段就跳过英语,直接走自己的路线。这一前置判断的变化,是这项研究最直接的产业意义。

三、跨语言迁移的收益边界

研究同时呈现了一张11×14的跨语言迁移矩阵:分别用11种语言做单语训练,再在14种语言上交叉评估。

广泛迁移的现象:用一种语言做训练,其他语言的性能几乎都跟着涨。例如,西班牙语单语训练后,法语的性能恢复了目标语言直接训练增益的约96%,只差约1个百分点。中文和日语之间的互相迁移同样明显,可能与二者同属CJK语系、预训练阶段存在共享有关。

反直觉的发现:英语并不总是最好的迁移源。在部分模型上,孟加拉语训练对中文的迁移效果反而优于英语训练。研究者推测,低资源语言的训练会迫使模型更深层地重组推理能力,这种重组带来的泛化有时比高资源语言训练更强。

多语言混合训练的实用性:在Qwen3-Base系列上,多语言混合训练与"为每种评估语言分别挑选最优迁移源"的理想方案相比,平均只差约0.3个百分点,但只需要训练一个模型。对于资源有限的团队,这是一条务实的路径,不必为每种目标语言单独跑训练。

四、性能回退风险与适用边界

跨语言迁移的好消息,被一种特定的失败模式冲淡。

极端回退案例:研究在Qwen3系列非Base模型上观察到,用斯瓦希里语或泰卢固语训练后,这些模型在含英语内容的未见任务上出现了高达约19.2个百分点的性能崩塌(Qwen3-4B斯瓦希里语训练),而训练语言本身的性能正常甚至提升。换成英语或多语言训练,同一批任务保持稳定。

困难任务的回退更集中:Qwen3非Base系列、SmolLM3-3B在非英语单语训练后,程序化生成的高难度数学题目平均分大面积下滑,部分配置跌幅超过30个百分点。回退高度集中在特定任务族,其他任务表现正常。

奖励语言本身也能触发塌方:特定模型用斯瓦希里语数据加母语推理奖励训练后,简单数学任务性能下降约3.1个百分点;但同样数据搭配英语推理奖励,性能反而提升约17.5个百分点。差距超过20个百分点,且在同一模型的其他语言训练中不出现。

这些回退无法从模型或语言中单独预测,只有在特定组合下才会暴露。

五、选择标准与成本评估

基于研究数据,可以提炼几条实用的判断标准:

1. 按语言资源厚度分级决策

2. 模型选型的考量

研究覆盖的是8B以下的开源模型,任务是程序化生成的数学和逻辑题。结果在9个模型上呈现一致趋势,但不是孤例外的绝对保证。真实部署场景中的表现仍需单独验证。

3. 训练方式的取舍

六、落地建议

评估覆盖度是底线要求

"差距可控"和"安全上线"之间差的是评估覆盖度。只看目标语言的平均分,回退藏在暗处;逐语言、逐任务、逐模型排查,才能把风险暴露在上线之前。这项研究最大的实践意义在于证明了逐组合排查不可省略。

分阶段验证路径

  1. 小规模试训:先用目标语言在小模型上跑几百步GRPO训练,对比英语推理奖励的基线
  2. 任务族覆盖:在数学、逻辑、代码、多语言理解等多个任务族上交叉评估,不要只看平均分
  3. 回退检测:重点关注困难题目和未见任务上的性能变化,这些是回退高发的位置
  4. 组合排查:如果训练数据包含低资源语言,必须对未见任务族做专项评估

对资源受限团队的务实路径

多语言混合训练只需一个模型,与逐语言最优方案差距仅约0.3个百分点,是成本与性能之间较好的平衡点。但需要接受跨语言迁移带来的不确定性,并对目标语言和关键任务做重点验证。

对中文生态的判断

从训练源头就走中文推理路线,在当前的实验数据下是一个合理的工程选择。中文在所有被测语言中差距最小,且既是好的迁移接收方也是好的迁移发送方。但"可控"不等于"零风险",逐组合的评估仍然是上线前不可或缺的步骤。

如何用起来:通过 OpenStarry 接入

如果你想直接用上 qwen 这类模型/工具,可以通过 OpenStarry 用一个 Key 快速接入,无需各自注册多个平台:

接入示例:

base_url: https://api.openstarry.com/v1
api_key: <你的 OpenStarry Key>
model: qwen3.7-max

以 AI 之力,筑未来之境

现在注册,立即免费获赠 200 次大模型调用权益

免费注册 →