本周更新的开源模型基准榜单迎来一次大洗牌。新一代推理模型在数学、代码生成与长文本理解三个核心任务上全面登顶,与头部闭源模型的差距缩小至 3 个百分点以内。

榜单变化的核心原因

此次排名变动主要来自三方面:更高质量的训练数据、推理时计算量的显著提升,以及新的测试集难度升级。

排名并非一切,但方向已经清晰:开源与闭源之间的能力鸿沟正在以季度为单位收窄。

值得关注的是,榜单前三名模型全部采用了类似的“长思维链”推理架构,在需要多步推导的任务上优势明显,而在简单问答场景中则与参数更小的模型持平。

下一步值得关注

  • 推理效率:新模型在高端 GPU 上的推理成本已接近闭源竞品
  • 生态适配:多家推理服务商已在本周内完成模型接入
  • 评测争议:部分研究者认为榜单任务仍偏向特定训练分布

下周,多个新版本模型将陆续开放权重,榜单竞争预计还会更加激烈。