本周更新的开源模型基准榜单迎来一次大洗牌。新一代推理模型在数学、代码生成与长文本理解三个核心任务上全面登顶,与头部闭源模型的差距缩小至 3 个百分点以内。
榜单变化的核心原因
此次排名变动主要来自三方面:更高质量的训练数据、推理时计算量的显著提升,以及新的测试集难度升级。
排名并非一切,但方向已经清晰:开源与闭源之间的能力鸿沟正在以季度为单位收窄。
值得关注的是,榜单前三名模型全部采用了类似的“长思维链”推理架构,在需要多步推导的任务上优势明显,而在简单问答场景中则与参数更小的模型持平。
下一步值得关注
- 推理效率:新模型在高端 GPU 上的推理成本已接近闭源竞品
- 生态适配:多家推理服务商已在本周内完成模型接入
- 评测争议:部分研究者认为榜单任务仍偏向特定训练分布
下周,多个新版本模型将陆续开放权重,榜单竞争预计还会更加激烈。
