一个覆盖图表、截图、物理场景与医学影像的全新多模态评测集本周公布首轮结果。头部模型在图表理解类任务上首次达到人类平均分,视觉推理得分接近人类水平的 92%。

任务难度的分层

评测团队将任务分为三层:信息提取、逻辑推理与对抗性场景。模型在第一层表现优异,第二层接近人类,第三层——包括遮挡、反光与视角畸变——仍与人类存在明显差距。

评测方法本身也在进化

值得注意的是,新评测集采用了“答案 + 推理过程”的双重评分方式,避免模型通过记忆相似题目得分。团队还公开了全部题目,供其他实验室复现。

研究作者指出,视觉推理能力的提升不仅依赖更大的数据集,更依赖跨模态对齐的训练策略。相关技术报告与模型权重预计下月公开。