全新多模态评测集公布结果:头部模型在图表理解与视觉推理任务上首次达到人类平均分,但对抗性场景仍大幅落后。
新的 AI Agent 安全框架强调运行时防护而非单一评测,提出权限隔离、工具审计与越权回滚三层防护机制。