8 月 1 日,OpenAI 用一份数学报告正式官宣了下一代模型家族的名字——Astra。这家公司表示,一个 Astra 的内部版本一口气解出了十个在数学与理论计算机科学领域悬置多年的开放问题,其中大多数问题的核心进展已经停滞超过十年,有些甚至更久。

在此之前,外界对 Astra 的了解仅限于传闻:一个专为长时间任务设计的模型家族,Sam Altman 已经带着它在华盛顿向政策制定者做过演示。而现在,OpenAI 用十份数学成果第一次确认了它的存在。

关键要点

  • OpenAI 正在开发名为 Astra 的新模型家族,通过协调多个 Agent 协同工作,处理长达数小时甚至数天的复杂任务
  • 奥特曼已在华盛顿向政策制定者展示 Astra;该模型目前处于测试阶段,预计将成为美国新 AI 审查框架下首批需要官方批准才能发布的模型
  • 一个 Astra 内部版本解出了十个数学与理论计算机科学开放问题,OpenAI 已发布论文、Lean 形式化证明和模型的推理过程走查

十项突破:从球堆积到非 sofic 群

OpenAI 在官方报告中表示,这十项成果覆盖高维几何、编码理论、算术电路复杂度、群论、算子代数、量子复杂度、格密码学和极值组合学等领域,每一项都”令相关领域的研究者等待了至少十年”。

领域成果
高维球堆积在 Cohn–Elkies 阈值之下给出球堆积密度的新上界
二元码与球面码对任意最小距离的二元码规模给出指数级改进的界,高维球面码同理
群论构造性证明非 sofic 群的存在,解决群论核心开放问题
算子代数推翻 Connes 刚性猜想:某些群不再由其冯·诺依曼代数唯一决定
算术电路复杂度给出计算积和式(permanent)的算术电路/公式新下界,包括 n⁴/log n 量级的公式下界
量子复杂度为一般双人量子博弈证明指数级并行重复定理
格密码学证明最近向量问题的多项式因子近似难度,与后量子密码直接相关
凸几何在每个维度上确定”质心是唯一内格点”的凸体的最大体积,解决 Ehrhart 体积猜想
组合数论给出多色三角形 Ramsey 数的超指数下界,解决 Erdős 问题 183
极值图论证明紧致性与退化猜想,解决 Erdős 问题 146 和 180

其中,非 sofic 群的存在性被视为群论中最重要的开放问题之一——此前数学家甚至不知道这样的对象是否存在,而 OpenAI 直接给出了构造。值得一提的是,今年 5 月 OpenAI 还曾用未发布模型推翻过 Erdős 单位距离猜想,这一次的成果被数学界认为分量更重。

数学界怎么看:大新闻,但”AI 取代数学家”说不通

曼彻斯特大学数学家 Thomas Bloom(他运营着 erdosproblems.com)在 X 上评价称,这是”大新闻”,分量超过今年 5 月公布的单位距离猜想反例:“也许不比完整的单位距离猜想证明更大,但就构造而言,这很重要。”

Bloom 同时反驳了”AI 正在取代数学家”的说法:Astra 建立在超过一个世纪的数学理论之上,由数学家构建,并训练于数学家写下的所有文献——这种说法本身就说不通。

研究测试时推理(test-time reasoning)技术的 OpenAI 研究员 Noam Brown 则透露,团队还尝试过其他重大问题,但没有成功:“遗憾的是,(还没有)千禧年大奖难题。“克莱数学研究所为七个千禧年难题各设 100 万美元奖金,自 2000 年设立以来仅解决了一个。Brown 补充说:“不过我们每个问题投入并不大。测试时算力还有很大的推进空间。“他把 Astra 称为”科学推理的重要一步”。

约 2000 美元的证明,以及”署名归谁”的新问题

OpenAI 披露,生成这十份解答所消耗的 token,按 Sol 的 API 价格计算约为 2000 美元。模型产出论证后,人类研究员与同一个模型协作,把论证整理成研究论文;随后模型再用 Lean 将每个证明形式化,生成机器可校验的正确性证书。OpenAI 还为每份解答发布了模型推理过程的走查记录。

值得注意的是署名立场:OpenAI 明确表示,研究人员协助了论文整理与证明形式化,公司对结果准确性负责,但数学论证本身由系统生成——把完全由 AI 生成的证明署名给人类,既会歪曲系统的贡献,也有损真正人类智力工作的含义。公司引用了《莱顿 AI 与数学宣言》(Leiden Declaration on AI and Mathematics)作为成果归属的参考框架。

Astra 是什么:为”小时级到天级”任务设计的模型家族

数学报告发布前,《The Information》援引三位知情人士报道了 Astra 的更多细节:这是一个面向长时间任务的模型家族,通过协调多个 Agent 在数小时甚至数天内持续处理难题,复杂工程与高等数学被列为典型用例。

Astra 将与 OpenAI 现有的 Sol、Terra、Luna 家族并列,构成新的一类模型。至于它最终以 GPT-6 发布,还是作为 GPT-5 线内的变体(类似 GPT-5.7)出现,OpenAI 尚未决定,也没有发布日期。奥特曼本周已在华盛顿向政界与监管人士演示了该系统。

美国新 AI 审查框架的首批测试对象

报道称 Astra 系列已进入测试阶段,预计将成为特朗普政府新 AI 框架下首批接受审查的模型——该框架要求模型在公开发布前提交联邦政府审批,政府希望在本周末前敲定细则。

监管不是唯一的不确定性。核心质疑在于:当上下文不断增长时,模型能否避免长时间工作流中的错误累积、能否在偏离轨道时自我纠正。这正是当前 Agent 系统的主要短板;而多 Agent 架构在规划这类强耦合任务上甚至可能更差——协调开销与复合错误会抵消协作收益。

路线图:九月的研究实习生,2028 年的自主研究员

Astra 的传闻与此前 OpenAI 的表态一脉相承。首席科学家 Jakub Pachocki 去年夏天曾在官方播客上表示,公司希望构建能连续工作数小时甚至数天的 AI 系统;去年年底,OpenAI 还提出了如何衡量”人类需要几个世纪才能完成的任务”的问题。

时间表上,OpenAI 计划今年 9 月前拥有一套达到”研究实习生水平”的 AI 系统,显著加速人类科学家的工作;到 2028 年 3 月,则要拥有能够独立运行研究项目的完全自主 AI 研究员。Astra 可能正是这套系统。

Pachocki 也强调,这类系统需要远超当前规模的算力——OpenAI 的长期基础设施计划正反映了这一野心。而公司营收能否以足够快的速度增长来支撑如此庞大的建设投入,仍是悬而未决的问题。

核心总结

  • 事实:Astra 内部版本解出十个十年未解的数学与理论计算机科学问题,含非 sofic 群构造与 Connes 刚性猜想反例
  • 方法:约 2000 美元算力成本 + 人类协作成文 + Lean 形式化验证,开创”AI 成果如何署名”的先例
  • 方向:Astra 是面向数小时至数天级任务的模型家族,也是美国新 AI 审查框架的首批测试对象
  • 路线图:2026 年 9 月”研究实习生级”系统,2028 年 3 月完全自主 AI 研究员

数学界的独立验证才刚刚开始——十份证明能否经受住同行评审、构造背后的思想能否被消化,比”AI 解出了难题”本身更值得关注。

原文:OpenAI announces its “next major model” Astra by dropping ten previously unsolved math solutions(The Decoder)

官方报告:Ten advances in mathematics and theoretical computer science(OpenAI)