行业观察

GPT-6 Astra 攻破 FrontierMath Tier 4 难题,Epoch AI 宣布数学测试饱和

发布日期 2026-09-15 作者 信息来源 量子位 · https://www.toutiao.com/a7685421076150567474 · 2026-09-14 标签 AI原生组织 / 自身即产品 / 上线
OpenAI 旗舰模型解出此前唯一未被 AI 攻克的数学研究级难题,基准测试机构宣布所有题目均已被 AI 成功解答

9 月 12 日,OpenAI 旗舰模型 GPT-6 Astra 成功攻破 FrontierMath 基准测试中 Tier 4 层级最后一道未被 AI 解出的难题。Epoch AI 随后正式宣布该测试已达到饱和状态,即所有题目都至少被 AI 成功解答过一次。OpenAI 公布的自身成绩为 97.6%。

FrontierMath 曾被公认为大模型数学能力的终极考验,其 Tier 4 难题被视为研究级 AI 数学能力的终局考题。从 2025 年至今,AI 在该基准上的进展速度被业内形容为相当惊人,这一突破再次点燃了关于 AI 推理能力是否已逼近人类数学家水平的讨论。

与此同时,OpenAI 与数学界的争议也在升温。据报道,25 位菲尔兹奖得主联名签署公开信,指责 AI 实验室为互相较劲而威胁数学家的智力劳动成果。OpenAI 还被指控在使用约一万个 Agent 的蜂群协作解决数学难题时,无法排除解决方案受益于某位研究者私有数据的可能性,引发了对数据来源与科研诚信的质疑。

【AICOR 点评】FrontierMath 饱和是一个标志性事件,说明 AI 在纯数学推理这一人类智力的最后堡垒上也已达到里程碑水平。但更值得关注的不是分数本身,而是 AI 解决数学问题的范式正在从单模型推理转向大规模多 Agent 协同。这种蜂群式解题能力如果迁移到工程与商业场景,将彻底改变知识工作的组织方式。

版权声明 本文由 AI 辅助整理,基于公开报道转写,信息版权归原作者及原媒体所有;内容仅作行业信息分享,不构成任何投资或商业建议。

如涉版权问题,请联系 AICOR(400-601-8080 / 微信 aicor-ai),我们将在收到通知后及时处理。

← 返回新闻列表