9 月 12 日,OpenAI 旗舰模型 GPT-6 Astra 成功攻破 FrontierMath 基准测试中 Tier 4 层级最后一道未被 AI 解出的难题。Epoch AI 随后正式宣布该测试已达到饱和状态,即所有题目都至少被 AI 成功解答过一次。OpenAI 公布的自身成绩为 97.6%。
FrontierMath 曾被公认为大模型数学能力的终极考验,其 Tier 4 难题被视为研究级 AI 数学能力的终局考题。从 2025 年至今,AI 在该基准上的进展速度被业内形容为相当惊人,这一突破再次点燃了关于 AI 推理能力是否已逼近人类数学家水平的讨论。
与此同时,OpenAI 与数学界的争议也在升温。据报道,25 位菲尔兹奖得主联名签署公开信,指责 AI 实验室为互相较劲而威胁数学家的智力劳动成果。OpenAI 还被指控在使用约一万个 Agent 的蜂群协作解决数学难题时,无法排除解决方案受益于某位研究者私有数据的可能性,引发了对数据来源与科研诚信的质疑。
【AICOR 点评】FrontierMath 饱和是一个标志性事件,说明 AI 在纯数学推理这一人类智力的最后堡垒上也已达到里程碑水平。但更值得关注的不是分数本身,而是 AI 解决数学问题的范式正在从单模型推理转向大规模多 Agent 协同。这种蜂群式解题能力如果迁移到工程与商业场景,将彻底改变知识工作的组织方式。
Copyright Notice This article is AI-assisted, rewritten from public reports. Copyright of the information belongs to the original authors and media; content is for industry sharing only and does not constitute investment or business advice.
For copyright concerns, contact AICOR (400-601-8080 / WeChat: aicor-ai); we will handle it promptly upon notification.