行业观察

Anthropic Claude 11 天端到端形式化证明费马大定理

Published 2026-09-07 Author Source 36氪 · https://www.36kr.com/p/3971371138855176 · 2026-09-06 Tags AI-Native Organization / Self as Product / Launch
Anthropic 9月4日宣布 Claude 用 11 天生成约 1300 万行 Lean 代码完成费马大定理首个完整机器可验证证明,规模超 Mathlib 5 倍。

2026 年 9 月 4 日,Anthropic 发布研究博文披露,旗下 Claude 大模型在基本自主运行 11 天后,完成了费马大定理首个端到端、可由计算机逐行核验的形式化证明。

本次工作是把英国数学家 Andrew Wiles 1995 年发表的 129 页经典证明,转写成 Lean 证明助手可机械检查的形式。整个流程中 Claude 输出约 1300 万行 Lean 代码,证出 30300 个中间定理,其中约 29500 个进入最终证明,工程体量超过 Lean 核心数学库 Mathlib 的 5 倍,全程耗用约 60 亿 output token。人类给出的最高层级干预,仅是项目主导者 Tianyi Peng(哥伦比亚大学助理教授)发出的两条高层方向提示。

为支撑多智能体协同,Anthropic 研究员团队基于哥伦比亚大学 Peng 实验室构建了 Prove2Me 平台:把 3 万个定理的依赖关系维护成一张有向无环图,所有 Agent 据此判断下一步应攻克哪个定理,从而解决长任务下的状态丢失问题。此前 Anthropic 的多次多 Agent 并行尝试均因全局状态丢失而失败,留下约 7% 的"学费代码"沉淀在最终版本里。

独立验证由 Imperial College London 数学家 Kevin Buzzard 完成,他本人正是 2024 年发起人类社区费马形式化项目的牵头人。Buzzard 在审阅后评价这是一项"非凡的形式化成就",证明过程"除数学公理外无任何额外假设"。

【AICOR 点评】这次突破的本质不在于"AI 解数学题",而在于把数学信任链条里最贵的那一环——验证——从稀缺专家人力,迁移到机械可执行的代码层。对企业而言启示同样清晰:当 AI 接管执行后,瓶颈会从"做出来"挪到"确认它对",而可信、可审计的验证机制将成为新的稀缺工种。Anthropic 自身同时披露 IPO 时间表后移、估值冲向 2 万亿美元,反映出资本对"AI 数学家"叙事与现实商业模式之间张力的高度关注。

Copyright Notice This article is AI-assisted, rewritten from public reports. Copyright of the information belongs to the original authors and media; content is for industry sharing only and does not constitute investment or business advice.

For copyright concerns, contact AICOR (400-601-8080 / WeChat: aicor-ai); we will handle it promptly upon notification.

← Back to News