Claude用11天证完费马大定理:1300万行代码,AI首次跑完机器验证全程

来源:互联网 时间:2026-09-06

Anthropic发布了一条比任何跑分都硬的成绩:首个完整经计算机验证的费马大定理证明。Claude在11天内大体自主完成形式化,写出约1300万行Lean代码,验证的29500个定理最终全部通过,规模超过Lean社区数学库Mathlib的五倍以上,全部代码以Apache 2.0协议在GitHub开源。358年无人攻克的数学难题,第一次由AI跑完了机器验证的全流程。

这件事的分量,得先讲清费马大定理本身。1637年费马在书页边写下那句著名的“空白太少,写不下证明”,此后358年无人攻克,直到怀尔斯在1994年给出证明——论文100多页,动用椭圆曲线和模形式等重型工具,数学界花了好几年审稿才确认无误。人类证明依赖的是顶尖专家的信任链,机器验证走的是另一条路:把证明翻译成Lean这样的形式语言,每一步推理由编译器机械检验,对就是对,错就是错,不存在审稿人看走眼这回事。

AI以前做不了这件事,卡点在形式化的琐碎程度上。形式化不是写解题过程,而是把数学直觉翻译成毫无人情味的形式语言——人类数学家觉得“显然”的一步,Lean可能要求几十行铺垫;费马大定理这种体量,任何一处定义偏差都会让百万行代码推倒重来。这次结果说明,模型在超长程任务规划和中间错误定位修复上,已经迈过了工程实用的门槛:11天里完成的不是一次性的天才迸发,是持续的迭代修正。

落地价值比榜单名次实在得多。数学界的审稿瓶颈由来已久,重大成果等同行验证动辄数年;关键软件和密码系统的形式化验证,又长期受限于人力成本推不开规模。AI把这条成本曲线打下来之后,航天控制、芯片设计、金融清算这些“错一行就出大事”的系统,都有机会用可承受的成本做完整验证。Apache 2.0开源的意义也在这里——全球数学家可以逐行检查这1300万行代码,可审计性正是它区别于“AI口头解题”的关键。

冷静的话也要说:所谓“大体自主”并非全自动,人类专家的引导和修正贯穿了全程;1300万行代码的复现和社区检验同样需要时间。但方向已经清楚——AI证明助手正从玩具走向工程工具,数学研究的协作方式,可能正在被改写。

相关文章

标签:

A5创业网 版权所有

返回顶部