10月6日,OpenAI在官方发布里公开了一批数学研究成果:722篇数学手稿,归入372个成果族,全部由一款尚未发布的内部前沿模型产出。这些手稿放在一个公开的代码仓库里,采用Apache2.0协议,任何人都能下载查看。所谓成果族,是把相关的论文归成一组,里面可能有一个主结果,加上配套论证、推论或者替代证明,每一族都标注了所属的数学分支。
这批结果是模型能力评估的产物。OpenAI说,模型在既有数学评测上的表现已经饱和,团队于是把评估范围扩到开放研究问题上,其中一部分输出还建立在此前模型产出的结果之上。整个过程中,模型被投喂约4000个问题;输出按相关性归并为成果族,再按“足够重要”的门槛筛选,最后留下这372族。算力上,平均每个结果消耗约等于3小时ChatGPT Pro思考模式的算力,绝大多数走的是同一套固定流程。
从学科分布看,372族覆盖17个方向。数量最多的是理论计算机科学,40族;排在后面的是组合数学37族、代数与复几何36族、数论31族;再往后是概率与统计力学、微分几何、数学物理、算子代数等,数理逻辑最少,也有6族。手稿目录以日期结尾,日期几乎全部集中在9月23日至10月5日之间,其中9月23日和24日两天各有近200篇。
更能说明问题的是验证这一层。OpenAI同步放出了三类证明工件:Lean形式化证明、10份模型推理过程的精简摘要,以及算力与尝试问题数的统计。据对仓库目录的统计,372族里约六成附有Lean形式化说明。OpenAI自己也承认,并非所有手稿都完成了形式化,未形式化的结果“可能存在问题”,团队会尽快修正并持续补充。另有两份手稿属于例外:黎曼zeta函数的一个无零点区域结果,以及CM阿贝尔簇霍奇猜想的证明。
发布流程听取了外部意见。普林斯顿高等研究院的数学与人工智能顾问组在9月29日发布了负责任发布建议,OpenAI称参考了这些建议。该组的建议包括:结果应存放到不受AI实验室控制的学术仓库,配上可长期引用的标识;每条结果都要公开模型名称、使用的提示词、推理过程摘要、耗时和算力成本估算;证明应尽可能形式化。这份建议里还有一句直接的表述——该组“不认可在专有模型上测试高等数学问题”,并要求相关公司停止这种做法。
这批手稿的分量,最终取决于数学界怎么看它们。OpenAI生成的证明看起来完整,并不等于问题已经得到承认,每条结果仍需专家检查证明是否严谨、是否存在隐藏错误、此前是否已有类似工作。OpenAI在仓库说明里也把这条边界写清楚了:未形式化的结果可能有问题,修正会以新版本记录,旧版本保持可访问。

A5创业网 版权所有