新智元报道
10道数学硬骨头,24小时风云突变。
这个周末,OpenAI与Anthropic在数学研究的深水区狭路相逢。
8月1日,OpenAI研究员Sébastien Bubeck抛出一枚重磅炸弹:他们尚未公开的下一代主力模型Astra,一口气攻克了10项前沿数学成果,并同步公开了10份Lean形式化证书及逐题思路复盘。
这绝非普通的小打小闹。
这些结论中,至少有10年无人推动,有的甚至搁置数十年,是实打实的开放性难题。虽算不上数学界最深邃的未解之谜,但每一道都是难啃的硬茬。
Epoch AI旗下FrontierMath负责人Elliot Glazer评价极高:单就非索菲克群那一篇的含金量,足以入选《Annals of Mathematics》这一数学界公认的顶级期刊。
消息一出,AI圈瞬间沸腾,甚至有人高呼「数学奇点已至」。
Anthropic反应极快。
不到24小时,研究员Levent Alpöge便在Bubeck的帖子下回应:「我用Fable完成了一半。」
随后他补充细节:自己复现的是OpenAI榜单上的第4、5、6、7、8项,共计5题。
实验环境方面,Levent强调条件纯净:完全自主运行,使用通用提示词,全程断网。为防OpenAI解法污染上下文,还专门加了防护层。
目前,Levent尚未上传Fable的完整证明细节,但他承诺会后续公布。
若结果属实,事态性质将发生反转:
OpenAI凭借未发布的Astra模型抢得先机,但这优势仅维持了24小时。而紧随其后的Fable,是Anthropic早已开源、任何人皆可调用的模型。
一项「数学首发」
保鲜期骤缩至24小时
网友Chubby转发观点称:「公开可用的Fable,复现了Astra一半的成果。」
评论区随即出现调侃:这么看来,OpenAI似乎只拿到了一个短暂的首发标签?
以往,数学成果的优先权争夺往往以年计。谁先提出、谁先证出、谁先发表,中间隔着漫长的投稿、审稿与修改流程。
如今局面大变。Astra尚未正式发布,其公布的成果仅在24小时内,就被一个公开模型追平了一半进度。
首发的光环依旧存在,但保质期已大幅缩水。
不少网民开始提及「数学奇点」,两大AI巨头也形成了紧密的对峙态势。
2000美元背后
还有更昂贵的隐性成本
OpenAI同时披露了一个数字:获取这10项解法的成本不足2000美元。
据研究员Noam Brown解释,该数值对应寻找解法所需的token消耗,并按Sol API价格折算得出。
这意味着,这仅是成功跑出10个解法那一刻的边际推理成本。
除此之外,还有Astra本身的训练研发费用、那些试错未果的问题成本、人类专家将论证整理成249页论文的工时、把每个证明形式化为Lean代码的成本,以及最终外部数学家审查的费用。
Noam本人也坦言,团队曾尝试其他重大难题,但未获成功,千禧年大奖难题依然无一斩获。
尽管如此,2000美元已将AI破解一道前沿难题的边际成本压至谷底。
有人戏谑地问,OpenAI明天是否会再公布10项突破,或者下周直接甩出100项?
从「互相刷榜」到「互相验货」
Fable去重做Astra的同一批题目,意义远超普通刷榜。
传统刷榜测试已知答案:题目和标准答案都在桌上,比拼的是分数高低。
而在无网络、防泄漏的条件下,两个模型独立抵达同一前沿结论,测试的是完全不同的维度:结果的可靠性与可复现性。
这更像是一场同行评审。
目前,Levent仅在X平台「作出了声明」,并未提供那5项证明的PDF、提示词、完整运行日志、token成本或Lean证书。
网友Haider质疑:即便属实,为何要用Fable去复现Astra,而非直接用它去解新的开放问题?
事实上,Fable并非只会蹭Astra的热度,它同样具备解题能力。
7月时,Levent便用Fable给出了Jacobian猜想的三维反例。事后,有专家专门撰写了一份7页的代数验证材料,确认该显式映射确实推翻了三维及更高维度的猜想。
绝大多数人看不懂的成果
谁来验收
这10项成果究竟有多重要,普通人很难评判。
Ethan Mollick一针见血:对地球上几乎所有人而言,这不仅超出能力范围,更超出理解范畴。我们只能依赖专业数学家的判断来评估其价值。
对于代码、图片、聊天等应用,普通人尚能亲身体验AI的强大。
但非索菲克群的存在、Connes刚性猜想的反例、量子平行重复定理,只有极少数专家能读懂。
当AI能力向科学前沿延伸,公众能依赖的不再是亲身体验,而是一条漫长的信任链。这种「连惊叹都无从说起」的状态,正越来越多地出现在各个领域。
数学家Thomas Bloom提醒,这些成果建立在百年积累的数学理论和数学家亲手搭建的形式化系统之上,简单将其描述为「AI取代数学家」并不诚实。
他提出的衡量标准是:这份证明是否教会了我们关于这个问题的新知识?
因此,真正的问题浮现:当AI能低成本、批量生产前沿数学证明,我们该如何衡量其成果?
答案或许不在产出端,而在验收端:一份证明能否被读懂、被核对、被判定分量,才决定其真实价值。
最稀缺的能力,正从「做出证明」转向「看懂并验收证明」。
当AI一夜之间证出十道难题,真正的考验才刚刚开始:证明制造得越快,我们的验证速度,还能跟上吗?
参考资料:
编辑:元宇
秒追ASI











