OpenAI公开62页核心手稿,AI连破十大「菲尔兹奖级」难题

新智元·2026年08月04日 16:13
OpenAI公开AI证明十项顶级数学难题,成本仅两千美元

十大「菲尔兹奖级」成果,AI证明过程全公开了!

今天,OpenAI重磅放出一份长达62页的「核心手稿」,详细展示了GPT的完整推演。

官方终于「盖章」,完成这一惊人突破的,正是「下一代主力模型」。

若以GPT-5.6 Sol API计费标准算,烧掉的所有Token成本,仅2000美元。

AI证明手稿一出,全网再次被点燃了。

所有人都在盲猜,「这绝对就是传说中的GPT-6」!还有人连连惊叹,2000美元竟解锁了十个历史级成就。

GPT破十大世纪难题,仅2000美元

两天前,OpenAI内部员工放出一篇博客,直言下一代模型Astra攻克了十大数学难题。

一张清单图摆出,震惊了所有人。

覆盖了高维球体堆积、二元码与球面码、群论、Connes刚性猜想、算术电路下界、量子并行重复、最近向量问题、Ehrhart体积猜想、多色Ramsey数、极值图论。

当时,官博挂出了249页的论文合集和一整套Lean 4形式化证书。

但直到今天,一份62页的手稿正式公开,名叫《How the Ideas Came Together》——这些想法是怎么凑到一起的。

传送门:https://cdn.openai.com/pdf/reasoning-walkthroughs.pdf

它的「摘要」只有一小段,但信息量却大得惊人——

这份笔记由AI模型独立撰写,OpenAI团队完全没有插手。

AI读了原始的CoT,以及最终成文的数学论文,然后针对每一道题重构出四件事:

哪些想法最初指出了一条可行的路径;

哪些看起来很有分量的方法撞上了真正的障碍;

什么样的视角切换让底层结构露出来;

决定性的洞察最后是怎么构成完成论证的。

全网热议难题,高维球体堆积,46年没人动

十道题里,全网关注度最高的,是高维球体堆积。

抛开高深的名字,问题本身其实通俗易懂:往一个箱子里,塞一堆一样大的球,最多能塞多满?

三维空间的答案早就有了,就是水果摊上「垒橙子」那种堆法。

但到了几百维、上千维,人类只能给出一个「上界」——最多不可能超过多少。

这个上界的指数,卡在0.5991上,从1978年算起,46年没有实质推进。

而Astra,直接把它推到了0.6044005442916776954…,密度上界写成 2^-(0.6044…+o(1))d。

关键是,它怎么推开的?

首先,Astra在推演过程中,确定了Cohn–Elkies线性规划这套方法本身的极限。

AI最初的思路是,用Cauchy–Schwarz去估计一个函数的负质量,做了半天,只能做到半径√d/(2√π)。

卡住之后,它给出了一个判断:障碍不是常数没优化好,是全局范数根本记不住负质量落在哪里。

于是,Astra决定更换视角:改用Mellin变换,外加调和测度。

但,为什么是它?

因为对径向函数来说,傅里叶变换本质上是Hankel变换,它的核只依赖空间半径和频率半径的乘积

在Mellin这一侧,这件事就变成了一个极其简单的操作:反射,加一个显式的相位。

这里还有一个精妙的地方:那个相位因子在实轴上模长恒等于1,在实轴上什么都看不出来

但它往复平面外延拓时,携带的正是范数不等式丢掉的那部分高维信息。

推到极限时,调和测度收敛成一个logistic密度,而它的对数位势精确等于digamma函数,积分出来正好是log(π/2)。

1/π这个阈值,就是从这儿出来的。

有个细节特别能说明它知道自己在干什么:

调和测度的总质量是(1−σ)/2,不是1。手稿专门写了一句:太早把这个核换成概率密度,会改掉指数常数。

下界拿到了,还得构造出一个真正达到它的函数。

高斯给了对的傅里叶对称性,但鞍点位置不对。

做法是乘上一个偶的形变,让鞍点移动而不破坏对称性。把可用的阻尼吃满之后,得到一个「理想剖面」。

它的鞍点位移积分靠Wallis乘积算出来,正好等于−(1/2)log(π/2)。

这个数把高斯的半径1/√(2π)精确地搬到了1/π

下界预测的半径,和上界构造出的半径,在这里对上了。

手稿中,还有个特别具体的细节:

构造辅助函数时,远处需要补一块正的阻尼。

而这块补丁必须加在一整个区间上,不能加在单点上,因为加在单点会撞上共振频率。

非sofic群,难点是「多」和「一」

第二道热题,便是27年没人构造出来的「非sofic群」。

曼彻斯特大学数学家Thomas Bloom直言,「在构造类成果里,这比之前的单位距离猜想反例更重大」。

「sofic群」这一概念,是由阿贝尔奖得主、俄罗斯数学家Mikhail Gromov于1999年提出。

在希伯来语中,sofic代表着「有限」。

用大白话讲,一个群是不是sofic,问的是这么件事:

这个无限大的、抽象的结构,能不能被一堆「足够大的有限洗牌操作」近似地模拟出来?

Astra给出了一个显式构造,答案是:存在一个无限的、有限表现的「非sofic群」。

手稿里最有价值的,是它写清楚了真正卡住的地方——

Kun定理给的是许多个扩张图,而Kun–Thom定理要的是一个。

「多」和「一」之间那道坎,是整章的核心难点。

AI把这个称为「关键的错配」(the crucial mismatch)。

它给了一个特别干脆的例子说明为什么不能随便挑一台:

在两份完全相同的Q并起来(Q⊔Q)上,「交换两份」这个操作跟扩张的K作用精确交换——但它不保持任何一个分量

也就是说,那些「近似中心的东西」可以在分量之间来回跳,你根本抓不住。

在这之前还有一条更早的弯路:想把property (T)直接转成混合性。这需要一个lazy或者反二部的平均集,因为一个二部图可以在−1附近有谱,尽管它在1处有Kazhdan间隙。

修正平均确实治好了这个谱问题,但治不了「到底选哪个分量」

为此,Astra先试了一版方案:把组件大小取对数、在随机平移的网格上分箱,再换成有界中位数比较。

但是这条路失败了,通过经验总结AI得出:

要平均的,永远是分量规模的一个有界单调函数,绝不能是无界的规模本身。

因此,最终版本以这个「本质原则」进行了重写。

在每个环境扩张分量A里,取一个顶点加权的中位数m_A,然后定义

f(x) = M(x) / (M(x) + m_A)

M是分量规模。这个f永远在0和1之间,而且1/2恰好是每个A上的中位数。

这个f的好处,在于它把一个失控的量变成了一个受控的量。

关键在于生成元是置换——只挪位置、不增不减,走一圈总变化必然是零;而每步最多掉一点点,两边就都被压成可忽略。

再按高度切开、对小的一侧用扩张性,两头一夹:f几乎处处等于1/2

也就是同一范围里所有块的规模被夹得几乎一样大,这才能一一对上号。

最终收尾时,还剩一小片区域。

Astra 的处理很反直觉:挑一片尽可能大的坏区域整个扔掉——正因为挑的是最大的那片,才反过来证明它其实小到可以忽略。

Gromov的问题,27年后有了答案。

其余八道题的AI证明过程,感兴趣的伙伴可参阅:https://cdn.openai.com/pdf/reasoning-walkthroughs.pdf

「奇点」降临,倒计时

手稿公开第一时间,OpenAI强化学习大佬Mo Bavarian发了一段长帖。

开头第一句话,这真是一个「超现实」时刻。

2021年,他和OpenAI团队放出一个GSM8K数据集——8500道小学数学应用题,简单到仅用2-8步就能做完。

GPT-2/3那个年代,AI确连小学数学题都做不稳,起草邮件勉强够用。

然而,短短几年,大规模RL狂飙突进,曾经那些看似不可逾越的「技术死胡同」,被逐一击碎。

这个时间跨度,短得离谱。

Mo Bavarian表示,「对我而言,这一刻,比任何时候都更像奇点前夜」。

几年前,AI还在小学应用题里跌跌撞撞。

如今,2000美元的Token,就能换来十份可能写进数学史的答案。

「奇点前夜」,或许并没有那么遥远。

参考资料:https://cdn.openai.com/pdf/reasoning-walkthroughs.pdf

本文来自微信公众号“新智元”,作者:ASI启示录;编辑:桃子,36氪经授权发布。

+1
6

好文章,需要你的鼓励

参与评论
评论千万条,友善第一条
后参与讨论
提交评论0/1000

36氪AI测评

选靠谱AI,看真实评测
查看
36氪AI测评官方交流社区
加入

36氪项目推荐

咨询项目审核和入驻
联系
36氪项目推荐订阅号
关注

下一篇

Claude Fable 5登顶AI编程MirrorCode榜单,断层领先

50分钟前

36氪APP让一部分人先看到未来
36氪
鲸准
氪空间

推送和解读前沿、有料的科技创投资讯

一级市场金融信息和系统服务提供商

聚焦全球优秀创业者,项目融资率接近97%,领跑行业