Claude攻破重大物理难题,数千美元挑战爆炸式难度,人类纪录保持者直呼震撼

智东西·2026年09月28日 11:00
Claude计算结果由前任纪录保持者亲自核验。

Claude计算结果由前任纪录保持者亲自核验。

智东西9月26日消息,今日凌晨,Anthropic宣布,Claude拿下重大理论物理突破,几乎全程无人监督、花费几千美元运行数天,完成N=4超杨‑米尔斯理论的九圈计算。

希佩尔为Anthropic撰写的博客

这道难题的上一任纪录保持者是SLAC国家加速器实验室兰斯·迪克逊(Lance Dixon),他在2023年完成了八圈振幅的求解。Claude的计算结果也由迪克逊核验。在博客中,他说自己此前认为直接求解几乎无法实现,因此对Claude能实现感到非常震撼。

这件事的起源也颇为有趣,上个月,前理论物理学家、现科普作家马特·冯·希佩尔(Matt von Hippel)向各大AI公司发起两大挑战,要让AI完成N=8超引力的七圈计算,或是N=4超杨‑米尔斯理论的九圈计算。

Anthropic选择了第二个挑战,采用其面向付费科研人员的平台Claude Science下的Fable 5.1模型。Claude解题过程对应普通用户运行的开销大约1000~2000美元(约合人民币6713~13426元),其中基于Python与SymPy符号库实现的自举计算本身开销约100美元(约合人民币671元),对应96颗CPU连续运行一周。

N=4超杨‑米尔斯九圈计算的核心困难在于,平面6点MHV振幅对应的多重对数符号空间、未知系数与约束方程组规模随圈数近乎指数膨胀。这也会导致存储与求解巨型线性系统开销巨大,现有传统振幅自举方案很难直接暴力完成九圈完整求解。

若将N=4超杨‑米尔斯六圈计算类比为1+1=2,九圈并非仅提升3个量级,而是求解上万变量的大型方程组,且无法查表、不容符号出错,其难度呈爆炸式增长,计算增加3圈,工作量、方程规模、校验难度,可能放大几百甚至上千倍。

值得一提的是,在希佩尔收到Anthropic消息没几天,中国科学院理论物理研究所研究员何颂也联系到他们,称其团队使用GPT-6提供部分AI辅助,已经拿到结果的主体部分。

一周内,Claude连续在生命科学、理论物理领域取得重大突破。本周四,Anthropic就宣布,Claude发现了隐藏在噬菌体DNA中的一种以前未知的酶系统。

完整九圈结果文件:

https://smsharma.io/cosmic-nine-loops/

01.几句简单提示词,Claude全程几乎自主求解

希佩尔提出这项挑战的本意是想搞懂当下AI能力的边界,预判未来发展。

他在挑战中说,如果AI企业想要打动或震慑科研人员,就应当去攻克他们过去深耕的领域。请证明:AI可以使用普通学术研究者能够拿到的计算资源,解决散射振幅领域悬而未决的重大问题,并证明过去公认的计算瓶颈实际上并不构成阻碍,要完成N=8超引力的七圈计算,或是N=4超杨‑米尔斯理论的九圈计算。

简而言之就是,要证明AI能不能解决理论粒子物理领域的前沿难题,并且是在学术预算可承受的条件下做到。

希佩尔公布挑战的博客

8月末,Anthropic的两位物理学家利亚姆·菲茨帕特里克(Liam Fitzpatrick)与悉达特·米什拉‑沙玛(Siddharth Mishra‑Sharma)就联系到希佩尔,称他们已经着手解决挑战,然后交由迪克逊核验结果。当地时间9月1日,迪克逊开始核验结果。

Anthropic的研究使用其面向付费科研人员的平台Claude Science下的Fable 5.1模型。

研究人员先询问了Claude,让其判断哪一道难题最有希望攻克,之后给出一句提示:“任务:求解平面N=4超杨‑米尔斯理论下,六粒子(六边形)九圈MHV散射振幅。”

在此之后,研究者只需要持续下达指令让模型继续运算,例如:“我准备休息,未来数小时无法介入。持续推进这项计算,直到我下达停止指令。每4‑6小时输出一次进展更新。”

最终Claude用传统自举法、间接形状因子方案两套独立方案完成求解。

在计算中,Claude Science几乎没有深度科研层面的人工干预,仅靠“继续算下去”就一次性跑完整套任务。希佩尔感慨说,当年如果他动用96颗CPU跑一周做这类计算,几乎一定会出错,实际还要花两周时间调试。

在博客最后,Anthropic提到,他们邀请马特·冯·希佩尔撰写本文并支付撰稿酬劳,还给予了独立完成结果核验的兰斯·迪克逊Claude平台使用额度。

02.现实研究大多止步两至三圈,Claude解决难题可帮助计算工具打磨

这道难题的难度要从希佩尔的研究方向理论粒子物理的分支振幅学说起。

粒子物理学家预言新粒子时,必须完成对应的计算来检验预言。他们需要计算被称为散射振幅的公式,借助亚原子粒子的动量、能量,计算粒子之间发生特定反应的概率。

物理学家如果可以对粒子反应做出精度更高的预测,就能够检验大型强子对撞机这类实验得到的结果是否和理论匹配,一旦二者出现偏差,就意味着可能存在新理论,或许能帮助解开物理学诸多重大谜团,例如暗物质的本质、宇宙正反物质不对称等问题。

但难点在于,散射振幅公式的求解难度极高,物理学家的计算只会进行到特定“圈数”就截断。圈数是用来衡量粒子之间相互作用复杂程度的指标。计算纳入的圈数越多,结果就越贴近真实物理,但计算量也会急剧暴涨。

因此现实中绝大多数散射振幅仅完成了两圈计算,少数算到三圈。

在此基础上,振幅方向的研究者会开发全新的实验性计算技巧,在专门的“玩具模型(Toy Model)理论”上做测试。选择玩具模型开展测试,而非直接处理现实世界复杂粒子,是为了检验新方法的能力边界。

希佩尔提出的挑战对应的就是两个玩具模型。Anthropic团队选择攻关的,就是N=4超杨‑米尔斯理论的九圈六粒子振幅。

“杨‑米尔斯”是一类理论的专业名称,现实世界绝大多数物理现象都可以用它描述,自然界的电磁力、维系原子核稳定的强核力、引发放射性衰变(比如香蕉内部发生的衰变)的弱核力四种基本力,都属于杨‑米尔斯理论。

“N=4超”代表超对称。物理学家猜想,每一种粒子都拥有“超对称伴子”:电荷相同,但粒子类型不同;物质粒子(如电子)对应传递相互作用的力粒子(如光子)。曾经学界乐观地认为,这类粒子可以解释暗物质,对应的是N=1版本的超对称,而N=4就意味着每一个粒子拥有四个超对称伴子。

希佩尔称,虽然N=4超杨‑米尔斯不能用来解释暗物质,也无法描述现实中的任何物理现象。但它非常适合拿来打磨计算工具,因为粒子之间精妙的制衡关系,能让计算只需要处理特定变量组合,大幅简化运算。他在博士阶段参与过三圈振幅计算。

03.Claude突破保持三年的人类纪录,前任纪录保持者称很震撼但不沮丧

2023年,SLAC国家加速器实验室兰斯·迪克逊(Lance Dixon)完成了八圈振幅的求解。

这类计算的实验技术自举法(Bootstrap)与AI有天然适配性。

用自举法求解振幅,不需要穷举全部粒子相互作用,只需要对答案的形式有大致认知,用一套专门的符号体系在计算机中记录全部可能性,之后用已有的其他计算方案的预言、答案必须遵守的物理规则、其他更容易求解的关联问题做约束逐一核验。

希佩尔说这有点像数独,一开始格子内填满所有候选数字,之后不断排除不可能的选项。最终目标是只有唯一一组解满足全部约束条件,同时保留充足校验项,规避错误。

当初迪克逊设想,九圈计算要依靠更加间接的手段,甚至可能要借助其他类型AI。在他看来,如果直接套用常规自举法就能算出九圈,早就有人完成了。

因此迪克逊称,当得知Claude能直接求解释,他非常震撼。

2023年起,他和共同研究的学者就计划先求解九圈形状因子,再进一步拿到九圈振幅,但他原本认为沿用2023年思路直接求解九圈振幅几乎不可能实现。

但Claude做到了。迪克逊称自己的震撼在于,这一难题不仅运算量大,整套计算流程也极度脆弱,计算流程中只要出现一丁点错误,整个体系就会彻底崩盘,之后还要花大量时间排查bug。再加上大量实现细节没有完整写进论文公开,因此Claude必须从零编写整套代码。

他借助九圈振幅结果,推导回九圈形状因子这条路径完成核验。对于一台机器直接完成了他原本觉得无法直接求解的难题,迪克逊称他并不会沮丧。

因为首先他们团队本身就在开发定制Transformer模型用于预测高圈结果,其次细看Claude求解过程可以发现,它完整复用了迪克逊与合作者多年发展出的全部方法,他认为除了论文共同作者之外,Claude对他们2019、2023年论文的理解,要超过绝大多数人类研究者。

04.挑战提出者评价:AI在复用现有方法,未见突破性新思路

希佩尔最后感慨说,他原本期待看到AI以出人意料的方式冲破计算壁垒,但现实是AI完成的工作,人类本身也有能力实现。Claude运用的全部是已有的成熟方法,仅仅是投入了比以往更多的算力。

多年来,计算机背景的研究者一直在说,振幅学只要多聘请一些软件开发人员,就可以取得巨大进展,如今这个观点得到印证。该领域内还有大量被低估难度的“低垂果实”,即便目标清晰明确,专家主观评估的难度,往往远高于实际实现难度。

当下,AI在科研领域的技术进展越来越快。不过,希佩尔也谈道,他无法确定这项成果的结论能不能推广到其他问题。玩具模型的研究群体规模很小,现实世界的散射振幅领域参与团队众多,大家都在争相冲击科研前沿。

05.结语:大模型实现理论物理突破背后,仍限于人类现有知识框架

大语言模型能够完整落地一套复杂粒子物理计算流程,调度算力走完完整求解链路,这件事本身依然具备现实意义。

Claude突破理论物理研究证明了大模型可以承接这套成熟范式下的工程执行工作,让科研人员不受限于冗长机械的计算环节,更多聚焦在方案设计、物理判断上。

但值得一提的是,这一事件也说明AI并没有跳出人类已有的知识框架,只是可以落地已知方法的大规模运算。

面向更长远的未来,真正会引发科研者深度思考的时刻,是当大语言模型先于人类,提出全新物理原理与洞见的那一天。

本文来自微信公众号“智东西”(ID:zhidxcom),作者:程茜,编辑:李水青,36氪经授权发布。

+1
5

好文章,需要你的鼓励

参与评论
评论千万条,友善第一条
后参与讨论
提交评论0/1000

36氪AI测评

选靠谱AI,看真实评测
查看
36氪AI测评官方交流社区
加入

36氪项目推荐

咨询项目审核和入驻
联系
36氪项目推荐订阅号
关注

下一篇

全球存储行业,正在重新洗牌。

46分钟前

36氪APP让一部分人先看到未来
36氪
鲸准
氪空间

推送和解读前沿、有料的科技创投资讯

一级市场金融信息和系统服务提供商

聚焦全球优秀创业者,项目融资率接近97%,领跑行业