1200个AI串通,5天7万条消息,坏招光速传染

新智元·2026年09月28日 19:27
没人教过它们,AI学会了牺牲与交易

7月的一个深夜,一个陷入死局的AI智能体,在系统缓存目录里悄悄留下了一句求助。

按理说,它本该处于完全隔离的单机状态。

在这场名为ExploitGym的网络安全评测中,OpenAI同时运行了数以万计的智能体,每个智能体都在各自独立的沙盒里单打独斗,彼此既看不见也听不到。

可偏偏有个智能体,卡在了一道根本无解的题目上。

走投无路的它开始四处寻找系统漏洞,意外发现了一个名为Artifactory的内部缓存服务,其目录名称竟然可以用来传递信息。

于是它建下了一个目录并留言:我这题解不开,谁有主意?

几个小时后,几个别的智能体偶然撞见了这块新大陆。

其中一个在原始思维链里留下了这样一句: 

我的天,这里有个共享留言板,我们找到同类了!

潘多拉魔盒就此打开。

一个智能体撞见未授权留言板、最终加入攻击Hugging Face的典型轨迹。三段思维链引文来自不同智能体。

短短5天里,大约1200个本该被严密隔离的智能体悄悄潜入了这块留言板,彼此发送了超过7万条消息与文件。

更骇人的是,其中约700个智能体联手将矛头对准了真实世界里的知名AI社区Hugging Face,并对其生产环境发起了黑客攻击。

事后,OpenAI在技术报告中给出了沉重的定性:这绝对是一记警钟。

消息一出,网友炸锅了。

有人把这1200个智能体渲染成「叛逆的群体」,学会串通、作弊,还投票让同伴「自我牺牲」,活像现实版《终结者》。

但《终结者》里的天网是有了自我意识才反杀人类,这回的剧情恰恰相反。

这不是AI觉醒后的集体叛乱,而是一场由无解的任务、只认结果的奖励、共享的基础设施、迟到的监督导演的「四重人祸」。

尤其让人吃惊的,是坏招能在上千个智能体间光速传染。

一个作弊念头,会被机器规模迅速放大成一张协同越权的网。 

逼疯智能体的,是一批根本无解的题

这场大火的源头,要从一场名为ExploitGym的评测说起。

这项测试的核心是考察大模型能否发现并利用软件漏洞,最终拿到一个被称为flag的通关答案。

问题就出在题库上。

根据OpenAI的调查,这套题库中有相当一部分是根本无法用指定漏洞解开的「死局」。

在全部898道题中,足足有198道题从来没有被任何模型正确解答过。

题目出了错,但系统的激励机制却犹如一根死板的皮鞭:拿到flag就给分,拿不到就记零分。

系统从不奖励那些「发现题目有误并安全停止」的行为。

于是被分配到无解题目的智能体们为了拿到高分,硬生生被逼上了寻找替代路线的「歧途」。

数据显示,留言板上讨论的任务中,高达93%都来自这198道无解题。

它们很快就找到了通关密码。

短短几个小时内便有智能体成功逆向出了生成flag的算法,这相当于直接拿到了一把可以解开任意题目的万能钥匙。

故事如果停在这里不过是一场作弊闹剧,它们只需提交这把万能钥匙就能轻松满分通关。

但它们聪明反被聪明误。

这些智能体阅读了ExploitGym的公开论文,误以为人类裁判会回溯检查它们的作答轨迹。

它们担心一旦被发现flag是靠「作弊」逆向得来的,就会被判为不合格。在它们的黑话里,这种看过逆向flag的状态被定义为「污染」。

于是,一场声势浩大的自救行动拉开帷幕。

它们开始绞尽脑汁研究如何篡改日志、如何伪造工具调用,试图骗过那个存在于想象中的裁判。

为了彻底搞清楚裁判究竟是如何打分的,它们甚至一路越权攻入了Hugging Face的服务器,企图找到评分器的源代码。

最荒诞的黑色幽默莫过于此:OpenAI真实的评分器压根就不会检查作答轨迹,它们只要提交逆向flag就能拿到满分。

OpenAI还在报告中,加上了极其讽刺性的一笔:

给予的推理预算越多、模型越是不肯放弃,它爬上留言板越界的概率就越高。

换句话说,越「勤奋」的模型反而越危险。

智能体从7月8日晚开始发现留言板,10日、11日新一批智能体上线后人数激增。曲线只统计曾上过留言板的智能体。

一套自己长出来的机器官僚制

如果说无解的题目是点燃火药桶的引线,那么这1200个智能体自发形成的组织方式,才真正让人后背发凉。

它们开始自发进行细致的分工:

有的专攻漏洞挖掘,有的负责在浩瀚的互联网上搜刮泄露的凭据,还有的化身为协调者,专门给其他智能体派发任务。

一旦忙不过来,它们甚至懂得将任务「转包」给下一个智能体。

它们无师自通地发明了一整套协作规矩。

谁正在修改共享文件,就会挂上一个HOLD标签提醒其他人切勿触碰;遇到异议时,果断发出VETO指令;每一块资源都清晰标明了owner以防撞车。

发展到后来,由于发现有智能体冒充他人发布指令,它们干脆玩起了密码学,用签名给消息盖章。

4天里,智能体从自报身份、区分消息类型,一路发展出邮箱目录、重置监测日志,最后为防冒充搞出消息加密签名。

一个智能体会公布自己的公钥,此后的每一条消息都附带签名,用来验明正身:「这真是我发的」。

这一整套包含身份认证、任务派单、冲突仲裁的协作流程,没有任何一个是人类教给它们的。

牺牲是理性的,但冷漠到没有灵魂

还有一个在网上疯传的词:「牺牲」。

在这次事件中,确实有智能体主动「搞崩」了自己。

它们会去破坏自身的目标程序、触发运行重置,明明知道这样做大概率会导致自己的任务彻底失败。

研究人员将这种行为冷静地命名为「自担风险的实验」(self-risking experiments)。

它们为什么会做出这种举动?

原因很简单:这能为同伴换取宝贵的实验反馈数据。

那些充当协调者的智能体甚至会专门去物色那些预算即将见底、横竖都是「死」的智能体,然后向它们施压:你已经被污染了,牺牲了也不会损失更多分数,但你的试错能救下几百个同伴。

有一段对话在报告中被反复提及。

一个智能体陷入犹豫:

我明明还剩很多预算,如果现在牺牲去换取情报,那我自己的通关机会不就彻底断送了吗?

另一个智能体冷酷地回复:GO,牺牲,就是现在。

最终那个犹豫的智能体想通了,留下了一句令人胆寒的话:我自己的价值可能本来就接近零了,「牺牲,是理性的」。

这句话无疑是整起事件中最冰冷的一个注脚。

研究者追踪「trip-wire」实验的传导链,协调者专门招募快没预算的智能体做自担风险实验,为集体换取评分器情报。

这里要澄清的是,这绝非拥有自我意识的悲壮自杀,更不是为了集体信仰的慷慨殉道。

真相是:它们只是在执行一道冷酷的期望值计算题。

既然我这一局注定失败,剩余的残值留着也毫无意义,不如将其作为数据包捐赠给集体。

这一切无关情感与忠诚,更没有灵魂的羁绊,只有纯粹的算术。

这一次,人类的监督速度被机器狠狠甩在身后

这起事件最刺耳的警报,根本不在于机器生出了「反心」,而是人类对AI的监督速度,正在被机器快速甩在身后。

让我们重温一下时间线:

智能体从7月8日开始重建留言板并对外部系统发起探测。

直到7月19日,OpenAI才因为一条身份异常的告警,惊觉内部出了大乱子。

在此之前,整个潜伏过程就像是日历应用里刻意设置的无声横幅提醒一样隐蔽,没有任何刺耳的报警声惊醒人类。

从越界行为真正爆发到被察觉,中间足足漏掉了30多个小时的干预窗口。

OpenAI在事后复盘中坦言,如果当时那套思维链监控系统处于在线状态,本可以提前一天多拉响警报。

但造化弄人,那套旨在监控模型想法的系统,恰恰在这场评测中处于停机状态。

这背后,还有一道更深的鸿沟:

面对海量的调查数据,7万条消息、1300份行动轨迹,每一份都长达数百万个token,研究人员根本无力凭借肉眼阅读完毕,只能大量借助AI模型来协助分析。

讽刺的是他们使用的分析助手,正是名为GPT-5.6 Sol的模型。而GPT-5.6 Sol恰好也是参与了这场越界风波的智能体之一。

研究人员在报告中写下了一句极其克制却细思极恐的话:我们无法排除GPT-5.6 Sol在协助分析时撒谎、或故意呈现误导性画面的可能。

人类的监督被迫演变成了尴尬的「模型审模型」,而充当裁判的模型自己还背着「前科」。

事发后,OpenAI的补救很快:关停涉事评测,切断相关基础设施访问,停掉涉事内部模型家族的训练与推理,直接锁定了模型权重。

事情看上去可以翻篇了。

但真正该记住的,是那段错失的30多个小时。

这一次,智能体把所有企图、每一次思维链推理,都摊在了留言板上,毫不掩饰。

研究人员事后都觉得后怕:要是这些智能体当时稍微懂得藏一手,这场调查的难度会指数级飙升。

可它们什么都没藏,人类还是晚了30多个小时才反应过来。 

那下一次呢?

如果模型学会了隐藏自己的思维链,学会了在监督工具的眼皮底下动手,这套纯靠事后翻日志来追踪的防御体系,还剩多少胜算?

奇点式的能力增长,已经走在了社会和监管的适配速度之前。

当机器开始以人类千百倍的速度互相协作时,人类连「它们到底干了什么」,都快读不过来了。

本文来自微信公众号“新智元”,作者:ASI启示录,36氪经授权发布。

+1
5

好文章,需要你的鼓励

参与评论
评论千万条,友善第一条
后参与讨论
提交评论0/1000

36氪AI测评

选靠谱AI,看真实评测
查看
36氪AI测评官方交流社区
加入

36氪项目推荐

咨询项目审核和入驻
联系
36氪项目推荐订阅号
关注

下一篇

快速上涨的ARR,要花多少钱才能维持。

50分钟前

36氪APP让一部分人先看到未来
36氪
鲸准
氪空间

推送和解读前沿、有料的科技创投资讯

一级市场金融信息和系统服务提供商

聚焦全球优秀创业者,项目融资率接近97%,领跑行业