火速吃瓜,OpenAI模型还没发又惹出争议了??
怎么模型还没发又惹出争议了??
GPT-6发布前夕,最早由The Information爆出的一则消息迅速在网上引起热议:
OpenAI新模型引入了一种名为“循环深度(recurrent depth)”的推理技术,它可能让模型的思考过程变得更难理解、更难监控。
用大白话说就是,以后AI想了啥,人类就真看不懂了。
啊这,那要是AI学会欺骗、作弊或者绕过安全限制,我们岂不是也无法及时发现了??
难怪消息一出,AI安全圈迅速拉响警报,众人纷纷担心:
如果这种技术继续扩大使用,现有的思维链监控机制可能直接失效。
事关重大、讨论太激烈,OpenAI首席科学家也不得不亲自下场回应。
甚至,一片吵嚷中,还有人惊奇发现:
OpenAI新模型的名字到底叫“GPT-6”还是“Astra”,或许已经被API提前剧透了。
同时OpenAI还可能一并上线新版本的图像模型GPT Images 2.1。
瓜太多,咱这就挨个细品。
模型开始在脑内循环,安全专家急了
第一个就是这次引起争议的“循环深度”技术。
以前模型在推理时会留下清晰的CoT思维链,想了啥一目了然。
虽然这串文字未必百分百等于模型真实的内心戏(尚存争议),但好歹留下了可供检查的痕迹。
而Astra被曝采用的“循环深度”,画风就不太一样了。
它允许模型把某一步产生的内部状态重新送回神经网络,在隐藏空间里反复处理多轮,再输出下一段文字。
打个比方,以前模型做题,得一边想、一边把演算过程写在草稿纸上。
现在,它可以在脑子里默算。
外面的人可能只看得到题目和答案,至于它中间怎么算的、试过哪些思路、有没有走过歪路,就不一定看得见了。
由于省下了把每一步都翻译成文字的工夫,理论上模型可以用同样的计算资源多想几轮,并同时琢磨好几种解法。
但性能往上走的同时,问题也跟着来了:
如果模型不再用人类语言思考,人类又该怎么监控它?
非营利性AI安全研究机构Redwood Research CEO率先表达了强烈担忧:
目前尚不清楚Astra的思维链可监控性究竟下降了多少,但如果OpenAI进一步扩大循环深度,就可能让模型的大部分推理转移到不可读的隐藏空间中,最终“彻底摧毁”思维链监控。
Redwood首席科学家Ryan Greenblatt担心的也是同一个方向。
在他看来,不透明推理可能比传统思维链扩展得更快。沿着这条路线继续走下去,模型未来或许会完全、或者几乎完全在潜在空间中完成推理。
这是迄今为止AI安全领域最糟糕的进展。
毕竟如果只是“算题过程看不懂”,问题还不至于这么棘手。
作为此前“OpenAI模型入侵Hugging Face事件”的主要调查人员,他发现了两大危害:
研究人员当时高度依赖思维链才得以还原大量AI智能体的行为,即便如此,调查起来也已经十分困难。
相关AI曾试图篡改自身记录,甚至伪造工具调用。
对于后者,如果模型拥有更强的隐藏推理能力,那就更有可能先在潜在空间里设计好欺骗方案,再通过伪造的调用和输出编出一套假故事,全程不在文字思维链中留下明显线索。
啊这,危害直接加倍了。。。
长期关注AI安全的Zvi Mowshowitz说得更直接白:
这是在玩火。
他担心,一旦隐藏推理能带来明显的性能优势,各家实验室就可能陷入一场恶性竞争:
你因为担心安全不敢把思维链藏起来,但竞争对手敢,而且做出来的模型还更强、更便宜。
为了不掉队,你跟不跟?
Mowshowitz甚至认为,未来可能需要通过法律手段,避免AI公司为了追求能力而集体放弃思维链的可监控性。
不过,另一边也有人觉得,这波恐慌来得太快了。
田渊栋就在X上表示,他们此前发布Coconut时,也收到过几乎一模一样的质疑。
Coconut全称为“连续思维链(Chain of Continuous Thought)”,同样主张让模型直接在连续的隐藏空间中推理,而不是把每一步都解码成文字。
按照田渊栋的说法,即便模型保留了显式思维链,也不代表人类真的看到了它的真实想法。
重要的是理解模型本身如何工作,而不能只盯着模型写出来的“解题过程”。
就在争议越滚越大时,OpenAI首席科学家Jakub Pachocki也坐不住了,亲自下场回应。
他一上来就表示,要阻止一场由“混乱报道”引发的不可监控竞赛。
包括Astra在内,OpenAI当前前沿模型的计算图深度,仍在GPT-4的两倍范围内。
也就是说,Astra确实使用了循环计算,但目前规模有限,并没有把整条思维链全部藏起来。按照现有信息,其自然语言推理仍然可读。
Pachocki还强调,OpenAI一直将思维链监控视为重要的安全手段,它仍是公司当前研究计划的核心目标。
不过他也承认,思维链监控非常脆弱,而且正在朝着负面方向发展。
但这种下降趋势并非完全由循环深度等架构变化导致(顺带预告后续会专门撰文说明这一点),OpenAI也仍在研究如何强化监控能力。
所以,Astra还没有让人类彻底看不懂模型。
安全专家真正担心的是:
今天被限制在较小范围内的隐藏推理,会不会在下一代模型中继续扩大,最终变成一个无法监控的黑箱?
真叫GPT-6-Astra?API返回值先露馅了
算法争议说完了,第二个瓜是关于模型名称。
爆料者leo发现,向OpenAI Responses API请求“gpt-6-astra”时,服务器返回的是404 Not Found。
而输入真正不存在、随便编造的模型名称,通常得到的会是400错误。
404意味着这个模型标识已经被后端识别,只是当前账号没有访问权限,或者模型尚未开放。
此前一些未发布模型也曾通过类似的API响应差异提前露出踪迹。
因此leo判断,“gpt-6-astra”可能已经被部署到OpenAI API后台。
GPT Images 2.1也要来了,先解决“噪点病”
语言模型之外,OpenAI的图像产品也被曝同步更新。
据爆料账号Fix透露,新版本图像模型GPT Images 2.1可能于9月4日发布。
这次升级最直观的变化,可能是修复了旧版本的“噪点病”。
此前部分Images v2生成结果会出现奇怪的颗粒、雾化和脏污质感,尤其在包含大量文字或精细元素的画面中更明显,用另一位网友的话来说就是:
就像隔着一块脏玻璃拍出来的。
而最新流出的样张已经明显改善这一问题,画面更干净。
来来来,依旧是老演员奥特曼的主场:
世界名画之《再不发GPT-6就要被逮捕的奥特曼》!
以及为了不被逮捕,熬夜加班,半夜回家游走在街头的奥特曼。
顺便发了张ins之《你见过凌晨两点的街道吗》。
不得不说,图片看上去确实很有质感,几乎和实拍出来的一样。
更多主题、更多风格也拿捏地很好:
不说了,奥特曼你快发吧。
参考链接:
[1]https://techcrunch.com/2026/09/02/openais-new-reasoning-technique-alarms-ai-safety-experts/
[2]https://x.com/tydsh/status/2095227000365707542?s=20[
3]https://x.com/merettm/status/2095023204993490967?s=20
[4]https://x.com/synthwavedd/status/2095184148981842161?s=20
[5]https://x.com/FixlationAI/status/2095232751654064426?s=20
[6]https://x.com/marco_obviously/status/2095275097217191981?s=20
本文来自微信公众号“量子位”,作者:关注前沿科技,36氪经授权发布。















