谷歌Meta被锤刷榜

新智元·2026年09月12日 16:17
Gemini暴跌70分,Top 2秒变倒数第三

跑分这事儿,最近有点不太对劲。 

9月8日,分析机构SemiAnalysis连甩五条推文,直接点名谷歌和Meta两家万亿巨头—— 

Gemini 3.8 Flash和Muse Spark 1.3是「刷榜痕迹最明显的两个模型」。

证据,非常清晰。 

在测Agent干活能力的Terminal-Bench 2.1榜单上,Gemini 3.8 Flash考了89.4分,在182个模型里高居第2,把GPT-6 Astra都压在了身下。 

结果换到8月29日刚上线的Terminal-Bench 4.0,同一个模型只拿到19.1分,在14个测试对象里直接掉到第12,成绩当场打了个二折。 

同一时间,GPT-6 Astra从88.4掉到57.7,好歹算个六五折。 

仅仅27分钟后,Meta首席AI官Alexandr Wang亲自杀到评论区,开口直接甩出六个字,这是个愚蠢的论点。

他认为GPT-5.6 Sol在2.1上是88.8,在4.0上掉到了37.3,落差更大但没人说Sol在刷榜。 

同时他还强调,Meta从没说过Muse Spark 1.3能跟Astra或Fable 5.1一样强,只是它的性价比显然更高。 

换张卷子,成绩直接脚踝斩

简单介绍一下,Terminal-Bench测的是Agent真实干活的能力。 

方法是丢给模型一个终端和一个模糊目标,剩下的全让它自己看着办。然后,系统得自行规划路径、调工具、写脚本,报错了还得自己去改。 

在已经被业界刷了大半年的2.1版本上,这俩的成绩确实好看。 

Gemini 3.8 Flash拿下89.4分排在第2,Muse Spark 1.3以88.8分排在第4,紧随其后的是88.4分的GPT-6 Astra和85.02分的Claude Fable 5.1。 

好家伙,一个Flash级的便宜模型,一个主打性价比的Meta新作,双双把两家顶级实验室的旗舰按在地上摩擦。 

然后,4.0版本来了。 

新卷子一共66道题,不仅砍掉了8道已经被「刷穿」的旧题,大修了19道,还统统加上8小时的超时限制。 

防作弊机制同样上了极高强度。 

主办方不仅设了35条评分细则,还加了一轮专门的「对抗性作弊试验」,故意让Agent自己去试着钻奖励机制的空子,只要钻得通的题就会被直接毙掉。 

新榜一出,画风突变。 

Claude Mythos 5.1(max)拿到60.9分稳住阵脚,GPT-6 Astra和Claude Fable 5.1分别以57.7分和55.8分紧随其后,再往下是52.3分的Claude Opus 5。上一代的GPT-5.6 Sol和Terra分别拿到37.3分和23.6分。 

相比之下,Gemini 3.8 Flash直接暴跌到19.1分。而按SemiAnalysis给出的图表,Muse Spark 1.3的成绩是33.3分。 

总结一下就是。 

旧榜上,Gemini 3.8 Flash还能压着GPT-6 Astra打;新榜上,它的分连人家的三分之一都不到,甚至被上一代的GPT-5.6 Terra甩在了后面。 

不用抄答案,买套「密卷」就行

吵架归吵架,SemiAnalysis第二条推的点名才是真正的行业内幕。 

在他们看来,Terminal Bench 2.1的任务是完全公开的,Meta和谷歌绝对不会傻到直接拿原题去训练,但他们绝对会去买数据,专门买那些被设计得无限贴近TB 2.1题型的训练数据。最后的效果其实跟作弊没差。 

而这,就是2026年刷榜的高阶玩法。 

以前的「污染」套路很糙,直接把原题混进预训练语料让模型死记硬背。 

这种事一查一个准,洗一遍数据成绩就得现原形。 

业界在这上面栽过不少跟头,比如HumanEval近四成样本被污染,GSM8K去污染后掉13分。最狠的是SWE-bench,换套私有代码库重测,分数直接腰斩。 

所以现在大厂不碰原题了,大家改买「长得像考题的模拟卷」。也就是提供给模型试错并给奖励的封闭任务系统。 

目前,这已经是一门明码标价的成熟生意。 

单个训练任务售价200到2000美元,复杂的软件工程任务甚至能开到2万。

要是想克隆一个网站做成UI训练场,大约需要2万美元。

如果要求复刻一个Slack量级的产品,那就是30万美元起步。

遇到要求独家买断的客户,价格还能再翻4到5倍。

根据Epoch AI的调研,Anthropic内部讨论过每年在这上面砸10亿美元。单季合同动辄六七位数,有研究员透露均价在30万到50万美元一季。 

供给侧至少有35家公司在做这门生意,绝大多数是20人以下的初创团队。老牌数据巨头也全在转型,Scale AI在被Meta入股前营收就超14亿,Surge的ARR也逼近10亿。 

现在的局面非常魔幻。 

一边是完全公开的榜单题库,另一边则是成熟的卖题产业链。想让模型在某个榜单上考高分,真不用费劲作弊,直接掏钱下单就行。 

既当卖题机构,又当监考老师

随后,SemiAnalysis直接点名了一家叫Datacurve的公司。 

在专测长周期编程的DeepSWE 1.1榜单上,Muse Spark 1.3(max)以75.4分拿下第一,GPT-6 Astra和Claude Opus 5紧随其后,Gemini 3.8 Flash拿到73.8分排在第四。 

被指控刷榜的两位,一个第一,一个第四。 

想必,你已经发现了这背后的猫腻。 

这个榜是Datacurve办的,而Datacurve赚钱的门路,恰好是向前沿实验室出售「专家级编码数据和强化学习环境」。 

DeepSWE不仅是Datacurve自家的基准,跑分用的还是它自己运营的评测环境。 

既当卖题的辅导机构,又当出卷的监考老师,可以说是彻底坐实了。 

榜单的保质期,所剩无几

最后,SemiAnalysis顺势给整个行业的公开评测下了一道判词。 

他们觉得这说到底就是所有优质公开基准的宿命。TB 4.0也不例外,它现在看着还准,仅仅是因为它才发布了两周。 

只要它的题目还是公开的,用不了多久就会被所有标榜「前沿」的实验室盘出包浆。 

SemiAnalysis最终给出的解药非常直接,那就是多做高质量的私有基准。 

方向是对的,但代价同样惨痛。 

一旦评测全部私有化,公开榜单就会彻底沦为各家的营销通稿。 

真正有区分度的真实成绩,只会在实验室和私有评测机构之间暗箱流动。 

大厂当然乐见其成,毕竟闭卷考试谁也没法提前背题。 

但对于广大开发者来说,那把用来公平丈量所有模型的公共尺子,恐怕再也找不回来了。 

参考资料:

https://x.com/SemiAnalysis_/status/2097112791471522292

编辑:摩西

本文来自微信公众号“新智元”,作者:ASI启示录,36氪经授权发布。

+1
27

好文章,需要你的鼓励

参与评论
评论千万条,友善第一条
后参与讨论
提交评论0/1000

36氪AI测评

选靠谱AI,看真实评测
查看
36氪AI测评官方交流社区
加入

36氪项目推荐

咨询项目审核和入驻
联系
36氪项目推荐订阅号
关注

下一篇

6亿欧元。

10小时前

36氪APP让一部分人先看到未来
36氪
鲸准
氪空间

推送和解读前沿、有料的科技创投资讯

一级市场金融信息和系统服务提供商

聚焦全球优秀创业者,项目融资率接近97%,领跑行业