又一款匿名模型杀入编程榜:免费、性能追平 GPT-6 Astra

极客邦科技InfoQ·2026年09月28日 18:40
神秘模型扎堆,网友快猜不动了。

又一款没有公开开发者身份的模型,出现在编程工具和评测榜单上。

神秘模型 Pixel Canary 发布:免费、追平 GPT-6 Astra 

近日,Cline 在 x 上宣布,匿名模型 Pixel Canary 已在其平台免费开放。引发讨论的是它在 Next.js Agent Evals 中的成绩:常规设置下完成 31 项任务中的 28 项,成功率为 90.3%,与 GPT-6 Astra(高推理强度)持平,高于 Kimi K3 的 84%。

但这份成绩单还有另一面:榜单显示,Pixel Canary 完成任务的平均耗时为 1015.80 秒,约 16 分 56 秒;同一榜单上,GPT-6 Astra 为 251.89 秒,Kimi K3 为 352.34 秒。

把成功率和耗时放在一起看,Pixel Canary 展示出了完成复杂任务的能力,却还没有证明自己适合快节奏的日常开发。

那这 90% 的成绩,究竟意味着啥?

Pixel Canary 最早于 9 月 25 日登陆 Vercel AI Gateway,模型标识为 stealth/pixel-canary。Vercel 将其定位于应用构建、现有代码重构、前端开发和移动应用设计,并表示匿名开放期间限时免费。平台公开的模型信息显示,它支持约 26.2 万 Token 的上下文窗口及可调节的推理强度,但没有披露开发团队。

Vercel 的 Next.js Agent Evals 考查的是智能体完成实际 Next.js 开发任务的情况,涉及 App Router 迁移、数据获取、图片与字体优化、缓存及页面过渡等。Pixel Canary 的 90.3% 指的是 31 项任务中有 28 项通过。评测采用 pass@4:每项任务最多尝试四次,只要有一次成功,就算该任务通过。

所以值得注意的是,90% 这个数字也不能直接理解成开发者交给它十个任务,它首次尝试就能完成九个。

当评测通过 AGENTS.md 向智能体提供 Next.js 文档后,Pixel Canary 又完成了 30 项任务,成功率升至 96.8%。不过,这一设置下 Kimi K3、GPT-6 Astra 等模型也同样达到约 97%。这说明任务相关文档能够显著改变结果,也提醒开发者:真实项目中的代码规范、框架版本和项目说明,可能和模型选择一样重要。

但值得注意的是,免费试用背后,还有一项需要看清的条件。

Vercel 在发布说明中明确写道,Pixel Canary 不提供零数据保留(ZDR),发送给模型的提示词和回复可能被用于训练及模型改进。其模型页面也提示,提供方可能保留输入与输出。

对于把代码仓库接入智能体的开发者,这项条件比“免费”两个字更值得先看一眼:代码、配置文件或项目上下文,都可能随任务进入模型请求。

部分实测:速度极慢还不稳定 

Pixel Canary 上线后,网友很快分成了“测能力”和“猜身份”两路。

首先是测能力。在 x 上,有用户测试后表示,这款模型速度极慢,且很不稳定。他写道:

“6 小时后 Pixel Canary 终于完成我的孔雀测试了,这东西现在运行速度慢得令人抓狂,而且很不稳定。就连 Astra、Kimi K3 或 Fable 5.1 都没让我等这么久,结果还算不错。这些羽毛看起来跟我测试的 MiMo V2.6 Pro 的羽毛惊人地相似。”

实际体验中,稳定性和速度成为争议焦点。网友 codemeoww 称,自己使用 Pixel Canary 时多次遇到任务进行到一半突然中断,最终停用。

展示测试结果的 Sahil Panhotra 回应说:“我也是试了好几次才得到这个结果。”

codemeoww 随后表示,这款模型太慢,恐怕很难有人愿意长期使用。

还有 x 用户进行了经典的鹈鹕测试,并表示测试过程很痛苦,因为速度太慢了!

“痛苦实测,神秘模型 Pixel Canary 鹈鹕测试,跑了 5 个小时,中途各种报错🤣,个位数 tps 真的蚌埠住,效果你认为如何?”

还有用户表示,最终在经历了 20 多个 Provider 错误和 7 个多小时后……,终于测试了这款模型,效果如下:

还有网友 @benchmark_lb900 晒出 Pixel Canary 在“最大努力”模式下完成马里奥基准测试的表现,并对其能力提出质疑。他写道:

“有些开发者称它达到了 FABLE 水平,但在我看来,它更像是 Sonnet 水平。”

这条评价反映的是该网友对一次测试结果的主观判断,尚不能据此认定 Pixel Canary 的整体能力处于哪个档位。

网友 VulKan 表示,等待 8 小时后,他放弃了对 Pixel Canary 的测试。

他认为,如果服务无法稳定提供,即使基准测试分数很高,也难以体现实际价值,若后续分配更多计算资源,他愿意重新测试。

另一位网友 Muntasim Ul Haque 也抱怨其响应速度“让人想起电传打字机时代”,认为漫长等待抵消了模型可能具备的能力。这些反馈来自个人测试,尚不足以判断延迟是模型本身还是当时的服务资源所致。

Reddit 上的反馈更直接。一位用户称,Pixel Canary 读取代码库花了很长时间,慢到难以形成对能力的完整判断;另一位用户报告了更低的个人实测输出速度。这些是不同用户在各自接入条件下的体验,不能当作模型统一的性能指标,但与榜单上接近 17 分钟的平均任务耗时指向了同一个实际问题:能做完,与能高效地做完,是两件事。

社区态度因此相当分裂。一边有人为持续出现的免费模型感到兴奋,想尽快把它接进开发工具;另一边已经开始追问,免费匿名模型为什么开放、会开放多久、使用数据将如何处理。这些疑问并非都能从一张排行榜上找到答案。

神秘模型出自谁家? 

虽然该模型的实测效果让很多人大失所望,但仍然有很多人猜测它到底出自谁家。

有网友猜测,Pixel Canary 可能与 Qwen 3.8 有关,或是新的模型检查点、经过微调的版本,而非目前可直接调用的 Qwen 3.8 Max。其依据是模型处理泰语和印地语文本时的切分方式。不过,这只是网友根据输出特征作出的推测,尚无证据证实 Pixel Canary 的身份。

中文社区 LINUX DO 上,有用户用一些特殊文本片段测试模型输出,认为它“貌似是 Qwen 系”。

此外,也有人猜测,这款模型名字里的“Pixel”和“Canary”让一些人猜测它可能与 Google 有关。

有网友在 Reddit 的 Cline 讨论帖下猜测也有同样的声音,认为它可能来自 Google,另一位网友随即提醒,名称也可能只是随机代号。

OpenCode 社区里,还有人直接问:“Gemini 4 Pro 来了?”这些都是依据名字和发布方式作出的猜测,目前没有官方信息可以证实。

Reddit 用户 lucid_supernova 认为,Pixel Canary 看起来颇有能力,表现甚至可与 Astra 相比。但他不倾向于猜测其来自谷歌,理由是 Pixel Canary 标称约 26.2 万 Token 的上下文窗口,而 Gemini 已支持 100 万 Token。

另一位用户 Then_Bake_6524 随即提出异议:模型支持的上下文长度,与它在具体编码产品中开放的长度可能不同。他称,谷歌部分编码应用的上下文窗口约为 16.8 万 Token,Pro 模型则约为 26.2 万 Token。

还有网友表示,自己 80% 确定,这款模型是 Kimi K3.1。

Pixel Canary 目前最确定的价值,是给开发者增加了一个可以试用的选择。它在特定 Next.js 任务上交出了有竞争力的通过率,文档加持后进一步提升;它的提供方、长期价格和更广泛任务上的表现,则仍待公开信息与更多实测回答。

如果要判断它能否成为日常主力,下一轮值得看的不是再猜一次“它是谁”,而是在同一项目、同一工具、同样的任务和时间限制下,看看它交付的代码质量,以及开发者为此等了多久。

 “神秘模型”多了,神秘感也会失效 

过去一个多月,模型社区似乎进入了“猜身份”的循环。8 月,Ox Alpha 以匿名身份供用户试用,中文社区给它起了“牛来”的名字;讨论了一阵之后,智谱揭晓它就是 GLM-5.3-Flash。

到了 9 月,OpenRouter 上又出现 Union Alpha。现在,轮到 Pixel Canary:开发者拿它跑编程测试,网友根据输出习惯、上下文窗口和响应速度,推测它究竟出自哪家公司。

匿名上线有其合理性。把厂商名字暂时拿掉,可以让开发者先动手测试,少受品牌印象影响。模型在真实任务里能做什么、哪里容易出错,也可能比一张官方跑分表更早进入讨论。“牛来”的身份揭晓,就给此前的试用和猜测画上了句号。

但同一套玩法频繁出现之后,问题也来了。用户第一次见到神秘模型,会好奇它是谁;第二次、第三次,类似的代号、悬念和身份竞猜反复上演,注意力很容易从“这个模型能解决什么问题”,转向“这次又是谁在制造悬念”。尤其当匿名身份本身成为传播的主要看点时,外界难免怀疑:这究竟是在收集真实反馈,还是借“神秘”完成一次预热?目前没有证据表明 Pixel Canary 的发布方刻意炒作,但这种质疑值得正视。

Pixel Canary 的争议,恰好说明了猜身份之外还有更重要的事。有用户认为它的表现接近顶级模型,也有人测完马里奥基准测试后觉得并没有达到预期。还有测试者称,等待 8 小时后只能放弃;另一位用户则抱怨速度拖累了使用体验。这些反馈各自只代表有限的测试经历,却指向同一个问题:模型即便能在某项评测中拿高分,如果开发者在实际使用时长时间等不到结果,跑分很难独自说明产品价值。

因此,Pixel Canary 最终会不会被某家厂商“认领”,或许能满足一时的好奇心,却未必是这轮讨论最有价值的答案。

匿名模型越来越多,神秘感就会越来越短暂。要让用户在身份揭晓之后继续使用,厂商还得回答更朴素的问题:模型是否稳定、速度能否接受、不同任务上的表现能否重复。猜谜可以带来第一波关注,长期评价终究要靠这些可验证的体验。

本文来自微信公众号 “InfoQ”(ID:infoqchina),作者:冬梅,36氪经授权发布。

+1
0

好文章,需要你的鼓励

参与评论
评论千万条,友善第一条
后参与讨论
提交评论0/1000

36氪AI测评

选靠谱AI,看真实评测
查看
36氪AI测评官方交流社区
加入

36氪项目推荐

咨询项目审核和入驻
联系
36氪项目推荐订阅号
关注
36氪APP让一部分人先看到未来
36氪
鲸准
氪空间

推送和解读前沿、有料的科技创投资讯

一级市场金融信息和系统服务提供商

聚焦全球优秀创业者,项目融资率接近97%,领跑行业