DeepSeek V4.1 Flash上线,崔添翼加入“义父之战”

字母AI·2026年09月10日 18:37
DeepSeek V4.1 Flash全面替代V4 Pro,价格也按Flash算

就在DeepSeek测试V4.1 Flash中间版的两天后,V4.1 Flash就正式上线了。

总参数552B的MoE模型,采用了全新的Causal-Encoder-Decoder非对称结构。输入激活只有8B、输出激活16B,推理成本大幅低于同尺寸模型,还原生支持多模态视觉理解,无需外挂视觉模块。

并且通过KV Cache压缩,对显存需求需求降至上一代的1/4、SSD降至1/8,社区实测输出速度达300到500 tokens/秒。

通常来说,又小又快的模型性能也就越低。然而V4.1 Flash不一样,各项基准全面超越V4 Pro,GPQA Diamond达90.9。

而且它还降价了。9月10日12:00,Flash起闲时缓存命中输入0.02元、未命中1元、输出4元/百万token,高峰时段翻倍。

之前缓存命中是0.05元、未命中1.5元、输出4.5元/百万token。

一天以前,崔添翼曾在社交媒体上发文表示,以后V4 Pro的调用会转到性能更高、速度更快的V4.1 Flash上,并且价格也会按Flash价算。

Pro的价格是Flash的3倍,这么一改,我就又能在外卖里加俩鸡腿了。看来我又要多认一个赛博义父了。

月初的时候我总喜欢大手大脚,月末发现,到下一个发薪日前,我好像只能吃土了。

模型额度也是类似的。订阅的第一天,把大文件整个塞进上下文,明明只需要文件里20行的逻辑,却让Agent通读2000行的源码。于是它把整个仓库的索引、构建产物、lockfile全都读了一遍。几百 token 能搞定的问题,直接烧掉了大几万。

没办法,有额度就是任性。

可过不了几天,额度就花的差不多了,想买更高级别的订阅,怎奈囊中羞涩,但是不用AI又没办法完成工作。

左右为难之际,突然天降甘霖,你获得了一次重置额度的机会。

于是网友就管这些发放额度的人叫做“赛博义父”。

比较知名的有OpenAI的Tibo,谷歌的洛根,如今崔添翼也是位列仙班。

“赛博义父”经济,也正在成为AI大厂的胜负手。尤其是当模型性能难分伯仲的时候,额度就是成了AI厂商手里最温柔的武器。

模型参数好有什么用,我的“赛博义父”在你之上!

赛博义父起源

在大模型圈,“赛博义父”起源自西方,他们走的是“恩赐派”路线。不定期发放像是重置额度这样的小礼物。这套玩法的集大成者,是OpenAI的Tibo。

Tibo外号叫做重置额度的神,他本名为蒂堡特·索蒂奥(Thibault Sottiaux),比利时人,鲁汶天主教大学应用数学出身。

他从小就是个“非典型神童”,7岁就写下人生第一个程序。但Tibo说他自己真正想要的,是一台能跟自己说话的机器。后来Tibo先去了Google Maps,又去DeepMind参与AlphaGo背后的研究基建,2024年加入OpenAI,接手了当时还没什么人看好的Codex。

真正让他封神的,是2025年11月。

那段时间Codex系统错误频发,Tibo给受影响的用户补偿额度。没人想到,这个朴素的补偿动作,会演变成一场持续至今的互联网仪式。

2026年4月,Codex周活突破300万,OpenAI宣布此后每增加100万用户就重置一次额度,一路重置到1000万。于是500万、600万、700万、800万。

7月15日,Codex和ChatGPT Work的活跃用户达到800万,Tibo在社交媒体上宣布再次全员重置,还顺手“继续不设5小时速率限制”。到8月底,他在访谈里提到,Codex的用户如今已经超过了2000万。

Codex有Bug?好,重置额度。修好了Bug庆祝一下,再重置额度。发新模型,更要重置。

Tibo就像当年的王思聪,凭自己的喜好在微博上给大家发苹果手机。

于是社区就专门建了个网站,叫做codex-reset.com,用以记录Tibo重置额度的次数。

根据网站的信息,Tibo重置额度已经将近40次。

GPT-5.6发布后的12天里就来了10次。OpenAI发布GPT-6 Astra时,由于网络安全的,只有授权的网络安全机构以及Plus用户能够使用Astra。于是Tibo就给这些暂时用不上Astra的付费用户“每天存一个重置”,最后干脆又给全员发了一次完整重置。

Tibo自己调侃这份日程表:休息,重置,休息,重置。

Tibo本人也很会接梗。OpenAI被曝算力紧张时,他在评论区自嘲:“我真的应该停止按我桌子上那个巨大的Codex重置按钮了。”

他甚至真的搞了一颗实体重置按钮,名言是“只要哥想重置,哥随时都可以重置”。有一次用户喊他“宝贝”,他回:“不用叫我宝贝,重置将于今天下午进行。”

这些梗甚至被做成了一个叫做TiboGPT的网站。网站上只有一段话:“Tibo重置了吗?”,答案是“大概率!”。

这个比利时人甚至会说普通话。他在简历的“使用语言”这一栏写到:法语、荷兰语、英语、普通话。

起初大家都以为这是闹着玩的,可是当一位中文粉丝在社交媒体上给Tibo留言,说自己自从用了Codex就再没打开过Claude Code,Tibo直接回了一句中文:“你最牛了!”

隔壁Claude正在不断封禁中文用户,Tibo却用中文回复中文区粉丝,让不少国内开发者直呼:这义父,认得不亏。

2026年6月11日,Codex上线了Banked Reset(库存重置)功能。

就像卡包一样,OpenAI把重置券直接存进用户的账户,30天内想什么时候用就什么时候用。一次完整兑换,可以同时重置5小时窗口和每周窗口,还把周重置日期顺延7天。

如果说Tibo是 OpenAI 的“额度之神”,那谷歌这边对应的就是谷歌白嫖大使洛根·基尔帕特里克(Logan Kilpatrick),DeepMind旗下AI Studio和Gemini API的产品负责人。

他此前正是OpenAI的开发者关系负责人,跟Tibo恰好互换东家。

再往前,洛根在Apple做过机器学习工程师,给NASA当过开源政策顾问,还帮Julia语言建过开发者社区。2024年他跳槽时只有27岁,曾被媒体形容为“奥特曼最的秘密武器”。

到了谷歌,外媒直接称他是Gemini的“门面”,谷歌内部对他的评价是“一个人包揽了90%的营销工作。”

在他的任上,AI Studio的免费额度多到让开发者怀疑人生。

2.5 Pro免费一天使用大约50次,上下文支持最高100万 token,2.5 Pro的单次调用成本约为1美分。

2025年11月,Gemini 3 Pro问世,奥特曼因为受到了这个模型的威胁,首次拉响了OpenAI内部的红色警报,公司放下所有其他业务,全力投入到模型中,以防止被谷歌超越。

洛根这边更“过分”了,不仅可以在AI Studio白嫖Gemini 3 Pro,他还把额度提升,每天的免费额度一度达到了250次。按照Gemini 3 Pro单次调用1.5美分的价格来算,每天约为4美元,每月约为120美元。要知道,联合国难民署每月给的救济金也就才100美元。

在洛根的管辖下,单单Gemini 3 Pro这一个模型的白嫖额度,就超过了每月800块钱人民币。

如果你以为这样就完了,那你还是太小瞧洛根这个“白嫖大使”的称号了。AI Studio虽然面向所有人,但毕竟有些许的上手门槛。真正让洛根一战封神的,是学生免费送12个月的谷歌AI Pro订阅。以至于在闲鱼上出现了大量的代注册edu邮箱业务,3块钱到5块钱不等。

按美区的价格统计,一年的谷歌AI Pro是240美元。不需要任何门槛,只要你想办法弄个edu邮箱就能免费领到洛根给你的大礼。

随后,洛根再次发力,新用户注册绑个卡,就送300美元额度,有效期3个月的谷歌云余额。哪怕这个信用卡明天就注销,洛根照送不误。

除此以外,洛根还改了谷歌的站内直接付费流程,砍掉了跳转Cloud Console绑信用卡的劝退流程。

有赛博义父,自然就有赛博义母,就比如Anthropic的雷蒂亚·哈莉(Lydia Hallie)。

雷蒂亚是Claude Code团队的MTS(Member of Technical Staff,技术成员),主管开发者体验与教育,之前在Vercel做DX工程师,后来当过Bun的Head of DX。

一切的开始要从3月底说起。当时Anthropic因为限额收紧被全网嘲讽。有Max 20x用户发文称,他只用了19分钟就烧光了5小时额度。

随后雷蒂亚回复他说:“你的打开方式不对”。

5月20日,雷蒂亚又发布了完整的免费课程《Claude Code》,在Frontend Masters和master.dev正式上线 ,甚至不需要绑定信用卡就能观看。

到了9月5日,她突然发文:“我们刚刚为所有Claude Max用户重置了每周限额。Fable 5.1发布在即,加上很多人即将迎来长周末,我们想让你继续写下去。”

西方义父们的共同点是,他们不能改变模型的费用,却可以变着法的帮用户省钱。

国内的赛博义父

如果说西方走的是“恩赐派”,那国内走的就是“定价派”。不搞仪式感,不按重置键,直接把价格打穿。

典型代表就是“梁圣”梁文锋。

梁文锋从不送券,甚至不搞社区运营,他选择把模型权重MIT开源,并以远低于行业的token价格开放给市场。

梁文锋的逻辑是理性克制,DeepSeek的定价原则是10个月回本,对应6倍利润。梁文锋认为,在这个目标下,开源对商业模式毫无负面影响。

今年4月,DeepSeek把 Flash的缓存命中价格降到了0.02元/百万token,创下全球大模型价格新低。

可到了8月6日,DeepSeek突然预告全线涨价。8月17日新价生效,V4 Pro高峰时段缓存命中价涨了11倍,输出价涨了3.5倍。

一夜之间,梁文锋从“梁圣”变成了“梁叔”,然后又跌到了“梁子”、“牢梁”、“小梁”。

OpenCode上DeepSeek的调用量也随之下降,Flash两天内下降了59.1%,Pro下降了55.7%。

事实上4月的时候,DeepSeek官方还预告称“下半年超节点批量上市后,V4 Pro价格将大幅下调”。

然而等到了V4.1 Flash发布,大家一拍大腿才发现,“哎呀!是我们误会梁圣了!”

一天之后,正如前文所提到的,DSH负责人崔添翼发文:“鉴于DS V4.1 Flash模型在性能、费用、速度、总用时等各项指标上都全面超越了V4 Pro。再以更高的价格、更慢的速度和更多的算力消耗给DS用户提供原有的性能较差的V4 Pro模型会不太合适。V4.1 Flash正式上线之后,V4.1 Pro上线之前,V4 Pro模型的请求都会被路由到V4.1 Flash,并按Flash的价格计费。”

我的赛博义父终究是放不下我。

国内另一个定价派就是智谱首席科学家唐杰和CEO张鹏了。

DeepSeek多少还得花钱,智谱是直接免费。

智谱第一个免费大模型API是2024年8月上线的GLM-4 Flash,也因此开创了“Flash免费档”的先河。

2026年1月20日,GLM-4.7 Flash发布,官方称永久免费、无token上限、200K上下文、并发限制约30 QPS,连缓存都免费。

国内开发者社区流传的几个《白嫖指南》中,GLM-4.7 Flash一直是头号选择。

8月20日,一个叫Ox Alpha的匿名模型空降OpenRouter。

100万token上下文、原生多模态、免费一周,使用量一度冲到DeepSeek的两倍以上,直接霸榜,终结了DeepSeek在OpenCode上56天的垄断。

因为模型名字中带有“牛”(Ox),又因当时电影《牛来》的爆火。因此,社区给它起名“牛来”。

为一探牛来的究竟,全网开发者当了六天侦探,从分词器特征猜到模型架构,猜它到底是谁家的孩子。

8月26日谜底揭晓,智谱发文称,牛来就是GLM-5.3-Flash,320B-A18B,Artificial Analysis 智能指数57分,对标 Claude Opus 4.8,其性能甚至超过了DeepSeek V4 Pro。并且MIT全开源。

但牛来不再免费,而是改成了低价收费模式,其价格为旗舰模型GLM-5.3的1/10。

国内义父们的逻辑也很一致,不搞花里胡哨的这卡那券,把“便宜”做成产品属性,用技术升级实现“降价”。开发者少花点钱,AI厂少挣点钱又如何,积攒客户才是硬道理。

义父经济学

这些义父到底图什么?

重置额度本就是营销。

就像健身房的年卡,会员办卡后平均只去三分之一,健身房却按全价收钱。重置只是把“没用到的那部分”提前释放出来,对巨头来说成本接近零。

但用户感知到的价值是实在的。

按照社区的推算,一张Banked Reset,哪怕是用满,Plus用户的算力成本大约1-2美元,Pro用户5-8美元。

假设OpenAI给所有订阅用户发放一张Banked Reset,并且这些用户全都将其使用掉,那么按照Codex2000万周活的数据来看,满打满算也就1.8亿美元。

2025年,OpenAI在超级碗上的广告约花费将近2亿美元,大型全球品牌campaign也是2亿美元。但是这些曝光几千万到几亿的广告,OpenAI能获得的用户,可能不到其中的10%。而Banked Reset则是100%直达账户。

用户看过广告,可能3秒后就忘了。然而用户拿到一张Banked Reset,那用户很有可能会发自内心地感谢Tibo。

而且额度本身,也是2026年的AI大厂的第二战场。

7月12日,Anthropic宣布Claude Fable 5订阅访问期限第三次延期,延到7月19日,同时维持Claude Code周额度50%的上调。

不到一个小时后,Tibo就宣布暂时取消Codex和ChatGPT Work的5小时使用限制,Plus、Pro和Business全覆盖,同时给600万活跃用户全员重置额度。

现实的商战就是这么朴实无华。

而雷蒂亚重置Claude Max周限额,背景也是OpenAI发布GPT-6 Astra。

给用户的福利,本就是一颗射向敌人的炮弹。

西方义父们选择把重置权交给用户,30天内自选时机用掉。这本质上是在发“期权”。降价是确定性的,今天降了明天还在。可重置券是不确定的,你不知道Tibo下次什么时候发。这种“等待感”本身就是粘性。

codex-reset.com上守夜的人平均等约9天,最长等过70多天,等得越久,就越离不开OpenAI。

你会因为Tibo没有重置就退订Pro吗?显然不会。你只会因为重置而更离不开Codex,一次重置,买断了接下来一个月的忠诚。

那为什么国外是恩赐派,国内是定价派?

底层原因是市场成熟度不同。OpenAI和Anthropic已经有了稳定的付费基本盘,订阅用户本就是它们的现金牛。

重置额度,是在不触动基本盘定价的前提下,给开发者群体的“增量福利”。

而国内厂商还没有这个基本盘,DeepSeek、智谱、月之暗面都还在争夺市场份额,没有稳定的订阅收入可以依靠,所以必须用性价比去从巨头手里抢用户。

今年7月,Kimi K3上线48小时就把集群挤爆,月之暗面干脆暂停接收新付费用户,把算力优先留给老用户。杨植麟宁可少收钱也要保住体验,不是因为他不想赚钱,而是因为在这个阶段,用户比短期收入重要得多。

这是两种发展阶段的必然选择,不是谁比谁更慷慨。

当然,义父的恩情不是永久的。只有当策略和用户利益恰好同向时,才叫做双赢。

本文来自微信公众号“字母AI”,作者:苗正,36氪经授权发布。

+1
33

好文章,需要你的鼓励

参与评论
评论千万条,友善第一条
后参与讨论
提交评论0/1000

36氪AI测评

选靠谱AI,看真实评测
查看
36氪AI测评官方交流社区
加入

36氪项目推荐

咨询项目审核和入驻
联系
36氪项目推荐订阅号
关注

下一篇

36氪免费征集值得报道的创业项目,可扫码或线上提交

2小时前

36氪APP让一部分人先看到未来
36氪
鲸准
氪空间

推送和解读前沿、有料的科技创投资讯

一级市场金融信息和系统服务提供商

聚焦全球优秀创业者,项目融资率接近97%,领跑行业