你花一块钱,巨头补贴五块六,也盖不住几千块成本黑洞
这不是理财广告,是我用两天实测亲手算出来的数字。
腾讯WorkBuddy,70块月费,含4000积分。按我的实测兑换率(1积分≈4100 Token)和Kimi K3 API均价折算,4000积分可调动1640万Token,API价值约394元——补贴约5.6倍。
隔壁阿里
需要说明的是,以上算的是旗舰模型API公开价。如果用户不自主选择,平台后台实际调用简单任务用便宜模型,复杂任务才上旗舰,这是行业通行做法。平台的真实算力成本可能远低于我算的这个数。
从补贴力度可以看到腾讯对桌面AI入口的投入强度以及战略决心,但是,
这意味着,WorkBuddy"5.6倍补贴"里相当一部分,可能不是腾讯主动让利,而是
而且,在2026年7月的SuperCLUE中文大模型综合评测中,Qwen3.8-Max以71.48分排名第一,
但是总体而言,腾讯的补贴力度带来的市场价值(或者说价格)是更大的,如果用户要用到K3,在WorkBuddy调用,显然划算些。
毕竟相比,"平台定价体系内"的补贴倍数,用户真正关心的,是另一笔账:如果平台不补贴,我两天实测消耗的算力值多少钱?
WorkBuddy这边,两天约700万Token,按
两笔加在一起,两天约287元。按这个强度外推一个月,约4300元。这是我这个"定时任务+长文修订+品牌共创"重度用法的真实算力成本。158元的订阅档根本包不住,我只是在用积分包填坑。
但拆开账单之后,我发现了三个问题。每一个都让我觉得,这钱没那么好省。
跑完之后,我对着账单坐了二十分钟。不是因为数据太复杂。是因为我发现,这场巨头们烧钱补贴的赌局里,我可能是他们最不想见到的那种用户。
这篇文章,就是我把账拆开之后看到的全部真相。
01 先交代全貌
WorkBuddy那边,品牌共创全流程,约700万Token,折合1500到1900积分。
账单的结构里藏着三个事实。
第一,最贵的不是思考,是记忆。
为什么这么重?因为Agent模式下,每一轮对话都要把完整上下文——系统指令、工具定义、全部历史交互——重新喂给模型。第30轮的成本大约是第1轮的10倍。生成的新Token只占总消耗的5%左右,剩下95%全是上下文的重复输入。
这不是浪费,是架构代价。Agent每走一步都要"回头看"自己走过的所有路,走一步看一路,任务越长,回头看越贵。你付的钱,大部分不是在买"新想法",是在买"它别忘掉之前的事"。
第二,定时任务是后台的成本炸弹。两个定时任务占掉两天消耗的一半,而且是固定开支,每天准点烧,不看也不停。
第三,这笔账单有真实的刻度。两天里我的
对官方而言,我不是什么被赠送积分覆盖的用户,而是一个纯亏损用户。Microsoft 365 Copilot的3000万付费席位里,周活只有两到三成,留下来的人,恰恰是烧得最狠的人。巨头们抢的入口之战,最终都要落在少数重度用户与赔率表之间的拉锯上。
02 定时任务:后台沉默的成本炸弹
用
两个任务,两天,三份日报级交付。
第一次跑简报,111分钟,烧掉约200万Token。第二次跑,20分钟,约70万。成本差近三倍。
变量不是模型,不是智力,是路径。第一次撞上成片拒绝直连的站点,Agent不断重试、绕行、换源,每绕一次都要把全部历史重读一遍;第二次它已经记得哪些路走不通,直奔正确的路,账单直接砍掉三分之二。
定时任务的另一个特征是固定开支。两个定时任务占掉两天消耗的一半,每天准点烧,不看也不停。按这个强度外推,仅定时任务每月约1亿Token,裸算力成本每月约千元级别。定时任务越多,账单越沉重。
03 长文修订:最大的单项
最重的一项,是一篇二万字长文的四轮修订,实际上,这篇稿子最主要的部分、花了最多时间的交互打磨,都是用别的模型完成的。
四轮修订,约300万Token,是
Agent的现阶段就是这样:它能交付,但中途需要人看着;它不能全信,但已经值得算账。
04 WorkBuddy的另一笔账
两个自媒体品牌,从零开始:起名、slogan、三十个logo、几十张渲染图。系统实时核算的Token账单约700万,折合1500到1900积分。
交付物摆在桌面上:三十个logo里,真正能用上的只有一个(其实就是探花AI飞刀这个号的logo)。账号名最终是自己想的。整个过程中最核心的思考——品牌调性判断、slogan方向取舍、视觉风格审美决策——还是靠人。长文修订也一样。它能压缩、能补数据、能调结构,但一旦涉及"核心论证链是否成立""逻辑推进是否有说服力",它就会跑偏——就像第三轮修订那样,需要人手动掰回。
半自动化,但是也已经够用了。
WorkBuddy高级版140元买9000积分,每积分合一分六厘;而按市场算力价,这一积分背后的成本是6分到2毛4。倒挂五到十倍。
用户烧得越狠,平台亏得越多,这也引出了最致命的问题:如果明天补贴停了,我还会为这820块的算力买单吗?
05 同一个任务,三倍方差
同一个简报,同样的53个账号,同样的交付要求:第一次111分钟,第二次20分钟,成本差近三倍。方差,而不是智力,才是这条赛道眼下的真正分水岭。
这也是全行业的共同赌注所在。第三方实测显示,字节扣子空间的任务成功率约70%,仍不及Manus官方宣称的85%;网页操作类基准从14%爬到60%,人类是78%,而单步成功率60%,连续8步全对的概率只剩25%。
Agent = 基础模型 + Harness。基础模型没变,价格差三倍,差的全在Harness那层薄薄的东西里——路径记忆、失败规避、任务路由。微软的CodeAct用这套编排里的模型路由,把Token消耗砍了64%:简单活给便宜模型,硬骨头才上旗舰。模型不再是信仰,是零件。智力的上限由模型决定,账单的下限由管控决定。
我也见到了Harness的反面。值班日报跑到第62分钟,报了一个错:模型流超时,120秒无响应。Agent没有睡着,它是在原地空转着烧钱,直到保险丝熔断。我手动接续,日报才跑完。
那一刻我突然理解了生死账里引用的那张亚马逊账单——AI请求空转五个月,烧出180万美元,超预算860%。大厂的灾难与我的一次超时,是同一门物理学,只是量级不同:该装的熔断、该记的重试、该避的路径,都属于Harness层的功课。Agent的成本管控,从来不是财务问题,是工程问题。
好在这一层真的会积累。用到第三天,它已经记得我要Word交付、中午交付、改稿只留一条主线;给我融新素材前,会先分级、问我确认范围,再动手;动我的原文件前,会先备份。Harness层沉淀着最稀缺的数据资产,落到个人体验里,就四个字:越用越顺。
06 定价:订阅是一场赌局
先摆我自己的数字。算力口径:按两天样本外推,我这个用法如果按API市场价实付,每月裸算力成本约4300元——已经快要顶得上一个实习生的月薪了。积分口径更直接:两天烧掉五千多积分,照这个强度跑一个月,大约七万五到八万积分,而
平台都在赌大多数用户不会像我这样用。
而我两天烧掉五千多积分、外推月均4300元算力消耗——这不是平台的补贴承诺,是我的实测账单。当然,平台不会并不会每月按这个强度补贴我,这是用户自己的账单。
算到这里,不妨把账再放大一层。
按两天实测外推,我这个用法的月均算力成本约4300元,已经快要顶得上一个实习生的月薪了。
但这是"重度用法"。如果我降一半强度——日报只跑一份,不做四轮长文修订,品牌共创只做单品牌——月均成本就落到2000元上下。这个数,比任何人力都便宜,交付物虽然需要人审核,但省掉的是最耗时的"从零到一"。
所以真正的判断是:重度用,算力成本逼近人力;适度用,碾压级性价比。
它的定位从来不是"替代人",是"放大人的效率"。你把30%的活交给它,它省你一半的时间;你把80%的活交给它,它可能拉出你一整份工资的账单。
关键不是AI贵不贵,是你怎么用。更深一层:如何看待这份账单。 纳德拉6月播客给出的框架是:Token不是消费品,而是"Token资本"。用户要回答的不是花了多少钱,而是每花一块钱Token,累积了多少属于自己的AI能力。
订阅制的本质是一场赌局:赌大多数用户买了不用。Copilot的3000万席位、两三成周活,是庄家的赢利面;我是反面,庄家最怕的那种用户,付158,烧掉的是远超订阅费的算力。而且这个悖论是结构性的:最愿意买高价套餐的,恰恰是调用最多、服务成本最高的人。用户从资产变成成本项,这是互联网商业史上罕见的倒挂。
Anthropic和Cursor已经先踩了这道雷——封杀额度复用、撤回、被诉、转向按量计费,订阅制的裂缝早在去年就裂开了。a16z的判断不留情面:订阅已触天花板,走向十亿用户,按量计费或广告是必经之路。
PPIO创始人姚欣说得最狠:今年Agent兴起,跑一个任务轻松消耗上百万Token,Agent消耗的Token量已超过人类,行业要从按Token计价转向为任务结果付费,而Token计价的宿命,是每年跌价十倍。
那赌局能不能打平?高盛五月的报告说得清楚,Token定价已经止跌,底层算力成本还在以每年六成到七成的速度压缩;价格止跌,成本续降,剪刀差就是利润。Anthropic的ARR从90亿美元冲到600亿,有望在三季度GAAP转正。拐点,就这两年。
订阅买工具使用权,按量买水电,结果买劳动。眼下行业正在发生的,就是从第一阶段向第二阶段的大迁徙。而
补贴填不了的成本黑洞,最终只能靠技术迭代去填上。谁先能把4300元的用户成本,打成430元,谁才是真正能够留下用户的平台。但是真正做到这种迭代的模型最终可能不只是迭代了技术,还会迭代掉靠补贴辛辛苦苦维持的所谓“入口”
07 账本缺页
积分与Token的兑换率是多少?官方没说。应用的用量页只有一个汇总,没有逐任务消耗明细接口。但我的实测把它逼出了一个近似值:五千多积分,约900万Token,1积分约合1500-1600Token。这样逼出来的兑换率当然不精确,但它是普通用户眼下唯一能抓住的锚。
拿WorkBuddy的账单再对一次,问题更清楚了:700万Token折1500-1900积分,1积分约含4000多Token。同样叫"积分",两边的含金量差了大约两到三倍。积分根本不是通用度量衡,跨平台连比价都做不到。黑箱不是一层,是两层。
这不是一家公司的问题,是整个行业的集体不成熟。卖水电的有水表,卖燃气的有燃气表,卖Agent的,还在用一张只写总金额的餐厅小票。Gartner预测超四成的Agentic AI项目会在2027年底前被取消,成本失控是重要原因;企业想给Agent批预算,先要向财务解释单价,而厂商连一张逐任务的价目表都拿不出来。谁先把明细表做进产品主界面,谁就先完成从"卖盲盒"到"卖水电"的转身。
08 附:两套积分制的算力账
上面的账,算的是"我烧了多少"。下面这笔账,算的是"平台给我的是多少",把积分的黑箱撬开一条缝。
Qwen3.8-Max混合均价13.2元/百万Token的推算
阿里云官方API定价为:输入12元/百万Tokens,输出36元/百万Tokens。
实测中Agent任务上下文重传占绝对大头,输入Token约占95%,输出Token约占5%:
12元 × 95% + 36元 × 5% = 11.4 + 1.8 = 13.2元/百万Token
月之暗面官方API定价为:输入20元/百万Tokens(缓存未命中),输出100元/百万Tokens。按同样95%输入、5%输出的任务结构计算:
20元 × 95% + 100元 × 5% = 19 + 5 = 24元/百万Token
实测兑换率:
WorkBuddy:1,500-1,900积分,约700万Token,每积分约4,100 Token。
同样叫"积分",含金量差约2.6倍。
验证:
WorkBuddy标准版70元/月,月得4,000积分,可调动1,640万Token,按
09 写在最后
两天高强度实测,我的判断分三层。
内容工作者与研究者,是眼下桌面Agent性价比最高的客群。定时日报加长文修订这套组合,一天数百万Token,几十元算力,换回的是两三千字的成品简报和三版日报。对比雇一个实习生,是碾压级的正收益。
企业用户,先装熔断再谈规模。Uber四个月烧光全年预算、亚马逊空转烧出180万美元,不是段子。
重度用户,先上高级档,再备好积分包。只跑定时任务的话,日均约一千九百积分,高级版每天两千的赠送刚好够;一旦叠上单次重任务,月消耗直接破十万,任何订阅档都包不住。庄家赌我不常用,我赌它扛得住。
Token会越来越像水电煤,便宜、按量、夜间打折;Agent会越来越像员工,按岗位计价,按结果付费。
但如果成本不降呢?
虽然这些都是日常需求,但是在没有补贴的情况下,我大概率不会选择这样使用——4300元的月账单,不是每个人都能闭着眼续的。
得成本者得天下。事实上成本正在高速率走低,但是这种走低在各个厂商主导的大模型并不是均匀分布的。
如果没有快速持续压降算力成本的能力,所有补贴、工作流、生态位、入口,最后可能都不过是给别人培育用户习惯。
2026年桌面Agent战争的走向,不写在巨头的资本开支表里。
它写在每个用户的账单上。
本文来自微信公众号“探花AI飞刀”,作者:摘花飞刀,36氪经授权发布。















