Hy4爆火,终于轮到腾讯紧急扩容了
腾讯最新大模型Hy4 preview,火了。
今日,腾讯混元发文称,该模型上线首日,就在腾讯旗下AI办公工作台
即便如此,高峰期仍可能继续排队。
Hy4 preview于8月28日发布,主要面向复杂办公任务。
官方跑分显示,Hy4 preview多项成绩与GLM-5.3、
目前该模型在
其每百万Token输入/输出分别为6元和18元,是Hy3的6倍和4.5倍。
实测Hy4 preview,更会干活了
7月份Hy3发布时,我们曾在
这要求模型自己搜索资料、整理数据,最终完成一份报告。
Hy3花了10分钟完成任务,最终给出了一份数据基本准确、排版中规中矩的报告。
如今Hy4 preview上线,我们把同样的提示词交给了它。
对比下来,进步还是很明显的。
Hy4 preview最终交出一份6页报告,不再只是简单罗列数据,而是进一步补充了个股涨跌中位数、行业涨跌、成交额等数据。
表格、走势图和数据来源也更加完整,已经比较接近一份正经的市场复盘报告。
不过,Hy4 preview完成整个任务花了43分55秒,速度反而比上一代慢了不少。
这可能既与模型本身计算量增加有关,也受到了
此外,在报告完成度相近的情况下,
第二项任务,我们给Hy4 preview上了一点强度。
我们准备了一份能够正常打开、但藏有多个Bug的数据看板,没有告诉它问题在哪里,也没有规定排查、修复和测试的具体流程,只要求它自行检查并交付一个能够正常运行的版本。
结果,Hy4 preview把我们埋下的核心问题基本全部找了出来。
它还额外发现了表头排序不完整等问题,最后一共列出了9项功能缺陷。
和上一个任务一样慢工出细活,它前后花了一个小时才完成整个任务。
不过,检查得确实很细。
除了修复代码,它还自己写了两套测试,进行了47项功能检查和38项真实浏览器测试,覆盖桌面、平板和手机多个尺寸;甚至连一些并不影响当前使用、更多属于代码可维护性的问题,也一起揪了出来。
比如“月份选项硬编码”,严格来说更接近优化项,并不算真正的功能Bug。
最终,Hy4 Preview交付了修复后的压缩包、测试脚本和多张截图。
腾讯的优势,发挥出来了
在这一代模型上,腾讯首先把模型本身做得更大了。
Hy4 preview总参数,从Hy3的295B增加到770B,激活参数从21B增加到49B,上下文也从256K拉到了1M。
同时,腾讯还重新设计了注意力机制,通过稀疏注意力和跨层索引复用,减少处理超长上下文时的无效计算。
但更重要的是,腾讯在把更多资源集中到混元身上。
今年二季度,腾讯资本开支达到528亿元,同比增长176%。
腾讯明确表示,当季已经支付大额AI相关预付款,用于支持Hy模型升级、
大模型是个很现实的行业,钱多不一定能做出好模型,但训练更大的模型、跑更多实验、买更多算力,都离不开钱。
而腾讯还有一个更难复制的优势。
腾讯业务覆盖社交、游戏、金融、办公和云服务,不同业务部门都能给大模型提供不同类型的真实任务。
按照官方说法,这次Hy4 preview的训练过程中,混元团队直接与软件工程、游戏、金融、安全等业务专家进行“高质量数据共建”,同时与
比如在办公场景里,模型要从多份杂乱文件中整理数据、处理公式、搭建金融模型,最后交付文档、表格或PPT;
在游戏场景里,则要从一句需求开始生成可玩的原型,再进入游戏引擎继续修改。
这些腾讯员工真正会遇到的问题,也可以反过来成为混元训练和评测的素材。
腾讯还找来163名内部专家,用203项真实工作任务进行盲测;最终,Hy4 preview平均得分2.99,略高于
对腾讯来说,这也形成了一条越来越清楚的路径。
业务给模型提供真实任务,模型能力提升后再进入业务,产生新的用户反馈和数据,再用于下一轮训练。
腾讯AI,依然有赛马
混元正在成为腾讯通用AI能力最重要的底牌,它负责不断冲击模型能力上限,
但到了微信这里,却没有直接使用混元。
今年8月,微信公开了自研大模型WeLM-80B,该模型用于AI助手“小微”,可以聊天、搜索、调用微信原生功能和小程序。
这不是混元针对微信做的适配版,而是微信自己又做了一套模型。
这很像腾讯过去所熟悉的“赛马”机制。
例如,腾讯内部曾有多个团队同时探索移动社交产品,最终由QQ邮箱团队孵化出来的微信跑了出来。
但大模型时代,继续维持多条技术路线的成本已经高得多。
多一套模型,背后可能就是另一套训练体系、数据体系、算力资源和算法团队,也意味着更多的开支。
高盛就在一份研报中提到,市场对于微信使用自研WeLM而不是混元存在疑问,两套模型并行是否会造成资源重复投入,目前仍不明确。
但腾讯的考虑也很明确。
刘炽平在二季度业绩会上表示,微信AI并不需要最强的大模型,更重要的是模型能否适应微信本身的产品需求。
这也解释了两条路线为什么会同时存在。
WeLM更看重隐私、成本效率和微信场景适配;混元则继续追求更强的通用能力,支撑
从目前来看,混元更像腾讯面向整个集团的通用能力底座,WeLM则针对微信这个超级应用寻找自己的最优解。
腾讯给大模型准备的标准答案,可能不止一个。
本文来自微信公众号 “科技每日推送”(ID:apptoday),作者:科技每日推送,36氪经授权发布。















