DeepSeek V4.1 Flash发布,用pro的能力收flash的钱
图片由AI生成
9月10日,
按照
此次更新的重点,也由此落在了三个相互关联的变化上:新架构提升能力与效率,视觉理解并入主力模型,更低的价格让开发者有机会把更多工作交给Flash。
01、5520亿参数,输入与输出采用不同计算规模
V4.1 Flash的升级深入到了模型结构。
此前7月31日发布的V4 Flash正式版,保持了预览版的模型结构和尺寸,主要重新进行了后训练。此次,V4.1 Flash采用全新的Causal-Encoder-Decoder(因果编码器—解码器)结构,是一个总参数量为552B的混合专家模型(MoE)。
这套架构的特点,是输入与输出不对称:处理输入时激活80亿参数,生成输出时激活160亿参数。 模型拥有较大的总参数规模,每次计算只调用其中一部分,并为读取信息和生成内容分配不同的计算规模。
这种设计与Agent的工作方式有较强关联。处理代码仓库、长文档和历史对话时,模型需要读取大量信息,再生成相对有限的判断、代码或操作指令。降低输入环节的计算开销,有望改善这类任务的整体效率。
架构之外,V4.1 Flash还采用了新的预训练方式,并进行了更大规模的强化学习后训练。
根据官方公布的结果,V4.1 Flash在科学问答测试GPQA Diamond中得分90.9,Codeforces竞赛编程评级为3471,MathArena Apex得分65.6。在考察终端任务执行的Terminal-Bench 2.1上,新模型得分90.6;在网络安全测试CyberGym上得分88.1,此前V4 Pro公布的对应成绩分别为87.9和83.3。
V4.1 Flash是新架构系列中尺寸最小的型号。按照
02、视觉理解并入主力模型
V4.1 Flash的另一项变化,是原生支持多模态视觉理解。
此前,
按照最新图像理解文档,开发者可以让模型描述图片、识别截图文字、分析图表。图片可以通过公开链接传入,也可以编码后直接提交,或通过Files API上传后引用。
这对处理真实资料的Agent有实际意义。业务文档里的说明文字与图表、代码与界面截图,经常需要结合起来理解。统一模型入口,可以减少开发者在不同模型之间分配和切换任务的工作。
在基础规格上,V4.1 Flash支持100万Token上下文、最大384K输出,以及JSON Output、工具调用、Responses API等功能。模型同时提供思考与非思考模式,默认开启思考,思考强度支持low、high、max三档,开发者可以根据任务复杂度配置。
03、缓存输入降价60%,连续工作更便宜
V4.1 Flash的新价格于北京时间9月10日12时生效,继续采用峰谷定价。按每百万Token计算,空闲时段的缓存命中输入价格为0.02元、缓存未命中输入为1元、输出为4元;高峰时段分别为0.04元、2元和8元。
高峰时段为北京时间周一至周五9:00—12:00、14:00—18:00,其余为空闲时段。
与此前V4 Flash同一时段的价格相比,缓存命中输入降价60%,未命中输入降价约33.3%,输出降价约11.1%。
需要反复读取大量上下文的任务,受益更加明显。Agent连续工作时,往往多次输入历史对话、工具说明和代码,缓存价格下降可以降低这部分重复开销。对于以生成新内容为主的任务,节省幅度则相对有限。
以固定用量测算,一次任务若消耗100万缓存命中输入Token、10万未命中输入Token和1万输出Token,空闲时段费用将从0.245元降至0.16元,下降约34.7%。实际账单还取决于模型的思考长度、工具调用轮次和失败重试次数。
deepseek-v4-pro将在9月14日12时后转向新Flash,并按Flash价格计费,直至未来V4.1 Pro上线。
04、模型与Harness一起训练,强化连续工作能力
与V4.1 Flash同步更新的,还有
这意味着,训练开始覆盖模型实际工作的不同环境。Agent完成任务时,需要在工具调用、结果读取和下一步决策之间持续循环。针对不同运行模式训练,有助于模型适应工具组织和调用方式,减少执行中的衔接问题。
一个值得关注的细节是,使用V4.1 Flash时,新版Harness支持在保留已有KV Cache的情况下更新系统提示词。对于需要调整工作规则的长任务,这为复用此前计算结果、减少重复处理提供了条件,也与此次缓存输入降价形成呼应。
文件处理能力也随之完善。Web界面支持上传图片、PDF等文件,由模型通过文件工具按需读取;右侧栏可以浏览工作区文件树,预览Markdown、HTML、PDF、代码和图片。结合V4.1 Flash的原生视觉理解,用户可以把资料交给Agent,再直接查看它生成的文件。
多Agent协作则向前走了一步。父Agent与子Agent支持双向通信,执行过程中可以补充信息、调整方向;主Agent也可以为子Agent选择模型和推理强度。新增的实验性功能Agent Teams允许主Agent创建多个成员,通过共享任务列表分配、跟踪工作,成员之间可以互发消息,最终由主Agent汇总结果。该功能默认关闭,启用后会增加Token消耗。
此外,新版Harness为插件提供了左右侧栏的标准化界面入口,并优化了长会话加载、恢复和内存占用。
从这次更新看,
05、如何使用
开发者可在
普通用户可通过
此外,腾讯
模型更新之外,
V4.1 Flash正在拉高低价模型的能力边界,也为未来V4.1 Pro设置了更高的起点:如果Flash能够承接更多复杂工作,更大型号需要拿出更有说服力的能力增量。
本文来自微信公众号“腾讯科技”,作者:晓静,36氪经授权发布。















