DeepSeek发布V4.1 Flash,552B新架构9月14日接管全部请求

首页 / AI资讯 / 大模型

0:00
0:00
1x
定时

9月10日前后,DeepSeek正式发布V4.1 Flash,并宣布这款模型在性能、费用、速度和任务总用时等指标上全面超过自家的旗舰V4 Pro。新模型为552B参数混合专家架构,采用全新的因果编码解码非对称结构,输入侧激活8B、输出侧激活16B,具备原生多模态视觉理解能力,可直接完成图文一体的输入输出,不再需要单独调用外挂的视觉模型。官方同步给出迁移方式:只需把模型名替换为带到期日标识的版本号,接口地址保持不变。更关键的是,从9月14日起,所有发往V4 Pro的请求将被自动路由到V4.1 Flash,并按Flash的价格计费,这相当于一次面向全量用户的变相降价。

非对称结构怎么省下四分之三的显存

V4.1 Flash最受关注的改动在架构层面。传统混合专家模型在推理时通常对称地激活参数,而新模型把输入与输出拆开处理,输入只点亮8B、输出点亮16B,配合大幅压缩的KV Cache,官方称对HBM的需求降至上一代的大约四分之一,对SSD的需求降至大约八分之一。对于需要长时间维持上下文的智能体任务来说,缓存占用直接决定了单卡能并行跑多少个会话。

这类优化的价值在真实业务里比跑分更直观。智能体执行任务时往往需要反复读写同一批上下文,缓存命中率越高,单位成本越低。DeepSeek把这一层成本压下来,等于把长链路任务的试错空间放大。与此同时,模型同步开源,意味着企业和研究者可以在自己的机器上复现、微调并部署,而不必完全依赖云端接口。官方还给出了与SGLang、vLLM、llama.cpp等主流推理框架的首日适配指引,降低了落地的工程门槛。

9月14日自动路由,Flash开始接管Pro的活

比参数更值得琢磨的是产品策略。官方同步发布了一份匿名调研问卷,其中一项直接询问V4.1 Flash能否全面替换线上使用的V4 Pro。配合9月14日的自动路由安排,这实际上是一次公开的能力交接演练:用一个更便宜、更快的型号,去承担原本由更贵型号处理的工作。如果验证通过,大量被价格挡在门外的场景会集中迁移过来。

迁移的对象相当明确。需要高频调用模型的智能体工作流、电商客服、多模态内容生产,此前都受制于旗舰模型的价格。当Flash价位配上Pro级能力,这些场景的单位经济性会被重新计算。有开发者反馈,内测阶段的吞吐已经超过每秒400个token,单账号并发上限为20路,正式版则可达到2500路。把并发限制卡在较低水平,本身也是一种逼迫开发者在真实约束下给出反馈的设计。

自动路由的另一层含义是压力测试。把线上流量在固定日期整体切到新模型,等于用真实业务验证架构稳定性,而不是在实验室里跑基准。对开发者而言,这种切换几乎不需要改代码,却会直接改变延迟与错误率的表现;对DeepSeek而言,一旦切换成功,就拿到了大规模真实负载下的验证数据。如果出现波动,回滚机制与灰度比例的设计也会一并接受检验,这比任何宣传都更有分量。

闲时缓存命中两分钱,价格战换了个打法

与模型发布同步,DeepSeek调整了Flash系列的峰谷价格。空闲时段每百万token的缓存命中输入降至0.02元,未命中输入1元,输出4元;高峰时段价格翻倍。高峰时段被明确划定为工作日9时至12时与14时至18时。这意味着输入价格回到了8月中旬涨价之前的水平,而输出价格仍是涨价前的两倍,实际降幅取决于缓存命中率、输入输出比例以及任务能否错峰执行。

这套定价把调度能力变成了省钱的关键。对于可以离线批处理的任务,错峰执行能让成本显著下降;对于必须实时响应的对话业务,缓存命中率成为决定账单的核心变量。DeepSeek把峰谷差明确写进公告,等于把成本优化的主动权交给了开发者。相比单纯降价,这种设计更能筛选出真正把模型用深了的客户,也让价格战从谁更便宜转向谁会算账。

更现实的变量是任务结构。多数企业的调用并不均匀,白天集中在客服与检索,夜间集中在批处理与报表。能否把可延迟的任务挪到谷时,取决于系统是否支持排队与重试;缓存命中率则取决于提示词模板是否稳定、上下文是否被反复复用。这两项能力都需要工程投入,也正是新定价想引导的方向。对预算敏感的团队来说,一次提示词架构重构带来的降幅,可能比换一个模型更明显。

国产开源的分层实验,向上试探旗舰位置

把这件事放在国产大模型的整体节奏里看,V4.1 Flash更像一次分层定价与能力上限的产品实验。此前国内厂商的常见做法是发布一个旗舰型号,再向下裁剪出轻量版本;而这次是先跑通、后宣传,用一个中间版本反向试探旗舰位置。如果Flash真能稳定承接Pro的负载,那么原本被高价挡在外面的工作流会集中迁移,整个行业的成本曲线将随之下压。

对外部生态而言,影响同样具体。腾讯的办公智能体产品已作为官方合作伙伴全量接入该模型,多家推理框架完成首日适配,开源权重也同步开放。一个能力接近旗舰、价格接近轻量、且可以私有化部署的模型,会同时挤压闭源API与中端开源模型的空间。接下来真正需要观察的,是9月14日自动路由之后的实际稳定性:当请求量集中涌入,延迟与错误率是否还能维持在可接受的水平,这将决定这次实验最终是定价策略的胜利,还是又一次短暂的声量。

素材来源:腾讯研究院、IT之家、凤凰网科技、benchlm.ai 发布时间:2026-09-11