DeepSeek开源首个V4视觉大模型,3050亿参数看懂截图专供智能体

首页 / AI资讯 / 大模型

0:00
0:00
1x
定时

继文本版V4-Flash开源之后,DeepSeek在8月31日正式开放了V4系列首个视觉模型DeepSeek-V4-Flash-Vision-Exp的完整权重,模型总参数量约3050亿,采用MIT许可证对外发布,开发者在全球范围内都可以免费下载、微调并投入商业部署。这款实验模型早在8月21日就已上线DeepSeek官方API接受调用,此次权重开放补齐了本地部署的最后一环,也让DeepSeek成为继智谱之后,又一家拿出三百亿参数级开源多模态模型的国产实验室。

给AI装上眼睛:视觉模块如何长在文本底座上

从架构上看,Vision-Exp并不是另起炉灶的新模型,而是在V4-Flash-0731文本底座之上叠加视觉能力。原底座是一个总参数2840亿的稀疏混合专家模型,每次前向计算只激活约130亿参数,上下文窗口延续了V4家族的100万token配置。新增的视觉部分由一个32层、1024维的视觉编码器构成,把图片切分成14乘14像素的小块逐一编码,再经由对齐器把视觉特征投影到语言模型的隐藏空间,与文本输入一起参与后续推理。

官方资料显示,视觉模块使模型总参数增至约3050亿,每张输入图片在计费上按不超过384个token处理,与API的定价规则一一对应。值得注意的是,Vision-Exp全部权重采用FP8精度存储,与文本版V4-Flash混合使用FP4专家权重的方案不同,这意味着它可以同时跑在Blackwell与Hopper两代硬件上,部署示例使用四张GB300显卡配合vLLM即可运行,社区推出的4比特量化版本体积约155GB,供有条件的开发者在自有服务器上自托管。

跑分反超Opus 4.8,但重点是给智能体用的眼睛

在官方公布的成绩单里,Vision-Exp的文本能力相比纯文本版几乎不受影响,纯文本智能体基准Terminal Bench 2.1从82.7升至83.9,编码基准DeepSWE从54.4跃至59.3,反超了Claude Opus 4.8的58.0。多模态场景的提升更明显,ApexBench多模态智能体任务Pass@1达到36.5,Agents Last Exam以27.3分压过Opus 4.8的25.7,ZeroBench Pass@5也以35.0对34.0领先。

DeepSeek在发布说明里特别强调,这双眼睛不是给人看图的,而是给智能体用的。与传统的看图问答不同,模型的主打场景是让智能体直接读取网页截图、软件界面、图表与文档扫描件,在理解视觉信息的基础上继续调用工具执行任务,从而把视觉理解接入自动化工作流。需要说明的是,上述成绩来自DeepSeek自家的Harness评测框架,该框架代码尚未公开,独立实验室暂时无法完全复现,这也是业界对其保持谨慎态度的原因之一。

先卖API再开源,一个月两家中实验室的路线分野

DeepSeek此次的发布节奏颇为特别,8月21日先在自家API上线Vision-Exp,开发者只能付费调用而拿不到权重,十天之后权重才正式开放。这种"先卖API再开源"的顺序,与其7月31日发布V4-Flash文本版时权重同步放出的做法形成鲜明对比,也透露出这家实验室对API收入模式的看重。就在一周前,智谱开源了GLM-5.3-Flash,同样是MIT协议的三百亿参数级多模态模型,两家国产实验室在短短八天内先后放出同量级开源权重,让开放生态的竞争陡然升温。

对开发者社区而言,Vision-Exp的开源意味着不必再为每一次图像理解调用支付云端费用,模型权重、分词器、提示词编码参考实现以及一份最小化的PyTorch推理代码全部随权重公开,Hugging Face上已经出现了面向llama.cpp、LM Studio、Ollama等本地推理工具的多个量化版本。不过3050亿参数的体量决定了它仍是多卡集群或高内存工作站的玩具,消费级显卡无法直接驱动,真正受益的是具备算力储备的企业与研究机构,他们可以在不依赖海外API的前提下,把国产开源多模态能力接进自己的智能体流水线,这或许才是本次开源最值得关注的产业信号。

国产多模态开源的下一步竞速

随着Vision-Exp权重落地,国产开源大模型的多模态拼图正在快速补齐。过去一年,DeepSeek凭借文本与代码能力建立了口碑,但在图像理解上始终缺位,官方API变更日志显示V4家族从4月起就一直在为视觉能力做准备,此次发布补上了这块短板。而智谱、阿里、MiniMax等厂商的开源路线图里,多模态同样被列为下一阶段重点,可以预见,三百亿参数级开源多模态模型的赛道将在今年下半年变得更加拥挤。

对行业来说,竞争的焦点已经不再是"谁能看图",而是谁能把视觉理解真正转化为智能体的生产力。DeepSeek把Vision-Exp定位成智能体的眼睛,本身就说明模型厂商对多模态价值的判断正在从内容生成转向任务执行,当智能体需要读报表、看界面、审截图时,图像理解就不再是附属功能,而是核心能力。MIT协议下的免费商用授权,则进一步降低了这套能力的采用门槛,让更多中小团队有机会在自有数据与业务场景中打磨属于自己的多模态应用,开源生态的下一轮增长或许就藏在这样的组合里。

素材来源:Tech Times、AIBase、GIGAZINE 发布时间:2026-09-07