7月31日,DeepSeek悄然上线了DeepSeek-V4-Flash正式版API,开启公测。据北京日报客户端7月31日报道,这是继4月24日V4系列预览版发布以来,该系列模型迎来的首次重大升级。与常规认知中Pro强、Flash弱的分层逻辑不同,此次升级最引人关注的一点是,Flash正式版在Agent能力上实现了对自家Pro预览版的全面反超。官方公布的9项基准测试成绩显示,V4-Flash正式版在Terminal Bench 2.1终端操作测试上得分82.7,Cybergym网络安全攻防模拟得分76.7,Toolathlon Verified工具调用综合测试得分70.3,内部全栈开发测试DSBench-FullStack达到68.7,高难度编码测试DSBench-Hard拿下59.6,多项指标远超4月上线的V4-Pro预览版。
更值得关注的是升级路径。DeepSeek官方表示,V4-Flash-0731的模型结构和尺寸与此前发布的预览版完全一致,总参数2840亿、激活参数130亿,仅重新进行了后训练。同样的模型骨架,经过更精细的训练策略调优,就在基准测试中产生了质的飞跃。这种以训练方法驱动能力跃升的路线,展现了DeepSeek在模型优化上的深厚功力。
在AI行业,Flash通常是轻量级的代名词,与旗舰Pro版本存在明显的能力落差。但DeepSeek V4-Flash正式版打破了这一惯例。凭借混合专家模型的架构优势,V4-Flash虽然激活参数仅130亿,但在终端操作、网络安全攻防、工具调用等Agent核心任务上全面超越了激活参数490亿的V4-Pro预览版。这背后是训练数据的优化、后训练策略的改进以及Agent专项能力的强化,让轻量级模型在特定任务上实现了对旗舰模型的弯道超车。
对开发者而言,V4-Flash正式版的价值在于性价比。更低的激活参数意味着更低的推理成本,而Agent任务的执行往往需要数十轮工具调用,成本优势会被大幅放大。据测算,V4-Flash的API定价显著低于同类旗舰模型,这使其成为构建Agent应用的理想底座。DeepSeek还特别说明,目前公测仅限API接口端,App和网页端暂无法体验最新能力,V4-Pro正式版将尽快发布。这种渐进式的发布节奏,既保证了服务的稳定性,也为后续版本的登场留足了悬念。
此次更新最值得玩味的是DeepSeek Harness的首次亮相。据官方披露,本次公开基准测试中的CodeAgent任务,使用了DeepSeek Harness极简模式作为框架进行测试,这也是DeepSeek在Harness团队公开招聘后,首次在官方公告中披露相关能力。公开资料显示,DeepSeek的Agent Harness团队组建于今年3月,负责人崔添翼是90后,浙大计算机出身,拥有6枚ACM亚洲区域赛金牌,曾在顶级量化机构Jane Street任职九年,今年3月加入DeepSeek后于5月大力招兵买马。
Harness在Agent生态中的角色,类似于大模型的神经系统,负责编排模型与外部工具、环境之间的交互。一个成熟的Harness框架,能让模型稳定地完成多步骤任务,包括规划、调用工具、观察反馈、修正错误。DeepSeek押注Harness,表明其战略重心正从单纯的模型能力向Agent基础设施延伸,这与OpenAI、Anthropic等国际巨头的布局方向不谋而合。对于开发者来说,DeepSeek Harness的出现意味着国产大模型在Agent工程化能力上补齐了关键短板。
V4-Flash正式版的发布,正值国产大模型竞争进入深水区。此前,Kimi、MiniMax接连用新模型抢占头条,而DeepSeek选择用Agent能力作为突破口,走出了一条差异化路线。从V4系列预览版到正式版,DeepSeek始终坚持性价比优先的策略,用更低的成本提供接近旗舰的能力,这在Agent高频调用场景中极具竞争力。与此同时,V4-Flash原生支持Responses API格式并适配了Codex生态,开发者可以无缝迁移现有应用,进一步降低了迁移成本。
这场Agent之战的终局,可能不是单一模型的胜利,而是整套基础设施的竞争。谁能提供更稳定的Harness框架、更丰富的工具生态和更低廉的推理成本,谁就能吸引更多开发者构建Agent应用。DeepSeek V4-Flash正式版的上线,为这场竞赛增添了一个有力的变量,也让中国大模型在Agent赛道的角逐中,拥有了与国际巨头正面掰手腕的底气。
值得一提的是,V4-Flash正式版在训练策略上的投入回报比极高。官方披露仅通过重新后训练,就在9项基准测试中实现了对预览版的全面超越,这说明DeepSeek的数据筛选、训练调度与评测体系已经高度成熟。对于行业而言,这种以优化方法驱动能力跃升的路径,比堆砌参数更具可持续性,也为小算力团队提供了一条值得借鉴的技术路线。