大模型竞赛的计分方式正在换轨。过去两年比的是谁的总参数更多、谁的榜单分数更高,9月20日阶跃星辰发布的新一代旗舰基座模型Step 5 Preview,把比拼的落点换成了另一件事:同样的智能水平下,成本能压到多低。这款模型采用稀疏混合专家架构,总参数6000亿,每个词元实际只激活270亿,支持100万词元的上下文窗口,原生支持文本与视觉输入,重点面向AI编程、软件工程、专业知识工作与金融场景。
混合专家架构可以理解成一支专家团队:总参数储备很大,但每次处理任务只调用其中很小一部分。Step 5 Preview的激活比例约为4.5%,这让它在保留庞大参数储备的同时,把单次推理的算力开销压了下来。相较于总参数上万亿的旗舰模型,它的总参数只有约三分之一,单次参与推理的参数更小。
参数更少并不等于能力更弱。在Artificial Analysis智能指数中,Step 5 Preview取得44分,位居全球开源模型前三,排在其前面的开源模型是Qwen3.8 Max与GLM-5.3。在软件工程评测中它得分67.7,领先Kimi K3与GLM-5.3等开源模型,仅次于GPT-6 Astra与Claude Opus 5两款闭源旗舰。在跨领域深度研究、智能体考试的命令行子集等多项测评里,它同样进入前列。
更有说服力的是长周期任务的表现。在24小时GPU内核优化实验中,模型在单张H100上约22小时后达到前向与反向合计508 TFLOPS,这一结果超过了对比中的Claude Opus 5。内核优化是典型的长时间、多步骤工程任务,考验的不只是单点能力,还有在长时间上下文里保持目标一致的能力。
大模型仍受规模法则制约:能力越强,算力成本通常越高,业内用帕累托边界来描述这种取舍关系,在边界线上提升一分智能就需要多付一份成本。阶跃星辰的表述是,新模型正在把这条边界线往外挪,相当于同样的成本智能更高,同样的智能成本更低。
数字口径来自Artificial Analysis。Step 5 Preview每完成一项智能指数任务的成本约为0.71美元,输入与输出价格分别为每百万词元1美元和2.7美元,输出速度约为每秒100个词元。作为对照,Claude Opus 5的单次总开销为5.86美元。按官方测算,在智能水平相当的情况下,单任务成本约为后者的八分之一。换成人民币口径,价格约为每百万词元输入7元、输出20元,可与DeepSeek-V4-Pro的高峰时段定价对标。
值得注意的是,这次价格策略没有走低价倾销路线。它的定价落在行业中位附近,靠的是单位任务成本而不是单价本身,这意味着压缩成本的主要手段是架构与推理效率,而不是补贴。
在训练新款基座模型的过程中,阶跃星辰把金融列为重点验证场景。外部基准FrontierFinance包含220道专业金融问题与11543项评估标准,覆盖六类投资应用场景,Step 5 Preview在该基准上取得66.4%的成绩。金融任务的特点是信息密度高、链条长、对错误零容忍,恰好对应智能体在实际工作中最容易失手的部分。
团队还自建了StepCodeBench,覆盖553个独立代码仓库、9类任务、20个应用领域与33种编程语言,模型在该基准上的avg@4达到49.0%。这类自建基准的意义在于,公开榜单容易被针对性优化,而贴近真实仓库结构的测试更能反映工程可用性。
模型目前已全量开放第三方接口,完整权重将于10月15日开源。先开放接口、后释放权重的节奏,给了外部开发者一段可验证窗口,也把社区的评测压力提前引进来。
把评测场景选在金融与软件工程,反映的是对目标用户的理解。这两类场景的付费意愿最强,也最愿意为稳定性付溢价,但它们对错误的容忍度最低。模型要进入这些场景,靠的不是榜单上的零点几分,而是能不能在长时间、多步骤的任务里保持不跑偏。对采购方来说,可预期的失败模式比偶尔的惊艳表现更重要。
把这次发布放回9月的国产模型节奏里看,信号更清楚。9月中旬中电信开源星辰Xing4.0-29B-A4B,全程基于国产算力与国产框架训练;9月18日阿里上线原生全模态的Qwen3.8-Omni-Flash;智谱的GLM-5.3-FlashX把输出速度推到每秒200词元。这些动作的共同点,是竞争焦点从谁的模型更强,转向谁能在给定成本下提供更稳定的智能产出。
需求端的证据也在同一边。OpenRouter的真实用量榜上,DeepSeek V4.1 Flash以每日2.62万亿词元蝉联第一,而部分闭源旗舰的用量出现回落。当企业开始按实际调用量而不是榜单分数做采购决策,单位经济学就成了比跑分更硬的指标。
这对中小模型公司是机会也是压力。机会在于参数效率可以换来成本优势,压力在于效率优化的收益会被迅速拉平。真正的护城河,可能不在模型本身,而在能否把推理成本、稳定性和工程工具链一起做成可交付的服务。