上海AI实验室开源决策模型:4B小模型均分90.02反超闭源标杆

首页 / AI资讯 / 大模型

0:00
0:00
1x
定时

9月26日,上海人工智能实验室旗下书生团队在Hugging Face上线了开源结构化决策模型Intern-Decision,一次性放出0.8B、2B与4B三个尺寸,底座为Qwen3.5,权重采用Apache-2.0协议。官方模型卡显示,4B版本在七套决策类评测中的均分为90.02,高于闭源标杆Jev的88.74。这条消息在社区引起讨论的原因不在于分数本身,而在于它把一类长期被闭源方案占据的能力,直接做成了任何人都能下载、修改与商用的公共资产。

决策模型是什么,为什么要单独做一个

大模型擅长生成,但在需要连续判断的场景里并不天然可靠。让一个模型在多个候选动作之间反复权衡、在信息不完整时给出带置信度的选择、在长流程里保持判断标准一致,这些能力与文本生成共享同一套底层参数,却有着完全不同的评价标准。把决策单独拿出来做成模型,本质上是在承认一件事:会说话不等于会做选择,而后者往往才是自动化系统真正卡住的地方。

这类模型通常不负责写长篇内容,而是输出结构化的判断结果,例如在若干选项中给出倾向、给出概率、或者在条件不足时明确表示需要更多信息。它的价值在于可被校验:当输出是离散选项加置信度时,系统可以设置阈值,低置信度时转交人工或更贵的模型处理。这种分层设计正是当前智能体工程化的主流思路,也是决策模型被单独讨论的原因。

与通用大模型相比,决策模型的规模可以小得多。判断动作优劣不需要记住海量事实,只需要对状态与动作的关系有稳定表征,因此参数量不再是唯一的胜负手。这也解释了为什么4B这个量级能进入讨论中心:如果小模型能在决策任务上逼近甚至超过闭源大模型,那么把它部署在本地、部署在边缘、或者为每一个子任务单独配一个,成本结构会发生根本变化。

90.02分意味着什么,与Jev怎么比

90.02这个数字需要放在具体口径下理解。它是七套决策评测的均分,而不是单一榜单的最高分,这意味着模型在不同类型的判断任务上表现相对均衡,没有靠某一项拉高整体。相比之下,闭源标杆Jev的均分为88.74,差距约1.28分。单看绝对值差距不大,但考虑到参数量级的差异与开源权重带来的可复现性,这个对比的意义超出了分数本身。

更关键的是可比性。闭源模型的评测结果通常由厂商自行发布,外部只能看到结论,无法检查评测条件、提示词模板与失败样本的处理方式。开源权重的意义在于任何人都可以用同一套题目重跑一遍,也可以针对自己的业务场景设计私有评测集。对采购方来说,可复现比高分更有决策价值,因为业务场景与公开榜单的分布往往相差很远。

需要保持清醒的是,决策类评测本身仍在演化。不同的评测集对什么算正确决策的定义并不统一,有的偏重选项匹配,有的偏重过程合理性,还有的把置信度校准纳入计分。因此把90.02当作能力上限是不合适的,更合理的读法是:在公开定义的决策任务上,一个4B量级的开源模型已经进入第一梯队,剩下的问题变成它能否迁移到具体业务里。

0.8B到4B,三档尺寸各自的取舍

同时放出三档尺寸,是这次发布里容易被忽略的工程考量。0.8B面向的是高频、低延迟、可批量并行的判断场景,例如对工具调用结果做快速筛选,或者对生成内容做初筛分类。这类任务的特点是调用量极大而单个判断简单,把参数量压到最小能显著降低单位成本,也更容易塞进本地设备或推理加速卡。

2B通常被当作质量与成本之间的折中档。它足以处理带有上下文依赖的判断,例如在多轮对话里识别用户真实意图的转向,或者在工具调用链里判断当前步骤是否已完成。4B则承担最需要推理深度的那一层,例如在多个可行方案之间做取舍、在信息冲突时决定采信哪一方。把三档配合使用,可以组成一个分层决策栈,让昂贵的判断只发生在真正需要的地方。

这种分层设计对部署方还有一个隐性好处:可观测性更好。当每一层输出的都是带置信度的结构化结果时,系统可以记录每一层的判断分布,找出哪一类输入最容易触发低置信度,从而有针对性地补数据或调整阈值。相比之下,让一个超大模型从头到尾包办所有判断,虽然实现简单,但出问题时很难定位到底是哪一步的判断偏了。

决策能力对智能体意味着什么

决策模型真正的作用场景是智能体。一个智能体在执行任务时会不断面对分叉:是先搜索还是先提问,是调用工具还是直接回答,是继续重试还是换一条路径。这些判断如果全部交给同一个大模型,会出现两个问题:一是成本随步骤数线性上升,二是判断与生成共用同一套能力,容易出现同向偏差,也就是模型在某个方向上错了,后续所有判断都跟着错。

把决策剥离成独立模型,等于在系统里加了一道外部检查。判断层与生成层来自不同模型、不同训练目标,犯同一个错误的概率会下降。行业里已经有类似思路的实践,例如用专用小模型承担智能体的动作验证环节,替代大模型自检,从而在保持效果的同时把延迟与成本压下来。Intern-Decision这类开源权重的出现,让这种分层架构不再只属于资源充足的大团队。

对国内开发者而言,还有一个现实层面的意义:Apache-2.0协议允许无附加条件的商业使用,意味着可以把它直接嵌进产品而不用担心授权边界。当一个基础能力变成可自由组合的模块,围绕它长出的应用形态通常会比模型本身更有想象力,这也是开源决策模型最值得关注的长期影响。

素材来源:上海人工智能实验室、Hugging Face、机器之心、量子位 发布时间:2026-09-28