35B和397B两档全开源,国产搜索智能体把训练配方也交了出来

首页 / AI资讯 / AI智能体

0:00
0:00
1x
定时

搜索智能体这条赛道上,最近出现了一份比较特别的开源成果。中国团队AllSpark发布了Iris-mini与Iris-pro两款搜索智能体,不仅开放了模型权重,还把整套训练配方一并公开。两个版本分别建立在千问系列模型之上:Iris-mini总参数35B、每次激活3B,Iris-pro总参数397B、每次激活17B,均支持256K词元上下文,权重许可证为Apache 2.0,Hugging Face页面无需申请即可下载。

这件事的分量不在榜单名次,而在一个长期悬而未决的问题上:搜索智能体给出答案时,究竟有多少是真的上网查出来的,又有多少只是在确认训练时已经记住的事实。在业界常用的几套基准上,这个界限一直很模糊。Iris的训练方法与评测框架,恰好把这个问题摆到了台面上。

训练题从网页链接里反向长出来,让模型没法靠关键词蒙答案

Iris的训练数据不是现成的问答集,而是从网页之间的超链接关系反向构造出来的。系统先取一个种子页面及其链接页面,整理成一张实体关系图,再沿着多个页面之间的关系生成需要多步查找的问题。关键在于,问题中除最终答案之外的每一个直接名称都会被改写成描述性线索,这样一来,模型把原词复制到搜索框就能得到答案的机会被大幅削减,必须真的去推理,而不是做关键词匹配。

生成出来的问题还要通过两道筛选才能进入数据集:参考模型在不给网页证据时无法直接回答,拿到对应证据后能够得到唯一答案。这两条同时成立,意味着题目既足够难,又具备清晰的可验证性。通过筛选的问题会被转成包含推理、工具调用和网页观察的完整轨迹,为后续的训练提供可复现的样本。这种从链接结构出发造题的方式,与过去直接拿问答对微调的做法相比,把搜索智能体最核心的能力,也就是决定搜什么、读哪些页面、何时停止,真正纳入了训练目标。

两级过滤加SFT-RL爬升,数据质量比模型规模更关键

轨迹生成之后,会经过一个更强教师模型产出的解答路径,再接受两轮过滤。第一轮检查整条路径的正确性、是否陷入重复循环以及搜索深度是否失控;第二轮由裁判模型逐步复核,而裁判模型的评判标准是从数据本身推导出来的,不是手工设定的。这种让标准从数据里长出来的做法,是为了避免人工规则带来的偏好偏差,也让整个训练流程更容易被外部复现和检验。

之后模型通过强化学习对接真实网页搜索持续改进。监督微调与强化学习交替进行,团队把这一流程称为SFT-RL爬升:每一轮中解出的最难任务和效率最高的解答路径,会回流到下一轮监督训练中。裁判模型与结果摘要都跑在训练集群内部,由团队自己的大尺寸千问模型提供支持,训练过程不依赖外部服务。对开发者来说,两级验证加上交替训练这套设计,比榜单分数更值得细看,因为决定智能体好不好用的,往往是它判断何时该继续搜、何时该收手的那个机制。

四个基准上的成绩单,以及被单独拎出来的上下文管理

评测覆盖四套基准:BrowseComp考察从间接线索中找罕见事实的能力,BrowseComp-ZH是其中文对应版本,DeepSearchQA评估检索证据的完整程度,Humanitys Last Exam则是专家级学术问答。在开启上下文管理的情况下,Iris-mini分别取得82.2、84.8、86.9与52.3分,Iris-pro达到88.6、85.1、92.9与56.4分。团队称,Iris-mini在同尺寸档位四项基准中三项领先,在BrowseComp上比次优模型高出3.4分;Iris-pro在更大尺寸档位领先或持平,部分成绩接近需要远多算力的系统。

比分数更有意思的是团队对上下文管理的处理。他们主张,在常见基准上,运行时的上下文管理策略带来的差异,往往比系统之间被报告的能力差距更大:长时间研究任务中,上下文可能在子问题尚未全部解决前就被填满,而丢弃对话历史这类技巧只是人为延长了研究时间,并不能说明模型本身的质量。为此,Iris的评测框架把上下文管理当作单独变量,在工具、上下文上限与裁判模型保持一致的前提下,对每套基准分别测试开启与关闭两种状态。论文还提到,上下文管理对小模型的提升尤其明显,BrowseComp分数最多能提高21.2分,原因不是词元预算更小,而是消耗速度更快。

搜索能力外溢到办公任务,才是这次开源最值得看的信号

论文里一个意料之外的发现是,这套为搜索任务设计的训练数据与方法,在模型从未被专门训练过的任务上也带来了提升,包括通用工具调用和办公类工作。如果这一结论能在独立复现中站得住,那它指向的判断就相当重要:自主检索可能不是一项狭窄的专长,而是一种可以迁移的基础能力,训练目标越接近真实的信息获取与决策过程,模型在其它任务上的泛化就越自然。

对希望自建检索与执行系统的团队而言,开源权重加上公开的训练配方,意味着可以检查奖励模型是怎么搭出来的、裁判标准是否可靠,而不只是接受一个榜单数字。部署规模需要与模型体量匹配:官方示例中Iris-mini采用4路张量并行,Iris-pro采用8路张量并行加8路专家并行,后者需要多节点或容量较大的单节点。务实的路径是先从小模型与配套评测框架入手,按硬件条件再调整并行参数与上下文长度。真正值得先回答的问题不是它排第几,而是把它指向一个没训练过的任务时,它还站不站得住。

素材来源:The Decoder、AI Daily Post、AlexTech、Hugging Face 发布时间:2026-09-15