一个刚刚开源几天的智能体框架,正在成为AI社区的热议焦点。8月7日,由Prime Intellect团队发布的Prime Agent在GitHub上迅速走红,星标数已接近五千。官方宣称,这套面向编程、研究和长时间自主任务的自我改进RLM框架,在ARC-AGI-3评测上联合Claude Opus 5拿到了95.5%的成绩,超过人类专家基线。ARC-AGI-3不是那种刷过题库就能拿高分的考试,它由一堆完全陌生的抽象游戏组成,每个游戏的规则、目标和操作逻辑各不相同,模型需要自行摸索、试错、归纳,在有限的行动预算内完成任务,因此这个成绩的含金量非同寻常。
Prime Agent的底层技术来自递归语言模型RLM(Recursive Language Models),这一概念由MIT博士生Alex Zhang等人于去年10月提出。RLM的核心思路是把输入上下文当作可操作的变量:主模型在类似Jupyter的编程环境中工作,通过编写代码对庞大的上下文进行切分与过滤,并将子任务递归外包给临时的小模型调用,最后综合各结果形成答案。这种将上下文作为计算对象的设计,让模型能够突破单次推理的上下文限制,以更低的成本处理超长任务。
要理解Prime Agent为什么强,先要理解传统智能体框架的瓶颈。主流Agent通常采用"思考、行动、观察"的循环,模型每一步都依赖对话式推理,长任务中上下文会不断膨胀,最终触及模型的上下文窗口上限,导致早期信息丢失或成本飙升。RLM的思路则完全不同:主模型不再被动地逐字处理整个上下文,而是像程序员一样,用代码对上下文做切片、过滤、压缩,把大问题拆成可以并行或递归处理的小任务,再让多个小模型分头解决。
这种设计带来的提升是显著的。在OOLONG等最难的长上下文评测中,GPT-5-mini采用RLM后的正确率超过直接使用GPT-5的两倍,而且单次成本更低。原理并不复杂:大模型在长上下文中容易"迷失",但小模型处理被清晰切分的子任务反而更加精准;主模型负责全局调度和质量把关,把繁琐的细节交给专用的小模型,就像资深工程师把模块外包给熟练程序员,再逐层验收整合。
Prime Agent把RLM理念做了工程化落地,并在此基础上做了关键扩展。官方博客透露,它彻底重构了harness的底层设计假设,让框架能够处理需要数小时甚至数天的自主任务。框架内置了环境管理与任务分解机制,模型可以在虚拟环境中持续工作,自主决定何时调用工具、何时暂停思考、何时生成中间结果,最终交付完整的项目成果。这种长时间自主运行的特性,正是从聊天机器人迈向真正智能体的关键一步。
Prime Agent选择完全开源,这个决定本身就有深意。在ARC-AGI-3取得95.5%的成绩后,团队没有把成果锁在封闭环境里,而是公开了完整代码,并明确表示欢迎开发者参与改进。这种开源姿态与近期AI社区的技术氛围高度契合:无论是Meta开源编程智能体Muse Code,还是国内厂商相继开放模型权重,开源正在成为智能体技术加速迭代的重要路径。当更多开发者可以复现、验证和改进这套RLM框架,相关技术路线有望在短期内快速成熟。
值得关注的是,围绕Prime Agent也存在不少争议。有研究者质疑ARC-AGI-3成绩的可比性,认为95.5%的成绩部分依赖Claude Opus 5的底层能力,框架本身的实际增益需要在更多基准上验证;也有开发者指出,RLM方案对推理环境的稳定性要求较高,生产环境中的网络波动和工具失败可能影响任务完成率。这些质疑并非否定框架的价值,而是提醒行业:评测榜单上的数字与实际生产环境的差距,依然是智能体落地必须面对的课题。
从技术趋势看,自我改进正成为Agent研究的新焦点。RLM的思路本质上是让模型管理自己的推理过程,通过代码执行实现上下文的动态组织,这与近期热门的推理时扩展、工具调用增强等方向一脉相承。可以预见,未来几个月会有更多基于递归语言模型思路的框架和论文出现,智能体将不再只是会调用工具的执行器,而是能够自主规划、自我优化的任务引擎。Prime Agent的出现,为这条路线提供了一个高质量的起点。
ARC-AGI-3的高分固然亮眼,但智能体框架的真正考验在真实生产环境。ARC-AGI-3的题目是抽象的逻辑游戏,规则封闭、反馈清晰,而实际业务任务往往信息不完备、工具不可靠、目标模糊。Prime Agent的RLM机制依赖持续的编程环境执行,这意味着在真实部署中,网络波动、API限流、第三方工具故障都可能打断递归过程,如何保证长任务运行中的稳定性和可恢复性,是框架走向工程化必须解决的难题。
与主流闭源智能体相比,开源框架的优势在于透明和可定制。Claude Code、Cursor等产品能力成熟,但内部机制不透明,用户难以深入改造;Prime Agent则把harness的完整逻辑开源,开发团队可以根据自身业务调整任务分解策略、模型调度规则和上下文管理方式,这种可塑性对企业级场景尤其有价值。当然,开源也意味着技术支持需要社区共同维护,企业采用时需评估自身的工程能力和长期维护成本。
从产业视角看,Prime Agent的热度反映出智能体竞争正在进入框架层。此前行业比拼的是模型能力和应用体验,如今模型趋同之后,如何组织推理过程、如何调度工具、如何管理长上下文,成为拉开差距的关键。RLM路线为这些问题的解决提供了一种系统化方案,而开源社区的高频迭代,将让这条路线以远快于闭源产品的速度成熟。对于关注智能体技术的开发者和企业,现在正是评估这套框架、验证其生产可用性的窗口期,抢先跑通RLM工作流的团队,有望在下一阶段的智能体竞赛中占据先发位置。