一家生物技术公司可以没有实验室、没有工位、也没有工资表,这件事在2026年9月被摆到了台面上。9月17日,斯坦福大学医学院在《科学》发表一项研究,把一个完整的药物研发组织搬进了云端,最多同时动用3.7万个AI智能体。系统在一周内完成约5.6万项临床试验的结构化标注,归纳出两条能预测药物成败的靶点规律,还独立提出一款针对肺癌蛋白B7-H3的抗体偶联药物策略。数月后,一家真实药企独立开发了思路相近的方案并拿到美国食品药品监督管理局的突破性疗法认定。
过去三年,AI制药的主流形态是研究人员向一个模型提问,让它预测蛋白结构或者做分子对接。这种方式在单点任务上有效,但药物研发是横跨靶点发现、安全性评估、剂型选择到临床策略的长链条工程,单一模型的幻觉与知识断层会在长链路上被逐级放大。
斯坦福团队的选择是反过来的:不追求一个全知全能的超级单体,而是复刻一家真实药企的组织架构。系统设有一名虚拟首席科学官作为中枢,职责只有三件事,把科学问题拆成子任务、派发给专家智能体、综合结论,而这位首席科学官自己从不访问数据。其下是靶点发现、安全评估、剂型选择、临床事务四个部门共八个科学家智能体,另配一名幕僚长和一名只有只读权限的科学审稿智能体。
编排者不碰数据、审稿人独立把关,这套设计被研究团队视为系统能够避免自我论证、保持结论可追责的关键。整套系统还能调用一百多个工具,用于检索数据库、分析生物数据以及执行其他研究环节的常规操作。分工带来的直接好处是每个智能体足够小、成本足够低,而系统整体覆盖的专业面又超过任何一个基础模型。
规模验证环节最能说明这套架构的价值。系统一次性派出37075个临床试验员智能体,各自负责一项二期或三期试验,并行补齐了终点指标与不良事件率这类埋在自由文本里、通常需要人工逐篇阅读的缺失数据。
同样的任务如果交给单个智能体串行执行,研究团队估算需要约1839小时。并行之后,整轮分析在六小时内完成。为验证标注质量,团队随机抽取100项试验做人工复核,主要终点的一致率达到89.7%。
更关键的是成本结构。按公开分析,前沿模型接口按输出词元计价,若每个智能体都做上千步推理,37万个角色乘以数千步的开销会把单个任务的成本推到不可承受的区间。研究团队明确指出,决定吞吐量的瓶颈是上下文窗口与键值缓存压缩效率,而不是模型本身的绝对能力。这句话把多智能体科研的门槛从模型质量拉回到了工程实现。
基于新标注的数据,团队给每个药物靶点算了两个指标。第一个是表达集中度,衡量这个靶点的表达是否集中在某一种细胞类型上;第二个是分布形态系数,衡量基因活性更像开关还是更像调光器。
结果相当清晰。靶点集中在单一细胞类型的药物,走到市场的概率比表达广泛的靶点高48%,不良事件率低32%,从一期进入二期的概率高40%。在剔除遗传证据等混杂因素后,这种效应依然显著。同样的模式在肿瘤、脑部、心脏、肾脏和肺部疾病中都能观察到。
这个发现的产业含义是具体的。药物研发最昂贵的失败通常发生在后期,也就是投入了数年时间和数亿美元之后才发现靶点选错了。如果在立项阶段就有一个可量化、可复核的筛选维度,试错成本可以前移。研究者强调这类指标的价值来自数据本身,说明大规模、结构化的单细胞层面数据值得被系统采集。
分析已有证据只是第一步。研究团队随后测试这套系统能否在分析之外真正提出治疗方案,选定的切入点是B7-H3,一个已经被广泛研究的肿瘤相关蛋白。
智能体调取了多类生物数据,发现B7-H3在肺部肿瘤周围的成纤维细胞中高表达,并进一步推断这类细胞可能参与抑制免疫系统对肿瘤的攻击。基于这条推断,虚拟药企提出了一款靶向B7-H3的抗体偶联药物方案,也就是用抗体定位携带特定蛋白的细胞,再向细胞内递送毒性载荷。
设计上有一个值得注意的约束:研究者只允许智能体使用2025年1月之前可得的信息。2025年8月,一家成熟药企独立开发了思路相近的B7-H3抗体偶联药物,该疗法随后获得美国食品药品监督管理局的突破性疗法认定。时间顺序与思路重合构成了外部对照,这也是研究团队愿意把它称为独立验证的原因。需要说明的是,这种不谋而合说明方向值得跟进,并不能证明系统首创了某个全新靶点。
研究团队自己的表述相当克制。智能体可以找出可能的药物靶点,但靶点仍然必须在真实实验室里验证,最终还要经过人体临床试验。肿瘤学里逻辑合理的机制经常因为安全性上限、耐药性、肿瘤异质性、药代动力学特征或患者筛选困难而失败。
数据侧的限制同样明显。临床试验记录异质且不完整,公开记录往往缺少项目终止的真实原因、阴性结果细节、生物标志物分析、生产制造约束以及企业内部的临床前数据。AI可以把这些证据组织起来并反复追问,但无法凭空补上不存在的信息。
团队现在正把虚拟药企找到的其他靶点带进实验室,检验有多少预测能经得起实验。这项研究真正的转向在于组织形态:AI从一名研究助手,变成了可以自我分工的自主研究团队。当数以万计的角色能在同一周内并行处理一个学科的全部公开证据,科研的瓶颈就从人的阅读速度,转移到了实验验证的吞吐能力上。