9月下旬,英伟达宣布加入Google DeepMind与欧洲合作伙伴的联合项目,发布了一批由AI预测的蛋白质结构,覆盖2800多种病毒。这批结果并不是某一项新算法的论文演示,而是一次规模化的结构补全:把大量此前缺乏实验解析的病毒蛋白,用计算方式先给出可用的三维结构,供全球研究者查询与使用。对一个长期受制于实验解析速度的领域来说,这意味着可用结构的总量在短时间内被显著抬高。
蛋白质结构决定功能,而解析结构历来昂贵且缓慢。冷冻电镜与X射线晶体学等方法虽然可靠,但需要样品制备、数据采集与重建,单个蛋白往往要耗费数月甚至数年。对病毒这类数量庞大、变种频繁的对象,实验解析的速度远远赶不上序列测序的速度,结果就是数据库里堆满了序列,却缺少对应的结构。
AI结构预测改变了这个比例关系。一旦模型训练完成,从序列到结构的成本与时间大幅下降,研究团队可以批量处理数千个目标,把有限的实验资源集中到最关键、最有争议的少数结构上。这次覆盖2800多种病毒的成果,正是这种批量化能力的直接体现,它补上的不是某一个明星蛋白,而是一整片此前空白的地图。对需要快速响应新发病原体的公共卫生体系而言,先有可用的计算结构、再谈实验验证,能够显著压缩从发现到研发的时间差。
病毒蛋白的难度来自几个叠加的因素。首先是高变异率,尤其是表面蛋白,为了逃避免疫识别会不断改变关键位点,导致同一类病毒在不同毒株之间的结构差异明显,需要反复解析。其次是修饰复杂,许多病毒蛋白带有糖基化等翻译后修饰,这些修饰既影响构象也影响免疫识别,而计算模型对这些修饰的建模仍具挑战。
第三是构象多变。不少病毒蛋白在结合受体或进入细胞时会经历大幅构象变化,静态结构只能描述其中一种状态,而理解感染机制往往需要知道整个变化路径。第四是实验本身困难,某些病毒需要高等级生物安全实验室,可开展的实验数量有限。这些因素叠加,使病毒结构成为检验结构预测能力的高难度考场,也让预测加少量实验验证的组合,比纯实验穷举更现实可行。
对下游应用而言,结构是起点而不是终点。在疫苗设计上,知道表面蛋白的精确形状,有助于判断哪些区域暴露在外、哪些区域相对保守,从而选择更合适的免疫原设计策略;在抗病毒药物研发中,结构信息可以帮助定位可能被小分子结合的位点,缩小筛选范围,避免在无望的方向上浪费资源。
但预测结构不等于验证功能。模型给出的是几何与化学环境的推测,实际是否稳定、是否可被抗体有效识别、是否会引发预期免疫反应,仍然需要实验验证。因此这类成果的现实价值,更多体现在压缩早期探索的试错空间,让研究者把精力放在验证与优化上,而不是从零开始猜测形状。把结构预测看作研发链条前端的加速器,比把它当作终点更符合实际。
英伟达的加入值得单独讨论。蛋白质结构预测已经过了证明算法可行的阶段,进入把算力稳定投进去、把规模持续做上去的阶段。要在合理时间内完成数千个目标的预测与校验,需要的不只是好模型,还有成规模的加速计算集群、稳定的调度系统与可复用的工程管线,而这正是算力厂商最擅长提供的部分。
反过来看,科研合作也在为算力供给提供真实的高强度场景。生物大分子计算属于典型的算力密集与数据密集任务,对并行效率、显存容量与互联带宽都有很高要求。把这类任务跑通,既能验证硬件在科学计算上的适配度,也能沉淀面向科研的软件生态。因此这笔投入并非单纯的公益,它同时是技术路线的一次大规模实战演练,成果与商业利益落在同一个方向上。
这一轮进展最值得注意的特征,是它的公共品属性。蛋白质结构预测自AlphaFold等模型取得突破以来,最大的贡献并不是某一篇论文,而是把结构数据库变成了全行业共享的基础设施,让不同国家的实验室都能在同一个起点上工作。此次针对病毒的大规模结构发布,延续的正是这条路线。
当算力公司、模型团队与欧洲科研机构联合推进这类项目,结构数据的更新速度会与算力供给直接挂钩。这也解释了一个趋势:AI4S的竞争,越来越不只是模型算法的竞争,而是算力、数据与协作网络的竞争。谁能把三者在同一个开放框架里组织起来,谁就能更快地扩大公共知识的边界。对科研界来说,这种规模化的开放成果,其长期影响往往超过单次技术指标的刷新,因为它改变的是整个领域的工作方式。
批量发布的结构数据,也带来如何使用的问题。预测结构存在置信度差异,有些区域模型相当有把握,有些区域则只是合理猜测。如果不加区分地使用,下游研究可能把不确定的推断当成事实。因此这类数据集通常需要附带置信度指标,让使用者知道哪些部分值得信任、哪些部分需要用实验去确认,而不是把整份结构一视同仁。
另一个现实问题是更新与版本管理。病毒在变异,模型在迭代,今天预测的结构明天可能被更准确的版本取代。如果没有清晰的版本与追溯机制,不同研究基于不同版本得出的结论就难以比较。因此公共结构数据库的价值,不仅在于发布多少条记录,也在于能否说明每条记录的来源、方法与更新时间,让科研协作建立在可核对的基础之上。