9月15日,位于美国门洛帕克的Periodic Labs发布了一个名为Periodic Neon的模型。它有一万亿参数,走开源路线,目标却不是聊天、写作或写代码,而是分析实验室里的X射线衍射图谱。发布者是公司联合创始人Liam Fedus,他此前在OpenAI与Google DeepMind任职。按他的说法,团队只用了1300张H200,加上自己实验室几个月积累的实验数据,就把一个开源底座中期训练加强化学习成了在材料分析上超过通用前沿模型的专用系统。
这件事的分量不在参数规模。一万亿参数的模型在2026年已经不算新闻,真正值得注意的是它的数据来源和评测结果:它超过了GPT-6 Astra与Claude Fable 5.1,而它的微调起点是开源模型Kimi K2.6,后者在同一套评测上的初始成功率只有2.7%。一个专用系统把通用巨头甩开二十倍,靠的不是更大的算力,而是别人拿不到的那批实验数据。
Periodic Labs的定位不是模型公司,而是一家试图把实验和模型连成闭环的材料研发机构。公司由前OpenAI与Google DeepMind研究员创办,在门洛帕克建了高通量实验室,目标是寻找新的超导体与磁体。这类实验的特点是单次测量信息量大、结果解读极耗时,而候选材料空间又极其庞大,靠人力逐条分析图谱根本跟不上实验产出的速度。
他们的思路写在官方博客里:实验室全天候运转,AI嵌入设备、识别数据中的异常、并学习科学流程;高通量实验产生数据,数据训练出更强的科学AI,科学AI再指导下一轮更好的实验。当通用前沿模型在这个具体任务上表现不够好,或者调用成本太高时,他们就自己训一个。Neon是这条逻辑的第一个完整成品,它现在已经在自家实验室里分析实验数据。
训练配置是这次发布里最反直觉的部分。团队披露,Neon的训练只用了1300张H200,采用中期训练加强化学习的组合,把开源底座改造成领域专用模型。配套的工程优化同样被公开:相比自家Megatron基线,训练吞吐提升4.1倍,解码速度提升2.5倍,集群利用率维持在95%以上。
这些数字的意义在于性价比而非绝对规模。当前主流前沿模型的训练动辄动用数万张加速卡,而Periodic Labs证明,在数据足够专、评测足够硬的前提下,千卡级算力也能在特定科学任务上超过通用巨头。团队同时把技术改进回馈给Megatron-LM、SGLang与Miles等开源项目,这意味着这套提速方法可以被其他实验室复用,而不是锁在公司内部。
他们选的第一个攻坚任务是X射线衍射分析。这是材料发现的基础能力,却也是典型的高门槛环节:研究人员往往要在科学软件、历史实验、文献和数据库之间反复切换,花上数小时才能解析一组复杂的衍射测量。
Periodic Labs为此构建了内部评测集FrontierXRD,取自实验室的134个样本,这些样本因复杂与含糊,人类专家也需要数小时才能判定。在这个评测上,Periodic Neon的成功率达到55.3%,而作为微调起点的Kimi K2.6初始成功率仅2.7%,相当于20倍提升。评测采用Opus 5与GPT-5.6-Sol组成的评审集成,并已用专家评分做过校准。
另一个细节是执行框架。所有模型都跑在团队自研的Periodic Harness上,官方称这套框架在自家场景中优于Claude Code与Codex这类现成框架。这说明科学任务的瓶颈不只在模型本身,还在于工具链是否为该领域的操作流程做过适配。
除了成功率,团队还给出了成本口径:自家模型按每H200小时的吞吐量折算,H200单价取每小时2.5美元;外部模型则按标准API价格估算,并假设跨智能体轮次实现完美缓存。结论是Neon在FrontierXRD上同时取得更高成功率与更低单次分析成本,落在一条成本与性能的帕累托前沿上。
这个口径值得留意,因为它把科学AI的评价标准从能不能做,推到了划不划算。材料研发的真实约束从来不是单次预测精度,而是有限经费能筛掉多少错误方向。如果一次图谱分析的成本低于研究人员半小时的人力成本,实验室的运行方式就会改变:机制判断和方案优选前移到计算端,湿实验只用来验证筛出来的少数候选。
Neon的成立前提是Periodic Labs自己拥有高通量实验室和数月积累的实验数据,这是它最难被复制的地方。真正的壁垒不是那一万亿参数,而是别人拿不到的湿实验数据。换个团队、换批数据,同样的训练配方未必能复现同样的结果。
局限同样清楚。公司没有公开Neon的模型权重,FrontierXRD属于内部资产,134个样本的规模也远小于公开基准;55.3%的成功率意味着仍有近一半的困难样本需要人来判断。放在更长的时间线上看,Neon提出的问题比它给出的答案更重要:当通用模型越来越贵、也越来越同质,愿意沉到具体实验场景里积累私有数据的团队,会不会在若干科学领域里跑得比巨头更快。这个问题的答案,要靠下一个被攻下的任务来验证。