美国推理芯片公司Positron AI于9月10日宣布完成8.75亿美元C轮融资,投后估值约50亿美元。这笔钱分两笔到账:首笔3.75亿美元C轮按35亿美元投前估值定价,由NEA、Atreides Management、Valor Equity Partners、Andra Capital与SemiAnalysis Capital联合领投;第二笔最高5亿美元的C-1轮由NEA与网景创始人吉姆·克拉克领投。公司今年2月才完成2.3亿美元B轮,估值约10亿美元,七个月时间估值涨到五倍。融资用途指向下一代Asimov芯片的流片、Titan系统的量产爬坡,以及一座超过2兆瓦的工程数据中心与仿真平台。
这轮融资的资金用途说明了一件事:钱主要花在芯片与客户之间那段最贵的距离上。流片、仿真、供电基础设施、内存供应承诺、制造产能、系统集成与市场推广,每一项都需要在产生收入之前投入。Asimov计划2026年底在台积电N3P工艺上流片,量产目标定在2027年下半年。这意味着在两年左右的时间里,公司几乎不会有来自新芯片的收入,8.75亿美元必须支撑团队走完整个研发与量产周期。
支撑估值跃升的是已交付产品的表现。公司第一代Atlas系统已经出货,在Oracle云基础设施上部署了50多个机架,客户包括Parasail、Jump Trading与i3d.net。公司公布的基准数据称,Atlas在每瓦性能上超过选定的英伟达Hopper配置4倍以上,在每美元性能上超过3倍。这些数字是公司自报且依赖具体工作负载,但真实客户在用、真实机架在跑,这一点比任何跑分都更能说服投资人。有产品在客户机房里运行,是芯片公司拿到下一轮融资的必要条件。
Asimov的核心设计选择是放弃高带宽内存,改用消费电子领域常见的LPDDR5X。每颗芯片支持288GB到2304GB内存,容量区间上限远高于同代GPU的常规配置。代价是带宽,LPDDR5X的峰值带宽低于HBM,公司称其架构能在Transformer类工作负载上实现超过90%的可用内存带宽利用率,用更高的实际利用效率部分弥补理论带宽的差距。这个取舍逻辑成立与否,取决于推理任务究竟更缺带宽还是更缺容量。
从成本与供应角度看,绕开HBM有现实理由。HBM与先进封装是当前AI硬件供应链中最紧张的两个环节,产能被少数厂商锁定,价格与交期都难以预测。使用商品化的LPDDR5X意味着可以接入更成熟的存储供应链,降低对单一环节的依赖,也让散热设计更灵活,风冷与液冷数据中心都能适配。在推理场景中,模型权重需要常驻内存,长上下文与持久化的智能体状态进一步推高容量需求,因此把资源押在容量而非极限带宽上,是一个有明确目标客户画像的技术选择。
Titan是把4到8颗Asimov芯片组合成一个节点的系统,公司给出的目标是可以承载超过16万亿参数的模型,支持超过1000万词元的上下文窗口,并可扩展到数千个节点。这组指标指向的不是普通对话服务,而是超长上下文、持久记忆的智能体与视频生成这类对内存容量极度敏感的工作负载。当一个模型需要长时间保留大量状态,内存容量就从成本项变成了能力边界,容量不足意味着模型无法承载更长的上下文与更多的并发会话。
这套假设背后是对市场结构变化的判断:训练需求集中且总量有限,推理需求随每个助手、智能体与搜索请求持续增长,长期看规模远大于训练。如果这个判断成立,那么在推理场景下按每词元成本与每瓦性能优化,比追求峰值算力更有商业价值。风险也很清楚,这些指标是2027年产品的目标值而非实测结果,芯片初创公司的流片与量产计划延期是常态,一旦时间表滑出,50亿美元估值就会显得跑在了硅片前面。
Positron的路线是先卖产品再自研芯片。第一代Atlas是基于FPGA的Transformer推理服务器,用相对成熟的硬件先进入客户机房,积累真实工作负载数据与部署经验,再用这些反馈定义下一代自研芯片。公司首席执行官表示,Atlas的部署经验直接影响了Asimov与Titan的设计。这种做法在芯片行业里并不新鲜,但在AI推理这个迭代极快的领域尤为重要,因为软件栈、模型架构与服务模式都在快速变化,闭门设计两年再交付,很可能对不上届时的需求。
客户关系也在向资本关系转化。Jump Trading在测试Atlas之后领投了公司的B轮融资,把采购决策变成了投资决策。这种模式在AI基础设施领域越来越常见,算力买方希望通过投资锁定供应与价格,算力卖方则获得资金与需求确定性。它加快了初创公司的成长速度,也带来新的风险:一旦客户同时是股东,定价与采购条款的独立性会受到质疑,公开市场在估值时通常会对此打折。对Positron而言,真正的考验是2027年Asimov量产后,客户是否愿意在自研硅片上继续下注,而不是回到通用GPU。