字节推进10万亿参数大模型预训练,规模超Kimi三倍直追Anthropic

首页 / AI资讯 / AI大厂

0:00
0:00
1x
定时

国内大模型的军备竞赛正在进入新的量级。据金融时报援引知情人士消息,字节跳动正在推进参数规模上限达到10万亿的超大模型预训练。这个体量意味着什么?对标Anthropic的顶级Mythos系列,同时是国内目前已推出最大模型Kimi K3的3倍以上。消息显示,该模型目前仍处于预训练初期,完整周期预计需要3到6个月。如果顺利走完,字节将第一次真正站到全球前沿通用大模型的第一梯队里。

对于一家以应用见长的公司来说,这一步棋的份量远不止参数数字本身。字节旗下豆包、即梦、Seedance等产品矩阵已经覆盖数亿用户,但底座大模型长期被视为短板。今年年中全员会上,管理层也公开承认在通用大模型能力上落后于头部对手。如今启动10万亿参数级别的预训练,等于把追赶姿态直接摆到了台面上。

10万亿参数意味着什么,一个难以想象的技术工程

10万亿参数,即100T级别,在今天的行业语境里依然是一个惊人的数字。目前市面上公开的最大开源模型、闭源模型普遍停留在万亿级,Kimi K3以2.8万亿参数登顶多项评测时已经被称作里程碑,而字节这次的目标是它的3倍以上。业内普遍认为,跨过10万亿门槛之后,模型在复杂推理、长程规划、知识整合等能力上可能产生质的飞跃,但也意味着训练成本、数据规模与工程复杂度同步跃升。

从技术路线看,超大参数模型几乎必然采用混合专家架构,把网络拆分成大量专家模块,每次推理只激活其中一部分,以控制算力开销。10万亿参数级别的模型,对分布式训练框架、高速互联、故障恢复机制的要求都达到新的高度,任何一个环节出问题都可能导致整个训练任务中断重来。这也解释了为什么消息称模型仍处于预训练初期,3到6个月的周期在业内看来已经属于相当乐观的估计。

算力账同样令人咋舌。以现有公开成本估算,训练一个10万亿参数级别的模型,单次投入可能高达数十亿美元量级,这还不包括反复实验、调参和失败重来的隐性成本。字节敢于押注,背后是其庞大的广告与云业务现金流,以及张一鸣此前表态的坚持自研路线。对于一家把推荐系统做到极致、以效率著称的公司而言,这是一次从应用层向底层能力发起的总攻。

从全员会的坦诚到千亿投入,字节为何执意自研底座

字节的自研决心并非突然出现。今年年中全员会上,管理层罕见地承认大模型能力落后于同行,同时明确拒绝通过蒸馏等捷径快速追赶,坚持自研路线。这一表态当时就引发行业热议,因为对于多数公司来说,接入成熟的开源或商业模型是成本最低的选择,字节却选择了一条更慢、更贵、风险更高的路。

背后的商业逻辑其实清晰:字节的流量生态高度依赖模型能力,无论是搜索、信息流还是AI创作工具,底座模型的水平直接决定产品天花板。豆包已经积累数亿用户,即梦在AI创作赛道领跑,但这些产品如果始终依赖外部模型授权,成本结构和产品差异化都会受制于人。自研10万亿参数模型,本质上是把AI能力的核心资产掌握在自己手里,为未来十年的产品矩阵建立护城河。

更重要的是组织层面的信号。字节过去以快速迭代、产品驱动著称,大模型研发却是典型的重投入慢产出赛道。敢于在这个方向上下重注,说明字节对AI的押注已经从战术层面上升到战略层面。全员会上的坦诚与如今的真金白银投入形成呼应,外界看到的不再是公关话术,而是实打实的资源倾斜。

3到6个月的窗口期,算力数据人才三重考验

3到6个月的预训练周期,在行业里属于什么水平?对比来看,主流头部模型的完整训练周期通常在数月到一年以上,考虑到模型规模越大、训练越久,10万亿参数模型能在这个窗口内完成预训练,前提是算力储备、数据质量和工程团队都处于顶级状态。字节在GPU采购上的激进程度业内闻名,但这只是必要条件之一。

数据是另一个隐形门槛。10万亿参数模型需要的数据规模达到数十万亿token级别,不仅要量大,还要质优、多样、去重彻底。高质量中文语料相对稀缺,如何在全球范围内获取并清洗合规数据,是字节必须解决的现实问题。此外,训练过程中的稳定性控制、损失曲线监控、灾难性遗忘规避,每一项都需要顶尖算法工程师的持续投入。

人才争夺同样白热化。国内头部大模型公司之间的人才流动本就频繁,字节作为后来者,要组建并稳住一支能驾驭10万亿参数训练的团队,薪资与期权成本不可小觑。消息人士称字节已在全球范围内招募顶尖AI研究员,这一动作本身就说明,字节深知这场竞赛的胜负手在人而不在钱。

国产大模型军备竞赛进入新阶段,格局将如何改写

字节此举并非孤立事件。今年以来,国产大模型在参数规模与能力上限上持续突破,DeepSeek、月之暗面、阿里、智谱等厂商轮番亮出新一代模型,行业整体进入高密度发布周期。字节以10万亿参数级别入局,直接拉高了赛道竞争的基准线,也让外界对国产模型的下一个能力台阶有了更多想象空间。

对行业格局的影响是深远的。如果字节的10万亿模型成功落地,将直接冲击现有头部格局,豆包生态可能迎来能力上的代际跃升,搜索、办公、创作等多个场景的产品体验将被重塑。而其他厂商为了保持竞争力,大概率会跟进更大规模的训练计划,新一轮算力军备竞赛将由此启动。对于上游的GPU厂商、算力服务商来说,这无疑是重大利好。

当然,预训练只是第一步。模型训练完成后的对齐、评测、迭代,以及如何把能力转化为可用的产品功能,才是真正的考验。历史上不乏超大模型训练失败或效果不及预期的案例。字节的10万亿豪赌能否兑现,3到6个月后自有分晓,但无论结果如何,国产大模型的天花板已经被再次抬高,这本身就是一场值得关注的产业叙事。

素材来源:金融时报、PConline太平洋科技、新浪科技 发布时间:2026-08-11