国产算力终于不只用来"跑"模型,也开始用来"训"模型了。9月17日,中电信人工智能科技有限公司发布新一代星辰大模型Xing4.0-29B-A4B,并同步在GitHub、Hugging Face、Gitee、魔搭、魔乐五个社区开放权重。这款模型的定位是面向智能体时代的轻量级代码智能体大模型,聚焦复杂任务理解、任务规划、工具调用与自主执行。它更值得记的标签是:国内首个基于国产算力和国产框架完成训练、面向复杂工程任务深度优化的百亿参数大模型。
Xing4.0采用的是MoE混合专家架构,总参数量290亿,每个token只激活40亿参数,比例接近七比一。架构上是64个路由专家加1个共享专家,共40层,隐藏维度3584。这个设计的直接好处是算力按激活参数计算,能力按总参数计算,同样硬件下能拿到比同规模稠密模型高得多的吞吐。对开发者而言,29B的全量推理光权重就要几十GB,一张消费级显卡根本放不下,而激活只要4B,再叠加低比特量化,占用就能压到单卡可部署的区间。
上下文长度是另一个关键指标。模型原生支持256K上下文,可扩展至512K。对智能体来说,长上下文不是加分项而是必需品:一条任务链路跑下来,读文件、调工具、查资料,上下文很快堆满,装不下任务就断在半路。评测数据也偏向多步任务:SWE-bench Verified拿到75.0,Terminal-Bench 2.1为57.5,AIME2026为90.0,Claw-Eval为76.55,DeepresearchBII为60.80。这几个项目考的都是在真实环境里连续操作并自己拿主意,正好对上智能体的用法。
全程基于昇腾910C集群与昇思MindSpore框架训练,是这款模型最受关注的部分。原因在于,推理和训练是两回事。过去两年国产算力的进展大多集中在推理环节,把已经训练好的模型放到国产芯片上跑起来相对容易。训练则完全不同,它要求芯片、互联、并行框架、算子库、编译器、容错机制全部配合到位,任何一环掉链子,整个训练就会崩。能推理和能训练之间,隔着的是一整套软件生态的成熟度。
据公开的模型资料,团队在工程上做了几件事:优化MoE通信、做选择性重计算、使用图算子融合、用昇腾C编写融合算子。合起来的效果是训练吞吐比开箱即用提升了约96%。这个数字的含义不是模型跑分,而是软件栈的优化能力:同一批硬件,通过框架层与算子层的调优把效率拉高近一倍。硬件可以堆,把硬件效能榨出来的工程能力需要长期积累。对行业来说,如果国产方案的训练效率能持续逼近国际主流水平,用国产算力训国产模型就会从口号变成经济上可行的选择。
与此前以问答为主要交互方式的大模型不同,Xing4.0系列更强调执行。上一代的主战场是问答,你问它答,答完就结束;智能体要的是另一套能力,给一个目标,它自己拆步骤、找工具、执行,看到结果再调整。模型把复杂任务理解、任务规划、工具调用、自主执行列为四项核心能力,架构上采用mHC加MLA加MTP的组合,用来支撑多步规划与稳定的推理链执行。
差别的核心在链路长度。问答是一跳,智能体是多跳,多跳意味着每一步都可能出错:第一步理解偏了后面全偏,某一步工具返回慢整条链路卡住,上下文里塞进一段噪声后面判断跟着歪。所以稳定性比单步聪明更要紧,这也是模型强调长上下文下任务连贯性的原因。落地场景上,工作侧是数据分析、材料整理、信息研究,由Agent自主读取文件、分析数据、调用工具并生成结果;生活侧则是积分兑换、观影推荐、出行规划这类需要理解意图并调用服务的任务。
这次发布值得留意的地方在方式而非参数。模型权重直接放在五个社区,开发者拿来就能跑,跑通就能改,改完还能接着训。对一个要跑在开发者电脑上、要接进各种工具链的智能体模型来说,开放程度本身就是产品的一部分:闭源模型再强,接不进你的工作流,对你就是零。推理侧它已适配SGLang、vLLM、KTransformers,训练侧支持LLaMA-Factory与MindFormers,智能体框架方面对接了OpenCode、Claude Code与Hermes,并完成多种国产及主流AI芯片平台的验证。
这背后也是运营商系大模型的一次转向。过去的习惯是先做行业交付,模型藏在项目里;这次把权重放出去,等于把评判权交给开发者。把三大运营商摆在一起看,三条路径的落点并不相同:中国移动的重心在企业内部规模化上岗,主打企业级智能体工作台,内部活跃数智员工已超9万个;中国联通的重心在平台与生态,元景MaaS平台纳管了230多款主流模型;中国电信这一款落在模型层,做轻、做小、开源出去,让开发者在自己的机器上跑。三条路瞄准的不是同一批客户,而对写代码、搭工作流的开发者来说,一个能本地跑、权重开放、可以自己微调的底座,价值比一个封装好的平台更直接。