8月31日,中国科学院大连化学物理研究所联合科大讯飞、阿里云等共同研发的智能化工大模型3.0 Pro正式发布,这是我国化工行业首个大模型的最新迭代版本。与以往版本最大的不同在于,3.0 Pro实现了从"专业知识问答模型"向"化工任务智能执行系统"的重要跨越,推动智能化工大模型从"能理解、会回答"向"能规划、会执行、可验证"迈进,从辅助知识获取的专业助手,升级为具备与专业人员协同完成复杂任务能力的智能工程伙伴。同一天,智能化工创新中心在大连揭牌,多项重磅成果集中亮相,标志着大连AI加化工融合发展进入新阶段。
化工行业具有对象复杂、尺度跨度大、数据类型多、工程约束强等特点,通用大模型难以满足专业需求,这是智能化工大模型从1.0一路迭代到3.0 Pro的现实动因。3.0 Pro突破了传统大模型以知识问答和内容生成为主的应用模式,构建出大模型、智能体、专业技能与工具、应用场景四层技术体系。其中,大模型作为认知核心,负责专业知识理解、多模态信息解析、方案生成与任务规划;智能体作为执行主体,围绕任务目标完成流程分解、工具调用、结果校核与动态调整,形成贯通认知、推理、规划、执行与验证的闭环能力,让专业人员可以围绕具体任务完成需求解析、任务分解、专业计算与方案生成的全流程操作。
为了让机器可执行的约束真正落地,研发团队把化工机理、物理规律与工程规范转化为可校验的规则,对参数来源、量纲、适用范围与计算结果进行全过程核验,同时通过专业工具调用、计算过程留痕、多目标优化与专家复核,让每一个方案都能追溯依据、复核过程、明确适用边界。大连化物所人工智能中心主任叶茂表示,团队正在构建从模型能力到工程应用的全链条验证体系,希望进一步打通实验室、虚拟工厂与实体工厂的范式,让AI输出的不再是简单的生成式答案,而是一套经过机理约束、计算验证与工程实践检验的决策建议。这套全链条验证思路的背后,是化工行业对安全与可靠性的极致要求:一个参数错误可能意味着产线波动而非简单的代码报错,因此模型输出的每一步都必须能被工程规范兜底,这也是行业大模型与通用大模型在落地方式上最本质的区别。
支撑3.0 Pro能力跃升的,是极其厚重的专业数据底座。该模型集成超过400个化工智能体和工具,基于百亿词元级的化工专业语料开展持续预训练,并采用数十亿词元级的高质量问答数据完成监督微调,为执行复杂化工任务提供了专业支撑。语料与任务的匹配度直接反映在评测结果上:经化工领域多维测评体系验证,3.0 Pro的文本问答准确率和多模态问答准确率分别达到81.96%和80.75%,综合得分较3.0版本分别相对提升20.2%和31.4%,其中多模态能力的提升幅度尤为显著,说明模型对工艺流程图、设备图纸与实验数据的理解能力正在快速接近实用门槛。
数据的源头来自大连化物所多年积累的科研与产业实践。该所构建了我国首个覆盖研发、设计、生产、市场全环节的石化化工全链条大数据中心,入选国家数据局石化化工行业高质量数据集建设链主单位及先行先试单位。在数据基础设施之上,团队还在大连长兴岛建成了国内首个千吨级智能中试平台,形成实验室难以覆盖、工业装置难以获取的真实工况催化反应与工艺数据按需生成的能力,这些一手数据反哺模型训练,让3.0 Pro对化工真实场景的理解建立在工程实证而非纸面理论之上。值得注意的是,语料的专业性与时效性同样关键,随着新能源、新材料等新兴方向不断涌现,团队需要持续把最新工艺文献与中试数据纳入训练集,才能避免行业大模型在快速演进的领域里迅速过时。
3.0 Pro另一层值得关注的信息,是它依托国产算力集群完成训练部署。据叶茂介绍,在国产算力上训练化工大模型,与成熟的通用GPU环境相比,对软硬件协同优化提出了更高要求,需要结合化工领域的数据特点、专业任务与复杂推理需求进行针对性优化,实现从国产算力底座到领域大模型训练部署的协同适配。这一选择意味着智能化工大模型从底层算力到上层应用实现了自主可控,对涉及工业数据安全与产业链稳定的化工行业而言,具有超出模型本身的意义。
生态层面,与3.0 Pro发布同步,大连化物所与科大讯飞、阿里云、华为、宁波数据集团、中控技术等单位签约成立智能化工联合创新实验室,围绕智能化工大模型与智能体研发、行业数据与算力平台建设、工业软件融合及典型场景应用等方向开展联合攻关;大连理工大学智能分子工程交叉研究院同步启动,将构建AI、化工与材料深度交叉的创新体系。截至目前,已有300余家化工企业、高校和科研院所注册使用智能化工大模型,API累计调用量突破1400万次。从模型发布到企业规模级调用,这套以化工为起点的行业大模型路线,正在为传统产业的智能化转型提供可复制的样本。从1.0到3.0 Pro,这条路线最宝贵的资产不是某个跑分数字,而是300多家机构在真实工况中沉淀的反馈数据,它们与科研积累一起,构成了化工大模型持续进化的数据飞轮。