8 月 31 日,中国科学院大连化学物理研究所(DICP,以下简称“大连化物所”)、科大讯飞、阿里云等合作方共同发布 ChemELLM 3.0 Pro。此次更新的核心在系统形态;对话窗口是否扩大、通用排行榜是否再添一项成绩,都属次要问题。大连化物所称,其化工大模型现已形成四层体系:大模型层、智能体层、专业技能与工具层、应用场景层。大模型理解文本和图像并提出计划;智能体把计划拆成多个步骤,调用工具、核验结果,再据此调整。[1]
产品形态由此发生实质变化。能够解释换热器的模型仍是顾问;一套能够选择计算方法、填入参数、读取输出并决定下一步动作的系统,开始进入工程工作流。因此,ChemELLM 3.0 Pro 应被视为一次以任务编排为核心的版本更新,其意义超出了问答模型变得更聪明的范畴。
这次发布同样需要划出严格的证据范围。发布稿列出 400 多个化工智能体与工具、较高的问答分数、300 多家注册机构,以及累计超过 1,400 万次 API 调用。[1] 这些数字都无法说明,智能体在缺少专家审核关口时,仍能把一项化工任务从实验室的初始前提一路安全执行到工厂操作。大连化物所自己的路线图也把实验室—设计—工厂的完整衔接留给未来的 ChemELLM 4.0,并计划以甲醇制烯烃工艺作验证。[1] 发布稿中信息量最大的一句话,采用了将来时。
本轮增量落在任务执行层
经过同行评议的上一代 ChemELLM,公开论文尚未把它描述成如今宣传的智能体—工具技术栈。最初的研究介绍了一个基于 Spark-70B、拥有 700 亿参数的模型:先用 190 亿个化工领域 token 做领域自适应预训练,再用 10 亿个 token 做监督微调。配套基准 ChemEBench 分为 3 个层级、15 个维度和 101 项任务,从基础知识、进阶知识一路延伸至专业问题求解。[5]
2025 年发表的一篇系统论文,呈现的用户体验仍以专家对话为主:接收文本或语音问题,可选择展示“深度思考”过程,随后返回答案。作者把因果推理、多模态能力、在线搜索和知识增强列为未来改进方向。论文还给出本次发布说明没有重复的工程细节:275 万个微调样本,在 128 个华为昇腾 910B 加速器上训练 3 个 epoch,以及该实现 10,000 个字符的输入上限。[6]
其间,2025 年 11 月发布的 3.0 版加入深度推理、网络搜索,并增强了对工艺流程图和反应网络图像的理解。该版采用“1+1+N”体系:一个全链条数据中心、一个行业大模型和多个智能体。当时,大连化物所称已有 100 多家企业试用这套系统。[3][4]
3.0 Pro 把这些组成部分纳入明确的编排循环。检索、推理和图像理解现在只是流程中的中间环节,智能体层还负责拆解任务、调用工具、检查结果和动态调整。[1] 大连化物所的在线产品页面列出 7 类共 36 项可复用技能,以及 6 类共 34 个工具包,其中包括反应动力学拟合、反应器估算、设备成本估算、流体水力学计算、物性查询、分离过程设计、工厂运行分析和流程系统模拟。[2]
公开页面上的 36 项技能和 34 个工具包,与发布稿汇总的 400 多个智能体和工具并非同一口径。从公开呈现方式看,前者是一组经过筛选、逐项具名的入口,后者则是项目方统计的更大范围总数。大连化物所没有公布包含 400 个条目的逐项名录,也没有为每个组件提供版本历史或测试状态。[1][2] 这一缺口关系到实际可靠性,因为智能体系统在一次具体运行中的表现,取决于它选中的工具、数据源、单位约定,以及各环节的交接方式。
工具调用改变了出错边界
在普通对话中,模型会在生成的文本里完成算术,或凭记忆给出某条关联式,错误会直接显现在答案中。使用工具的系统可以把计算交给确定性软件。在工具经过验证且调用正确的条件下,这条路线可以提高安全性与实用价值:经过验证的热力学软件包理应优于逐 token 即兴拼出的算术,最新的物性数据库也理应优于模型记忆。
委派同时会带来新的故障方式,包括智能体选错计算程序、映射错变量、悄然混用单位、调用超出适用范围的关联式、接受未收敛求解器给出的结果,或把看似合理的输出带入下一步。计算本身可以正确,整个工作流依然会出错。因此,“调用了工具”算不上可靠性结果;它只说明现在必须在哪些环节检验可靠性。
面向生产部署,一份有价值的记录应当是字段类型明确的执行轨迹,其中包含用户目标、检索证据、模型与提示词版本、所选技能、工具 schema、带单位的输入、软件版本、输出、验证规则、人工审批,以及任何下游写入。有些工具可以安全地保留为探索用途。物性查询可以只读,模拟可以在沙箱中运行,设定值变更建议则可以要求工程师签字批准。动作越接近设备,把模型置信度当成操作授权就越不合理。
标题把“最终决定权”留给工厂现场,原因正在这里:语言模型负责提出候选方案,决定权由现场掌握。物理极限、仪表读数、工艺安全规则、经批准的操作范围和对结果负责的工程师,共同决定一项计划能否经受真实系统的检验。ChemELLM 适合承担的角色,是更快地组织并测试候选工作流,同时让化工工程赖以成立的否决关口继续生效。
公开分数检验的仍是旧重心
大连化物所报告称,3.0 Pro 的文本和多模态问答准确率分别为 81.96% 和 80.75%,相较 3.0,综合得分分别提高 20.2% 和 31.4%。[1] 这些结果来自项目方,公开发布稿没有说明确切测试集、数据划分、提示词协议、评分方法、对比日期、模型设置、硬件、运行时、统计不确定性或独立评估方。在这样的证据范围内,这些数字只能视为方向性信号。
措辞还需要格外留意。2025 年一篇关于 3.0 版的报道给出另一组数据:10 个化工核心维度上的平均问答准确率为 81.37%,多模态准确率为 71.92%。[4] 这些已公布百分比无法直接推导出新发布稿所称的 20.2% 和 31.4% 相对增幅。较合理的解释有两种:“综合得分”采用了另一种汇总口径,或评测套件已经变化;大连化物所披露的方法信息还不足以判定具体原因。把这些数字串成一条连续排行榜,会暗示一项尚未得到证明的可比性。
问答准确率还有一个更根本的限度:它没有测量本次发布最核心的新主张。执行评测的核心应是轨迹,最终回答只占其中一环。评测需要揭示系统能否选对工具、给出有效输入、发现调用失败、在多步骤之间保持单位和约束、在证据不足时停止,并把后果重大的动作转交人工。它还要分清两种同样得到正确结果的过程:一条路径脆弱,另一条工作流可重复、可审计。
采用数据也有相似的限度。从 2025 年 11 月 100 多家企业试用 3.0 版,到 2026 年 8 月 300 多家企业、高校和研究所完成注册,显示出关注范围扩大的迹象。[1][3] 1,400 万次 API 调用说明系统有人使用,却没有说明使用分布与价值。少数重度测试者就能贡献大部分调用量,一次注册也未必会转化为生产部署。发布稿没有提供任务成功率、人工修正率、活跃机构数量、重复使用分布、事件记录或工厂运行成效数据。
更可信的目标:让模型连接实体设施
ChemELLM 最突出的优势未必只在模型本身。大连化物所称,其石油化工数据中心横跨科研、设计、生产和市场,长兴岛还建有千吨级智能中试平台。该平台可以在实验室无法达到的工况下生成催化反应与工艺数据,而这些数据也很难从运行中的工厂取得。[1] 二者结合,指向一条更完善的开发循环:利用领域记录训练模型或检索信息,提出工作流,在仿真中测试,再到中试线验证,最后把证据送回系统。
这套闭环仍停留在目标阶段,尚无实证展示。大连化物所称,新成立的联合实验室汇集科大讯飞、阿里云、华为、宁波数据集团、中控技术(SUPCON)、AVEVA 等机构,将研究模型与智能体、数据与算力平台、工业软件集成、场景验证和商业化。规划中的 4.0 系统将加入更深层推理与多工具协同规划,再通过成熟的甲醇制烯烃工艺,逐步连接实验室研究、工程设计和工厂运行。[1]
这份路线图也清楚限定了 3.0 Pro 目前能够证明的范围。当前版本公开了执行架构和一组领域工具入口;下一版预计验证不同阶段之间的协同。“从实验室一步到工厂”是项目的目的地,8 月的公告尚未确立这项能力。
下一次发布需要哪些工程证据
以下四类披露可以为架构说明补上更有力的证据。
第一,发布带版本记录的智能体、技能与工具名录,列明责任方、schema、单位约定、依赖项、验证状态和权限。第二,基于版本固定的任务集建立轨迹评测;指标除答案准确率外,还应包括工具选择准确率、无效参数拒绝、工具故障恢复、约束保留、转交人工的行为,以及端到端可复现性。第三,按分布报告使用情况,包括活跃机构、重复使用用户、任务类别、获采纳的输出、修正和失败,不再只给出一项累计 API 计数。第四,完整记录一次从任务前提到结果的中试验证,并标出工程师改动、否决或叫停模型计划的位置。
ChemELLM 3.0 Pro 的意义,在于它让中国垂直模型的讨论从“懂行业”向“参与实际工作”推进。400 多个智能体和工具清楚呈现了这一步,整套系统仍有一段路要走。在化工工程中,只有每次交接均可检查、实体系统保留否决权,执行才可信。
来源
- 中国科学院大连化学物理研究所,《ChemELLM 3.0 Pro 正式发布》(2026 年 8 月 31 日;发布架构、项目方指标、采用数据、实体基础设施、联合机构与 4.0 路线图;中文)。
- 中国科学院大连化学物理研究所,ChemELLM 官方产品网站(当前公开的技能与工具目录;中文)。
- 中国科学院大连化学物理研究所膜技术国家工程研究中心,《大连化物所在 2025 年石化化工行业数字化转型大会发布 ChemELLM 3.0》(2025 年 11 月 11 日;发布时间线、“1+1+N”体系、试用用户基线与发布照片;中文)。
- 《中国化工报》,由大连化物所转载,《ChemELLM 3.0 发布》(2025 年 11 月 12 日;版本变化,以及项目方文本与多模态评测数据;中文)。
- Heng Zhang 等,《From lab to fab: A large language model for chemical engineering》,Chinese Journal of Catalysis 73(2025),159–173(模型、训练语料与 ChemEBench 设计)。
- Heng Zhang 等,《A large language model system for the field of chemical engineering technology》(arXiv:2509.07034,2025 年 9 月;系统工作流、微调设置、硬件、界面限制与作者所列未来工作)。