在会议展台上,基础模型很容易被纳入一个清晰的画面:一个名称、一块屏幕、一个发布编号。2026 年 7 月 17 日,磐石·科学基础大模型 2.0(下称“磐石 2.0”)在上海世界人工智能大会发布;离开演示屏后,它的全貌反而更难说清。中国科学院此次展示的重心落在一座科研转接台上,目标是连起科学数据、通用推理、领域模型、软件工具、仿真硬件和面向具体任务的智能体,其范围远超一个体量更大的科学聊天机器人。[1]
这正是本次发布最重要的变化。4 月的磐石 100 体系以磐石·科学基础大模型 1.5pro 为中心,配有处理波、谱、场数据的专用模型,以及 2,000 多种科研工具。三个月后,2.0 发布材料给出一套递进式三层架构、800 万条科学推理数据、8,000 多种工具和技能,并加入异构算力层,分别服务于模型训练、常规科学仿真和专用分子动力学计算。[1][2]
从工具层数量看,平台扩展到原来的四倍。单凭这一数字,无法证明科学家也能完成四倍的有效工作。磐石 2.0 最有力的主张落在架构上:它把阅读、推理、计算和领域执行之间的交接纳入同一产品。公开信息中最薄弱的一层则是评测。中科院报告了 60 多项专业任务的结果,发布材料却没有公开复现这些对比所需的任务清单、数据划分、模型版本、提示词、硬件、运行时间和结果表。[1] 目前,性能标题只能作为方向性信息;相比之下,平台设计更容易检视。
此次发布从模型家族走向科研路线
4 月发布的磐石 100 已经把通用基础模型放在主干,各学科模型和智能体则向外分叉。其 1.5pro 模型使用 650 万条科学推理数据,并设有波基座、谱基座和场基座,分别处理类波信号、光谱和物理场。同一份发布材料还介绍了“磐石·智能体工厂”,覆盖 10 多个科研领域,内含 2,000 多种工具。[2]
磐石 2.0 为这套组合标出一条更清楚的路线。中科院将其描述为依次衔接的三层:科学数据统一编码、自然世界知识对齐,以及领域任务定向解码。[1] 这组表述有具体含义。光谱、地震图、蛋白质位点和压力场即便以图像呈现,也各自带有单位、不变性、噪声来源和允许的变换。通用视觉语言模型可以描述表面,科学系统还要保留足够的结构信息,才能把表征交给合适的预测器、求解器或仪器流程。
因此,领域解码器对系统能力的影响,比拓宽聊天界面更深。共享表征到了这里,需要转化为符合化学约束的性质估计、候选分子结构、蛋白质位点预测,或其他范围明确的输出。磐石的设计允许编码与知识共用,同时把最后一程留给专业组件。面对通用助手与窄域科学模型之间的张力,这套分工给出了一种合理答案:共享部分处理共性,专业组件守住各自的任务范围。
发布材料中的数据变化需要审慎阅读。4 月公布的是 650 万条高质量科学推理数据;7 月公布的是覆盖 200 多项科研任务的 800 万条数据。[1][2] 名义增量为 150 万条,约合 23%。两次发布都没有给出统一的数据组织规范、去重方法、来源构成或版本清单,因此这两个数字尚不能组成一条口径清晰的增长序列。数据数量增加后,其证据链、任务定义和污染控制能否经受检验,决定了增量的实际价值。
数据层已有一部分真正开放
磐石公开数据的方式,展示了披露细化到具体制品层面时应有的样子。S1-MMAlign 数据集收录超过 1,550 万组科学图文对,取自 250 万篇开放获取论文。作者介绍了一套增强流程:结合论文摘要及引用某幅图的上下文,生成信息更丰富的图像描述,再用对齐任务与下游科学视觉任务检验所得数据。[3]
S1-MMAlign 与磐石 2.0 公布的 800 万条推理数据分属两套语料。若将两组数量混用,两者的来源与用途都会变得含混。不过,与 2.0 发布时公布的指标相比,S1-MMAlign 留下了更多可检查的材料:论文、公开仓库、明确的 CC BY-NC 4.0 许可、带版本的文件,以及可浏览的样本页面。[3][4]
这项对照也指出了下一份实用发布材料应有的形态。磐石 2.0 需要一份模型卡和数据清单,把每项公开主张对应到带版本的组件:现有哪些编码器与解码器,哪些权重或 API 可以访问它们,各类推理数据怎样供给这些组件,分别适用何种许可,每项能力又由哪套评测集检验。7 月发布公告没有附上 2.0 检查点、代码仓库或任务级评测材料包。[1] 系统内部的开放程度仍属未知;外部研究者目前还无法根据发布页重建所宣传的版本。
八千种工具体现库存规模,编排能力仍待验证
工具和技能从 4 月的 2,000 多种增至 7 月的 8,000 多种,是平台最醒目的扩展。[1][2] 这个数字也最容易引起误读。只有当模型能够选择有效工具、满足输入契约、在调用过程中保留单位与不确定性、发现失败、保存记录,把结果交给下一阶段并保留原意时,工具目录才真正成为科研系统。
分子动力学软件包、文献索引和蛋白质位点预测器都可以被调用,彼此却没有天然统一的接口。它们能否给出有用结果,取决于软件版本、数据库、边界条件、收敛标准和科学假设。清点数量回答的是“平台可以触达多少工具”,却回答不了“平台有多大比例能够组装出正确路线”。
2025 年发布的初代磐石把这项目标呈现得更清楚。中科院当时介绍了一套面向科学定制的异构混合专家(MoE)架构,将其与 AlphaFold、MatterGen 等专业系统组合,并配备文献检索和工具调度智能体。[5] 磐石 2.0 把早期的组合方式进一步明确为产品层。工程证据接下来应从目录规模转向完整的工作流记录,其中包括任务、计划、工具版本、输入、中间输出、错误恢复、专家复核和最终结果。
这类记录属于科学程序的一部分。流畅答案与可审计流程的差别,也落在这里。失败的工具调用应留在记录中,单位换算应明确呈现,文献主张应保留来源,智能体还应识别专业模型的输出何时超出经过校准的适用范围。
计算体系映照整条工作流
磐石 2.0 所称的“超算 + 智算 + 速算”听起来带有采购口号色彩,底层却对应实际的任务分工。按中科院的说明,超算负责通用科学计算与多学科高通量仿真,智算集群负责模型训练和推理,天穹 3D 等专用加速硬件则处理分子动力学这类高精度、长时程任务。据报道,这套系统也已适配昇腾和海光芯片。[1]
这项安排很重要,因为 AI for Science 的流程很少停在 token 生成。模型可以提出候选方案或选择求解器,成本最高的验证环节仍会落在模拟、仪器运行或湿实验上。若由一个规划器统一调度多类算力,阶段间的交接摩擦可以降低,智能体也能把各项工作分派给合适的机器。
与此同时,新的评测责任也随之出现。平台结果需要报告模型准确率以外的指标:排队时间、计算时间、加速器类型、求解器容差、条件允许时的能耗或资源成本、失败率,以及审批或修复路线所需的人工投入。缺少这些量,“从数小时缩短到数分钟”会把学习型替代模型、更快硬件、放宽的近似条件和任务变更带来的收益混在一起。
《北京日报》报道了一个具体但仍不完整的例子:在与 LAMOST 望远镜有关的工作中,磐石 2.0 的一个天文智能体据称相比此前最佳方法将稀有天体识别准确率提升约 50%,并把参数模拟时间从数小时缩短到数分钟。[6] 报道没有给出数据集、分母、误差条、计算配置或旧基线的定义。这项结果值得继续核验,现有细节尚不足以支持复现。
评测表需要覆盖每次交接
中科院称,磐石 2.0 在 60 多项专业任务的大多数项目上超过通用旗舰模型,并在选定的化学性质预测、谱到分子结构预测和蛋白质位点预测问题上领先领域模型。[1] 发布材料没有指明具体测试与对照模型,这些主张也就无法汇总成一份普遍适用的“科学能力更强”排名。带有多个专用解码器的系统在选定领域任务上胜过一个通用模型,符合其设计目标;真正需要追问的是,对比双方是否使用相同的信息、工具、计算预算和复核规则。
以下四类披露可以把性能标题变成实用的评测表。
第一,发布带版本的任务矩阵,列明数据集及其划分、领域、指标、基线版本、提示词或工具策略、硬件、运行时间和不确定性。第二,将组件级测试与端到端测试分开。编码器可以正确分类一张光谱,智能体仍有机会选错下游工具。第三,纳入弃答率、工具失败率和专家修正率。科研助手的安全性,有一部分取决于它能否识别路线已经中断。第四,公开若干来自实际部署的完整记录,成功与失败案例均应包括在内,让外部读者看到磐石在何处把控制权交给专业模型、模拟器或科学家。
采用规模也需要同样严格的口径。7 月发布材料称,磐石已用于中科院 50 多家研究所,以及 30 多家外部单位,涵盖高校、科研机构和国有企业,并借助联合国教科文组织(UNESCO)和“一带一路”国际科学组织联盟开展国际推广。[1] 这些数字展示了分发范围,却没有说明活跃研究人员数量、重复运行的工作流、经过验证的发现,也没有区分有多少安装使用完整的 2.0 系统、有多少只调用一项服务。按使用群体和部署批次披露情况并审计成果,才能比较不同时期的部署情况。
磐石 2.0 最值得关注之处,在于它承认科学智能分布在整条科研路线,单一权重集合只是其中一环。数据、专业表征、工具、模拟器、加速器、智能体和研究人员都位于这条路线上。中科院如今已经以少见的广度描述了整条路线。下一次发布应让外部研究者能够循着记录,在这条路线上完整回溯一次科研旅程。
来源
- 中国科学院,《磐石·科学基础大模型2.0发布》(2026 年 7 月 21 日;架构、数据、评测、工具、计算与部署主张的官方发布材料)。
- 中国科学院自动化研究所,《中国科学院“磐石100”模型体系发布:AI引擎驱动科学创新》(2026 年 4 月 28 日;1.5pro 基线、科学模态模型、推理数据、工具数量与部署背景)。
- He Wang 等,《S1-MMAlign: A Large-Scale, Multi-Disciplinary Dataset for Scientific Figure-Text Understanding》,arXiv:2601.00264v2(2026 年 5 月 6 日;语料构建、规模、对齐方法与验证)。
- ScienceOne-AI,S1-MMAlign 数据集仓库(访问于 2026 年 8 月 3 日;公开文件、版本历史、样本浏览器与 CC BY-NC 4.0 许可)。
- 中国科学院自动化研究所,《“磐石·科学基础大模型”正式发布 赋能科研范式重塑》(2025 年 7 月 26 日;初代架构、专业模型集成、智能体与平台定位)。
- 《北京日报》经北京市政府门户发布,《大模型产品持续创纪录 人工智能融资全国占比超四成 北京加快打造人工智能万亿级产业集群》(2026 年 7 月 21 日;磐石 2.0 应用主张及本文照片的来源页面)。