ai china

上海AI实验室的科学模型路线:规模之外,技术栈正在成形

6 条来源 2 条一手来源 已翻译 2026年5月20号

正文
白天拍摄的上海徐汇滨江实景照片。

这张摄于 2014 年的上海徐汇滨江实景照片,呈现了本文的机构与地域线索:上海AI实验室公开把工作扎根于城市级科研网络,抽象的基准表格只是其中一部分。[6]

截至 2026-05-20 UTC,若只用“中国有了一个万亿参数模型”来概括上海AI实验室的科学模型工作,许多后续进展会被漏掉。这一说法有事实依据:Intern-S1-Pro 发布时被称为一个 1T 参数的 MoE 科学多模态模型,设有 512 个专家;一次推理只激活其中 8 个,共 22B 参数。[2][3] 对 AI-China 跟踪而言,这项规模主张发布后的配套工作更值得留意。上海AI实验室正尝试为科学智能(AI for Science)搭建一套可运行的技术栈:兼顾专长与通用能力的大模型、更小且重视效率的后继模型、开放的模型文件、部署方法、评测工具、文档解析工具和科研流程演示。

中国AI竞争的公开讨论经常聚焦消费级聊天应用、云服务降价和通用基准排名。上海AI实验室选择了另一方向。公开材料显示,其模型能力覆盖化学、材料、生命科学、地球科学、物理信号、科学图表、长跨度异构时间序列,以及智能体(agent)参与的科研流程。[1][2][3][4] 通用助手仍有作用;这套路线另有一项主张:科学工作需要一组彼此配合的模型,分别处理不同模态的输入,使用相应的训练数据和评测方法,也各有失效范围。

图片说明:封面选用 Wikimedia Commons 上的上海徐汇滨江实景照片,让真实城市环境取代模型截图或合成概念图。本文记录的是一套由机构主导、扎根上海AI科研网络的研究技术栈。这段产品故事也包括公共实验室、开源基础设施和城市层面的科学政策。[6]

Intern-S1-Pro 验证了扩大规模的可行性

2 月发布时,上海AI实验室清楚展示了自己的技术主张。实验室将 Intern-S1-Pro 描述为基于 SAGE 的科学多模态模型;SAGE 是一种“specializable generalist”(可专门化的通用模型)架构,旨在结合通用能力与科学领域的专门能力。[3] 发布材料声称采用了两项架构设计:Fourier Position Embedding 用于表示周期性数据和物理信号,另一套路由方案则用于提高 1T 参数 MoE 训练的稳定性与效率。[3]

公开的 GitHub README 用工程术语重述了这项主张。Intern-S1-Pro 被描述为万亿参数级 MoE 多模态科学推理模型,拥有 1T total parameters512 experts,每个 token 激活 22B activated parameters。README 还宣称该模型的科学推理达到领先水平,通用多模态表现也较强,并列出 STE routing、grouped routing 与 FoPE。升级后的时间序列建模可处理长度从 10^010^6 个点的序列。[2]

这些设计服务于一个具体问题:科学数据的形式远比文本丰富,还包括分子构型、蛋白质、图表、实验图像、遥感影像,以及物理或生物时间序列。许多前沿模型把扩大参数规模视为普遍解法。Intern-S1-Pro 的扩展目标具体落在这类特殊数据上。若模型无法直接、充分地处理这些数据类型,它就会成为一个在科研外围输出冗长答案的助手,很难参与实际科研工作。

arXiv 收录信息进一步表明,这项工作提出的是系统层面的研究主张,产品页面不足以概括它。Intern-S1-Pro 论文首次提交于 2026-03-26,并在 2026-04-02 更新,归入 machine learning、computation and language、computer vision 等类别。[4] 这些分类跨越多个学科,也反映出上海AI实验室希望这项工作同时接受语言、视觉、科学推理和模型系统等方面的检验,评价范围超出普通聊天模型的比较。

Intern-S2-Preview 开始检验模型能否实用

目前更值得关注的是 Intern-S2-Preview。模型卡将其描述为高效的 35B 科学多模态基础模型,并称它探索 任务扩展(task scaling):除参数量与数据量外,专业任务及其训练方式也成为扩展重点。[1] 模型卡还称,专业科学任务贯穿了从预训练到强化学习的整个训练流程;模型只用 35B 参数,便在多个核心专业科学任务上取得与 Intern-S1-Pro 相当的表现。[1]

研究重心由此发生变化。S1-Pro 展示了巨型开放科学模型的可行性。S2-Preview 接着检验其中多少能力可以由更小、更易部署且针对具体任务的模型承担。

S2-Preview 所做的远多于尺寸压缩。模型卡列出数百项专业科学任务、小分子空间构型建模、实值预测模块、更强的科研智能体能力、MTP,以及提高推理效率的思维链(chain-of-thought)压缩。[1] 模型卡还给出基于 LMDeployvLLMSGLang 的推理服务方法。[1] 科学智能模型的部署不能只看纸面成绩。实验室、高校团队或工业研发部门需要确认模型能否完成服务化部署,能否接受检查、复现、路由和评测;配套基础设施的负担还须控制在合理范围内,避免每次实验都演变成基础设施工程。

综合 [1] 和 [2],本文把这套安排解读为两级台阶。S1-Pro 位于上一级,证明科学多模态模型能够扩展至万亿参数级 MoE;S2-Preview 位于下一级,检验任务扩展和效率优化能否让同一研究方向更接近实际部署。

实验室的路线包括模型,也包括工具链

上海AI实验室的技术路线同时覆盖模型与配套工具。S1-Pro 发布材料称,实验室已经开源一套贯穿数据处理、预训练、微调、部署、评测和应用的大模型研发与应用系统,并将 XTunerLMDeployOpenCompassMinerUMindSearch 列为核心工具。[3]

这份清单很容易被匆匆略过,却是理解实验室定位的核心。用于科研的模型若没有工作流程配合,单独使用会很脆弱。科研论文通常以 PDF 文档流转,实验数据则以表格、图像、光谱、序列或传感器数据流出现。基准结果需要复现,专业领域主张与通用推理主张需要分开检验,部署方案还要适应手头的算力。这些环节需要完整的工具链配合。

OpenCompass 尤其能说明这条路线:实验室将评测纳入公共基础设施。其 GitHub README 将它描述为 LLM 评测平台,用于梳理复杂的模型评测工作,并设有公开网站、排名、文档和代码仓库入口。[5] OpenCompass 本身无法自动平息所有基准争议;这套平台表明,上海AI实验室希望同时掌握评测工具和模型。

对 AI-China 跟踪来说,这套组合比一项孤立的榜单排名包含更多信息。一家实验室若主导或深度参与模型资源、推理服务方案、评测工具和文档处理基础设施,其成果便更容易进入高校、开源社区和企业研发团队。模型权重、配套工具和部署方法共同抬高竞争门槛。

公开主张的证据与限制

上海AI实验室的各项公开工作彼此呼应,技术方向一致。S1-Pro、S2-Preview、Intern-S1、OpenCompass、LMDeploy、MinerU 和相关工具都指向同一要求:科学智能需要理解多种数据形式,使用专业领域数据,针对具体任务训练,并接受可复现的评测,最终还要能够部署使用。[1][2][3][5] 这条主线很清楚;相比每隔几周发布互不相关模型演示的公司,这家实验室的方向更容易辨认。

仍需核验之处同样清楚。模型卡和发布材料都出自第一方。S2-Preview 的模型卡声称,它在多个专业科学任务上达到与 S1-Pro 相当的表现;只有在具体工作负载上复现这一结果,部署团队才能把它视为已经过验证的部署表现。[1] S1-Pro 的 1T/22B MoE 参数配置引人注目。化学规划、生物解释和科研智能体工作循环的可靠性仍需单独验证,模型规模无法替代这一步;在这些工作中,一个错误答案就会浪费实验室时间。[2][4]

第二项限制在于跨领域迁移。模型即使在科学基准上表现良好,遇到各实验室自有的数据格式、专有测量惯例、罕见仪器、版式混乱的 PDF 或缺失的元数据时,仍有失效风险。周边工具因此十分关键,也必须与模型一同接受评估。文档解析、评测套件和推理引擎都会影响可靠性,属于核心部件。

第三项限制关乎治理。公共实验室的开源策略有助于建立信任并促进使用,科学智能部署却常常要处理敏感的未发表数据、知识产权、临床或工业约束,以及可复现性要求。开放技术栈降低进入门槛,部署设计仍须纳入数据控制和审计记录。

接下来观察什么

首先观察 S2-Preview 能否进入真实部署。更有价值的迹象包括可复现的科研智能体基准、上海AI实验室以外团队发布的部署报告,以及较小的科学模型在真实研发流程中胜过较大通用模型的案例;这些案例的定制提示工程负担还应保持在较低水平。[1][5]

部署工具同样值得跟踪。若 LMDeploy、vLLM 和 SGLang 的部署方法足够易用,使研究团队能够自行运行模型,S2-Preview 的 35B 方案便更有实际价值。若部署仍依赖特殊的硬件条件或脆弱的定制代码,效率主张的说服力就会下降。[1][2]

最后还要看 OpenCompass 及相关评测工具能否把科学推理划分得更清楚:分子构型、蛋白质序列、图表和图像解读、长时间序列、科学文献问答,以及交互式科研智能体工作流。[3][5] 如果各项任务分开报告,用户便能更清楚地区分单一综合高分与跨任务的科学可靠性。

由此看,上海AI实验室的 AI for Science 路线已经从超大模型延伸到配套工具。接下来要检验的是,一家中国公共实验室能否把科学多模态建模变成一套可反复部署的技术栈。它需要用大型模型测试前沿科学推理,也要有便于部署的小型模型;各个环节还须足够开放,让其他研究者能够检查整条路径。

来源

  1. InternLM on Hugging Face, "Intern-S2-Preview" model card (35B scientific multimodal foundation model, task scaling, MTP, CoT compression, serving paths, and quick-start details).
  2. InternLM, "Intern-S1" GitHub repository (Intern-S series README, S2-Preview and S1-Pro descriptions, model artifacts, activated-parameter notes, routing and FoPE features).
  3. Shanghai Open Source Information Technology Association, "Towards AI4S 2.0: Shanghai AI Lab Open-Sources Intern-S1-Pro, the 1-Trillion-Parameter MoE Scientific Large Model" (2026-02-05; SAGE framing, 1T/22B MoE details, open-source links, and toolchain list).
  4. Yicheng Zou et al., "Intern-S1-Pro: Scientific Multimodal Foundation Model at Trillion Scale," arXiv:2603.25040 (submission and paper record for the S1-Pro technical report).
  5. OpenCompass, "opencompass" GitHub repository (LLM evaluation platform, documentation, ranking, and public evaluation infrastructure).
  6. Wikimedia Commons, "File:Xuhui Riverside Shanghai.jpg" (source page for the real 2014 Xuhui riverside photograph used as this article's cover image).
Previous AI-China 堆栈更新:AIGC 标识正在成为一条元数据供应链 Next 中国医院 AI 竞赛正从模型演示转向本地部署

Recommended In ai china

Matched by subject and format