ai china

SoMBench 要 AI 读懂场面,场面仍由人预先编排

5 条来源 5 条一手来源 已翻译 2026年8月8号

正文
程学旗手持麦克风,在蓝色大会舞台上发言。

中国科学院计算技术研究所副所长程学旗在 2026 年 7 月 10 日曙光 8000 发布会上发言,知境于此次活动亮相。照片记录的是发布活动,未呈现该基准的标注或评测流程。[2]

语言模型可以答对错误信念谜题,置身一屋人中却仍会判断失当。它知道某人没看见物体被挪走,却看不出一句请求为何说得含蓄,哪位同事握有决定权,礼貌的回答何时变成敷衍,以及角色与关系变化后规则会怎样改变。

SoMBench 试图为这个更大的房间建立量尺。中国科学院知境团队于 2026 年 7 月公开介绍这项基准,将它作为一项更广泛的“社会心智”计划的评测层。SoMBench 将评测对象从单一的心智理论分数扩展到三个部分:心理状态推断、策略互动与规范理解。技术报告以 284 个情境编制的 3,481 道中文题目评测了 20 个模型。[1][2]

截至 2026 年 8 月 8 日,与最佳受测模型拿到 72.08% 这一醒目结果相比,更有分量的贡献来自数字之下的诊断设计:同一个社会情境可以分别采用受限答案和开放答案、第一人称和第三人称视角、长短文本,以及细分的能力标签来探查。它的适用范围也同样重要。这些题目属于刻意编排的书面情境,与不断变化的社会环境中观察到的真实行为仍有距离;现有公开材料也尚不足以从头到尾复现报告中的表格。[1][3]

图片背景:封面是程学旗在知境亮相活动上发言的官方照片。它说明项目的机构归属与公开亮相背景;SoMBench 的制作过程及结果仍须由其他证据核验。[2]

从一个错误信念到完整的社会场域

早期心智理论基准把一个关键问题变成了可操作的测验:模型能否分清实际发生的事,与某个特定人物知道或相信已经发生的事?以 ToMBench 为例,它把 8 类任务和 31 项能力组织成一套双语选择题评测,并明确采用新编题库,以降低污染和主观评分的影响。[5]

SoMBench 朝两个方向拓展了评测目标。第一项一级维度是心理状态理解(mentalizing),涵盖信念、欲望、意图、情绪、视角、共情,以及个性或偏好。第二项是社会互动中的策略应对,涵盖沟通、协商、议价、合作与冲突、信任与欺骗,以及群体动力。第三项是社会规范的内化与动态平衡,涵盖规范、身份与角色、权力与制度,以及群体界线。这三个分支之下共有 17 个二级维度和 71 种任务范式。[1]

这套分类让“社会智能”有了可以检验和证伪的具体内容。模型可以擅长识别情绪,却分不清信念与事实;也可以写出得体的话,却没察觉下属无法安全地拒绝;还可以背诵一项规范,却忽略角色、过往关系与相互冲突的义务。单一平均分会藏起这些各不相同的失效方式,有标签的分类网格则能逐项检查。

评测范围的拓展也改变了“通过”的含义。报告中的 SoMBench 评测全部采用中文,为英语占主导的基准版图补上了重要一块。它检验现有模型能否处理由中文表达的社会线索,也避免直接把从英语翻译而来的惯例视作普遍规则。语言覆盖仍不等同于文化效度。中文情境依然会嵌入作者对争议规范的某一种理解;参考答案被判为正确,也不会把这种理解提升为普遍的社会法则。[1]

构造流程才是真正的技术成果

团队的流程远比让模型生成几道难题后直接发布更完整。他们先制定各项能力对应的情境要求,再生成受控改写,依据模型失误筛出更难的变体,最后将每个候选题交由人工审核。15 名具有心理学背景的本科生和研究生使用一套定制标注系统完成审核。每个实例由两人独立检查,意见冲突时由第三人裁决。审核者先检查情境是否连贯、人物的知识范围是否成立,随后在看不到参考答案的情况下自行作答,最后再检查完整的问答链。[1]

3,484 个生成候选题中,最初有 3,034 道通过审核。3 道题因无法修复而被删除,其余未通过者经修改和复核,最终得到 3,481 个经专家核验的实例。其中有 1,704 道原始题,以及 1,777 道改写题或难度更高的变体;按题型划分,则包括 713 道单选题、626 道多选题、1,661 道判断题和 481 道开放分析题。[1]

与题目总数相比,这些细节更能说明基准的价值。受控改写可以揭示模型究竟遵守了人物的信息范围,还是只认出了熟悉的故事模板。第一人称和第三人称版本可以暴露视角泄漏。多选题则能检验模型能否同时维持数项彼此相容的约束,其判断不能止于第一个看似合理的答案。

把这类扰动当作证据,已有研究先例。2024 年一项发表于 Nature Human Behaviour 的研究在多种心智理论任务上比较了模型与 1,907 名人类参与者,并利用改写题目区分响应偏差、prompt 敏感性与稳定的类人能力,表明表面上的强弱表现会受前两者左右。[4] SoMBench 的变体在更广范围内延续了同一种方法意识:答案写得再圆熟,也要等设置改变后再看是否站得住。

排行榜藏起了更敏锐的信号

20 个模型的表格给出了一个显眼的头条。Claude Opus 4.8 以 72.08% 居首,随后是 69.35% 的 GPT-5.4 和 69.09% 的 GPT-5.5。受测模型中的最低分为 42.69%,首尾相差 29.39 个百分点。放眼全部模型,没有一个在 17 个二级维度中的任何一项达到报告所定的 90%“近天花板”门槛。[1]

然而,题型拆分更能说明评测面对的问题。所有模型的平均成绩中,单选题准确率为 94.47%,多选题准确率为 55.60%,判断题准确率为 64.06%,开放题通过率为 62.86%。当一个显眼的答案与干扰项并列时,模型很容易取得近乎满分的单选成绩;一旦必须同时保住所有适用的信念、关系或规范,可靠性便显著下降。[1]

这道差距无法直接视为“题型难度”的纯粹因果估计。不同题型承担的任务各有差异,开放回答还采用了另一套评分办法。即使共享同一个情境,从选择题改成分析题,也会同时改变输出方式与认知要求。结果能确定的是设置敏感性;若把取消单选按钮概括成普遍适用的 38.87 个百分点惩罚,就越过了证据范围。

视角与篇幅同样没有单调关系。第三人称题目的平均成绩比第一人称题目高约 2 个百分点,但部分维度的方向相反。长文本平均只高出 0.12 个百分点,角色与议价任务从中受益,意图与共情任务则在短文本上表现更好。增加文字并不会稳定增加可用的社会理解;有时,新增的是更容易丢失的关系与约束。[1]

因此,综合分数不宜包装成社会 IQ。它混合了不同能力、4 种答题形式和 2 条评分路径。把它当作一张矩阵最有价值:找出模型成绩随视角、上下文或回答要求而变化的位置,再逐一检查相关案例。

开放答案把第二个模型写进成绩

封闭题依据参考标签匹配答案。481 道开放题采用了另一种方法:两个自动裁判按照 rubric 给出连续分数,再以固定阈值将分数转为通过或未通过。因此,报告中的开放题成绩属于一个由三部分组成的系统——受测模型、rubric 和裁判模型——衡量范围涵盖三者。[1]

这种评法能够合理衡量解释质量,公开记录也必须列清每个组成部分。技术报告提到两个裁判,却未在基准章节中注明各自的模型快照,也未在那里写出数值阈值。目前公开的 SoMEval 仓库补上了具体操作方式:各维度专用的 rubric、满分 10 分时以 7 分为通过线、一个启用中的 qwen3.7-max 裁判配置,以及一段已注释掉的可选第二裁判配置。仓库也说明,启用第二个裁判即可仿照双裁判协议。[3]

这些代码有助于理解流程,但不能直接拿仓库默认值代替论文表格背后未公开的设置。精确重跑需要两名原始裁判的身份与版本、各自的 prompt 和采样设置、阈值、受测模型的 API 快照,以及逐题结果。缺少这份清单,后来评估者即使复现了流程形态,仍会得到实质不同的分数。

公开代码与公开测试之间仍有缺口

这次发布还存在第二处复现缺口。在本文核查的固定公开 commit 中,SoMEval 包含运行器、prompt 生成器、评分代码、rubric 文件和文档,惟独缺少 3,481 条 SoMBench 记录。其下载脚本指向 Hugging Face 的一个数据集端点;2026 年 8 月 8 日的未认证检查显示,该端点要求授权。仓库文档还把 SoMBench 来源称为内部数据,并说明若干经过审核的基础文件属于本地输入,已被忽略而未纳入仓库。[3]

私有测试集本身没有问题。把题目隔离在模型训练之外,可以防止基准变成又一份被记住的公开试卷。不过,私有安排需要一条配套的核验路径:托管评测器、加密数据集版本、不可变的模型与裁判清单、可下载的逐题成绩,以及审核争议标签的流程。目前,外部读者只能检查整套装置,仍无法独立确认公开装置、隐藏题目与已发布排行榜是否来自同一次实验。

这项区别格外重要。知境报告已经用基准的能力诊断指导 Zing 模型家族的后训练,随后又介绍 Actio 推理框架,由它调度技能、心理状态表征、经验与检索到的规范知识。这套从评测到训练再到部署的循环,是项目的战略构想。[1][2] 若评测层无法接受独立检查,循环内部的改进就更难与针对其标签和 rubric 的专门适配区分开来。

SoMBench 证明了什么,下一步还应证明什么

SoMBench 已经说明,社会智能评测可以比一组彼此孤立的错误信念题覆盖更广,也更便于诊断。其中包括一套严肃的中文分类体系、一条有文档记录的人工审核流程、多种答题形式,以及控制视角和上下文的实验轴。它自己的结果显示,模型排名与表面能力都会随这些选择而变化。[1]

72.08% 仍不足以证明一个系统能够在开放环境中理解他人。题目保持受控,开放答案依赖自动裁判,文化与制度规范会发生变化,公开材料也还不能支持精确的外部重跑。报告承认了这一限制在概念上的对应部分:真实的社会智能需要随时间综合多种线索,处理含混、冲突与不断变化的情境,其能力不能停留在彼此孤立、带有标签的项目上。[1]

补齐以下四份凭据,可以让这项前景良好的基准成为耐久的基础设施:

  1. 可核验的评测路径:发布带版本的数据集,或提供带有逐题审计记录的托管运行器。
  2. 完整的裁判清单:冻结每张已发布表格所用的两名裁判快照、rubric、阈值、prompt 与推理设置。
  3. 人类与文化基线:测量不同人群之间的一致、分歧与校准情况,把规范标签的差异也纳入记录。
  4. 超越答题的行为测试:从对完整故事的回答延伸到多轮修正、不确定性表达、延后判断,以及关系变化时的行动。

项目名“知境”,字面可作“知晓所处情境”解。SoMBench 最诚实的发现是,模型对情境的理解始终受呈现方式约束。改变视角、上下文长度、回答形式或裁判,表面上的社会心智也会随之变化。这份敏感性让基准的价值落在一个具体要求上:完整保留房间中的每一部分。

来源

  1. 知境团队等,“Zing: Social Mind for LLMs”(arXiv:2607.23740,2026 年 7 月 26 日;介绍 SoMBench 构造、审核、评测协议、模型结果、Zing 训练、Actio 与局限的主要技术报告)。
  2. 中国科学院计算技术研究所,“‘知境’社会心智大模型亮相国产AI超集群曙光8000发布会”(2026 年 7 月 24 日;官方机构报道及活动照片来源页)。
  3. Zhijing-AI,SoMEval 仓库 commit 6453a83(公开评测框架、SoMBench 任务配置、rubric 评分、数据集文档和下载脚本;2026 年 8 月 8 日查阅)。
  4. James W. A. Strachan 等,“Testing Theory of Mind in Large Language Models and Humans”,Nature Human Behaviour 8(2024;开放获取的人类对照研究,以及受控变体在稳健性与响应偏差方面的证据)。
  5. Zhuang Chen 等,“ToMBench: Benchmarking Theory of Mind in Large Language Models”,ACL 2024 论文集(官方论文页面;双语基准设计、8 类任务、31 项能力、选择题评分与污染控制)。
Previous MiniMax M3 两度发布:服务先行,可审视的基础设施随后开放

Recommended In ai china

Matched by subject and format