设想两张标题相同的试卷:一张要求解答英文竞赛几何题,另一张给出一道配有图示的中文物理题。在其中一张试卷上拿到更高分,能说明模型在这张卷子上的表现。差距究竟来自语言、学科、难度还是读图能力,单凭分数还难以分辨。
OlympiadBench 的设计中就有这层区别。它由清华大学、北京航空航天大学和 Wisdom Way AI Lab 的研究人员共同开发,于 2024 年 8 月发表于 ACL。[1] 它为中国 AI 研究带来了一套便于细查的试题:题目、解题过程、分类和评测工具均已公开,可供逐项核验。[2]
本文解读这套评测设计,核查日期为 2026 年 10 月 8 日。下文讨论的模型得分百分比均出自原始研究,适用范围限于当时的实验,不能用作当前系统的排名。
双语题库中的两种语言,各有各的试卷
已发布的题库共有 8,476 道题,每条记录将题目、详细解答、最终答案、学科、语言及其他标注分开保存。公开的数据集浏览器允许读者查看具体样例,让题目总数有了可查验的依据。[3]
论文列出的题量为 2,125 道英文题和 6,351 道中文题,按题型又分为 6,728 道开放作答题和 1,748 道定理证明题。这些数字统计的是整个题库;每项成绩实际纳入哪些题目,还要看相应实验的评测范围。[1]
子集名称还揭示了另一层差别。OE_TO_maths_en_COMP 代表开放作答、纯文本的英文竞赛数学题;OE_MM_physics_zh_CEE 代表开放作答、带图像的中文高考物理题。代码仓库列出了命名规则,并说明题目取自国际竞赛、中国竞赛及高考。[2]
读懂这些标签,才能确定比较结论的适用范围。比较中文与英文成绩,还需交代两组题目各自来自哪些考试、涵盖哪些学科。“双语”这个名称本身,并不能保证两组题目互为对应译本。本文据此推断,按语言汇总后的分差,无法单独衡量切换语言带来的表现差异。
若要进一步设计对照实验,可以固定题目,保留原有图示和数值,委托翻译并核验译文,再以相同的提示词和生成预算比较模型回答。这样的实验回答的是一个更具体的问题。现有题库考察的范围则更广,关注模型面对各类高难度中学理科题时的表现。
先变的是分母
原始研究中 GPT-4V 的成绩,很直观地说明了这里的解读风险。代码仓库在覆盖范围较广的基准成绩表中报告了 17.97%,在纯文本成绩表中则报告了 29.07%。[2] 表面上的提升来自参评题目范围的变化,不能据此认定模型经过升级后,能力提高了十一个百分点。
论文的主要实验涵盖可自动评分的开放作答题,证明题则另行抽样,由人工评阅。模型采用零样本提示,即提示词中不给示例,并附有答案格式要求。论文报告的总体指标是微平均准确率:汇总时以每道题为单位计入总分,各个具名子集的权重随题量而定。[1]
设想一场评测:大多数题目属于模型擅长的类型,另有一小组题目是它经常答错的。此时,总体得分看起来足以让人放心,那一小组题目上的表现却依然薄弱。即使每道答案都判得准确,这种平均方式仍有这样的特点。
因此,评估一个助手是否适合辅导中文物理习题,需要查看对应的学科与语言子集、题目对图像的要求,以及该子集的题量。测试内容固定时,总体平均分仍有比较价值。若两份报告从同一个题库中悄然抽取了不同试卷,分数也就更难解读。
题目之外,评分规则也要一并核对
从研究发布到实际运行评测,还要经过一次衔接。ModelScope 的 EvalScope 中文文档将所用的数据集划分标为 train,规定了数学答案的判定方式,并要求把最终答案放在 \boxed{} 中。文档同时提醒,定理证明子集目前尚无法自动评测;对于近似答案,评测工具还支持设置数值容差。[4]
这里的 train 是评测程序读取的数据划分在存储时使用的标签。仅凭这个标签,无法认定某个受测模型曾用这些题目训练。同样,将答案放进方框,是帮助评测程序定位结果的格式约定;方框本身不能证明推导成立。
数据集将详细解答和最终答案保存在不同字段中。[3] 这样分开保存很有价值:评分程序可以读取简短的目标答案,人工复核时也有完整材料可查。公开浏览器中的一道几何题要求求出四边形的面积,记录中既有数值答案,也有利用组成该四边形的两个三角形推导面积的过程。[3] 评阅者可以据此检查结果是怎样得出的。
就可复现性而言,本文建议一并记录几项依据:确切的题目 ID 和数据集修订版本、实际送入模型的文字与图像、模型版本、提示词、生成限制,以及评分程序的实现。后来的读者据此就能分清,变化来自解题能力提高、试卷更换,还是判分方式调整。这项报告建议出自本文,不属于 OlympiadBench 的新增研究结果。
这项工作最突出的贡献,在于让更精确的追问有了依据。哪些中文物理题的成绩提高了?两个模型收到的是同一组图像吗?证明题是否单独评阅?OlympiadBench 为这些问题留下了具体可查的材料。要让分数可信,先得知道桌上摆的是哪张试卷。
参考来源
- Chaoqun He 等,《OlympiadBench:以奥林匹克竞赛级双语多模态科学问题促进通用人工智能发展的高难度基准》,ACL,2024 年 8 月——作者所属机构、表 2,以及第 4 节的实验范围与指标。
- OpenBMB,OlympiadBench 官方代码仓库——已发布数据、子集命名,以及历史全题目范围与纯文本成绩表;访问日期:2026 年 10 月 8 日。
- OlympiadBench 作者,Hothan/OlympiadBench 数据集——公开记录、标注和解答示例,包括编号为 2417 的几何题;访问日期:2026 年 10 月 8 日。
- ModelScope,EvalScope 的 OlympiadBench 中文文档——数据划分、提示词、子集定义及自动评分的限制;访问日期:2026 年 10 月 8 日。
- 清华大学,《主楼》,官方校园图库——照片及拍摄地点的出处;访问日期:2026 年 10 月 8 日。