ai china

LongBench v2 追问:模型究竟读到了什么

5 条来源 2 条一手来源 已翻译 2026年9月22号

正在加载阅读与收藏统计…
正文
夜色中,清华大学西馆灯火通明,前景是庭院喷泉与树木。

清华大学西馆,摄于 2022 年 11 月 30 日。配图呈现该校 LongBench 研究所在的校园环境。摄影:Lining Huo / Wikimedia Commons,CC BY-SA 4.0;已调整尺寸。[5]

设想把一份厚厚的项目记录交给助手,问它某项决定后来为何被推翻。找到最初的决定固然有用,真正需要完成的工作,还包括把它与后来的异议、最终的修订联系起来。系统能容纳整份文件,也未必能完成后一步。

清华大学与智谱(Zhipu.AI)的研究人员开发了 LongBench v2,让这一区别变得具体可见。[1] 这项基准于 2024 年 12 月 20 日发布,其评测设计至今仍值得细读。[4] 下文列出的历史成绩来自最初的实验,不代表 2026 年 9 月可用模型的排名。

一场不同的阅读考试

第一代 LongBench 于 2024 年 8 月发表于 ACL,汇集了中英文两种语言的 21 个数据集,涵盖六类任务,其中包括摘要生成、问答、少样本学习、合成任务和代码补全。英文输入的平均长度为 6,711 个单词,中文则为 13,386 个字符。[2]

比较两代基准时,需要先看清这些任务的跨度。摘要和代码补全放在同一套基准里,衡量的就是多种输出能力。即使文档长度尚未增加,任务形式的变化也已经改变了分数所能说明的问题。两个版本的百分比各有衡量范围,直接并列如同比较接连两次考试的成绩,会掩盖这些差异。

v2 数据集包含 503 道四选一题目,上下文长度从 8,000 到 2,000,000 个单词不等。六类任务涵盖单篇文档、文档集合、从示例中学习、对话历史、代码仓库和结构化数据。官方数据集将语言标为英语,并列有领域、子领域、难度和长度等字段。[3]

沿着这些字段查看结果,比只看一个平均分更有价值。代码仓库中的问题,有时取决于函数之间的关系;对话中的问题,有时取决于哪条指令取代了先前的指令。本文据此理解任务级结果的价值:一种阅读任务上的成功,未必能同样迁移到另一种任务。

语言差异也值得单独辨明。中国 AI 领域产出的研究,可以为全球研究者带来一套英语测试;研究机构来自中国,这一点本身不足以让总分成为中文理解能力的证据。早期的双语基准与这份英语数据集,各自支持的结论有所不同。[2][3]

消失的中间部分

公开的评测代码揭示了一个影响结果的细节:提示内容超过设定的 token 上限时,代码会保留开头和结尾,删除中间部分。因此,数据集标注的单词数与模型实际收到的输入量,是两个不同的量。token 是分词器划分的单位,与单词的计数方式有别。[4]

再看前面假设的项目记录:开头几页批准一项设计,中间记下一条例外情况,最后几页只交代结果,没有重复说明原因。中间部分一旦被删除,助手便失去了说明决定为何被推翻所需的前提。即使花更多时间思考留下的页面,也难以可靠地还原那份缺失的证据。

由此,文档评测可以增加一项实用的区分:一类问题的决定性证据已经送达模型,另一类问题的证据则在处理中被丢弃。对于已部署的系统,两类结果都有意义,却指向不同的问题。前一类有助于发现理解环节的失误,后一类有助于发现理解开始之前的信息筛选问题。这项诊断办法是本文的建议,并非 LongBench v2 已报告的实验结果。

同一个代码仓库还公开了另一项设计。常规思维链(chain-of-thought)流程先允许模型输出最多 1,024 个 token,再单独调用一次模型,要求它在 128 个 token 的上限内给出最终答案。第二次调用的提示包含先前的推理和答案选项,文档本身则被省略。[4] 按本文的理解,中间回复在这里成了一份压缩后的工作记录;凡是在这份记录里遗漏的细节,最终调用也就无从读取。

那些广为引用的百分比说明了什么

论文的常规准确率表中,在直接零样本提示下,GPT-4o-2024-08-06 得分为 50.1%;使用内置推理能力的 o1-preview-2024-09-12 得分为 57.7%。人类基线为 53.7%:参与者可以使用文档搜索工具,每题限时 15 分钟,并在 8% 的题目上选择放弃作答。[1]

在这项比较中,4 个百分点的领先确实存在,说明模型的得分高于采用特定限时流程的人类参与者。这个结论的适用范围止于该流程,尚不足以推及所有工作条件下的阅读能力。两个不同模型之间的比较,也缺少单独识别额外推理时间影响所需的控制条件。这里报告的指标是准确率,延迟、硬件效率和成本均未在这些结果中测量。[1]

后续若要进一步检验,我会固定模型和实际送达的证据,调整推理预算,并保留完整回复。接着,在所有必要证据都能容纳于输入的问题上重复比较。这样更容易辨明,额外计算是否有助于整合已有事实,同时排除模型不同或输入覆盖范围变化对结果差异的干扰。

下一次评测应当保留什么

LongBench 作者公开了代码、提示、数据和文档,让研究者能够逐项检查评测中的选择,其中还包括对第一代基准的中文介绍。[4] 这些材料为审视长上下文能力的各项主张增添了有价值的依据。

评估文档助手时,我会在分数之外,一并保留截断后的实际输入、中间回复和最终答案。我还会抽取少量样本,要求助手给出与决定性段落对应的解释,再由人工核查。仅凭一个正确的选项字母,尚难看出助手是否理解了真正影响答案的那层关系。

项目记录中的那个问题,为这项工作定下了清楚的目标:我们希望助手找回异议,将其与修订联系起来,并解释决定为何被推翻。更大的文档容量,为这些证据留出了空间;证据送达之后究竟发生了什么,还要由评测来确认。

来源

  1. Yushi Bai 等,《LongBench v2: Towards Deeper Understanding and Reasoning on Realistic Long-context Multitasks》,arXiv 修订版 2——作者所属机构、最初实验的常规准确率、模型版本及人类评测流程。
  2. Yushi Bai 等,《LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding》,ACL,2024 年 8 月——第一代基准的范围、语言、任务和平均输入长度。
  3. Z.ai / LongBench 团队,官方 LongBench-v2 数据集——题目数量、语言、上下文长度、任务类别及数据记录格式;访问日期:2026 年 9 月 22 日。
  4. THUDM,LongBench 代码仓库,提交 2e00731——发布历史、pred.py、prompts/0shotcotans.txt 及 LongBench/README_ZH.md;公开的推理流程与中文第一手文档。
  5. Lining Huo,《Night View of the West Library in Tsinghua University》,2022 年 11 月 30 日——照片原图及来源信息,Wikimedia Commons,CC BY-SA 4.0。
Previous VisuLogic 分数攀升,遗漏的视觉细节更显重要 Next VoxCPM2 让合成声音有了多种起点

Recommended In ai china

Matched by subject and format