设想一个助手正在读取发票照片。它给出了正确的总金额,审核者请它高亮标出这个数字所在的那一行,高亮却落在了收货地址上。答案即便可用,审核者仍得回到页面中寻找依据。一个看起来很小的要求——指出文字在哪里——让“读这份文档”里藏着的另一项任务显露出来。
OCRBench v2 的核心提问,就落在这两项任务的区别上。华中科技大学、华南理工大学、字节跳动和阿德莱德大学的研究人员共同开发了这一基准,考察视觉阅读在同时承担定位、结构理解和推理任务时的表现。[1]
本文所述评估情况的核查日期为 2026 年 10 月 10 日。下文用于诊断问题的结果取自论文 2025 年 6 月 5 日的修订版;在线排行榜则是另一份时间更晚的记录。
答案正确,审核者仍要在页面上寻找依据
初版 OCRBench 收集了 1,000 对经过核查的问答,分为五个部分,涵盖文字识别、文档问答、信息提取和手写数学等内容。项目仓库将 v2 描述为规模更大的双语数据集,包含 10,000 对经人工核验的问答,覆盖 31 种场景,并将 v2 的发布日期记为 2024 年 12 月 31 日。[2] 数据集扩充后,评估者有了更多检验方式:面对同样的视觉材料,当任务要求改变,模型原有的阅读能力还能发挥多少作用。
一项历史结果让这种要求变得具体。2025 年 6 月的论文中,InternVL3-14B 在带位置的视觉问答(VQA-with-position)任务中,回答问题的得分为 78.3%,答案区域的交并比得分则为 12.9%。交并比衡量预测区域与参考区域的重叠面积占二者合并面积的比例。它衡量的是几何关系,因此这里的 12.9% 表示区域重合程度,与“恰有 12.9% 的答案正确”含义有别。[1]
作者报告称,评估开放模型时使用了官方预训练权重、推理代码和默认参数。定位提示词要求将坐标归一化到 0–1000 的范围。这些细节限定了结果的适用范围:测得的是该模型在这套评估设置下的作答表现,其中也包括它按指定格式表达位置的能力。[1]
回到前面设想的发票审核,实际含义很清楚:返回数字与返回可用的证据区域,值得分别检查。即使数字正确,框错行也会拖慢审核。反过来,即使框的位置准确,审核者仍要确认选中的那一行能否回答问题。两项输出各自对应一种信任依据。
任务不同,分数的含义也随之改变
公开的评估代码将这些区别写得很具体。文本定位调用区域重叠计算;表格解析采用 TEDS,衡量表格结构的相似度;整页 OCR 则综合 BLEU、METEOR、F-measure 和一项基于编辑距离的指标。[3] 因此,分数所衡量的相似性各有侧重:文字位于何处、表格如何组织,或转写文本与参考文本有多接近。VQA-with-position 的评分函数本身对答案质量与区域重叠程度取等权平均;论文分别列出的诊断数值,则显出了合并分数容易遮蔽的差异。[3]
设想一张表格,所有文字都能辨认,单元格却被分到了错误的行。转写结果即使保留了大部分词语,产品与价格之间的对应关系仍会受损。解释评测结果时,评分函数也应交代清楚:应用实际依赖哪种能力,评估就需要相应地计分。
这里还涉及语言范围。ModelScope 的 EvalScope 中文文档列出了 300 道英文 VQA-with-position 题目,也列出了手写答案提取、整页 OCR 等中文任务。其列表中的 VQA-with-position 仅有英文子集。[4] 因此,上述历史定位结果应按英文任务结果解读;基准整体采用双语,尚不足以将这项结果视为实测的中文定位得分。
同一份文档还规定在 test 划分上开展零样本评估,并列出可按名称选用的子集,指标的简短标签为 accuracy。[4] 将这一标签与作者按任务编写的评分代码放在一起看,解读百分比分数之前,就有必要核对实际计算方式。[3] 一份有用的报告应同时写明语言、任务、评分实现和输入设置。这些细节能让读者看清,究竟是哪一种阅读能力有所提升。
排行榜的期次与统一评测日期有别
官方私有数据排行榜又带来一层区别。2026.09 这一期的说明写明,它沿用了 6 月的结果,并加入 2026 年 10 月 4 日批次中新评估的五个模型。[5] 因此,这个期次汇集了不同时间的测量结果;仅凭页面标示的期次,尚不能认定榜上所有系统都在 9 月一同重新接受了评估。
判断这些比较是否成立,还需结合具体评测条件,单凭上述记录的来源与时间差异尚不足以下定论。在把名次变化归因于模型进步之前,读者需要核实受测模型的版本、该行结果是否沿用旧值,以及评估设置是否保持可比。同样,论文中较早暴露的弱点可作为诊断案例,其证据范围也止于当时受测的模型;榜上每个新模型的定位能力,仍需各自的评测结果来说明。
对开发者而言,我建议先从自己的一小批文档入手,每次运行都保留两项输出:答案和证据区域。先分别审核,再考察使用者能否将二者配合使用。若应用依赖表格,再加入结构检查。这样便能把 OCRBench v2 最有用的区分转化为应用测试,至于它的总分能在多大程度上预测某个办公室的实际工作表现,则仍需验证。
发票审核者需要一条能迅速回到页面原文的线索。OCRBench v2 让这条线索也成为评估者可以要求、检查和评分的内容。
来源
- Ling Fu 等,《OCRBench v2》,arXiv v2,2025 年 6 月 5 日——第 4–5 节及附录 A.6。
- Yuliang Liu 及合作者,MultimodalOCR 官方仓库——初版基准的组成、v2 数据集,以及带日期的发布记录;访问日期:2026 年 10 月 10 日。
- OCRBench v2 作者,官方评估脚本——eval.py 的任务分派,以及 IoUscore_metric.py 对答案和位置的合并评分;访问日期:2026 年 10 月 10 日。
- 阿里巴巴 ModelScope,EvalScope 的 OCRBench-v2 中文文档——子集清单、评估数据划分、零样本设置和指标标签;访问日期:2026 年 10 月 10 日。
- OCRBench v2 作者,官方项目排行榜——私有数据评估,以及 2026.09 期榜单的结果来源说明;访问日期:2026 年 10 月 10 日。
- 中国地质大学(武汉)计算机学院,院庆论坛报道,2025 年 12 月 23 日——Yuliang Liu 的报告及活动照片。