视频助手即使认错了前一个动作,仍有机会猜中某个角色为何离开房间。如果评测逐题计分,这次猜对仍然能得一分。Video-MME-v2 将答案之间的关系也纳入测试:系统能否识别证据、理清先后顺序,并让一组相关问题的答案共同支持一个结论?[3]
开发评判模型所用的工具,是中国 AI 研究的一项重要工作,这个项目正属于这一领域。南京大学的中文教师主页将 Video-MME 系列列为 Chaoyou Fu 的代表性成果。[1] 初版基准于 2024 年 6 月推出,包含 900 段视频和 2,700 道问题,按视频时长和字幕设置分别报告结果。[2] 第二版于 2026 年 4 月 7 日推出,将评估单位改为每组四道问题。[3]
本文依据 2026 年 4 月的论文,以及截至 2026 年 9 月 26 日核查的公开评测材料,讨论这套测试如何运作。至于当前哪个模型领先,则超出了本文的讨论范围。
正确的结论需要前面步骤的支持
双语项目页面中的一道几何题,清楚展示了这套设计。前两问分别求出两个分量的值,第三问结合这两个值计算面积,第四问再推导最终结果。页面给出的依赖关系是 [[1,2],3,4]:开头两个步骤相互独立,后续步骤依赖它们。[6]
这组题目将课堂上常见的一个问题带进了模型评测:学生即使在中间算错了一步,最后也有机会得到预期答案。只给最终答案计分,记录的是一次答对;题目稍作改动,这套解法是否仍然成立,则有待检验。把相关问题放在一起考,便有机会暴露解法中的薄弱之处。
Video-MME-v2 区分两类题组。一致性题组(consistency groups)用相关问题考查同一项能力;连贯性题组(coherence groups)则考查按推理关系相互连接的答案。[4] 这一区分有其必要性:统计答对的数量,与检查答案间的依赖关系,是两项不同的操作。
公开的评分代码给出了具体算法。一致性题组若答对三题,得分为 56.25 分,满分 100 分,计算式是 (3/4)² × 100;按普通准确率计算则为 75%。对于一条简单的四步推理链,只计入首次出错前连续答对的部分。因此,“对、错、对、对”得 6.25 分,“对、对、对、错”得 56.25 分,两者的普通准确率相同。这些数值是按评测器规则推算的示例,与模型实测结果应加以区分。[5]
代码还专门处理了分支关系。起始阶段若有两个独立分支,其中一个出错,另一个仍可得分。若将简单链条的规则套用于所有题组,就会错误描述这套基准的评分方式。[5]
这些分数的解释范围需要明确:它们依据标注者设定的依赖关系,评估提交答案的组合表现,模型内部的推理过程仍然不可见。本文将其理解为一项力度更强的行为测试,用来检验答案能否相互支持;至于每一处依赖关系是否标注得当,仍有讨论空间。
字幕改变了模型收到的信息
仓库提供了几类差异显著的输入方式:固定抽取 64 帧,或每秒抽取一帧;只输入画面,或同时输入画面与字幕;使用直接作答提示,或推理提示。字幕既可合并成一整段文本,也可依据时间戳与视频帧交错排列。[3]
设想一段烹饪视频:镜头对着一口盖上锅盖的锅,声音里有人说火已经关了。文字转录在这里补充了信息,仅凭抽取的画面未必能获得这些信息。再设想另一段视频,厨师说的与画面中的动作相矛盾。此时,各项证据在时间上的对齐就很重要,因为任务要求识别言行之间的出入。这两个例子均为假设,用来说明输入设置如何改变评测所能回答的问题,实际基准中并无这两道题。
4 月的论文报告,思考模式有助于利用文字线索,但在仅提供视频帧时,表现也有下降的情形。论文的“带字幕”条件还包含一项安排:对能够接收原始音频的模型,同时提供原始音频。[4] 因而,这一栏涵盖的输入,比给所有系统统一添加一份转录文本更广。
在这一条件下,分数上升可以来自对语音、文字、图像或它们组合的更好利用。若要将提升专门归因于视觉推理,就需要受控比较。在实际报告中,每次引用分数,都应同时注明模态设置。
醒目的分数也有分母
论文 4 月公布的结果显示,在带音频/字幕的条件下,Gemini-3-Pro 的平均准确率为 66.1%,分组得分为 49.4;人类基线分别为 94.9% 和 90.7。表中列出的 Gemini 采样频率为每秒一帧,其他系统则根据自身的输入限制采用不同的帧数预算。[4]
这些数值揭示的是在这套经过筛选的评测中,模型与人类之间的差距。49.4 分不代表模型能理解任意一批视频中的 49.4%。从准确率到分组得分,数值下降也不代表答错的题目增加:同一批预测结果采用了不同的汇总方式。
分组得分较低,部分原因正是指标设计如此。值得追问的是,它能否区分实际任务中重要的失误类型。例如,助手在整理一份事件报告时,需要先把观察到的动作放进正确的先后顺序,再判断原因。对于这一假设任务,零散的正确答案所能带来的信心仍然有限。
便捷的评测工具也会报告另一种指标
工具层面还有一处区别。EvalScope 的中文集成指南将默认设置描述为零样本评测,以准确率为主要指标。它默认使用公开的视频 URL,也允许改用官方归档的 MP4 文件,并支持设置是否加入字幕。[7]
这种方式便于运行数据集,但文档列出的主要结果,不能直接视为基准论文所用的分组得分。基准自身的独立评测器明确计算分组得分。[5] 在与论文表格比较之前,报告应明确实际产出的是哪一种指标。
本文认为,Video-MME-v2 最有用的贡献,是让相互关联的答案接受一套可供检查的测试。评估某项改进时,应保留模型版本、视频帧选取方式、音频或字幕处理方式、提示词和评分实现的记录,再查看哪些题组有所改善。一个系统补上了缺失的第一步,另一个系统更擅长猜中结尾,两者取得的进展各有含义。
来源
- 南京大学,Chaoyou Fu 的教师主页(中文);用于核对任职机构与 Video-MME 研究系列,核查于 2026 年 9 月 26 日。
- Video-MME 团队,初版基准仓库;2024 年 6 月发布、数据集规模、视频时长分类与字幕评测设置。
- Video-MME-v2 团队,官方仓库;2026 年 4 月发布、分组评测、视频帧配置、字幕对齐与提示词设置,核查于 2026 年 9 月 26 日。
- Chaoyou Fu 等,《Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding》,arXiv:2604.05015v1,2026 年 4 月 6 日;题组定义、表 1、输入条件与思考模式分析。
- Video-MME-v2 团队,独立评测代码,修订版本 28fc3bc;评分函数中的一致性得分,以及链式和分支关系的处理。
- Video-MME-v2 团队,双语项目页面;几何题示例及其列明的题目依赖关系,核查于 2026 年 9 月 26 日。
- EvalScope,Video-MME-v2 集成指南(中文);零样本默认设置、以准确率为主要指标、媒体来源选择与字幕选项,核查于 2026 年 9 月 26 日。
- ScareCriterion12,南京大学鼓楼校区照片,摄于 2018 年 3 月 12 日;Wikimedia Commons,CC BY-SA 4.0。