ai china

VisuLogic 分数攀升,遗漏的视觉细节更显重要

6 条来源 4 条一手来源 已翻译 2026年9月21号

正在加载阅读与收藏统计…
正文
合肥中国科学技术大学入口处被雨水浸暗的路面和石质校名牌。

中国科学技术大学是参与 VisuLogic 研究的机构之一,照片摄于 2018 年 4 月 5 日,展示了这项研究所在的校园环境。摄影:Leiem / Wikimedia Commons,CC BY-SA 4.0;已调整尺寸。[6]

一套视觉谜题基准的角色,10 个月间就有了变化。2025 年 4 月 21 日发表的 VisuLogic 论文研究了依据图像推理的难点。[1] 到 2026 年 2 月 14 日,字节跳动已在 Seed2.0 的中文发布公告中提到这项基准,同时宣称模型面向生产任务的视觉理解能力有所提升。[5] 一项研究测试,就这样成了产品对外展示能力的证据。

理解这一变化,可以对照三类材料:VisuLogic 的实验、MathVerse 中相关的信息控制设计,以及把模型回答转成分数的软件。将它们放在一起,中国多模态 AI 的进展便多了一种观察方法:既看答案是否变好,也看走向答案的过程中,哪些视觉关系得以保留。

设想把一道图形谜题描述给看不到题图的人听。“三个相似图形,各有一个涂色的角”,听起来已经交代了不少信息。但若缺失的细节恰好是这个角随着图形旋转,还是始终固定在页面的同一位置,解题就会受影响。流畅的描述可以留下画面概貌,却遗漏决定答案的关系。

更难的测试走进产品叙述

参与 VisuLogic 合作研究的机构包括中国科学技术大学、西安交通大学、上海人工智能实验室、商汤研究院和清华大学。[3] 其评估代码仓库介绍,数据集包含 1,000 道题,覆盖六大类别、23 个子类别。[2] 这些机构共同推出了测试,也公开了相关材料,供其他团队检查和研究。

2026 年 9 月 21 日查阅的项目排行榜上,Seed2.0 的成绩为 47.4%,PEREA-1.0 为 52.8%,均明显高于论文最初发表时的结果。页面仍保留着一段早期摘要,称大多数模型得分低于 30%。介绍文字与持续更新的榜单,就这样记录着不同阶段的表现。[3]

字节跳动在 Seed2.0 公告中明确表示,相比 Seed1.8,新模型在 VisuLogic 及其他视觉谜题任务上有所进步。公司将更强的视觉理解能力,与生产任务中文档、图表及其他非结构化材料的处理需求联系起来。[5] 这正是值得观察的行业信号:细致的视觉推理正在走出研究演示,被视为处理杂乱信息的能力基础。

这些成绩的适用范围需要交代清楚。47.4% 是公开报告的基准成绩,本文未独立复现,也未确认排行榜后续条目是否采用一致的提示词、推理预算和运行时长。谜题上的表现与可靠处理文档之间,还隔着一项需要单独验证的能力迁移。

人工参考成绩也有具体的测试条件。论文中的 51.4% 汇总了 100 名理工科研究生的答题结果,每人回答 10 道随机抽取的题目,每道题允许用时 2 至 5 分钟。[1] 当排行榜上的模型超过这一分数时,应先检查评估程序,再考虑它能在多大范围内支持关于人类视觉智能的论断。

两种研究设计,追问证据留在何处

在 VisuLogic 的文本模型实验中,GPT-4o 根据题目生成图像描述,指令要求细述图中信息,并将解题留给后续模型。随后,语言模型依据这些描述作答。采用思维链提示时,Qwen2.5-72B-Instruct 得分为 28.0%,DeepSeek-R1 为 26.6%;作者模拟得到的随机作答基线为 24.9%,接近四选一题目 25% 的理论值。[1]

从信息传递的角度看,这项实验检验了描述与解题之间的衔接。解题模型收到的描述若不完整,就无法查看其中漏掉的那个角。失败的结果同时反映了描述质量,以及模型依据描述推理的能力。若要进一步据此断言语言存在某种内在局限,就需要逐一核验描述,确认它保留了解题所需的每一项关系。

MathVerse 由包括香港中文大学(CUHK)和上海人工智能实验室团队在内的研究人员开发,采用了另一种处理信息问题的方式。研究者将 2,612 道视觉数学题各自改成六个版本,调整信息在文字与图像之间的分配。项目页面区分了纯文本、纯视觉等条件,将视觉证据是否可用明确设为一个变量。[4]

这种设计的价值在于,因果关系更容易辨认。保持题目本身不变,只调整信息出现的渠道,有助于看清模型用了哪些证据。题干已经给出相关几何关系时得到高分,与必须从图中辨认这些关系时答对题目,两者所说明的问题有所不同。

这些项目指向一个共同的评估问题,至于各类任务是否都需要相同的架构,仍需另行验证。对文档助手而言,工程上值得追问的是:中间生成的文字描述能否保留下游任务需要的关系。精简的文本表示在什么情况下够用,阅读者在什么情况下需要回到图像,都应在实际任务中检验。

评估软件补上最后一环

模型输出结束后,还有一次信息交接。VisuLogic 的代码仓库介绍了带方框标记的答案提取、预设提取方法,以及借助大语言模型的答案提取器:先将回答归结为 A、B、C 或 D,再与参考标签比对。仓库还记录了项目于 2025 年 4 月 26 日集成到 VLMEvalKit 的情况。[2]

公开的评估代码让这一依赖关系有据可查。如果重新运行评估,我会同时保留完整回答与提取出的选项字母,复查两者不一致的情况,尤其留意那些提到多个候选答案的回答。模型即使推理不佳,仍能选中正确选项;提取失败则会掩盖一份有用的回答。汇总分数无法区分这些情况。

下一步更有说服力的证据,应把这些阶段联系起来。可以让同一个固定的解题模型分别接收模型生成的图像描述和经过核验的描述。另设一组测试,只改变一道谜题中决定答案的一项视觉关系,其余部分保持不变:例如将图形的旋转改成镜像翻转,或移动一个标记但保持标记总数不变,然后检查答案是否相应改变。这些是后续测试建议,并非 VisuLogic 已报告的实验结果。

对开发视觉助手的团队而言,实际做法是保留输入图像、确切的提示词、中间描述、完整回答以及接受评分的答案。排行榜分数上升令人鼓舞。评估者若能指出系统如今捕捉到了哪一种关系、这种关系过去在哪一步丢失,以及这项改进能否延续到用户实际交来的任务中,榜单对产品开发的价值也会随之增加。

资料来源

  1. Weiye Xu 等,《VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models》,arXiv v1,2025 年 4 月 21 日——表 1、第 4.1 节及附录 C.1 详述了图像描述实验和人工基线。
  2. VisuLogic-Benchmark,“VisuLogic-Eval”——官方评估代码仓库,包含数据集范围、发布历史、模型接口及答案提取程序;查阅日期:2026 年 9 月 21 日。
  3. VisuLogic 作者,官方项目页面——机构信息及后续排行榜条目,以 2026 年 9 月 21 日页面显示内容为准。
  4. Renrui Zhang 等,《MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?》——官方项目页面,介绍视觉数学评估的六种信息条件。
  5. 字节跳动 Seed,《Seed2.0 正式发布》,2026 年 2 月 14 日——中文一手公告,讨论 VisuLogic 及生产任务对多模态理解的要求。
  6. Leiem,《Gate of University of Science and Technology of China》,2018 年 4 月 5 日——原始照片及来源信息,Wikimedia Commons,CC BY-SA 4.0。
Previous YuBao:让中文语音 AI 在转写之前先匹配含义

Recommended In ai china

Matched by subject and format