ai china

Hanfu-Bench 要求 AI 让古代服饰走入现代,同时保留朝代脉络

5 条来源 4 条一手来源 已翻译 2026年9月5号

正文
身着色彩鲜艳、融入汉服元素服装的模特走过展台,长裙与宽袖搭配现代鞋履和贝雷帽。

2020 年 1 月 18 日,北京第 32 届 IDO 动漫游戏嘉年华上的一场厂商赞助汉服秀。照片未被纳入 Hanfu-Bench;它呈现了这项 benchmark 试图明确界定的当代造型范围。N509FZ / Wikimedia Commons,CC BY-SA 4.0;尺寸经过调整。[5]

历史服饰的现代化改造,听来容易;一旦把成功标准说清楚,难处便显现出来。新设计要有足够变化,能够进入当代生活,也要保留原有裁制的关键部分,让人仍能从中辨认其文化来历。宽袖是一项具体形制,不能只当作视觉气氛。领、裙、襟、层次与时代归属共同组成一套语法;选错要改的特征,所谓“改造”便成了替换。

Hanfu-Bench 于 2025 年 11 月发表在 EMNLP,把这股张力拆成两项相连的测试。第一,视觉语言模型能否从汉服照片中识别对朝代有区分力的特征?第二,一条从说明文字到图像的流水线能否把这些特征带入现代服装?这项 benchmark 最有用的发现是,识别与再创造各有不同的失败方式,几个看似微小的评测选择也会改变分数的含义;哪一个模型位居榜首,只是表层结果。[1]

衣橱属于当代,即使标签指向历史

Hanfu-Bench 最初收集了 902 套服装。作者从七家汉服零售商收集商品照片,从七部口碑较好的中国古装电视剧截取画面,还收录了某大学汉服社成员提供的照片。经过去重、质量筛选、裁切和标注,最终发布的数据集保留了 496 套服装,共 1,192 张图像。九名熟悉汉服的标注者——四名论文作者和五名社团成员——每三人一组开展工作;只有三人都确认画面清晰、特征可见,图像才会留下。[1][2]

这些来源划定了 benchmark 的解释范围。眼前的 496 套服装来自历史服饰的当代再现:零售商品、影视戏服和爱好者日常穿着;出土服饰、博物馆藏品和年代已有可靠考证的纺织品均不在其中。因此,这项 benchmark 衡量的是模型能否读懂今天汉服领域通行的视觉分类法。考古准确性仍需其他证据确立。

这套分类法依然格外具体。标注者记录三项全局属性——服装类别、适用性别和朝代——以及五项局部属性:袖型、领型、jin(襟,即前襟或衣襟构造)、下装和外衣。“类别”区分传统形制、改良汉服与现代汉元素服装;朝代标签只用于归为传统形制的服装。若三名标注者无法就某一特征达成一致,该项便以“无法确定”(unsure)记录,留在清晰类别之外。[1][2]

作者依照这些标签生成了 1,721 道单图题2,465 道多图题。每道选择题都经过设计,确保只有一个有效答案。二者的差别很要紧:单图题询问一套服装是什么;多图题则可要求找出哪一项晚于唐代,或哪一项具有某种相同的构造特征。前者考察识别,后者要求比较。[1]

82.28% 的成绩中,性别识别占了很大比重

在完整题集上,Doubao-1.5-Vision 位居五个受测模型之首,单图 VQA 为 82.28%,多图 VQA 为 75.95%。GPT-4o 紧随其后,两项成绩分别是 77.69% 和 69.53%。三个开放权重系统 MiniCPM-V 2.6、Qwen2.5-VL-7B-Instruct 和 InternVL2.5 的表现起伏更大,比较多张图像时尤为明显。[1]

这些总分混合了不同能力,不能视作纯粹的历史知识测试。性别题在题目构成中占比高,也是系统最容易作答的一类:五个模型在单图性别题上约为 88% 至 96%,多图版本约为 59% 至 95%。朝代题的表现则分散得多,单图准确率从 42.75% 到 76.81% 不等;相比把朝代、袖型、性别和外衣混在一个总平均里,这一跨度更能说明模型之间的不同。[1]

论文主表针对每个模型,从五种中文角色提示中选取其最佳结果;主表没有固定一条中性指令供所有模型对照。因此,醒目总分代表经提示词筛选后的上包络,各模型并未在同一条提示下作逐项对照。论文其他实验还显示,单图结果随提示措辞波动更大。让模型扮演传统服饰专家,某些属性上的表现甚至会下降;要求逐步推理或说明理由,也没有带来稳定收益。[1] 部署者若要把复测结果当作可比,需完整保存确切的中文提示、模型快照、图像预处理、答案解析器以及各属性分项结果。

模型版本与提示词同样重要。火山引擎 2025 年 1 月的官方公告称,Doubao-1.5-Vision-Pro 在动态分辨率、多模态对齐、细节理解和指令遵循方面得到升级。[4] Hanfu-Bench 测试的正是这一代系统。它的排名是一条带日期的基线;到了 2026 年 9 月,供应商继续沿用“Doubao”“Qwen”或“InternVL”等名称时,对应系统已经超出这份排名的结论适用范围。

比较如何帮助人,汇总表没有说清

为了与人类表现对照,研究人员制作了两个均衡子集,分别包含 160 道单图题和 160 道多图题,八项属性各有 20 道。三名熟悉汉服的评测者和三名非专家完成了这些题目。熟悉汉服的一组从单图的 77.50% 上升到多图比较时的 83.54%;非专家则从 57.92% 上升到 64.58%。受访者表示,比较让他们能够辨出其中的差异,并从前面的题目中学习。[1]

模型没有呈现统一走势。Doubao 在均衡子集上也从 70.00% 提升到 74.48%,GPT-4o 几乎持平。三个开放权重模型全部下降,其中 MiniCPM-V 2.6 从 52.50% 跌至 27.50%。由此看,“多图更难”只是一条方向性的概述:在规模更大、题目构成不同的总表里,每个模型都符合这一走势;一旦在人类对照子集里平衡属性,它就不再适用于每个模型。[1]

人类基线的规模很小——只有六人,分成两组——不足以代表整体“人类能力”。它更适合作为诊断线索:人能把相邻样例临时拼成一堂视觉课,多数受测开放模型却更像是把额外图像当成新增的输入负担,没有把它们组织成比较集合。后续更有力的实验可让同一套服装接受受控对比:一次只改变领型、袖型或朝代,并明确报告难度与干扰项距离。

背景既能提供语境,也能成为捷径

核心数据集去除了无关的背景细节,让服装始终成为判断目标。在一项补充实验中,作者恢复了画面环境。五个模型的整体表现全部提升,全局属性与性别题进步尤其明显,不过部分局部特征的判断反而波动加大。单图题使用中文指令时,结果的一致性也高于英文指令。[1]

两项结果都有价值,解释却各有两条路。电视剧布景、发型、道具或商品陈列可以提供合理的朝代信息,也会让模型只凭周围环境猜“唐”,跳过对服装本身的辨认。英文提示词的差距同样如此:汉语服饰术语能够紧凑地保留某些区别,提示文本本身的措辞质量也会造成差异。要区分知识与捷径,下一轮评测需要按来源分别报告结果——零售商、电视剧和社团照片各自成组——还要加入反事实配对,把同一套服装置于不同背景中。

这项来源拆分格外重要。公开数据集卡向研究评测开放图像与标签,同时把整套资料的用途限定为学术、非商业和仅限评测。[2] 公开代码仓库则展示了单图、多图运行程序和再创作各阶段,流程可供检查。[3] 与封闭榜单相比,整项评测更容易复现;数据集本身定位在测试,未提供一套针对已发现失败的训练方案。

42% 是整条流水线的成绩

第二项任务更具原创性。研究人员选出 50 套视觉特征鲜明的传统服装。GPT-4o 先描述每张源图像,再把说明改写成现代时装概念;这一编辑过程还会把中文说明译成英文,以适配后续系统。随后,InstructPix2Pix、Stable Diffusion 2.1 和 Stable Diffusion XL 1.0 三个图像系统共生成 150 张结果图。五名汉服专家在不知道每张图由哪个生成器制作的条件下,按五分制评价视觉变化、语义等价、自然度、现代适应性、文化传承和吸引力。[1][3]

一张结果图只有在语义等价现代适应性文化传承三项上都至少得到三分,才会计为成功。Stable Diffusion 的成功率最高,为 42%;InstructPix2Pix 只有 8%。Stable Diffusion XL 在传承方面得分较高,部分原因是它对输入改动较少。这项观察直接触及核心取舍:保留传统若等同于少做改动,现代化程度便会下降;现代化若舍掉源服装赖以成立的裁制特征,文化传承也随之消退。[1]

论文案例展示了级联流程如何发生偏移。一套采用直袖的唐代服装,被误写成有宽大、飘垂的袖口;现代化提示又忠实地把这个错误向后传递。最终图像即使看上去完整协调,仍会继承生成前已经引入的错误。GPT-4o 负责视觉描述与说明文字编辑,期间还插入翻译环节,最后再由另一个扩散模型渲染图像,因此 42% 这个比率无法归到单个“汉服模型”名下。它衡量的是一条处于 2025 年技术条件下的完整链路。[1]

随着时间推移,这层适用范围愈发重要。三款受测图像生成器都已无法代表 2026 年 9 月的前沿,流水线也未测试能够检查、修改并解释自身输出的当代统一模型。若按当下技术公平重测,应保留这 50 张源图像和专家评分标准,并逐一报告各次交接处的失败:特征提取、中译英术语、现代化方案和图像渲染。若不逐段报告,漂亮的图像足以掩盖领型丢失,忠实的图像也足以掩盖几乎没有改动的事实。

Hanfu-Bench 以一种富有成效的方式改变了评测问题。文化视觉能力的考察,范围超出模型能否叫出物件名称,还包括系统能否识别哪些特征携带历史信息,能否把这些特征与当代布景分开,又能否在改动其余部分时避免把错误包装成风格。这项 benchmark 尚未完成整套测量,却为它添上了一套衣橱、一条时间线和一项失败条件。

来源

  1. Li Zhou 等,“Hanfu-Bench: A Multimodal Benchmark on Cross-Temporal Cultural Understanding and Transcreation”,EMNLP 2025(数据集构建、提示词、模型与人类结果、再创作流水线和局限)。
  2. Hanfu-Bench 作者,“Hanfu-Bench”官方数据集卡(发布的图像与标签结构、示例、许可和仅限评测的使用条款)。
  3. 香港中文大学(深圳)HLT 团队,“TemporalCulture”官方代码仓库(VQA 运行程序、公开结果和从说明文字到图像的再创作流程)。
  4. 火山引擎,《豆包大模型 1.5 正式发布并全面上线火山方舟》(2025 年 1 月的中文官方发布说明,介绍受测 Doubao-1.5 视觉模型所属世代)。
  5. N509FZ,“People wearing Hanfu at IDO32 (20200118143522)”,Wikimedia Commons(本文所用 2020 年北京活动照片的来源页与出处信息)。
Previous DeepServe 的无服务器前门,通向一台有状态机器 Next 深圳想让 AI 按 token 出海,真正出售的是一趟合法往返

Recommended In ai china

Matched by subject and format