在 QualBench 认可模型选出的正确选项之前,论文作者先做了一项更反常的测试:他们只把一道职业考试题的前半段交给 Qwen,让它补出缺失的文字。补全文本很少与原题相似,答题准确率也随之大幅下跌。随后,研究者又检验了另一种设想——五个模型共同投票会比单个模型更明智——结果群体输给了其中表现最强的成员。[1]
这两项负面结果让 QualBench 比再添一张排行榜更有价值。它们追问正确答案究竟从何而来:模型认出了泄露的题目,提示本身给出了知识,集成模型达成了共识,还是模型理解了相应领域?该基准收录安全生产、消防安全、土木工程、石油与天然气、经济与金融、银行与保险六个领域的 17,316 道中文题目。在论文报告的实验中,Qwen2.5-7B-Instruct 以 75.26% 的准确率领先,GPT-4o 为 61.61%。[1]
这些职业资格材料让本地法规与技术知识进入可观察范围,也让两项探查方法自身的限度变得重要。无法还原原题的准确措辞,仍然排除不了模型接触过语义相同内容的情形;由能力参差的模型共同投票后得到低分,也不足以裁定模型协作的成败。截至 2026 年 8 月 15 日,论文、数据集托管页和公开代码仓库留下的核验线索仍未对齐:来源资格考试的数量说法不一,单道题目没有来源日期或考试标识,代码仓库中的运行脚本也与已发表的评测协议不符。[1][2][3]
图片背景:封面展示的是武汉市应急管理部门于 2026 年 3 月 5 日组织的一场真实安全生产培训讨论。课程把法律讲解与隐患排查、劳动者保护及管理人员提问结合起来,呈现了只看答案的基准无法复现的实际工作环境。[6]
从课堂学科走向受监管职业
更早的中文评测套件已经表明,本地化的范围远超翻译。以 C-Eval 为例,它把选择题分布在 52 个学科和四个层级中,覆盖从初中到专业学习的阶段,用来检验模型能否提取并推理中国教育背景下表述的知识。[5]
QualBench 改变了评测的重心。一道银行题的答案会取决于哪个机构发行人民币,一道安全题的答案则会落在中国法规或技术标准的具体措辞上。论文附录覆盖注册安全工程师、消防设施操作、造价工程、天然气安全、反假货币知识和银行法等材料。[1] 中文书写只是表层,正确答案还会取决于中国的制度安排。
这是实质性的推进。人力资源和社会保障部 2021 年公布的国家目录说明了原因:中国正式区分准入类与水平评价类职业资格,指定实施部门,并随着职业和监管变化修订目录。2021 年版目录包含 72 项职业资格,也调整了此前的 2017 年版。[4] 面向受监管工作的模型除了通用语言能力,还需要识别适用地区、文件版本和生效日期。
同一组事实也划出了 QualBench 的第一重范围。论文称源试卷的时间跨度最长达到十年,公开数据行却只给出 ID、题型、宽泛领域、问题、答案和解析,没有标明来源考试、年份、依据文件或版本。[1][2][3] 一旦规则发生变化,评测者便难以可靠地区分模型错误与过期的标准答案。本地化数据缺少出处时,可以衡量模型与数据集是否一致,却不总能说明模型掌握的知识是否仍然有效。
六个领域,安全题占去大半权重
数据构建流程从 31,841 组问答开始,这些内容经光学字符识别从 PDF 中提取。作者剔除了依赖非文本信息的题目,通过相似度匹配与人工筛查去除重复题,再由每个领域的两位专家核对相关性与完整性。最终数据集包含 9,538 道单选题、3,710 道多选题和 4,068 道判断题。[1]
从总量看,这套数据横跨多个领域,权重分布则远不均匀。安全生产贡献 6,520 道题,消防安全另有 3,401 道题,两者合计约占语料库的 57%;银行与保险只有 1,436 道题。论文称这种不均衡是有意安排,因为以往基准对安全领域的覆盖不足。[1]
有意设置的不均衡既有编辑上的理由,也会带来统计影响。这里的总分对安全知识格外敏感,把它当作六个行业能力的均衡估计会产生偏差。分领域结果更适合作为核验依据,部署团队还应按照模型预期承担的实际工作重新设定权重。
题目清单中还有一处细小却醒目的分歧。同行评审论文多次写明 24 项资格考试,代码仓库在提交 ca88e81 的 README 中则称 26 项国家资格考试;公开数据又没有来源考试字段,无法据此核对数量。[1][2] 这 17,316 道题依然可用,但发布方需要补上一份带版本的来源清单,覆盖范围的说法才经得起审计。
一次实验的排行榜,距离全国性排名尚远
论文对模型比较所用的若干设置交代得相当具体。本地部署的模型运行在一块 A100 GPU 上,GPT 系列模型则通过 API 调用。每个模型都会看到一道附带解题过程的示例题,并按要求给出答案和解析。生成参数为温度 0.5、top_p 0.9、最大长度 1,024 token;每个模型重复推理五次,最后取准确率和 F1 的平均值。[1]
在这组实验条件下,Qwen2.5-7B-Instruct 的总分为 75.26%。GPT-4o 以 61.61% 位列第二,DeepSeek-v2-Lite-Chat 得到 51.76%,Llama-7B 得到 30.45%。领先模型内部最显著的差距来自题型:Qwen 的单选题准确率为 80.89%,多选题为 61.17%,判断题为 74.09%。[1]
论文称中国模型的表现始终优于非中国模型,但表中数据无法支持每一组“中国模型—非中国模型”配对都符合这一说法:GPT-4o 的分数高过归入中国模型一组的五个模型中的四个。就接受测试的模型快照而言,Qwen 的领先确实存在,其成因却没有被单独分离。模型家族、训练数据组合、参数量、指令微调、API 版本和提示词随着参评模型一同变化,彼此没有分离。[1]
提示词消融实验让这层谨慎有了具体依据。加入“中国专家”角色,并把一道领域示例放入上下文后,Qwen 只提高了 0.82 个百分点,Mistral-7B 提高 5.06 个百分点,Llama-7B 提高 8.47 个百分点。这些结果表明,本地化提示方式会改变测得的表现;单凭这组证据,还无法认定模型来源本身决定了排行榜次序。[1]
鲁棒性检查回答的问题比标签更窄
QualBench 包含两项值得肯定的数据污染探查。打乱答案选项后,Qwen2.5-7B 的准确率从 74.78% 变为 74.45%。另一项测试从中抽取 1,020 道题,只把每道题的一半交给模型,让它尝试重建其余内容;仅有 5.10% 的补全结果达到论文设定的高相似度阈值,答题准确率也降至 29.61%。[1]
在上述补全提示下,这些结果削弱了答案位置被简单记忆、原文易被逐字复述的解释。至于训练数据中是否出现过考试文本、法规、备考资料或语义等价题目,实验没有给出定论。公开职业考试恰属容易在各类备考网站间流传的材料。实验最审慎的结论止于对原题逐字回忆的证据有限;“没有数据污染”已经超出证据所及。
集成模型实验也需要同样的分寸。五个模型的多数投票得分为 59.56%,加权投票为 63.98%,两者都低于 Qwen 单独作答。在这次实验里,把较弱且彼此相关的投票者加入集成,稀释了强模型的表现。结论的适用范围落在这组模型及其权重所采用的聚合规则上,无法由此延伸为模型协作普遍失败。[1]
公开运行脚本采用了另一套协议
发布内容开放到足以接受检查,因此复现上的缺口也格外清晰。代码仓库包含完整的 17,316 行 JSON 文件、打乱选项后的数据集、模型运行脚本、微调代码和保存的评测产物。Hugging Face 副本把所有数据行放在一个名为 train 的划分中,其中含答案和许多解析。[2][3]
然而,固定提交版本中的运行脚本无法直接定义论文表格采用的实验条件。它以 do_sample=False 做确定性生成,输出上限为 50 token,输入截断至 128 token,并且只运行一次。论文采用随机采样,最大输出长度为 1,024 token,并重复五次。README 推荐 H20 GPU,论文报告的则是 A100。脚本也没有固定论文比较所用模型的确切修订版或 API 快照。[1][2]
每套设置都适用于各自的实验,却定义了不同的实验。团队若在今天运行公开脚本,所得数字无法标作表 4 的复现结果。
发布条款同样悬而未决。Hugging Face 元数据和代码仓库徽章标示 Apache-2.0,论文伦理声明却称数据仅限学术研究并禁止商业使用;固定提交版本中没有独立许可证文件来解决这处分歧。[1][2][3] 公司在用这些答案训练模型之前,应等待维护者发布一份权威许可,再据此确认授权范围;单取最方便的材料无法解决现有冲突。
QualBench 能够验证什么
在审慎使用的前提下,QualBench 是一套有力的诊断语料库。它可以揭示模型的银行知识强于土木工程知识、处理多选题时容易遗漏限制条件,或需要本地化的提示背景。它也能为法规与技术语言的错误分析提供材料,而通用学术评测几乎触及不到这些内容。
它覆盖的内容还不足以认证模型胜任受监管职业。数据集剔除了图示类题目,也没有考查开放式案例、工具使用、现场检查、计算过程、不确定条件下的拒答、上报升级或实际行动。武汉课堂的封面照片之所以有用,正因为画面显出了缺失的这一层:从业者针对真实设备、现行法律、复工检查和防护措施提出问题,再把答案带回工作现场。[6]
第二版若要经得起时间,可以保留这套基准对职业领域的关注,同时增补四类核验材料:
- 题目级出处:考试名称、年份、适用地区、依据文件、版本和有效日期范围。
- 冻结的评测清单:确切的模型修订版、提示词、解码设置、硬件、随机种子和逐题输出。
- 受保护的测试通道:公开开发题,再配套持续维护的封闭评测端,防止已公开答案永久充当测试内容。
- 实操任务:开放式回答、文档检索、计算、多模态证据,以及规则缺失或过期时明确弃答或上报升级。
QualBench 的长久贡献,在于提出了一个比“这个模型懂中文吗?”更深入的问题:模型是否理解中国实际工作中的制度语言?这次发布给出的答案值得期待,也有明确范围:它能够评测以考试题形态呈现的那部分制度语言。标准答案止步之处,才是工作的起点。
来源
- Mengze Hong、Wailing Ng、Chen Jason Zhang 与 Di Jiang,〈QualBench: Benchmarking Chinese LLMs with Localized Professional Qualifications for Vertical Domain Evaluation〉,Proceedings of EMNLP 2025(论文、协议、结果、附录、局限与伦理声明)。
- Mengze Hong 等,
QualBench代码仓库提交ca88e81296ecec80ff7bbde1361c50bf0be2cb21(发布数据、README、运行脚本与微调产物;查阅于 2026 年 8 月 15 日)。 - Mengze Hong,Hugging Face 上的 QualBench 数据集(公开数据行格式、单一
train划分、答案暴露情况与页面显示的许可证元数据;查阅于 2026 年 8 月 15 日)。 - 中华人民共和国人力资源和社会保障部,《国家职业资格目录(2021 年版)》公告(2021 年 11 月 23 日;官方目录与修订背景)。
- Yuzhen Huang 等,〈C-Eval: A Multi-Level Multi-Discipline Chinese Evaluation Suite for Foundation Models〉,NeurIPS 2023 Datasets and Benchmarks Track(官方论文集页面;用于对照教育与专业学科评测)。
- 武汉市应急管理局,〈市应急管理综合执法支队送节后安全第一课进创立方产业园〉(2026 年 3 月 7 日;官方报道与封面照片来源)。