ai china

ProcessBench 将第一处错误设为评分目标

7 条来源 4 条一手来源 已翻译 2026年8月5号

正文
阿里巴巴朝阳科技园的玻璃幕墙访客中心,画面中可见阿里巴巴标志、奥运五环、树篱和喷泉。

北京阿里巴巴朝阳科技园。照片由 HoweyYuan 拍摄,采用 CC BY-SA 4.0 许可,经 Wikimedia Commons 获取并按原图缩放。这张背景照片展示的是阿里巴巴办公设施,画面未呈现 ProcessBench 的标注工作。[7]

最终答案可以正确,理由却站不住脚。一个符号错误可以与第二个错误相互抵消,无效的捷径也能偶然落到参考答案上。模型还会在一条从未给出充分论证的推理链后,复述熟悉的结果。若奖励标准只看“正确”,这些过程全都会被视作没有问题。

阿里巴巴通义千问团队开发的 ProcessBench,把这类隐蔽失效直接设为评测对象。给定一道数学题和一份按编号分步写成的解答,验证器需要找出最早出现错误的步骤;整份解答无误时,则返回 -1。基准收录 3,400 个专家标注案例,来自 GSM8K、MATH、OlympiadBench 和 Omni-MATH。预印本于 2024 年 12 月首次发布,论文随后在 2025 年 7 月发表于 ACL。[1][6]

截至 2026-08-05 UTC,更有用的信号来自测试设计,旧模型排名只记录了 2024 年前后、推理预算各异的一批模型快照。ProcessBench 所追问的长期问题是:一个在熟悉的基础数学上训练的验证器,遇到竞赛级题目、逐渐拉长的推理链,以及失去可信度却仍表面合理的最终答案时,能否继续识别细微错误。论文、四个数据分片、prompt 与评测代码至今都可供公开检查。[1][2][3]

图片背景:封面是北京阿里巴巴朝阳科技园的真实照片。它把这项研究与通义千问团队所属的公司联系起来,照片本身只承担机构背景说明;基准分数和作者所在地仍须由研究资料证明。[7]

第一处错误是唯一稳定的目标

ProcessBench 对任务的限定很窄,这正是它的长处。假设第 4 步把变量算错,第 5 至第 8 步则沿用这个错误数值正确运用代数。把后续每一行都标成“错误”,会混淆局部逻辑与整体有效性;把它们标成“正确”,又会忽略它们已属于一份断裂的证明。第一处错误正是评估者最后还能提出明确问题的位置:这份解答从哪里偏离了有效轨道?[1]

这个目标也让两类验证器之间的比较更加公平。过程奖励模型(process reward model,PRM)会为每一步给出正确性预测或标量奖励。通用语言模型充当批评模型(critic)时,则会通读题目和解答,自行推演,再返回最早出错的段落。两者最终都能归一为同一种输出:一个索引或 -1。[1][2]

简洁的任务表面之下,是成本高昂的数据整理。通义千问团队用 12 个开放的 Qwen 和 Llama 模型生成候选解答,模型的规模与能力水平各不相同。由于这些模型使用换行符的方式不一致,团队先去掉原有换行,再让 Qwen2.5-72B-Instruct 按逻辑把每份解答切成内容更完整的段落。重新分段后,解答内容发生变化的案例不到 0.5%。凡是重新分段导致最终答案改变的解答,团队都直接剔除。[1]

人工标注的要求更严。标注者掌握博士级别的数学专业知识,能力测试合格,也拿到了来源数据集的参考解答作为辅助;这份参考资料没有要求他们盲目接受其中某一条解法。每个候选案例先由 3 名专家审核。出现分歧时,团队会依次增加第 4 名和第 5 名专家,直到 3 人收敛到同一标签。若 5 人审核后仍无法得到 3 人共识,该解答便被剔除。大约 30% 的候选案例在此过程中退出数据集。[1]

这套流程还揭示了基准本身的一项重要事实:定位数学错误是一项高难度工作,单靠扩大人手很难低成本完成。面对最难的题目,即使合格专家也需要更多轮审核;无共识过滤还存在删去最难验证案例的风险。论文承认,保留下来的标签仍有出错余地,剔除争议案例也存在让发布集低估底层问题难度的风险。[1]

正确答案不等于无误的推理过程

专家审核开始前,研究团队有意在每个来源子集内抽取数量相等、最终答案分别正确和错误的候选解答。专家标注随后在“答案正确”组中揭示出鲜明的难度梯度:GSM8K 解答中只有 3.5% 含有过程错误,MATH 为 18.8%,OlympiadBench 为 32.2%,Omni-MATH 则达到 51.8%。[1]

这些比例描述的是基准构造样本,部署环境的错误率需要另行测量。样本由明确列出的一组 Qwen 和 Llama 模型生成,并按规则构造为平衡样本,与自然用户流量有别。它们用于难度之间的受控比较;若延伸成“一半高难度数学答案暗中有错”的预测,便超出了样本能够支持的范围。

这种比较仍然重要。题目越难,正确的最终答案就越难证明中间过程有效。强化学习中的可验证奖励常用一条省事的捷径:以答案精确匹配充当推理质量的低成本替代指标,ProcessBench 暴露了它的缺口。错误的推理链若能拿到与有效推理相同的正标签,基于结果衍生标签训练出的验证器,就容易把特定生成器的习惯当成数学正确性。[1]

过程监督原本就是为了修补这个问题。早期一项与人工标注 PRM800K 数据集同期发布的研究表明,在 MATH 基准上,奖励中间步骤可以胜过只监督结果的做法。[4] ProcessBench 沿着这项研究继续追问:当题目离开过程监督曾经表现良好的数据分布后,分步验证器还能否继续工作?

指标同时惩罚批评模型的两种取巧

错误检测器可以朝两个相反方向失败。它可以一律放行,在无误推理上取得很高的准确率,却漏掉所有错误;也可以逢解答便指控,虽然抓到了错误,却让验证器失去接受正确推理的能力。

ProcessBench 分别报告错误解答与正确解答上的准确率,再取两者的调和平均值作为核心“F1”分数。这里的定义有别于通常按类别计算 precision 和 recall 的 F1,它平衡的是错误定位准确率无误解答准确率。模型既要在错误存在时找准第一处错误,也要在整份解答正确时准确返回无错判断。[1][2]

整套评测条件与公式同样重要。标量 PRM 的阈值先在 GSM8K 分片上选定,再原样用于更难的子集,因此阈值迁移也属于测试内容。开源批评模型通常对 8 个采样结果做多数投票;GPT-4o 使用 greedy decoding,o1-mini 受 API 条件限制,只取 1 个样本。QwQ 的最大生成长度也高于普通模型。由于各行推理预算有别,论文表格应按完整设置解读;若要比较模型智能,还需要另行统一预算。[1][2]

单一均值被抄进模型卡时,这层适用条件最容易消失。一份当前的报告应写明数据分片、prompt、修订版本、解码参数、样本数、投票规则、最大输出长度与 PRM 阈值,也应同时发布两个分项准确率。否则,F1 的上升也会来自批评模型整体变得更爱怀疑或更加宽松,单一均值分辨不了这两种变化。

专用验证器在最难题段表现骤降

论文最有启发性的结果,是性能下降斜率发生了变化。Skywork 的 7B PRM 在 GSM8K 子集上得分 70.8,到了 OlympiadBench 和 Omni-MATH,却分别只有 22.921.0。通义千问团队自己的 7B PRM,在剔除重叠题目后直接用人工标注的 PRM800K 数据微调,表现保持得更好:GSM8K 为 68.2,MATH 为 62.6,OlympiadBench 为 50.7,Omni-MATH 为 44.3。[1][4]

以 prompt 驱动的大型批评模型同样有强有弱,其中最强者的性能降幅较小。Qwen2.5-72B-Instruct 在 OlympiadBench 和 Omni-MATH 上分别达到 54.652.2;QwQ-32B-Preview 则分别达到 57.861.3。按照论文的评测设置,专用奖励模型经常落后于通用模型,后者可以先推演候选解答,再指出具体步骤。[1]

把这些结果读成“批评模型胜过 PRM”,会越过证据所能支持的范围。部分小型批评模型或与任务不匹配的批评模型表现极差,专有模型所在的表格行还采用了不同的推理规则。更聚焦的发现是,“过程奖励模型”这一名称本身,无法自动赋予紧凑的标量评分器可靠的验证能力。训练标签的来源、对源模型的依赖、题目难度,以及批评模型自身的推理预算,都会改变“验证”在实际评测中的含义。

这对自动合成的过程标签尤其棘手。一种常见做法,是从某个中间状态采样后续补全,再观察其中有多少能得到正确答案,据此判断该状态是否良好。ProcessBench 指出两条失效通道。标签会变得依赖当前策略(on-policy),反映某个生成器倾向于产生哪些后续内容,数学上是否成立则退居其次。难题又允许错误推理链抵达正确答案,结果频率因此会给 PRM 本应捕捉的过程错误盖上合格印章。[1]

ProcessBench 测量什么,又留下哪些问题

这份公开材料的可用性很高。Hugging Face 发布页列出四个 JSON 数据分片,包含题目、生成器、切分后的步骤、最终答案状态与专家标签。GitHub 仓库公布了批评模型 prompt 和可运行的评测流程。团队据此足以检查评测约定,并用兼容模型重跑,得到比截图更完整的可核验证据。[2][3]

不过,任何新分数都应同时交代三个适用范围。

第一,公开暴露如今已经影响评测。ProcessBench 自 2024 年 12 月预印本发布起便处于公开状态。[6] 2026 年接受评测的模型,其训练语料中已有机会接触这些题目、解答或衍生的基准报告。严肃的主张应把 ProcessBench 与全新私有题目或污染分析配套使用;单独依赖公开测试,无法证明干净泛化。

第二,评测单位采用模型生成的段落,与形式证明中的步骤有所区别。切分让标注成为可操作的工作,同时也会把多个数学动作放进一个标签,或把同一个想法拆到不同标签中。索引正确,只能证明验证器在这种既定粒度上完成了定位。[1][2]

第三,测试领域是英文数学推理。数据卡将发布内容标为英语,测试范围止于数学文本;代码执行、科学实验、浏览器操作、工具调用与中文推理都在范围之外。[3] 后来的 PRMBench 对这一设计形成补充,在 6,216 个案例、83,456 个步骤标签中测试可靠性(soundness)、敏感性(sensitivity)等更细的错误类别。[5] 它与 ProcessBench 的难度阶梯各司其职,也说明“找出第一处错误”和“理解错误属于哪一种类型”是两条独立的评测轴。

对 AI-China 读者而言,这才是 ProcessBench 留下的长期启示。若把它解读为模型能够自我监督的证明,或把它当成 Qwen 与海外系统的永久排名,都会超出其证据范围。它是一项范围清楚的测试,用于观察监督能力能否经受难度迁移。评分落在第一处错误上,光鲜的最终答案退居其后,关于可靠推理的模糊承诺也随之变成可以定位、质疑和重跑的具体失败。

来源

  1. Chujie Zheng 等,“ProcessBench: Identifying Process Errors in Mathematical Reasoning”,ACL 2025 论文集(官方论文页面;任务设计、数据整理、标注、指标、模型设置、结果与局限)。
  2. 通义千问团队,QwenLM/ProcessBench 仓库,commit e802463(公开评测代码、批评模型 prompt、数据加载约定与推理设置;2026 年 8 月 5 日查阅)。
  3. 通义千问团队,ProcessBench 数据集 revision 3bdcd53(四个公开 JSON 数据分片、字段定义、语言标签与 Apache-2.0 发布元数据)。
  4. Hunter Lightman 等,“Let's Verify Step by Step”(arXiv:2305.20050;过程监督与结果监督的比较,以及人工标注的 PRM800K 数据集)。
  5. Mingyang Song 等,“PRMBench: A Fine-grained and Challenging Benchmark for Process-Level Reward Models”,ACL 2025 论文集(官方论文页面;错误类型的补充评测与基准规模)。
  6. Chujie Zheng 等,“ProcessBench: Identifying Process Errors in Mathematical Reasoning”(arXiv:2412.06559;2024 年 12 月的预印本记录与版本历史)。
  7. HoweyYuan,“Alibaba Chaoyang Technology Park”,Wikimedia Commons(CC BY-SA 4.0 来源与许可页面;文章采用这张 2024 年北京实景照片,并在本地缩放)。
Previous 地平线正把座舱与道路装进同一颗芯片

Recommended In ai china

Matched by subject and format