ai china

AREX 把验证变成下一条搜索查询,开源版本则把智能体循环留给使用方

7 条来源 6 条一手来源 已翻译 2026年8月30号

正文
北京智源人工智能研究院位于北京成府路 150 号的红砖总部大楼,建筑立面高处悬挂着 BAAI 名称标识。

北京智源人工智能研究院位于成府路 150 号的总部。该研究院以开放权重和研究平台的形式发布 AREX;公开模型包覆盖模型层,完整的托管式智能体系统仍需另行搭建。照片由北京时间于 2025 年 1 月 8 日发布。[7]

在北京智源人工智能研究院(BAAI,简称智源)的新研究模型里,search 没有占据首位。最重要的指令是 update_context

这条指令让模型暂时停止累积网页,重新整理当前调查状态:哪些发现已有证据,哪些候选答案已被排除,哪些约束仍待解决,下一步又该搜索什么。在 AREX 中,验证从报告末尾提前到研究过程中,成为连接前后两轮研究的桥梁。[1]

智源于 2026 年 7 月下旬发表 AREX 论文,随后在 8 月 11 日公布这款研究智能体及其公开平台。发布内容包括拥有 40 亿参数的稠密模型 AREX-Turbo,以及总参数量 1220 亿、每个 token 激活 100 亿参数的混合专家模型 AREX-Base。Base 和 Turbo 的权重均以 Apache 2.0 许可证开放。[1][2][3][4]

截至 2026 年 8 月 30 日,这次发布有两点独立价值。论文给出了少见的直接消融结果,用来检验持续维护研究状态能否改善网络调查。开源包也划出了清晰范围:智源发布的是经过训练、能够选择研究动作的模型,代为执行这些动作的完整智能体服务仍需由使用方搭建。

这里的自我改进发生在研究状态中,权重保持不变

AREX 从一种不对称关系出发。寻找一个同时满足多项相互牵连条件的答案,往往要循着微弱线索找上很久;一旦出现候选答案,逐项核验条件会容易得多。模型先在内层研究循环中搜索、访问网页、汇集证据并给出暂定答案。随后,外层自我改进循环会接受这一答案,沿有效轨迹继续处理未解决条件;轨迹噪声过大时,则将其丢弃并重新开始。[1]

自我改进这个说法容易引起误解。AREX 在研究期间保持模型参数不变,反复修改的是当前答案和研究状态。智源社区转载的一篇中文发布报道对此有明确说明。[3] 更贴近其实际运行方式的描述是递归式状态修复

状态修复分为两个层次。在单轮研究内部,update_context 会用一份条理清晰的记录替换不断膨胀的交互历史,其中包括已核验发现、引文、仍在考察和已经排除的候选答案、有效性疑点、未解决约束与下一步计划。轮次之间,外层循环根据暂定答案和模型生成的置信度分数,决定接受、改进或重启。论文将单次评测的上限设为 300 个内层回合和 5 次外层操作。[1]

这套做法比单纯再给智能体一百次搜索更有章法。已经完成的否定性工作会保留下来:遭到证伪的候选答案可以继续留在刷新后的状态中,从而降低模型再次发现、再次采纳它的概率。尚未回答的问题也会保留,让下一条查询直接追索缺失条件,避免含混地索取更多信息。

消融实验比排行榜透露的信息更多

智源报告称,AREX-Base 在 BrowseComp 上的准确率为 82.5%,在 DeepSearchQA 上取得 89.9 F1,在 WideSearch 英文划分上取得 82.0 Item-F1。它还借助工具评测了 GAIA、xbench-2510 和 Humanity's Last Exam。这些都是智源在统一工具接口下给出的第一方结果,可调用 searchvisitupdate_contextfinish,HLE 评测另加 Python。[1]

这张表比较的是整套智能体系统,模型只是其中一环。搜索服务商、页面解析器、提示词、工具预算和停止规则都会进入智能体的最终成绩。论文还注明,部分 HLE 竞品在完整题集上评测,其余未标记者使用纯文本子集。“10B active parameters”描述的是 MoE 模型经路由后实际动用的计算量;在存储、内存流量和部署复杂度上,122B 权重检查点仍有别于 10B 稠密模型。[1][2]

受控的 BrowseComp 消融实验更能说明这次发布的实际贡献。系统既未采用自主上下文更新,也未采用外层循环时,得分为 59.6。在相同的单轮设置中加入上下文更新,得分升至 71.4。以该版本为起点启用外层循环后,准确率进一步升至 82.5。在论文各项条件一致的设置下,完整系统比两种方法均未启用的版本高出 22.9 分。[1]

运行轨迹同样表明,上下文更新本身是一项研究动作,其用途超出了紧急截断。AREX 在 80.3% 的 BrowseComp 案例中调用了这项操作。每次更新时,活跃上下文的平均长度为 25,721 token,远低于评测所设的 128,000-token 上限。检索策略调整触发了 66.9% 的更新,候选答案遭到排除又触发了 13.6%。[1]

同一项分析也给出了一则重要警示。即使采用上下文更新,错误最终输出中仍有 33.0% 落在模型 90–100 的置信分数段。置信度能够把许多失败案例送回研究流程,却无法充当经过校准的真实性证书。生产系统仍应把来源核查和独立验证列为必经步骤;后果重大的工作还要加入人工审查,模型自身的高分不得跳过这些环节。[1]

BrowseComp 衡量持续追索能力,只覆盖研究工作的一部分

BrowseComp 包含 1,266 个问题,答案简短且可以核验,却很难通过普通浏览找到。创建者明确表示,这项基准有意保持不完整:它测试持续追索和创造性导航能力,同时避开歧义、长篇答案等真实用户工作内容。[5] AREX 的成绩有力说明了它在一个高难度研究切片上的表现;至于模型能否自主运行科学研究计划,这项成绩没有给出证明。

一项较新的文献发现基准让这一区别更为具体。AutoResearchBench 要求智能体完成两类任务:根据逐步给出的线索追踪目标论文,或找回符合技术条件的一组未知论文。作者报告称,受测系统中表现最强者在深度任务上的准确率仅为 9.39%,在广度任务上的交并比仅为 9.31%。[6] 该论文没有评测 AREX,因此这些数字不能用作 AREX 的对照成绩。它们所揭示的是另一条证据界线:一般网络搜索题的表现,不能直接延伸为穷尽式文献综述能力。

发布报道划出的适用范围,比“自主研究”这一标签更清楚。目前的 AREX 平台会整理新闻、论文和播客,也允许用户从这些材料出发继续调查。方案设计、代码执行、实验和性能调优则被列为未来扩展方向。[3][4] 现有公开证据支持其作为信息研究智能体的定位;自主科学家所需的实验设计、执行与复现能力,仍未得到证明。

权重已经开放,环绕模型的整套机器仍需另行搭建

模型卡显示,AREX-Base 拥有 262,144-token 上下文窗口,同时提供权重、完整的 BrowseComp 提示词和最小推理示例。其服务部署说明建议从 8 路张量并行起步,可采用 vLLM、SGLang,或其他支持 Qwen3.5 的 OpenAI 兼容服务器。[2] 这次发布包含了相当充足的材料:使用方可以检查提示词契约并自行托管模型,运行时不依赖智源面向消费者的应用。

不过,推理指南有意停在模型生成下一步动作的位置。当 AREX 发出 XML 工具调用时,调用方必须执行真实工具,把助手动作和工具结果追加到对话中,再继续运行,直到出现 finish。[2] 搜索服务商、浏览器抓取器、页面清洗器、引文解析器、凭证边界、重试策略和生产循环,都留给调用方提供。

这层管道工作具有决定性作用。它决定模型能看到哪一部分网络,又能信任哪些证据;也规定恶意网页能否向研究轨迹注入指令、抓取失败是否算作否定性证据、重复来源如何合并、单轮研究可以花费多少时间和资金,以及置信度达到何种条件才会停止运行。即使使用同一检查点,两支团队搭建出的智能体也会呈现显著不同的可靠性。

因此,这次发布更适合被理解为一套附带参考协议的开放研究策略。智源开放了可供检查的决策模型。若要复现论文中的智能体,使用方还需重建模型周围的运行环境,让工具、预算、提示词和轮次逻辑足够接近论文设置,使学习到的行为继续处在其预期条件之中。

有效的试验要把研究状态与最终答案一起纳入检验

内部评测可以采用一组清晰的设置:固定搜索服务商、网页访问组件、token 预算和工具调用上限,再比较三个版本——单条不中断的研究轨迹、带 update_context 的轨迹,以及包含完整外层改进或重启循环的轨迹。这样可以复现论文的核心消融实验,避免把论文分数直接移植到另一套系统中。[1]

每个案例都要保留中间研究记录。检查引用过的证据能否在压缩后保留下来,已排除的候选答案是否在缺少新证据时再次出现,每一项未解决约束是否转化为有针对性的动作,以及实质条件仍待解决时是否调用了 finish。除答案质量外,还要记录工具调用次数、耗时、token 用量和访问失败次数。一个系统若以 5 倍搜索预算换来少量新增正确答案,它学到的取舍便与高效调配投入的系统不同。

最重要的证伪标准很直接。在本地预算一致的条件下,如果上下文更新和外层改进没有提高约束覆盖率或准确率,或者压缩过程经常丢失决定性来源,那么 AREX 论文中证据最充分的方法就没有迁移到这套部署中。此时应修复工具与状态契约;反复强调 82.5 这一标题数字不会改变结果。

AREX 这次发布带来的增量真实存在,范围也比名称暗示的更窄。它让验证从终局裁决变成路由指令:保留已经证实的部分,分离仍缺失的条件,再把缺失条件设为下一个问题。开放检查点能够学会这种节奏,容纳它工作的研究环境仍要由使用方搭建。

来源

  1. Shuqi Lu 等,《AREX: Towards a Recursively Self-Improving Agent for Deep Research》,arXiv:2607.21461v2(2026 年 7 月 24 日)——架构、训练、评测协议、基准成绩、上下文更新轨迹、置信度分析与消融实验。
  2. 北京智源人工智能研究院,BAAI/AREX-Base 代码库(查阅于 2026 年 8 月 30 日)——Apache 2.0 权重、架构与上下文元数据、模型家族、完整 BrowseComp 提示词,以及将工具执行留给调用方的说明:模型卡最小推理指南
  3. 新智元,《智源AREX自主研究智能体:从「盲目搜索」到「验证驱动」》(2026 年 8 月;由智源社区转载)——中文发布报道、基准定位、平台范围,以及递归式改进修改研究状态而保持模型参数不变的说明。
  4. 北京国际科技创新中心,《在关键时刻做对决定,北京智源研究院发布自主研究智能体》(2026 年 8 月 12 日)——发布日期、双循环说明、开放权重发布与当前平台功能。
  5. Jason Wei 等,《BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents》,arXiv:2504.12516(2025 年 4 月 16 日)——1,266 道问题的设计、简短答案核验方式,以及基准作者列明的局限。
  6. Lei Xiong 等,《AutoResearchBench: Benchmarking AI Agents on Complex Scientific Literature Discovery》,arXiv:2604.25256(2026 年 4 月 28 日)——文献发现任务设计,以及各受测智能体报告的准确率与覆盖范围界线。
  7. 李叶,《重磅!智源研究院发布2025十大AI技术趋势》,北京时间(2025 年 1 月 8 日)——本文封面所用智源成府路总部纪实照片的来源页面。
Previous 曦智科技从让光子做运算起步,生意如今落在让光子传数据

Recommended In ai china

Matched by subject and format