8 月 25 日 10:23(UTC),AReaL 项目发布了 2.1.0 版本。其中影响最深的一项改动乍看像是回头:2.0 将强化学习拆分成独立的训练、推理、智能体和权重更新服务之后,2.1 又能借助 AWEX,把 actor 与 rollout 工作放回同一组 GPU 上。[1][2]
模块化方向并未改变。这里区分的是逻辑分离与物理放置。训练与推理依旧承担不同职责,使用各自的接口和权重版本;当 GPU 需求交替起伏、共享硬件更合算时,运维者可以将二者共置,当规模扩展与故障隔离更受重视时,也可以继续分开部署。2.1 还为 AReaL 基于 HTTP 的 Ray 调度器加入分组共置,支持 Qwen3-VL 走原生 AWEX 共置方案,并为采用 AdamW 的分离式训练增加 delta 权重传输通道。[1]
部署方式只是此次发布的一半内容。密集的一组修复把输出 token 归到实际提供服务的策略版本,清除会拆散轨迹的重试孤立 completion,保留单例在线奖励,拒收采样证据不完整的数据,在权重更新期间暂停代理 worker,并用管理员密钥保护模型注册。[1]这些条目看上去属于日常维护。在在线 RL 中,它们决定梯度所依附的经验是否可信。
因此,如实描述这次发布,重点比速度宣称更明确。AReaL 2.1 让 7 月的服务架构更便于部署,也让学习记录在内部更加一致。它没有公布 2.1 端到端基准,无法据此确认共置在某项具体工作负载上速度更快、成本更低或稳定性相当。项目自身研究议程所描述的、受治理的“自演化智能体”循环也仍未完成。[1][4]
2.0 拆开各项工作,2.1 把物理放置变成可选项
最初的 AReaL 系统着手解决大型模型强化学习中的 GPU 闲置。rollout 生成不用等待训练,训练也不用等待生成时间最长的答案,二者改为异步运行。新的正确性难题随之出现:同一个训练 batch 里会混入由多个较旧策略采样的 token。AReaL 记录策略版本,限制数据陈旧程度,并调整 PPO 目标函数,把生成每个样本的行为策略纳入计算。[6]
在作者控制条件下开展的数学与代码实验中,使用相同数量 GPU 时,该系统报告的训练速度最高达到同步系统的 2.77×,最终表现持平或有所提高。这组数字来自早期 AReaL 评测设置,并非对 2.1 新增放置模式的测量。[6]
7 月 1 日发布的 2.0 版本把这套异步引擎拆成四类服务:训练、推理、智能体和权重更新。它增加统一的命令行入口,并给出将 Hermes 和软件工程智能体接入训练循环的示例。[2]智能体可以保留自己的规划器、工具、记忆与 sandbox,只需把常规模型调用转向 AReaL 管理的端点。服务会采集 token 级交互数据,再将已完成且带有奖励的 session 送入在线策略训练。[4][5]
拆分之后,各部分更容易替换,但每个进程究竟运行在哪里仍需另行安排。独立的训练与 rollout 集群可以依照各自负载配置规模;当一边繁忙、另一边空闲时,也会留下闲置显存与算力。共置旨在收回这部分余量,同时让软件继续以多个独立进程运行,保留清晰的服务划分。
一个 GPU 池、两套模型布局,AWEX 居中衔接
训练与推理保存模型的方式可以不同。actor 端会采用一种并行布局并保有优化器状态,rollout 引擎则会为了快速生成,以另一种方式切分权重。新策略在二者之间流转时,还要处理 checkpoint 复制之外的布局转换。
AWEX 是 InclusionAI 开发并由 AReaL 使用的权重交换项目,它将这次交接拆成训练侧的 writer、推理侧的 reader,以及帮助双方制定确定性传输计划的 metadata service。其公开设计同时支持共置与分离部署,可以在训练和推理布局间转换,并且只传送接收 worker 所需的权重分片。[3]
AReaL 2.1 把这些能力落实为几条具体运行通道。此次发布增加基于 AWEX 的 actor-rollout 共置、Ray 下的分组共置、原生共置通道中的 Qwen3-VL 支持,以及训练与推理分离时的 AdamW delta 传输;AWEX 依赖也升级到 0.8.1。[1]整体思路保持一致:维持服务契约,再由调度器决定各服务是共享一台机器、一个 GPU 分组,还是只共用一条权重传输通道。
缺少的证据同样重要。AReaL 发布说明没有提供成对对照表,未比较分离与共置运行的实际训练时长、显存峰值、权重同步延迟、轨迹陈旧度或最终任务奖励。[1]AWEX 自己的仓库报告了更大规模下的快速同步,但那属于 AWEX 项目自身的主张,并非 AReaL 2.1 的实测结果。[3]在同条件对照实验公布之前,共置只是一种已经可用的放置方案,尚无普遍占优的实证。
那些安静的修复守住学习记录
在线 RL 对证据链的要求比普通模型服务严格。每条响应都要对应生成它的确切策略;采样所得 token 与 log probability 必须完整;奖励要归入正确的 session 或 group;一次请求重试只能对应一份一致的训练记录;worker 要等权重切换完整结束后才能继续服务。
2.1 触及了这条链上的每一环。[1]
服务版本修复十分重要,因为 AReaL 的异步目标函数会比较当前策略和轨迹背后的行为策略。若把输出 token 记到控制器所持的版本名下,偏离提供服务的 worker 实际加载版本,重要性比率就会使用错误的分母。拒收不完整证据也遵循同样的逻辑:丢弃畸形样本的风险更低,可以防止缺失采样 metadata 的记录被当作有效经验。[1][6]
重试清理处理的是一种更常见的分布式系统故障:服务器已经生成 completion,智能体 SDK 却在此后超时,继而对同一个 prompt 发起重试,最终只使用两个答案中的一个。如果孤立结果被单独导出,或两个 completion 拆开了本应完整的一次 session,训练器看到的就会是一段用户从未实际经历的历史。AReaL 2.1 现在会丢弃这些重试孤立结果,并让版本 2 通道也执行同样的清理。[1]
奖励保留同样是实质问题。此次发布修复了单例在线奖励丢失的情况,还增加分组奖励归一化控制,以及能够感知拒收情况的 token 和 log-probability 统计。[1]奖励是否代表真正的成功,仍取决于信号本身;运维者定义信号之后,系统则会按正确的分组规则保留其归属,避免奖励被悄然转移、抹除或归一化。
安全修复也属于同一类成熟度改进。/register_model 现在要求管理员密钥,从而封堵控制端点上的一条服务器端请求伪造通道。[1]模型注册表若能被未经认证的调用者操纵,问题就超出了普通 API 缺陷:学习循环所信任的计算平面和数据平面都会面临被改道的风险。
更清晰的策略更新循环,只覆盖演化的一条分支
AReaL 2.0 技术报告为“自演化”划出了一条有用的界线。报告提出三个更大的组成部分:标准轨迹协议,用来携带观察、行动、延迟奖励、版本、来源和训练资格;企业数据代理,在支持 replay 的同时对记录做脱敏和隔离;控制平面则要判断一次失败应当触发记忆写入、skill patch、prompt 或工具 schema 编辑、模型更新、回滚,还是不采取行动。[4]
作者明确把 AReaL 2.0 描述为其中一个分支的原型:在线更新策略模型权重。完整的轨迹治理、counterfactual replay、tenant-aware 隐私保护,以及在多种干预方式之间自动选择,当前版本都尚未覆盖。[4]2.1 加固了这条分支,原有界线依然存在。
这个区分可以避免类别错误。确定性采样能让交互复现,底层数据是否有资格用于训练仍由治理条件决定。准确的策略归属能让更新在数学上自洽,更新能否通过安全回归测试仍需另行验证。经过认证的模型注册端点能抵御一种针对控制平面的攻击,至于哪些团队的轨迹可以改变共享模型,仍要由权限规则决定。
下一项证据应是端到端放置基准
一项有说服力的 2.1 评测,应在相同模型、工作负载、硬件预算和奖励设置下,对比分离与共置的 actor-rollout 运行。报告内容应包括有效工作吞吐量、GPU 显存峰值、卸载与权重同步时间、被拒收或已经陈旧的轨迹、重启恢复情况,以及最终的留出任务质量。在线模式还应注入重试和延迟奖励,再证明导出的轨迹正是智能体实际经历的那一条。
证伪条件很直接。共享放置若只是把 GPU 闲置换成卸载停顿、显存压力和更长的权重切换,AReaL 的逻辑分离思路仍然成立,2.1 的共置论点则会失去支持。若同一服务图能够在分离与共置硬件之间迁移,同时保留准确的策略归属、完整的奖励和最终学习质量,这次发布所证明的就会超出速度技巧:软件边界与物理拓扑可以解耦的强化学习系统。
放在中国 AI 技术栈中,这才是值得持续观察的信号。前沿竞赛涵盖的远不止新模型发布。AReaL 2.1 表明,蚂蚁集团、香港科技大学和清华大学相关团队的系统研究正在深入一个较少受到关注的环节,检验在线智能体经验能否转化为可靠的训练数据。[4]
来源
- AReaL 项目,“v2.1.0”发布说明(2026 年 8 月 25 日)——AWEX 共置、Ray 资源放置、模型支持、奖励与轨迹修复、版本归属、代理加固,以及 2.1 的完整变更列表。
- AReaL 项目,“v2.0.0”发布说明(2026 年 7 月 1 日)——四服务架构、统一 CLI、Hermes 在线 RL 示例和软件工程工作流,它们共同构成 2.1 的基础。
- InclusionAI,“AWEX”仓库与技术概览——writer、reader、metadata service、布局转换、分片传输,以及共置和分离两种权重同步设计。
- Ran Yan 等,《Next-Generation Agentic Reinforcement Learning Systems Enable Self-Evolving Agents》,arXiv:2607.01120v2(2026 年 7 月 2 日)——AReaL 2.0 原型设计、蚂蚁集团/香港科技大学/清华大学的作者单位、三支柱治理方案和明确的范围限制。
- AReaL 项目,“Online RL Training”文档——session gateway、token 级采集、奖励分配、轨迹导出和异步权重更新流程。
- Wei Fu 等,《AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning》,arXiv:2505.24298v5(2026 年 3 月 2 日)——最初的异步架构、行为策略版本记录、陈旧度控制、评测设置和已报告加速比的适用边界。
- 36Kr English,“What will define AI? AReaL head Yi Wu points to reinforcement learning”,由 KrASIA 发布(2025 年 12 月 3 日)——吴翼专访,以及他与斯图尔特·罗素合影的来源页面。