OpenClaw-RL: Train Any Agent Simply by Talking
论文链接:https://arxiv.org/pdf/2603.10165
代码链接:https://github.com/Gen-Verse/OpenClaw-RL
摘要
每一次的智能体交互都会产生一个下一状态信号,即用户回复、工具输出、终端或 GUI 状态变化等,这些变化都发生在每次操作之后。然而,现有的智能体强化学习系统都无法将其作为实时在线学习资源进行恢复。我们提出了OpenClaw-RL 框架,该框架利用下一状态信号,通过基础设施和方法论的创新来优化个人智能体。(1)在基础设施方面,我们将现有的强化学习系统扩展到服务器-客户端架构,其中强化学习服务器托管推理 API 背后的策略,用户终端通过 HTTP 协议将交互数据流式传输回服务器。系统通过一个独立的异步服务器,从每个观察到的下一状态中提取两个互补的训练信号:评估信号和指令信号,从而确保信号提取和优化都不会阻塞推理过程。(2)在方法论方面,我们引入了一种混合强化学习目标函数,将两种信号类型统一到一个更新中:指令信号提供更丰富的、token 级别的监督,但数据较为稀疏;而评估信号则更易于获取。为了在师生不匹配的情况下稳定蒸馏,我们提出了一种 overlap-guided hint selection。该方法选择提示,使其诱导出的教师分布与学生的前 k 个 token 最大程度重叠,并结合对数概率差值限制,从而限制每个 token 的优势。应用于个人智能体时,OpenClaw-RL 使智能体能够通过被使用而不断改进,从用户的重新查询、纠正和显式反馈中恢复对话信号。应用于通用智能体时,OpenClaw-RL 是第一个统一真实世界智能体场景(包括终端、图形用户界面、软件工程和工具调用环境)的强化学习框架。此外,我们还展示了下一状态信号在长时场景中的实用性。
1.介绍

由大语言模型(LLM)驱动的智能体系统已被证明能够显著提高生产力,目前已广泛应用于工业领域。智能体使用过程中产生的数据,例如用户回复、工具执行结果和图形用户界面(GUI)状态转换,为改进智能体框架、构建记忆系统以及生成高质量的模型训练数据提供了宝贵的洞察来源。然而,如何利用这些使用数据实时改进语言模型的基础设施和方法仍有待深入研究。
实时学习对智能体模型的有效性取决于基础设施和方法论的精心设计。在基础设施方面,强化学习服务器必须足够灵活,能够与用户多样化且不断发展的智能体框架集成,并且优化过程必须异步运行,以免阻塞推理时间的使用。在方法论方面,算法必须充分利用提取的训练信号,并在整个优化过程中保持稳定性。本文提出了 OpenClaw-RL,这是一个结合了基础设施和算法创新的框架,旨在实现高效稳定的个人智能体在线优化。
我们扩展了现有的强化学习(RL)基础设施,该基础设施通常假设在 RL 服务器上进行批量数据收集,以支持智能体模型的持续学习。在我们的设置中,RL 服务器托管在推理 API 后面的模型。当用户终端查询模型时,生成的交互数据通过 HTTP 流式传输回服务器,并用于在线训练模型。为了在线提取训练信号,我们将下一个状态视为两种互补信号类型的来源:评价性信号和指令性信号。评价性信号由过程奖赏模型(PRM)产生,该模型隐式地对前一个动作进行评分:用户重新查询表示不满意,测试通过表示成功,错误跟踪表示失败。除了评分之外,下一个状态通常还包含指令性信息。例如,当用户说“你应该先检查文件”时,该消息不仅指出响应是错误的,还指出了在 token 级别应该如何更改。因此,指令性信号是从这些下一个状态中提取出来的,作为 token 级别的提示,提供指导而非标量奖励。通过将 PRM 托管为单独的服务器,信号提取相对于策略推出是异步运行的,因此训练信号收集不会阻塞策略推理。
尽管 RLVR 方法仅限于标量奖赏,因此无法将指令信号转换为策略梯度,但 on-policy 蒸馏方法提供了一种替代方案,它允许教师模型在纠正性提示的条件下,为学生模型提供 token 级的监督。事后重标记方法表明,在上下文中添加结构化的纠正信息可以显著改善输出,但这些方法都基于固定的数据集。在同期进行的研究中,Buening et al. (2026) 通过直接提示下一状态信息来改进在线策略,但其中的纠正性提示仍然隐含在提示中,而不是作为显式信号。
这些蒸馏方法由于教师和学生分布不匹配而导致训练不稳定和有效性降低,当纠正性提示质量较低时,这个问题会更加严重。我们提出了一种基于教师和学生分布中 top-k 个 token 重叠的新型提示选择准则来解决这个问题。在候选提示中,我们选择那些其诱导的教师分布与学生分布共享最多 top-k 个 token 的提示,无论是以单个 token 为单位,还是以序列聚合为单位。由于所选教师分布在高概率区域已经与学生分布重叠,因此蒸馏能够在保持 off-policy 重要性比率接近于 1 的同时,提供信息丰富的梯度,从而稳定更新。此外,我们对 token 级对数概率差异进行裁剪,以进一步稳定训练。我们的分析表明,评估信号和指令信号具有互补优势:指令信号比从评估信号中获得的标量奖励更具信息量,而评估信号出现频率更高,因为并非每个下一个状态都包含有用的提示。这促使我们采用结合损失项的混合强化学习目标。
我们首先在 OpenClaw 上进行了主要实验,以验证 OpenClaw-RL 的有效性。具体来说,我们模拟了不同职业用户使用 OpenClaw 进行工作的场景,并评估了模型学习适应用户偏好的效率。我们发现,OpenClaw-RL 在优化效率方面优于记忆和技能进化方法。此外,我们将该算法扩展到通用的智能体强化学习场景,以研究其鲁棒性。OpenClaw-RL 在保持稳定性的同时,实现了比 RLVR 方法更好的优化效果。
除了个性化之外,OpenClaw-RL 还可扩展至大规模通用智能体部署。它基于异步 slime 基础设施构建,支持跨终端、GUI、SWE 和工具调用等多种云托管并行环境,涵盖了最常见的实际智能体部署场景。据我们所知,这是首个将这些多样化的智能体类型统一到单一训练基础设施下的开源强化学习框架。在这些场景下,OpenClaw-RL 实现了强大的优化性能和良好的训练动态,我们进一步证明,在仅靠稀疏结果奖励不足以提供足够学习信号的长时域环境中,下一状态信号尤为重要。
Contributions。
- Infrastructure for real-time personal agentic RL。我们将现有的强化学习基础设施扩展到服务器-客户端架构,支持从已部署的智能体进行持续的实时学习。该系统足够灵活,可以与用户在远程终端上运行的各种且不断发展的智能体框架集成,能够从观察到的下一状态中自动提取两种互补的训练信号:评估信号和指令信号,并且异步运行信号提取和策略优化,从而避免阻塞推理时间的使用。
- Stable hybrid RL objective with overlap-guided distillation。我们提出了一种混合强化学习目标函数,它将评估信号和指令信号统一到一个更新中,充分利用它们的互补优势。我们引入了重叠引导的提示选择机制,该机制选择修正提示,使其诱导的教师分布与学生的 top-k 个 token 最大程度重叠,并结合对数概率差值限制,以限制每个 token 的优势。这些措施共同作用,使 off-policy 重要性比率接近于 1,从而实现高效稳定的优化。
- First unified RL infrastructure for real-world agent settings。OpenClaw-RL 是第一个开源的 RL 框架,它将终端、GUI、SWE 和工具调用 Agent 统一到一个训练基础设施下,并具有云托管的并行环境,涵盖了最常见的真实世界部署场景,并实现了不同 Agent 类型之间的直接比较。
- Comprehensive evaluation across personalization and general agentic RL。我们首先模拟来自不同职业的用户同时使用 OpenClaw 进行训练,结果表明 OpenClaw-RL 能够在大约 10.3 个会话内使模型适应每个用户的偏好,其效率高于记忆和技能进化方法。我们进一步将该算法扩展到通用的智能体强化学习场景,结果表明,该算法在保持稳定性的同时,实现了比 RLVR 基线更好的优化。
2.OpenClaw-RL Infrastructure: Unified System for Personal and General Agents
我们将个人 OpenClaw Agent 的自动优化和大规模 Agent 强化学习(适用于通用 Agent,包括终端、GUI、SWE 和工具调用设置)统一到一个框架内。
首先,我们描述了服务器-客户端架构,该架构通过无状态 API 实现与各种不断发展的 Agent 框架的集成(§2.1)。然后,我们介绍了完全解耦的异步流水线,该流水线从下一状态中提取评估和指令信号,而不会阻塞推理(§2.2)。最后,我们展示了同一基础设施如何从稀疏的、基于会话的个人 Agent 流扩展到密集的、并行化的通用 Agent,并支持终端、GUI、SWE 和工具调用等多种设置(§2.3)。
2.1 Flexible Server–Client Architecture for Live Agents
OpenClaw-RL 基于推理 API 服务器-客户端架构构建(图 1)。强化学习服务器通过无状态补全 API 托管策略 ;用户 Agent 框架(可运行于个人设备、终端或云实例)通过此 API 查询策略,并通过 HTTP 将交互数据流式传输回服务器。这种设计对用户端框架的结构没有任何限制:任何能够发出 API 请求的 Agent 都可以作为数据源,并且该框架可以演进、更换工具,甚至完全替换,而无需重新配置服务器。
每个 API 请求都被分类为 main-line turn 或 side turn。Main-line turn 包含智能体的主要响应和工具执行结果,这些构成可训练样本。Side turn 涵盖辅助查询、内存组织和环境转换;它们会被转发给模型,但不产生训练数据。每个请求还包含一个 session 标识符,使服务器能够对来自多个用户的并发交互流进行解复用,并将每个轮次归类到正确的 session 会话中。这种分类使强化学习框架能够精确识别哪些回合属于哪些 session,从而实现仅针对主线回合的定向训练。对于个人智能体,模型通过保密 API 连接,实现私密安全的部署,并且可以同时服务多个用户而不会发生跨会话干扰。对于通用智能体的大规模训练,云托管环境通过相同的 API 连接,无需更改架构即可实现可扩展的并行化。
2.2 Asynchronous Signal Extraction from Next States
OpenClaw-RL 的核心架构原则是完全解耦:(1)策略服务、(2)环境托管、(3)奖赏评判和(4)策略训练作为四个完全独立的异步组件运行,彼此之间没有任何阻塞依赖。模型处理下一个用户请求,同时过程奖赏模型 (PRM) 评判之前的响应,训练器应用梯度更新。权重更新会在预先定义好的边界处推送至服务引擎,因此实时用户始终可以看到一致的策略,无需等待训练完成。每个新的主线请求的消息都包含对上一轮的响应,无论是用户的回复还是环境的执行结果。这构成了上一轮的下一状态信号 。PRM 作为独立的推理服务器托管,负责自动提取信号:给定一个动作 和下一状态 ,它会生成一个评估分数,并在适用时生成一个指令提示。由于 PRM 判断与策略服务解耦,信号提取可以使用更强大的模型,并对每个样本进行多次投票,而不会影响面向用户的延迟。这种解耦使得从实时、异构交互流中进行连续训练成为可能:无需暂停或批量处理任何流以适应其他组件的调度。
2.3 Scalability: From Personal Agents to Real-World Agent Deployment

OpenClaw-RL 旨在覆盖从单用户个人 Agent 到大规模多环境通用 Agent 部署的整个应用范围。对于个人 Agent,其环境是单个用户的设备,交互流稀疏、基于会话且高度个性化。OpenClaw-RL 基于 slime 构建,继承了通用 Agent 可扩展的训练基础架构,并且我们进一步支持跨各种 Agent 场景的云托管环境。托管在云服务上的数百个并行环境生成密集的结构化执行信号流,从而实现可扩展的强化学习训练。
具体而言,OpenClaw-RL 支持广泛的通用 Agent 场景,涵盖了我们开源实现中最常见的实际部署环境(表 1)。Terminal Agent 是计算机使用系统的核心组件:它们高效、易于扩展,并且与 LLM 的文本界面天然契合。GUI Agent 涵盖了 Terminal Agent 无法直接访问的功能,例如可视化界面和基于指针的交互,因此对于更通用的计算机使用任务而言必不可少。SWE Agent 是一类特别重要的编码 Agent,其环境通过测试、差异比较和静态分析提供丰富的可执行反馈。工具调用 Agent 也至关重要,因为外部工具可以提高推理能力和事实准确性。
3.Methodology: Learning from Next-State Signals

我们将来自异构交互流(包括个人对话、终端交互、GUI 交互、SWE 任务和工具调用轨迹)的下一状态信号转换为策略梯度。
我们首先证明下一个状态会产生两种互补的信号类型:评估信号和指令信号,并引入一个混合强化学习目标函数,将它们统一到一个基于单个 token 的损失函数中(§3.1)。然后,我们通过提出重叠引导的提示选择和对数概率差分裁剪来解决提示条件蒸馏的核心稳定性挑战(§3.2)。最后,我们描述了如何将逐步过程奖赏与结果奖赏相结合,以处理长期通用智能体场景(§3.3)。
3.1 Two Complementary Signals and A Hybrid RL Objective
Evaluative signal。给定 ,PRM 被查询 次,每次 query 返回一个介于 之间的投票。我们取多数投票 作为步骤 的标量奖赏。评估信号由构造决定是稠密的:每次评分回合都会贡献一个样本,无论用户的反应是显式的(例如“成功了”)还是隐式的(例如重新查询或通过测试)。
Directive signal。在评估 时,PRM 还需要判断 是否包含有意义的修正:只有当下一个状态确实包含指令内容时,提取提示才有意义;否则,强制提取提示会产生低质量的提示,从而破坏训练的稳定性。如果答案是肯定的,PRM 会将 提炼成一个简洁的提示 ,并将其包含在 中;如果答案是否定的,则该回合不产生指令信号,仅贡献评估信号。提示会以 的形式附加到提示中,并通过在添加提示的prompt下 forward 同一模型来获得教师分布 。最终生成的信号是一个完整的 token 级分布,而非标量,但它也是稀疏的:指令信号仅在 PRM 判断存在有效纠正的词轮子集上触发。例如,用户简短的“谢谢,看起来不错”或通过的测试结果包含强烈的评价内容,但不包含指令内容;而指向特定行的错误跟踪则提供了可用的提示。
Complementary analysis。这两个信号在两个维度上互补。在频率上,评估信号在每个已评分的回合中都可用,而指令信号仅在下一状态包含可提取修正的回合子集中可用。在信息密度上,评估信号将整个回合压缩成一个标量,而指导信号通过教师分布 传递每个 token 的指导信息。RLVR 只能利用前者,而纯粹的 on-policy 蒸馏只能利用后者;两者都无法单独使用 的全部内容。
Hybrid objective。因此,我们将这两个信号合并为针对 token 的单个 token 损失。
其中, 是由标量优势 驱动的标准 PPO 截断 Agent 模型, 是公式 1 中定义的蒸馏损失。默认情况下,。这两个项共享相同的轨迹和相同的策略更新;混合目标函数整合了它们在频率和信息密度方面的互补优势(表 2)。在实验中,我们将证明该混合目标函数能够改进实时个性化和智能强化学习的优化。
3.2 Overlap-Guided Hint Selection

on-policy 蒸馏的一个核心失效模式是教师-学生分布不匹配:当教师分布 将质量集中在学生分布密度接近于零的 token 上时,off-policy 重要性比率会急剧上升,梯度变得不稳定。由于我们是通过对同一模型施加提示 来获得教师模型,因此提示的选择直接控制着不匹配的程度:模糊或不相关的提示会使教师模型与学生模型相距甚远,而精确的提示则能使两个分布在重要的 token 上保持接近。
Overlap as a selection signal。我们利用这一观察结果,基于诱导教师分布的几何形状而非提示长度、教师置信度或其他表面启发式方法来选择提示。给定学生生成的响应 ,令 表示学生在响应 token 位置 𝑖 处的 top-k 个词,令 表示教师在候选提示 下位置 处的前 k 个词。我们定义重叠信号为
该指标用于统计:在加入提示条件的教师模型中,学生模型原本赋予高概率的 token 中,有多少仍然保持高概率。在 个候选提示中,我们考虑以下两种选择方案:
其中,sequence-level 模式每条轨迹选择一个提示,而 token-level 模式则在每个位置选择一个不同的提示。token-level 选项的动机在于,经验 OPD 损失本身就是 token-level 的,而非序列级的(附录 C)。在我们的实验中,两种方案的性能相近,sequence-level 模式在一般的智能体强化学习环境中往往更加稳定。更高的重叠度意味着教师和学生在词汇支持层面已经就响应的形态达成一致,因此蒸馏可以将学生引导至其自身高密度区域内的教师,而不是引导至不熟悉的 token。
Top-𝑘 OPD loss with log-probability-difference clip。一旦选定 ,我们将蒸馏损失限制在词汇子集 内,默认值为 。对于每个 ,我们根据教师和学生之间的对数概率差距形成一个重要性加权优势 ,其中 。
权重 将优势集中在学生实际可能采样的 token 上,而 Δ_𝑣 的裁剪将每个 token 的对数概率差距限制在 处,从而限制了任何单次蒸馏更新的幅度,即使教师在局部上远离学生。对于每个 token 的比率 ,其中 ,蒸馏损失采用裁剪代理形式,并对子集求和:
其中,按照标准的 PPO 截断方法,设定 ,。在重叠度引导下选择 ,可以使监督 token 上的 保持在接近 1 的范围内;与此同时,-clip 会限制优势值的幅度。两者结合起来,对代理目标中的两个因子都进行了约束,从而实现稳定的参数更新,同时又不会丢弃提示信息所携带的方向性信息。
3.3 Step-wise Reward for General Agentic RL
如何在通用智能强化学习中结合结果奖励和过程奖励?
3.3.1 Why Process Rewards Are Vital for Agentic Tasks
在长周期智能体任务中,仅基于结果的奖赏只能在最终步骤提供梯度信号,导致绝大多数回合缺乏监督。过程响应模型(PRM)基于下一状态信号为每个回合分配奖赏,从而在整个轨迹中实现密集的奖赏分配。近期研究为此提供了强有力的实证证据。RLAnything 证明,在图形用户界面(GUI)智能体、文本游戏智能体和编程任务中,将分步 PRM 信号与结果奖赏相结合,其性能始终优于仅基于结果的训练方法。我们在 OpenClaw-RL 中直接基于这一见解:我们的 PRM 使用实时下一状态信号作为证据来判断每个回合,并且我们通过实证(§4.5)证明,这种密集信号对长周期强化学习(RL)设置非常有效。
3.3.2 Integrate Outcome and Process Rewards
在 RLVR 设置中,可验证结果是标准的监督信号。借鉴 RLAnything,我们通过简单地将结果奖赏和过程奖励相加来整合它们,使用 作为步骤 的奖励,其中 由 独立分配。与 GRPO 不同,由于存在分步奖赏,计算优势变得不那么直接。Feng et al. (2025b) 将相似的状态分组,并在每个组内进行标准化。然而,在诸如终端智能体等现实世界场景中,状态并不容易聚类。因此,我们直接将具有相同步骤索引的动作分组,我们在实证研究中发现这种方法是有效的。