OpenClaw-RL on Reef让你的个人Agent从日常使用中免费学会变强的完整指南【免费下载链接】reefInfrastructure for continually self‑improving agents项目地址: https://gitcode.com/gh_mirrors/reef7/reefOpenClaw-RL是一种面向个人 Agent的强化学习方法而Reef是它为 Agent 持续学习提供的基础设施Continual Learning Infra。一句话概括你不需要标注数据、不需要写奖励函数——Agent 每一次被用户接受或嫌弃的对话本身就是一条免费的训练信号。Reef 在后台默默读取这些信号边服务边更新模型权重让 Agent 越用越懂你。一、OpenClaw-RL 的核心思想奖励信号是免费的传统强化学习最贵的地方是奖励信号要么人工标注要么写规则要么训练奖励模型。OpenClaw-RL 的洞察是——用户的下一条消息就是天然的奖励用户的下一条消息信号含义继续追问、接着推进任务✅ 接受回复满足了偏好抱怨、要求重做、表达不满❌ 拒绝回复踩了雷这意味着训练信号和正常使用完全重合用户什么都不用额外做Agent 就在免费地学习。这是它区别于传统 RLHF 的关键——不依赖离线数据集而是从在线使用中持续采集。在 Reef 中这一切都发生在 recipes/openclawrl/ 这个 recipe 包里官方配方文档见 docs/user-guide/recipes/openclawrl.rst。二、Reef 如何实现流量本身就是老师2.1 会话绑定让每一轮对话可归因Agent 的每次推理请求都会被 Reef 记录下来。处理器从这些已记录的流量中重建出完整会话把用户下一条消息准确绑定到上一轮回复上可靠方式harness 在每次推理请求中携带一个对话唯一的x-reef-tag-session标签Reef 按标签到达顺序绑定各轮兜底方式没有标签时用客户端重发的不断变长的历史做前缀匹配会话重建逻辑在 recipes/openclawrl/sessions.py整个反馈处理器在 recipes/openclawrl/processor.py。值得强调的是Agent 端零侵入——它不知道 Reef 的存在也不上报任何训练数据学习信号完全来自 Reef 侧的旁路观察。2.2 PRM 裁判 后见之明提示hindsight hint当用户下一状态到达、某一轮完成后Reef 调用一个独立部署的PRM过程奖励模型来给这一轮投票这条消息是否表达接受若是接受PRM 还会额外提出一个后见之明提示——一句如果用户当初就这么说模型就会直接给出这个回复的简短指令。PRM 裁判实现在 recipes/openclawrl/prm.py在专用 worker 上独立运行与被训练的模型互不干扰。2.3 双信号训练RL 在线蒸馏OpenClaw-RL 用一个训练目标同时利用两类信号权重可调默认各 1.0RL 项以该轮的原始奖励作为优势函数的 PPO让被接受的行为概率上升OPD 项on-policy distillation把策略拉向带着 hindsight hint 提示的冻结教师模型等于让 Agent 从自己已经成功的经验中蒸馏训练配方loss 族openclawrl定义在 recipes/openclawrl/recipe.py目标函数与损失选择在 recipes/openclawrl/objective.py。每个训练步完成后新权重热切换回推理引擎——下一个会话直接用上新学到的行为服务从不停机。三、实验复现72 场 GSM8K 作业对话仓库内置了一个完整可跑的模拟实验recipes/openclawrl/examples/openclawrl/README.md把论文设定完整复刻学生一个由 Qwen3-32B 扮演的小学生带着72 道 GSM8K 数学作业逐个会话来问老师一个标准安装的 Hermes Agent策略模型是 Qwen3-4B-Thinking隐藏的偏好学生要求作业看起来像人写的——不许加粗、不许列表、不许最终答案这类 AI 味标记但必须展示完整的计算步骤。学生从不说出口Agent 只能从被嫌弃/被接受的反应中学这正对应标题里的从真实使用中学偏好只存在于用户的反应里而不在任何指令中。四、结果14 场会话就用顺了你的偏好上面这张学习曲线来自一次完整记录的运行前 36 场会话红色曲线是累计被接受的会话数持续增长蓝色/绿色曲线是近 10 场会话中仍出现加粗 / 列表的比例——两者都在明显下降虚线处第14场会话达到论文的适应判据连续 3 场通过也就是说从第 1 场会话被嫌弃格式太 AI到第 16 场会话首条回复直接通过Agent 只经历了十几场真实对话就完成了适应。实验结果目录见 recipes/openclawrl/examples/openclawrl/results/。五、动手运行从克隆仓库到一条命令 实验是单主机部署需要7 张 GPU4 卡训练、1 卡推理 rollout、1 卡 PRM、1 卡学生模型。1. 克隆仓库并构建镜像git clone https://gitcode.com/gh_mirrors/reef7/reef cd reef docker build -f docker/Dockerfile.reef -t reef-openclawrl .2. 下载模型# 策略模型 PRM 裁判 hf download Qwen/Qwen3-4B-Thinking-2507 --local-dir ~/models/Qwen3-4B-Thinking-2507 # 扮演学生的 32B 模型 hf download Qwen/Qwen3-32B --local-dir ~/models/Qwen3-32B3. 一键启动bash recipes/openclawrl/examples/openclawrl/run.shrun.sh会构建学生服务镜像、按 recipes/openclawrl/examples/openclawrl/serve.yaml 拉起整个训练栈Reef PRM 学生模型各自占独立 GPU、等待健康检查通过后按顺序跑完 72 场会话重复执行还能从上次中断处续跑。运行细节GPU 分配、断点恢复、WB 曲线导出完整记录在实验 README 中。六、为什么这值得你关注OpenClaw-RL on Reef 展示了一条低成本的 Agent 进化路径信号免费用户反应即奖励无需标注管线Agent 零改造Agent 照常工作学习发生在 Reef 的旁路里在线进化权重热切换服务不中断用一天强一分可插拔整套机制就是一个 Reef recipe配置项批次大小、会话 TTL、PRM 参数等在 docs/user-guide/recipes/openclawrl.rst 中有完整列表如果你的 Agent 也在同样的话被用户纠正了第三次现在你可以让 Reef 替你记住这件事了。【免费下载链接】reefInfrastructure for continually self‑improving agents项目地址: https://gitcode.com/gh_mirrors/reef7/reef创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
企业数字化 ERP 产品动态
相关推荐
LeetCode 41:原地哈希巧解缺失的第一个正数 1. 题目解剖:普通数组里藏着的"送命题"1.1 先看看题目到底让你干什么如果你在刷题列表里看到"缺失的第一个正数"这道题,千万别被"普通数组"四个字骗了——它看着人畜无害,实际是许多大厂面试和 LeetCode 41 的… · 2026/9/26 2:02:29
Pyxel 开源项目教程 Pyxel 开源项目教程 【免费下载链接】pyxel A retro game engine for Python 项目地址: https://gitcode.com/GitHub_Trending/py/pyxel
1. 项目的目录结构及介绍
Pyxel 是一个用于 Python 的复古游戏引擎,其 GitHub 仓库的目录结构如下:
docs/… · 2026/9/26 2:02:23
百度文心4.5海外爆火背后:从飞桨开源到TaoToken统一API接入的完整教程 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 2:35:52
Linux Socket编程预备课:搞懂内核协议栈与TCP状态机制 很多人学Linux下的socket编程,第一反应都是去查bind()、listen()、accept()的函数签名,照着网上示例敲一遍,发现能跑通就觉得自己会了。结果换了个业务场景——服务器要压并发、客户端要处理半包、连接莫名其妙被重置——立刻抓瞎。我在这个行… · 2026/9/26 2:35:52
高并发下Java线程池参数配置与调优实战解析 高并发这个话题,几乎每个Java后端都会接触到。特别是当流量从几千QPS涨到几万QPS时,线程池那些参数就不再是面试八股文里背的公式,而是实打实决定服务生死的关键。我这些年做过不少电商、支付类的接口优化,踩过的坑大多集中在三个… · 2026/9/26 2:35:52
设备无法获取IP问题处理过程:从DHCP到静态绑定的排障实录 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 2:35:46
RK3588部署YOLOv5s实战:环境搭建与模型转换全流程指南 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 2:35:46
醴陵智能锁哪家售后稳妥 在醴陵买智能锁,售后常踩的4个坑,第3个很多人装完才后悔
在醴陵选智能锁,多数人先看价格和功能,真正等出问题才发现售后才是麻烦。门店多、牌子杂,售后稳不稳,往往装完才见分晓。
第一个坑:以为… · 2026/9/26 2:35:46
数据库课后习题答案别硬背:当测试用例集刷,效率翻倍 简介:万常选版《数据库原理与设计》课后习题答案资源,覆盖第2至6章及第9章,适合正在学习关系模型、数据库建模、关系数据理论与模式求精的本科生、自学者作为复习与自测材料。压缩包共7个文件,含3个doc参考答案、2个sql示例脚本、… · 2026/9/26 0:00:21
OpenClaw 替代品?Hermes Agent 踩坑实录:macOS 飞书接入 TaoToken 配置 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 0:00:40
向下兼容与向上兼容:接口设计中的兼容性策略与工程实践 一次版本升级事故,是很多团队绕不过去的坎。线上环境里,服务端明明已经上线了新版接口,老的移动端还在照着旧文档传参数。请求一到网关,校验直接拒绝,用户操作失败,客服群炸了锅,开发群里开始互… · 2026/9/26 0:00:46