Reef模型权重训练实战如何用Slime与SGLang让你的Agent模型越用越强【免费下载链接】reefContinual learning infra for self-improving agents项目地址: https://gitcode.com/gh_mirrors/reef7/reefReef 是首个面向自我进化 Agent 的开源持续学习基础设施。它把 Agent 推理、反馈、训练与版本化发布连成闭环让你可以配合 Slime 与 SGLang 训练模型权重——用户每用一次 Agent模型就多学一分真正做到越用越强。本文面向新手用最少代码带你跑通一条完整的模型权重训练链路搭建 GPU 训练环境、启动 Slime SGLang 训练栈、接入你的 Agent 上报反馈并观察模型权重热更新上线的全过程。为什么越用越强需要模型权重训练大多数 Agent 部署是静态的模型上线后能力就固定了。如果你希望 Agent 从与用户的日常交互中持续变强就有三条路径可选你的目标学习路径所需条件持续获得更贴合自身需求的模型模型权重训练可训练模型 GPU 训练栈 可用的反馈让 harness 自我进化提示词/规则/技能Harness 优化模型端点 评估器无需训练 GPU做科学发现测试时训练执行环境 正确性检查器Reef 在技术栈中补齐了关键短板推理引擎SGLang 等只会服务流量RL 训练框架Slime 等只会训练权重而 Reef 把两者都管起来还额外提供版本管理与更新期间不中断服务的能力能力推理引擎SGLang…RL 训练框架Slime…Reef承接线上流量✅❌✅训练权重❌✅✅版本管理❌❌✅更新期间持续服务❌❌✅每个学习周期分为四步Serve服务并记录交互→ Observe把反馈匹配到交互→ Grow从合格记录产出更新→ Commit评估选择后发布新版本。本文聚焦其中与模型权重训练相关的主线。一键搭建训练环境GPU 镜像配置模型权重训练需要 Ray、Slime 驱动以及 CUDA 专用构建的 torch、SGLang、Megatron手动装依赖很容易踩坑。Reef 官方做法是把整套训练栈打进一个 Docker 镜像见 docker/Dockerfile.reef 与 docker/README.md# 1. 克隆源码训练示例需要源码安装 git clone https://gitcode.com/gh_mirrors/reef7/reef cd reef git lfs install # Reef 用 Git LFS 管理权重文件必须先初始化 # 2. 构建训练镜像Slime SGLang Ray Megatron 全部预装 docker build -f docker/Dockerfile.reef -t reef . # 3. 进入容器挂载模型目录与 Reef 状态目录 docker run --gpus all --network host --ipc host --shm-size 32g -it \ -v ~/models:/root/models \ -v ~/reef-run:/var/lib/reef \ -v $PWD:/workspace/Reef \ reef bash 参数说明--network host让 Slime 驱动、SGLang 与 Reef 能在 localhost 互相发现--ipc host --shm-size 32g是训练栈共享内存的硬性要求。镜像默认锁定带有 Reef 适配器接收能力的 SGLang 版本LoRA 训练开箱即用。Slime 管训练、SGLang 管推理启动训练部署权重训练时三个角色各司其职详见 docs/user-guide/evolve-your-model.rst进程负责Ray Slime 驱动GPU、优化器、checkpointreef/train/slime_backend/Reef请求、记录、版本发布链SGLang 引擎服务当前权重并捕获训练所需的 token id 与 logprobreef/inference/sglang/每个训练示例都自带完整的serve.yaml按正确顺序拉起进程。以最小的 SAO 示例2 张 GPU、Qwen2.5-1.5B为例export REEF_TOKENreef-local reef serve -c recipes/sao/examples/imo_answerbench/serve.yaml \ --inference.model-path ~/models/Qwen2.5-1.5B-Instruct # 启动约需几分钟等健康检查通过 curl -f http://127.0.0.1:8900/healthz启动前重点检查 recipes/sao/examples/imo_answerbench/serve.yaml 中的三处配置批大小必须一致recipe 的batch-size必须等于training.config.global_batch_size否则优化器批次不完整recipe 与 loss 参数要描述同一目标Slime 驱动会在启动时校验loss 参数lr、eps-clip、use-critic等写在training.options推理后端必须能捕获训练张量权重训练需要推理时精确的 token id、loss mask 和 rollout logprobSGLang 训练后端会把它们记录在response.training中。接入你的 Agent请求 → 回执 → 反馈三步走Reef 的推理端点兼容 OpenAI 与 Anthropic 格式向/v1/chat/completions发请求时带上x-reef-scenario请求头即可新名称会自动创建 scenario。训练闭环的关键在回执receipt机制只需三步发请求模型返回答案的同时Reef 在响应头x-reef-agent-record-id里给你一张本次交互的回执上报反馈调用/reef/report把数值score、文本feedback与回执一起提交上报 schema 见 reef/core/reports/自动训练当合格反馈攒够batch_size条recipe 自动组装训练批次向 Slime 发起一次优化器步进。以 recipes/basic/ 中演示的 Python 客户端为例核心就两句拿到response.headers[x-reef-agent-record-id]再post(/reef/report, {score: 1.0, references: [receipt]})。你的 Agent 代码几乎不用改动——把原来指向模型 API 的地址换成 Reef 即可。观察模型变强版本历史与热更新反馈达标后Reef 会保存 checkpoint、把新权重热更新进 SGLang 引擎并记录新版本——后续推理直接命中新权重全程无需重启服务。查询版本链curl -sS -H Authorization: Bearer reef-local \ http://127.0.0.1:8900/reef/scenarios/你的scenario/releases出现新的training条目即代表完成了一次训练步。另外两个实用技巧LoRA 多 scenario 共享底座加上--megatron-lora-rank32等参数后一个冻结底座可同时训练多个 scenario 各自的 LoRA 适配器。每次发布只含几 MB 的适配器标准 HF PEFT 格式可用transformerspeft在 Reef 之外直接加载因此每个版本都可持久化存档候选评估门禁默认训练成功即发布也可加evaluation段先对导出 checkpoint 做评估不合格则继续用当前版本。实测效果官方示例的学习曲线SAO 示例在 IMOAnswerBench 上训练模型每解决一道题就用更新后的权重去解下一道。SAO 与基线 GRPO(DIS) 的留出集准确率对比显示SAO 稳定训练 99 步后在 AIME 与 IMOAnswerBench 上提升 2~4 分而对照基线后期明显退化TTT-Discover 示例则展示了测试时训练模型在搜索 Erdős 问题解的同时用 LoRA 持续微调自己WB 记录的训练指标如下8×64 搜索网格每格一次优化器步进Erdős 最小重叠问题的最优解随搜索步数持续改善逼近论文目标值OpenClaw-RL 展示了最贴近越用越强的场景从真实对话中学习用户偏好被接受的回复是正样本抱怨的回复是负样本训练全程 Agent 保持在线服务如何为我的场景选训练配方Recipe按任务形状对号入座recipe 实现位于 recipes/官方文档见 docs/user-guide/recipes/配方任务形状信号来源典型资源SAO校验器逐个打分的独立任务流每次尝试一个分数即来即训2 卡起步TTT-Discover对一个难题反复搜索整格 rollout 打分后一次步进2 卡 LoRAOpenClaw-RL无人上报分数的真实交互对话流量 PRM 评审7 卡含 PRM 与学生模型新手建议从 SAO 冒烟配置入手它只用 2 张 GPU、batch_size: 1一条反馈到达就能看到完整训练链路跑通之后再按 docs/user-guide/recipes/sao.rst 把批大小调回论文默认值 128 做正式训练。常见坑速查清单启动失败先查/reef/status它汇报异步训练/预载失败、当前权重版本、推理准入与 checkpoint 状态/healthz只说明 HTTP 服务活着批大小不一致是最常见的配置错误——recipe 的batch_size与 Slime 的--global-batch-size必须严格相等换模型家族要同步改结构参数Reef 只从 HF 配置推导规模与拓扑参数像--add-qkv-bias、--padded-vocab-size这类模型专属标志需手动核对如 Qwen3 无 QKV bias磁盘余量要够checkpoint 预检要求约 16 倍 HF 模型大小的空闲空间反馈到不了检查请求是否带了x-reef-scenario以及报告里的references是否真的包含响应头里的回执。写在最后Reef 把推理—反馈—训练—发布这条最难打通的链路封装成了基础设施Slime 负责在 GPU 上更新权重SGLang 负责把新权重零停机推上线Reef 负责让每一次用户交互都变成下一版模型的养料。搭好一次训练栈之后你的 Agent 就从上线即巅峰变成了越用越强。想继续深入可以从 docs/user-guide/evolve-your-model.rst 的完整训练指南或 recipes/basic/ 的记录型起步栈开始。【免费下载链接】reefContinual learning infra for self-improving agents项目地址: https://gitcode.com/gh_mirrors/reef7/reef创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
企业数字化 ERP 产品动态
相关推荐
MySQL 4.1.18 老32位tar包部署指南:从解压到迁移的避坑实践 简介:这份资源是 MySQL 4.1.18 的 Linux 二进制安装包,面向需要在 i686 架构、glibc23 环境下部署数据库的初学者与运维人员,可用于搭建轻量级应用后台或学习关系型数据库的基础管理。压缩包共 1269 个文件,约 24.48MB,… · 2026/9/25 10:46:52
战网地区修改全攻略:Battle.net.config配置与避坑指南 1. 战网地区修改这件事,到底在改什么先把概念理清楚。暴雪战网的“地区”和“服务器”是两个不同层面的东西,很多人一上来就搞混,结果改了半天没效果,还以为是方法不对。战网客户端在启动的时候,会读取一个本地配置文件… · 2026/9/25 10:46:52
从零搭建AI视频生成网站:架构、队列与成本控制实战 1. 从零搭建一个AI免费生成视频网站,我踩过的坑和最终跑通的方案AI视频生成这个方向,从2024年下半年开始就热得发烫。我身边不少做自媒体的朋友、做独立开发的朋友,甚至一些做传统行业的朋友,都在问同一个问题:有没有一… · 2026/9/25 11:10:58
计算机网络物理层传输介质详解:双绞线、光纤与无线介质的选型实战 传输介质这个章节,很多学计算机网络的同学都把它当成“背名字”的内容来复习:双绞线、同轴电缆、光纤、微波、激光、红外线,六个词背下来就翻页了。但我做了几年网络运维之后回头看,这一节其实是整个物理层里最“落地”的知识点—… · 2026/9/25 11:10:58
智能客服知识库自纠错闭环:转人工审核回流实践复盘 做智能客服的人都有个共同的体会:知识库写进去容易,让它“变聪明”却很难。我们团队最近在落地一条叫“转人工—审核—回流”的自纠错闭环,简单说就是把机器人搞不定的转人工场景做成免费训练数据,经过人工审核后回流到知识库里&a… · 2026/9/25 11:10:58
Sigmoid激活函数深度解析:从数学推导到梯度消失与工程实践 1. 从一个被问烂了的问题说起:为什么还要单独聊Sigmoid每次带新人入门机器学习,讲到神经网络的反向传播,总会有人问:现在大家都用ReLU了,Sigmoid是不是已经可以扔进历史垃圾桶了?这个问题我大概被问过不下五… · 2026/9/25 11:10:52
光模块从原理到选型:TOSA/ROSA、单模多模与光功率排查实战 1. 光模块到底是个什么东西第一次接触光模块的人,多半是被机房那一排排铁壳子插在交换机上、尾巴拖着一根黄线或者蓝线的场景给整懵的。我当年也是,看着师傅把一个小铁块“咔哒”一声塞进交换机笼子,然后拿一根细细的光纤连上去,几… · 2026/9/25 11:10:46
BrowserSkill:基于WebSocket的浏览器会话接管技术 1. 项目概述:这不是一个“插件”,而是一次浏览器会话控制权的移交Tencent BrowserSkill 这个名字乍看像某个腾讯出品的浏览器扩展,但实际它完全不是。我第一次看到这个标题时也下意识点开 Chrome 商店搜了一圈,结果什么都没找到—… · 2026/9/25 11:10:40
创维E900V22D刷机全攻略:S905L3SB芯片兼容性解析与救砖实战 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:31
MQTT协议原理与Broker服务器搭建实战:从Mosquitto到EMQX /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:37