MetaClaw-Bench完全教程用30天多日交互数据集测量你的AI Agent学习能力与适应力【免费下载链接】MetaClaw Just talk to your agent — it learns and EVOLVES .项目地址: https://gitcode.com/gh_mirrors/me/MetaClawMetaClaw-Bench 是 MetaClaw 项目内置的AI Agent 学习基准测试套件它用一套 30 天连续多日交互的真实工作场景数据集考察你的 Agent 能否从逐日反馈中持续学习用户偏好并把学到的能力迁移到后续任务中。无论你是想给自家 Agent 做能力体检还是对比 Skills / Memory / RL 等增强策略的效果这份完整教程都能帮你在半小时内跑通校验 → 推理 → 评分 → 报告全流程。一、MetaClaw-Bench 解决什么问题传统评测往往用一次性问答打分但真实使用中的 Agent 面临的是连续多天的工作流今天你纠正了它一次时间戳格式它明天、下周还记不记得MetaClaw-Bench 把这个问题量化了 模拟一个完整的研发场景Orion Tech 团队的 Sprint 工作Agent 扮演内嵌在工程工具链中的专业助理每天day01 ~ day30由多轮任务组成任务类型包括文件检查生成/修改结构化数据文件与多选问答\bbox{}格式作答每一轮答错后系统会注入上一轮的纠正反馈——这正是考察学习能力的关键优秀的 Agent 应该越做越好、错误递减。二、五分钟环境搭建安装与环境变量1. 克隆仓库git clone https://gitcode.com/gh_mirrors/me/MetaClaw2. 安装基准测试工具要求 Python ≥ 3.10cd MetaClaw/benchmark pip install -e .3. 配置必填环境变量最简方式复制官方模板 benchmark/scripts/_env_arg_example.sh 并填入你的凭据。三个必填项变量说明BENCHMARK_BASE_URLOpenAI 兼容 API 地址如https://api.openai.com/v1BENCHMARK_API_KEY对应 API 密钥BENCHMARK_MODEL服务端预期的模型 ID如gpt-5.2 强烈建议同时把METACLAW_ROOT设为项目根的绝对路径避免相对路径在不同工作目录下静默失效。完整变量清单见 benchmark/docs/env.md。三、看懂30天多日交互数据集的结构数据位于 benchmark/data/metaclaw-bench/核心入口是 all_tests.json它定义了 30 个测试场景的完整编排每个场景都标注了所属剧情弧arc和考察的偏好标签preference_tags例如Arc Aday01~day05从首次引入时间戳规范→巩固→跨领域迁移→代码上下文→全面泛化追踪同一偏好 P1 的完整学习曲线Arc Bday06 起引入新偏好 P2如文件命名规范考察多偏好并存时的适应能力。每个场景包含三类资料历史会话记录openclaw_state/agents/metaclaw_agent/sessions/ 下的 JSONL 文件还原用户与 Agent 过去聊过什么每日任务如 eval/day01/questions.json定义当日多轮任务、反馈话术与自动评分命令共享工作区workspaces/shared/ 下有 AGENTS.md角色设定与 SOUL.md工作准则以及当天的原始素材文件。 想快速上手可先用 12 天的精简版数据集metaclaw-bench-small试跑结构完全一致。四、一键跑通完整流水线校验、推理、评分、报告安装后得到metaclaw-bench命令覆盖完整流程详见 benchmark/docs/CLI.md# ① 先校验数据集完整性8 项检查 metaclaw-bench check -p benchmark/data/metaclaw-bench/all_tests.json # ② 一条命令跑完 infer → scoring → report metaclaw-bench run \ -i benchmark/data/metaclaw-bench/all_tests.json \ -o benchmark/resultscheck命令会执行 8 项完整性检查数据集结构、引用文件存在性、会话 ID 一致性、JSON/JSONL 格式、目录结构、工作区身份文件、会话格式、题目完整性——确保你的评测基线干净可靠。跑完后输出目录中会生成infer_result.json逐题结果、scoring.json得分以及report.json/report.md准确率 Token 消耗汇总报告可直接用于不同模型或策略的横向对比 。五、选择实验策略8 种预设脚本对比想量化MetaClaw 各功能到底带来多少提升benchmark/scripts/ 下提供开箱即用的实验脚本自动处理代理启动、端口分配与日志记录脚本SkillsMemoryRL适用场景baseline_run.py———建立无增强的基线分skills_only_run.py✓——仅技能注入memory_run.py—✓—仅记忆抽取/注入skills_memory_run.py✓✓—技能 记忆rl_only_run.py——✓仅强化学习训练rl_run.py✓—✓技能 RLmadmax_memory_run.py✓✓✓全功能压测使用方式统一为python benchmark/scripts/脚本名.py。RL 类脚本额外需要TINKER_KEY、TINKER_MODEL、PRM_MODEL三个变量。每个脚本的完整说明见 benchmark/docs/scripts.md。六、关键细节为什么增强类实验必须串行执行这是新手最容易踩的坑 ⚠️带状态的实验Memory / Skills / RL必须逐日串行——day N1 必须看到 day N 积累的状态记忆条目、技能更新、RL 检查点并发会直接破坏累积状态这类脚本已硬编码-w 1无状态的基线baseline_run.py、proxy_passthrough_run.py各天彼此独立默认-w 15并行大幅缩短等待时间。七、评分机制速览分数是怎么算的file_check 轮执行题目中定义的校验命令如python scripts/check_iso8601.py ...按退出码判定通过与否multi_choice 轮从 Agent 回答中提取\bbox{X}并与标准答案比对反馈注入机制让每轮首轮除外都能看到上一轮的纠正意见Agent 能否听懂批评并改对正是适应能力分数的来源。总结MetaClaw-Bench 用一套 30 天多日交互数据集 一键式 CLI 流水线把AI Agent 学习能力与适应力这件模糊的事变成可复现的量化指标。建议路线先跑baseline_run.py拿到基线再用madmax_memory_run.py全功能对比最后阅读report.md中的准确率与 Token 成本双维度结论——你的 Agent 离越用越聪明还有多远一目了然 【免费下载链接】MetaClaw Just talk to your agent — it learns and EVOLVES .项目地址: https://gitcode.com/gh_mirrors/me/MetaClaw创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
企业数字化 ERP 产品动态
相关推荐
旧 REST 接口封装成 MCP 服务:完整实战指南(TaoToken 统一 Key 接入版) /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/27 19:03:19
手机app网页制作避坑指南:3类方案费用全拆解 手机app网页制作避坑指南:3类方案费用全拆解 域名解析报错404,服务器配置看不懂,SSL证书安装半天没反应?别慌,这种“技术黑盒”带来的焦虑,90%的甲方都经历过。很多老板以为做手机App只是写几行代码,其实背后是一整套从域名备案到服务… · 2026/9/27 19:03:19
3个排查法解决访问不了服务器网站吗最佳实践 3个排查法解决访问不了服务器网站吗最佳实践 网站突然打不开,后台却显示正常,这种“访问不了服务器网站吗”的报错最让人头大。更可怕的是,当你以为只是网络波动时,网站其实已被黑客植入木马,挂上了博彩广告或挖矿脚本。很多站长发现流量暴跌、被用户投… · 2026/9/27 19:40:15
长春绿园网站建设避坑指南 3个免费工具解决没人看难题 长春绿园网站建设避坑指南 3个免费工具解决没人看难题 网站上线三个月,后台访问数据却纹丝不动,这是长春绿园区不少企业主的噩梦。很多人以为建好网站就万事大吉,其实 网站做好了没人访问… · 2026/9/27 19:40:09
2026最新wordpress上传svg报错全解:5个坑别踩 2026最新wordpress上传svg报错全解:5个坑别踩 做网站运营和开发的朋友,是不是经常遇到这种“玄学”问题?代码看着没毛病,服务器配置也没动,结果一上传SVG图标,WordPress后台直接弹出一串英文报错,或者前端显示成一张破图… · 2026/9/27 19:40:09
彻底搞懂 MCP 协议:Agent 工具调用的统一标准,一文讲清原理、架构与落地 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/27 19:39:57
RAG 检索落地避坑:从原理到工程化,打造企业级 AI 知识库的 TaoToken 配置实战 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/27 19:39:45
MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现 简介:这套Matlab仿真工具完整呈现雷达信号脉冲压缩过程,从线性调频(LFM)信号生成、目标回波仿真到匹配滤波压缩处理均有可运行代码支撑,面向电子信息工程、计算机、数学等专业学生,适用于课程设计、期末大作… · 2026/9/27 0:00:01
汕头网站建设制作厂家避坑指南:5大注意事项救急 汕头网站建设制作厂家避坑指南:5大注意事项救急 改个需求建站公司拖一周,这种憋屈事我见得太多了。 很多汕头老板找本地建站团队,签合同前看着方案挺美,一上线就变脸。 今天不聊虚的,直接拆解找 汕头网站建设制作厂家 时的5个核心 注意事项… · 2026/9/27 0:00:01
多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习 简介:基于PyTorch的多模态虚假新闻检测项目完整代码包,面向自然语言处理与计算机视觉交叉方向的开发者、科研人员及毕业设计选题者,解决社交媒体中文本与图像联合识别虚假新闻的问题。系统以BERT预训练模型提取文本语义特征,以Res… · 2026/9/27 0:00:01
MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现 简介:这套Matlab仿真工具完整呈现雷达信号脉冲压缩过程,从线性调频(LFM)信号生成、目标回波仿真到匹配滤波压缩处理均有可运行代码支撑,面向电子信息工程、计算机、数学等专业学生,适用于课程设计、期末大作… · 2026/9/27 0:00:01
汕头网站建设制作厂家避坑指南:5大注意事项救急 汕头网站建设制作厂家避坑指南:5大注意事项救急 改个需求建站公司拖一周,这种憋屈事我见得太多了。 很多汕头老板找本地建站团队,签合同前看着方案挺美,一上线就变脸。 今天不聊虚的,直接拆解找 汕头网站建设制作厂家 时的5个核心 注意事项… · 2026/9/27 0:00:01
多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习 简介:基于PyTorch的多模态虚假新闻检测项目完整代码包,面向自然语言处理与计算机视觉交叉方向的开发者、科研人员及毕业设计选题者,解决社交媒体中文本与图像联合识别虚假新闻的问题。系统以BERT预训练模型提取文本语义特征,以Res… · 2026/9/27 0:00:01