首页/新闻资讯/正文详情

什么是递归自我改进(RSI)?NeoHorse-1-4B 如何搭建「自我进化」Agent 原型

发布时间:2026/9/25 2:52:54 来源:云帆数科 栏目:资讯中心
什么是递归自我改进(RSI)?NeoHorse-1-4B 如何搭建「自我进化」Agent 原型
什么是递归自我改进RSINeoHorse-1-4B 如何搭建「自我进化」Agent 原型【免费下载链接】NeoHorse-1-4B项目地址: https://ai.gitcode.com/hf_mirrors/TokenRhythm/NeoHorse-1-4BNeoHorse-1-4B 是一个约 4B 参数的因果语言模型由 TokenRhythm 基于 Qwen3.5-4B 后训练而来定位为迈向**递归自我改进Recursive Self-ImprovementRSI**的初始原型。它专为文本 Agent 框架Agent harness、工具调用、编码和指令遵循而优化通过「路由框架 能力级反馈」的闭环让模型评测结果直接驱动下一轮训练数据配比。一、先用大白话理解什么是递归自我改进RSI递归自我改进RSI指的是一个智能系统把自己的运行记录、评测反馈转化回自己的训练信号从而越用越强的机制。与传统训练人工标注数据 → 训练 → 结束不同RSI 追求的是一个闭环执行任务 → 记录轨迹与结果 → 评估能力短板 → 调整训练数据 → 更新模型 → 再次回到执行可以把它想象成模型自己给自己出卷、判卷、补课环节传统流程RSI 思路数据来源人工准备、固定来自模型自身执行轨迹评估方式一次性打分持续反馈驱动数据配比迭代方式人工介入模型更新后自动回到框架NeoHorse-1-4B 目前是一个原型它已经打通了评测 → 选择 → 更新的单轮闭环下一步目标是把闭环扩展到连续多轮迭代。二、NeoHorse-1-4B 是什么一句话概括NeoHorse-1-4B 是为Agent 场景工具调用 长上下文执行做后训练的小模型用 4B 的体量验证自我进化路线。核心参数一览详见 config.json属性说明模型类型Agent 原生因果语言模型纯文本输入/输出参数量约 4B基座模型Qwen3.5-4B后训练自该基座上下文长度原生 262,144 tokens可扩展至约 101 万 tokens权重格式Safetensors / BF16注意力结构线性注意力与全注意力混合32 层每 4 层一组值得注意的细节config.json 中layer_types显示它采用 3:1 的「线性注意力 : 全注意力」混合层设计——线性注意力让长上下文推理更省资源这正好服务 Agent 场景下的超长轨迹处理。三、它如何搭建「自我进化」闭环NeoHorse 的 RSI 原型由三块拼图组成3.1 路由框架Routing Harness给任务分诊路由框架像一位调度员维护一个异构模型池分派任务把不同难度的 Agent 任务路由给模型池中合适的成员记录轨迹完整记录工具交互过程与最终结果评估需求估算当前任务分布对各项能力的需求驱动训练用能力级反馈决定下一轮训练混合数据的配比。3.2 训练信号来自执行轨迹而不是凭空生成配套研究探索了两种后训练方法路由引导的课表式 SFTrouting-guided curriculum SFT按能力需求排课程先补短板路由引导的在线策略蒸馏on-policy distillation让模型在自己的执行轨迹上学习同时保留每条回复周围的执行上下文与框架上下文——这是 Agent 能力的关键。3.3 数据质量是闭环可信的前提 再自我的训练也建立在干净数据之上。项目对训练数据做了精确与近重复样本去重评测集去污染结构化校验 六维语义评估子场景级Scene / Goal / Outcome三级标注。闭环效果更新后的模型可以重新进入路由框架执行任务形成「评测 → 选择 → 更新」原型回路把这个回路在多轮次间滚动就是通往完整 RSI 的下一步。四、成绩单10 项基准平均分 64.87提升 5.93 NeoHorse-1-4B 与五款开源模型横向对比摘自 README.md 评测表Δ为相对 Qwen3.5-4B 的提升能力维度基准Qwen3.5-4BNeoHorse-1-4BΔ AgenticQwenClawBench38.4744.686.21 AgenticWorkBuddy Bench24.6234.419.79 AgenticPinchBench71.1977.336.14 AgenticVitaBench21.5032.0010.50 Agentictau2-Bench84.2988.464.17 CodingHumanEval87.2096.959.75 CodingLiveCodeBench v653.7159.435.72 指令遵循IFBench60.3365.335.00 指令遵循IFEval87.0688.351.29 总分十基准宏平均58.9464.875.93可以看到提升最集中的正是Agentic 与 Coding维度——与为 Agent 而生的定位完全一致。评测协议采用 SGLang v0.5.17开启思考模式enable_thinkingtrue部分基准取三次运行结果保证数据稳健。五、本地部署指南两步跑起来 NeoHorse-1-4B 5.1 获取模型权重git clone https://gitcode.com/hf_mirrors/TokenRhythm/NeoHorse-1-4B5.2 用 SGLang 启动官方推荐pip install sglang0.5.17 python3 -m sglang.launch_server \ --model-path /path/to/NeoHorse-1-4B \ --served-model-name neohorse-1-4b \ --host 0.0.0.0 \ --port 30000 \ --context-length 262144 \ --reasoning-parser qwen3 \ --tool-call-parser qwen3_coder启动后通过 OpenAI 兼容接口调用即可curl http://localhost:30000/v1/chat/completions \ -H Content-Type: application/json \ -d {model:neohorse-1-4b,messages:[{role:user,content:你好介绍一下你自己}],max_tokens:512} 小提示若显存紧张调小--context-lengthvLLM 用户可改用vllm serve并开启--enable-auto-tool-choice --tool-call-parser qwen3_coder参数细节见 README.md。六、仓库文件速览下载后都能用上什么文件作用README.md模型卡亮点、评测、部署指南都在这里config.json模型结构配置层数、注意力类型、上下文长度等chat_template.jinja对话模板定义系统/用户消息与思考块的拼装方式tokenizer.json / vocab.json / merges.txt分词器三件套词表 248,320model.safetensors.index.json权重分片索引model-00001-of-00002.safetensors / model-00002-of-00002.safetensors模型权重BF16两个分片LICENSEApache 2.0 许可证含上游 Qwen 版权声明七、写在最后为什么值得关注✨NeoHorse-1-4B 的价值不在于4B 模型又多了一个而在于它给出了一个可复现的 RSI 原型路由框架记录执行轨迹、能力级反馈决定训练配比、更新模型回到框架继续执行——闭环的每一环都是工程上可落地的。对于想理解「自我进化 Agent」如何从概念走向实践的新手来说这个项目提供了一份从数据质量、后训练方法到评测协议的完整参照。下一步把「评测 → 选择 → 更新」的闭环滚动到连续多轮迭代才是递归自我改进真正的考验。关注该项目见证 RSI 路线的持续演进。【免费下载链接】NeoHorse-1-4B项目地址: https://ai.gitcode.com/hf_mirrors/TokenRhythm/NeoHorse-1-4B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关推荐

网络安全入门学习路线:从零基础到渗透测试实战
网络安全入门学习路线:从零基础到渗透测试实战

1. 先给“黑客”祛魅:这个行当到底在做什么经常有人私信问我同一个问题:“我想学黑客,能不能教我怎么黑别人的网站?”说实话,我第一次接触网络安全的时候,也是带着这种好奇入坑的。但等你真正进了这个圈子&… · 2026/9/25 2:52:47

C#实现欧姆龙PLC FINS通信:绕过地址偏移、字节序与帧头校验
C#实现欧姆龙PLC FINS通信:绕过地址偏移、字节序与帧头校验

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 2:52:35

HHO-LSBoost多输入回归预测:哈里斯鹰优化与Matlab实现
HHO-LSBoost多输入回归预测:哈里斯鹰优化与Matlab实现

做预测建模这些年,我最深刻的体会就是:调参的功夫往往比跑模型本身还多。尤其是用集成学习做回归预测时,弱学习器的数量、学习率、树深这些超参数,直接决定了模型的上限,可手动一个个试又费时又费力。所以当我尝试把哈… · 2026/9/25 2:52:35

Moto CodeBuild 模拟实战:在测试中 Mock AWS CodeBuild 项目与构建 API
Moto CodeBuild 模拟实战:在测试中 Mock AWS CodeBuild 项目与构建 API

Mock测试 【免费下载链接】moto A library that allows you to easily mock out tests based on AWS infrastructure. 项目地址: https://gitcode.com/gh_mirrors/mo/moto 点击查看 免费下载 本篇技术指南围绕 moto 仓库中 CodeBuild 服务文档 展开,系统… · 2026/9/25 3:31:44

并行加法器 vs 先行进位加法器:进位延迟、关键路径与工程实现
并行加法器 vs 先行进位加法器:进位延迟、关键路径与工程实现

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 3:31:44

grammars-v4 中 R 语言 ANTLR 语法解析指南:掌握 RFilter 换行符预处理机制
grammars-v4 中 R 语言 ANTLR 语法解析指南:掌握 RFilter 换行符预处理机制

编程语言编译器开发工具 【免费下载链接】grammars-v4 Grammars written for ANTLR v4; expectation that the grammars are free of actions. 项目地址: https://gitcode.com/gh_mirrors/gr/grammars-v4 点击查看 免费下载 导读 在 grammars-v4 仓库的 r 目录下&… · 2026/9/25 3:31:44

VoltAgent 接入 Deep Infra:使用 `deepinfra/<model>` 模型路由打通低成本高性能推理
VoltAgent 接入 Deep Infra:使用 `deepinfra/<model>` 模型路由打通低成本高性能推理

人工智能AI AgentAgent 框架后端多智能体RAG工具调用Agent 记忆 【免费下载链接】voltagent AI Agent Engineering Platform built on an Open Source TypeScript AI Agent Framework 项目地址: https://gitcode.com/gh_mirrors/vo/voltagent 点击查看 免费下载 De… · 2026/9/25 3:31:44

在 Artillery 中复用 TypeScript 编写的 Playwright 测试代码
在 Artillery 中复用 TypeScript 编写的 Playwright 测试代码

性能测试接口测试CLI 【免费下载链接】artillery The complete load testing platform. Everything you need for production-grade load tests. Serverless & distributed. Load test with Playwright. Load test HTTP APIs, GraphQL, WebSocket, and more. Use any Node.… · 2026/9/25 3:31:38

Web工程师必备的协议层到渲染层实操指南
Web工程师必备的协议层到渲染层实操指南

简介:本资源是一份面向Web开发初学者的系统性入门指南,聚焦Web底层原理与前端核心技术,帮助零基础学习者建立完整的知识框架并规避常见认知误区。内容涵盖Web本质与演进脉络、TCP/IP与计算机网络基础、域名/HTTP/IP/带宽等基础设施概念&#… · 2026/9/25 3:31:38

数值优化(Numerical Optimization)学习系列-03-共轭梯度方法(Conjugate Gradient)
数值优化(Numerical Optimization)学习系列-03-共轭梯度方法(Conjugate Gradient)

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:31

创维E900V22D刷机全攻略:S905L3SB芯片兼容性解析与救砖实战
创维E900V22D刷机全攻略:S905L3SB芯片兼容性解析与救砖实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:31

MQTT协议原理与Broker服务器搭建实战:从Mosquitto到EMQX
MQTT协议原理与Broker服务器搭建实战:从Mosquitto到EMQX

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:37

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码