UltraData-RL-2609数据构建流水线揭秘从原始数据到RL-ready样本的6个阶段【免费下载链接】UltraData-RL-2609项目地址: https://ai.gitcode.com/OpenBMB/UltraData-RL-2609UltraData-RL-2609 是 OpenBMBMiniCPM 团队面向大模型强化学习RL后训练发布的 RL 数据集共 85,995 条可验证任务样本覆盖数学、代码、长上下文与科学推理四大领域。它的核心价值在于一条六阶段数据构建流水线从原始数据整合、标准化改写到可验证性过滤、奖励可信性校验、难度校准最终整理为统一的 RL-ready 样本。本文将完整拆解这条流水线的每个阶段帮助你理解高质量 RL 训练数据是如何炼成的。 数据全景4 大领域85,995 条样本领域样本数占比任务类型结果如何验证Math32,41237.7%竞赛 / 教材类数学题答案唯一可抽取与参考答案做答案匹配Code23,66527.5%按自然语言描述生成程序用测试用例执行提交代码Long-Context18,04621.0%长文档多跳问答答案匹配且上下文保证支撑答案Knowledge11,87213.8%科学 / 知识推理简答题与参考答案做答案匹配数据围绕三个目标构建结果可判定verifiable、奖励可信trustworthy、难度适配calibrated让策略模型获得稳定、可追溯的训练信号。各领域的原始数据文件可按目录浏览data/Math/、data/Code/、data/Long_Context/、data/Knowledge/。️ 六阶段构建流水线全拆解四个领域共用同一套六阶段流程只是在各环节使用领域专属的验证器与筛选规则。阶段 1 · 数据准备与来源整合按领域汇聚上游公开数据集与合成数据MathDAPO、DeepScaleR、DeepMath 三个公开可验证数学 RL 数据集取并集Knowledge / STEMOpenScienceReasoning-2 科学推理数据Long-ContextHotpotQA、Qasper、MuSiQue 多跳问答扩写至更长上下文并加入内部合成数据CodeOpenCodeReasoning、OpenCodeReasoning-2 与 HardTests 竞赛题配合合成测试用例。阶段 2 · 任务形式标准化与改写按训练器和验证器的要求统一任务格式、答案字段与元数据领域标准化做法Math / Knowledge改写为简答题形式Long-Context扩展上下文同时保持问题与参考答案的对应关系Code统一 query 表述、输入输出约定与提交格式阶段 3 · 可验证性过滤只保留答案唯一、可自动校验、抽取格式统一的样本。选择题、判断题、证明题、多问题以及依赖图片的题目都在这一阶段被移除。Long-Context 样本必须有明确的上下文—问题—答案关联Code 样本则必须能在沙箱中通过测试用例执行。阶段 4 · 奖励可信性校验这是奖励信号可靠的关键一环LLM Judge审核题目与答案的一致性Math / Knowledge 由多个独立模型重新求解按共识修正标签——无共识则直接丢弃不做猜测Long-Context 采用参考答案比对 多模型质量评估Code 对测试用例、参考实现与预期输出做三方交叉验证无效或无法执行的用例一律移除。阶段 5 · 难度校准在 RL 初始化 checkpoint 上对每条样本多次 rollout估算经验通过率并据此分层处理通过率 1已完全掌握、无梯度收益→ 移除处于可学习区间→ 保留通过率 0 但标签已确认合法→ 保留交由在线动态采样调控训练频率。注意本阶段只改变难度与采样权重绝不修改参考标签——难度筛选动分数、不动答案。阶段 6 · 格式整理与质量复核导出为统一 JSONL并做发布前最后一道体检检查可解析性、必需字段、唯一 ID、抽取规则与验证器配置清理精确 / 近似重复样本以及与公开评测集重叠的样本去污染复核各领域关键属性Math / Knowledge 答案唯一性、Long-Context 上下文关联、Code 测试用例可执行性记录数据来源、筛选版本与验证器版本保证全程可追溯。 最终成果统一的五字段 JSONL 格式每条样本一行五个字段即可驱动整个 RL 训练循环{ uuid: Math_00001, query: ……完整的题面……, ground_truth: ……参考答案……, source: 原始来源 | UltraData-RL-2609, domain: Math }字段说明uuid全局唯一 ID由领域前缀 序号组成query模型要回答的完整任务长文本任务的上下文和问题都在此字段ground_truth参考答案字符串Code 领域为测试用例对象source原始来源信息domainMath/Knowledge/Long_Context/CodeCode 领域的ground_truth特别值得一提它是一对等长数组inputs/outputs验证完全基于真实执行——把输入喂给候选程序比对标准化后的输出全部测例通过才计为正确。例如两组测例的形式{inputs: [3\n1 2 3\n, 1\n5\n], outputs: [6\n, 5\n]}这种以执行判对错的设计让代码任务的奖励信号几乎不存在歧义。 实战效果AIME 2025 从 61 到 86这套数据的成色有实打实的成绩单背书在 JustRL II 实验设置小模型 critic 的 128K 推理 RL中AIME 2025 在约 300 步 RL 内从 61 提升到 81最终消费该数据集完成后训练的 MiniCPM5-2B checkpoint 在 AIME 2025 上达到86。可验证、可追溯的训练信号正是稳定 RL 的基石。 快速上手指南数据集提供四个 config用 Hugging Facedatasets库即可加载from datasets import load_dataset ds load_dataset(openbmb/UltraData-RL-2609, Math, splittrain) # 也可用 Knowledge / Long-Context / Code仓库内同样提供完整的本地分片文件例如 Math_part-1-of-4.jsonl、Code_part-01-of-12.jsonl、Knowledge_part-1-of-2.jsonl、Long_Context_part-1-of-2.jsonl可结合 README_ZH.md 中的说明直接使用。⚠️ 使用注意事项Code 需自备验证器发布内容包含测试用例但不含沙箱需自行执行提交代码计算奖励静态标签构建时的难度过滤与采样权重不作为字段发布只保留最终入选样本去污染范围有限仅覆盖构建时已知的评测集引入新基准前建议另行检测。✅ 小结UltraData-RL-2609 用一条可判定 → 可信 → 难度适配 → 规范化发布的六阶段流水线把多源原始数据打磨成 85,995 条 RL-ready 样本。它的流水线设计——尤其是多模型共识校验与只调权重不改标签的难度校准原则——对任何想做 LLM RL 后训练的团队都有直接参考价值。项目按 Apache 2.0 许可发布更多细节可参阅 README.md。【免费下载链接】UltraData-RL-2609项目地址: https://ai.gitcode.com/OpenBMB/UltraData-RL-2609创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
企业数字化 ERP 产品动态
相关推荐
Claude-BugHunter × Burp Suite MCP集成:让AI直接驱动Repeater,开启对话式漏洞挖掘 Claude-BugHunter Burp Suite MCP集成:让AI直接驱动Repeater,开启对话式漏洞挖掘 【免费下载链接】Claude-BugHunter A Claude Code skill bundle for bug hunting and external red-team work - 82 skills, 15 slash commands, 681 disclosed-report p… · 2026/9/25 9:53:56
3个免费降AI率工具,让你的论文查重降AI两不误[必看] 最近不少同学私信我,说论文明明是自己一个字一个字敲的,就用AI帮忙理了理思路,结果学校AIGC检测系统一出,相似度直接飙到30%以上,整个人都懵了。这事儿真不是个别现象,现在查重平台陆续上线AI检测功能&… · 2026/9/25 9:53:56
dataDemo.rar数据交付校验:工业场景下的标准化探查与清洗闭环 简介:本资源是一个面向C#数据库开发初学者与中级工程师的多数据库操作实战示例包,聚焦Oracle、SQL Server、MySQL及SQLite四大主流数据库在.NET环境下的集成实践,解决跨数据库连接、CRUD操作、事务管理及工具类封装等核心开发痛点。压缩包共3… · 2026/9/25 10:17:21
本地可编程代码模板系统:CLI驱动的动态代码生成实践 1. 项目概述:一个被误读的CLI工具命名陷阱“claude-code-templates”这个标题,第一眼容易让人联想到Anthropic官方推出的Claude大模型生态工具——尤其是结合热搜词里高频出现的claude cli、codex cli、npm安装、vscode配置等关键词,很多人会… · 2026/9/25 10:17:15
AI时代下的前端求生之路:用TaoToken统一Key打通Cline与本地配置文件 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 10:17:15
Atlas 300V 24G是运算加速卡吗?NPU推理卡部署YOLO实战 “atlas 300v 24g 是运算加速卡吗”这个问题最近频繁出现,通常还连着“atlas部署yolo”一起被搜索。说实话,我第一次拿到Atlas 300V 24G这块卡时也愣过一下:它长得像显卡,插在PCIe槽位上,散热器和显存颗粒齐全… · 2026/9/25 10:17:15
C++代码风格检查工具详解:Clang-Tidy与Cppcheck配置实战 1. 项目概述1.1 为什么你需要一个代码风格检查工具这次想聊的是C代码风格检查工具。先别急着划走,我知道这话题听起来不性感,远不如“C小游戏编程100例”或者“用C制作僵尸末日小游戏”吸引眼球,但恰恰是这个不性感的环节,决定了你… · 2026/9/25 10:17:14
Atlas 300V 24G部署YOLOv5实战:NPU推理加速与踩坑全记录 这块卡刚到我手上的时候,我第一反应也是那三个字:能跑吗?当时项目里已经有现成的YOLOv5检测流程,推理侧跑在一张老旧的消费级GPU上,显存捉襟见肘。同事丢过来一块Atlas 300V 24G,问我“这玩意算运算加速卡吗… · 2026/9/25 10:17:14
创维E900V22D刷机全攻略:S905L3SB芯片兼容性解析与救砖实战 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:31
MQTT协议原理与Broker服务器搭建实战:从Mosquitto到EMQX /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:37