首页/新闻资讯/正文详情

从ProX到UltraX:LLM预训练数据精炼方法演进史与UltraX-0.6B精炼模型完整详解

发布时间:2026/9/25 22:57:18 来源:云帆数科 栏目:资讯中心
从ProX到UltraX:LLM预训练数据精炼方法演进史与UltraX-0.6B精炼模型完整详解
从ProX到UltraXLLM预训练数据精炼方法演进史与UltraX-0.6B精炼模型完整详解【免费下载链接】UltraX-Preview项目地址: https://ai.gitcode.com/OpenBMB/UltraX-PreviewOpenBMB 开源社区发布的UltraX-Preview数据集是 LLM 预训练数据精炼的最新成果它用 UltraX-0.6B 函数调用式精炼模型对五大英文预训练语料逐条做程序化编辑每个语料约 20B tokens。本文回顾从 ProX 到 UltraX 的数据精炼方法演进史详解精炼模型的工作原理与实测效果。为什么 LLM 预训练数据需要精炼大模型的预训练语料大多来自网页爬取原始文本里混杂着大量脏数据错误页面、登录墙、广告与导航按钮文本未清理干净的结构标记与重复模板局部脏段落混在正常文章中间如果直接丢进模型相当于让模型边学知识边学垃圾。预训练数据精炼的目标就是在保留原文信息的前提下把无价值内容精准删掉、把可修复内容改对。精炼方法演进从整篇改写到函数调用式编辑 LLM 数据精炼大致经历了三个阶段阶段代表方法做法主要局限规则与启发式过滤FineWeb 等语料流水线长度/比例阈值、质量分类器筛选只能粗粒度取舍无法修复局部脏数据端到端 LLM 改写ProXFineWeb-ProX 系列大模型整篇重写文档重写全文成本高可能引入幻觉、丢失原文函数调用式程序化编辑UltraX模型只输出结构化编辑指令在原文上确定性执行——ProX 开创性地证明用大模型改写预训练文档能显著提升下游效果但整篇重写有两个硬伤成本高全文都要过一遍大模型和不可控改写可能凭空创作。UltraX 的思路是让精炼模型不再直接生成新文本而是从有限的函数空间中预测编辑操作再由程序在原文明确定性地执行——像只下指令、不动手的外科医生改动最小、可审计、可扩展。UltraX-0.6B 精炼模型详解 UltraX-0.6B 是一个仅 0.6B 参数的轻量精炼模型训练与推理成本低适合大规模语料处理。它的工作流可以概括为三步1️⃣ 预测编辑操作模型从 5 个内置函数中选择操作形成编辑处方函数作用keep_all()文档无需修改原样保留remove_all()整篇无价值错误页、登录墙全部删除remove_lines(start, end)删除指定行区间replace_str(line, old, new)在指定行内替换子串add_line(base, sub_idx, content)在指定位置附近插入新行2️⃣ 行级对齐与上下文锚定LAM DCRLAMLine Alignment and Mapping在行级别对齐原始文本与精炼文本定位到底改了哪几行DCRDynamic Context Replacement把字符级编辑转化为带唯一上下文锚定的replace_str操作避免歧义匹配。3️⃣ 鲁棒的大规模执行针对工业级语料UltraX 采用滑动窗口推理 重叠感知操作聚合、歧义过滤、同行操作合并、重复模式检测等机制保证在 20B token 量级上稳定、可复现地执行。精炼效果1B 模型预训练实测 团队用 1B 参数的 MiniCPM 模型在每种语料的 20B tokens 上从零预训练并在 10 个基准ARC-C、MMLU、HellaSwag、PIQA 等做零样本评估关键结论UltraX 在全部 5 个语料上平均性能最高50 个任务-语料组合中拿下 34 个第一相比原始语料Raw和 ProX-C 精炼版平均相对提升分别约2.00%和1.53%数据效率更优在 FineWeb 上UltraX 仅用 16B tokens45.49 分就超过了 Raw 和 ProX-C 用满 20B tokens 的成绩45.08 / 45.05。换句话说同样的算力预算精炼后的数据每一 token 都更值钱。UltraX-Preview 五大精炼数据集一览 本仓库包含五个经 UltraX 精炼的英文预训练语料每个约 20B tokens数据集源语料说明数据目录UltraX-FineWebFineWeb大规模 Common Crawl 网页语料data/UltraX-FineWeb/UltraX-RedPajama-V2RedPajama-V2多源网页语料data/UltraX-RedPajama-V2/UltraX-AICCAICCHTML 解析的高保真网页语料data/UltraX-AICC/UltraX-Ultra-FineWebUltra-FineWeb质量过滤的 FineWeb 语料data/UltraX-Ultra-FineWeb/UltraX-FineWeb-ProX-DocFineWeb-ProX-DocProX 文档级精炼语料data/UltraX-FineWeb-ProX-Doc/每个 parquet 文件包含 5 列精炼前后对照一目了然列名说明uid唯一标识符原始文本的 MD5 哈希raw_content精炼前的原始文本cleaned_content经 UltraX 精炼后的文本processed_functions实际执行的编辑操作记录source源语料名称文件按 part 分片存放例如 UltraX-FineWeb-en-part-0001-of-0104.parquet。如何获取与使用 UltraX-Preview 数据集 方式一克隆本仓库git clone https://gitcode.com/OpenBMB/UltraX-Preview数据文件通过 Git LFS 管理克隆后data/目录下即为完整的 parquet 分片文件。方式二直接从模型平台加载以 datasets 库为例按配置名加载对应语料一行加载ds load_dataset(openbmb/UltraX, UltraX-FineWeb, splittrain)五个配置名分别为UltraX-FineWeb、UltraX-RedPajama-V2、UltraX-AICC、UltraX-Ultra-FineWeb、UltraX-FineWeb-ProX-Doc。使用提示项目基于 Apache 2.0 协议见 LICENSE但数据集基于多个源语料构建商用前请核对各源数据集的许可证更多细节可参考 README_ZH.md 与 README.md。结语从 ProX 的整篇改写到 UltraX 的函数调用式程序化编辑LLM 预训练数据精炼正走向更可控、更低成本、更可复现的方向。UltraX-0.6B 用轻量模型下指令 确定性执行的组合在 20B tokens 级别的真实预训练实验中全面领先为大规模数据精炼提供了一条可落地的新路径。【免费下载链接】UltraX-Preview项目地址: https://ai.gitcode.com/OpenBMB/UltraX-Preview创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关推荐

S型曲线Demo:手把手理解扩散模型DDPM原理与实现
S型曲线Demo:手把手理解扩散模型DDPM原理与实现

简介:面向机器学习初学者的扩散模型微型demo,通过生成S型曲线演示扩散模型从随机噪声逐步还原数据分布的核心过程,特别适合刚接触生成模型、想绕过复杂公式直接看代码逻辑的读者。压缩包共8个文件,大小约9.74MB,主程序… · 2026/9/25 22:57:18

Robomongo 内嵌 esprima 2.7.3:ECMAScript 解析器在 MongoDB Shell 脚本解析中的集成与应用
Robomongo 内嵌 esprima 2.7.3:ECMAScript 解析器在 MongoDB Shell 脚本解析中的集成与应用

数据库客户端桌面应用 【免费下载链接】robomongo Native cross-platform MongoDB management tool 项目地址: https://gitcode.com/gh_mirrors/ro/robomongo 点击查看 免费下载 Robomongo(即 Robo 3T)是一款原生的跨平台 MongoDB 管理工具&… · 2026/9/25 22:57:18

参与NiubiGEO开源项目:如何提交代码、报告问题并加入社区
参与NiubiGEO开源项目:如何提交代码、报告问题并加入社区

参与NiubiGEO开源项目:如何提交代码、报告问题并加入社区 【免费下载链接】niubigeo Open-source AI brand visibility and competitor reports. Official website: https://niubigeo.ai/ | Paid services: AI testing by real people and GEO optimization. Pricin… · 2026/9/25 22:57:12

银河麒麟V10网卡驱动编译加载全指南:e1000e与rtl8125适配实战
银河麒麟V10网卡驱动编译加载全指南:e1000e与rtl8125适配实战

简介:本资源是专为银河麒麟V10操作系统适配的e1000e与RTL8125网卡驱动源码包,面向国产化信创环境下的Linux内核开发者、系统集成工程师及运维人员,解决Intel和Realtek主流千兆网卡在麒麟V10上因内核版本差异导致的编译失败问题。压缩包共56个… · 2026/9/25 23:27:21

银河麒麟V10驱动编译实战:e1000e与r8125网卡驱动适配指南
银河麒麟V10驱动编译实战:e1000e与r8125网卡驱动适配指南

简介:本资源是专为银河麒麟V10操作系统适配的e1000e与RTL8125网卡驱动源码包,面向国产化信创环境下的Linux内核开发者、系统集成工程师及政企IT运维人员,解决在该国产OS上编译主流Intel和Realtek千兆网卡驱动时常见的兼容性问题。压缩包共56个… · 2026/9/25 23:27:15

Dify官方部署包解析:GitHub Release资产与生产级配置指南
Dify官方部署包解析:GitHub Release资产与生产级配置指南

简介:本资源为 Dify 开源低代码 AI 应用开发平台的官方完整源码安装包,面向 AI 工程师、后端开发者及大模型应用实践者,用于本地快速部署、二次开发或深度学习其 RAGAgent 架构设计。压缩包含 2000 个文件,主体为 1337 个 Python … · 2026/9/25 23:27:08

词达人协议逆向工程实战:HTTP抓包、签名解析与AES解密
词达人协议逆向工程实战:HTTP抓包、签名解析与AES解密

简介:本资源是一套面向英语学习技术爱好者与逆向分析初学者的词达人客户端抓包调试工具集,聚焦于理解词汇类App网络通信机制与本地交互逻辑。压缩包含92个文件,总大小7.4MB,主体为13个exe(含词达人工具.exe、Fiddler.e… · 2026/9/25 23:27:08

都以为 AI 越来越便宜,麦肯锡却说:真让它干活,可能贵 30 倍
都以为 AI 越来越便宜,麦肯锡却说:真让它干活,可能贵 30 倍

AI 语音、模型的 token 价格一路暴跌,企业AI账单却一路涨。麦肯锡给正在狂欢喊"AI 降本"的人泼了盆冷水:会聊天的 AI 是便宜了,会让它干活的那种"智能体"(Agent),同一件任务成本能差 3… · 2026/9/25 23:27:01

Codeg Token 用量报告完整指南:趋势、缓存命中率与活动热力图,如何快速优化 AI 编程成本
Codeg Token 用量报告完整指南:趋势、缓存命中率与活动热力图,如何快速优化 AI 编程成本

Codeg Token 用量报告完整指南:趋势、缓存命中率与活动热力图,如何快速优化 AI 编程成本 【免费下载链接】codeg Collaborative multi-agent AI coding workspace: aggregate sessions from Claude Code, Codex, OpenCode, Pi, Grok Build, etc. Desktop… · 2026/9/25 23:26:13

数值优化(Numerical Optimization)学习系列-03-共轭梯度方法(Conjugate Gradient)
数值优化(Numerical Optimization)学习系列-03-共轭梯度方法(Conjugate Gradient)

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:31

创维E900V22D刷机全攻略:S905L3SB芯片兼容性解析与救砖实战
创维E900V22D刷机全攻略:S905L3SB芯片兼容性解析与救砖实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:31

MQTT协议原理与Broker服务器搭建实战:从Mosquitto到EMQX
MQTT协议原理与Broker服务器搭建实战:从Mosquitto到EMQX

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:37

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码