UltraX-Preview数据格式实战指南raw_content与cleaned_content对照解析5列设计【免费下载链接】UltraX-Preview项目地址: https://ai.gitcode.com/OpenBMB/UltraX-PreviewUltraX-Preview是 OpenBMB 开源社区发布的大规模预训练数据精炼数据集合集基于自适应程序化编辑Adaptive Programmatic Editing对 5 个英文语料逐例精炼每个语料约 20B tokens。它的 UltraX 数据格式采用简洁的5 列设计uid、raw_content、cleaned_content、processed_functions、source其中raw_content与cleaned_content的原始 vs 精炼对照是整个数据格式的核心价值。本文带你快速看懂每一列的含义与实战用法。一、30 秒认识 UltraX 数据集 UltraX 不是端到端地改写文本而是训练一个轻量精炼模型预测结构化编辑操作插入、删除、修改再在原始文本上确定性地执行。最终产出的每个样本都完整保留了修改前和修改后两个版本——这正是 5 列设计的由来。仓库内置 5 个精炼后的英文语料数据集目录源语料说明分片数data/UltraX-FineWeb/FineWeb大规模 Common Crawl 网页语料104data/UltraX-RedPajama-V2/RedPajama-v2多源网页语料110data/UltraX-AICC/AICCHTML 解析的高保真网页语料61data/UltraX-Ultra-FineWeb/Ultra-FineWeb质量过滤的 FineWeb 语料104data/UltraX-FineWeb-ProX-Doc/FineWeb-ProX-Doc文档级精炼语料100每个目录下的文件都是标准 parquet 分片命名规则为数据集名-en-part-序号-of-总数.parquet例如 UltraX-FineWeb-en-part-0001-of-0104.parquet。二、5 列设计总览每一列都在回答一个问题 UltraX 数据格式中每个 parquet 文件都包含且仅包含 5 列均为 string 类型列定义可在 README.md 的元数据中核对列名类型回答的问题uidstring这条样本是谁——唯一标识raw_contentstring原文长什么样——精炼前的原始文本cleaned_contentstring精炼后长什么样——UltraX 处理后的文本processed_functionsstring具体改了哪里——应用的编辑操作sourcestring它从哪来——源语料名称 记忆口诀谁(uid) → 原来什么(raw) → 现在什么(cleaned) → 怎么改的(functions) → 哪来的(source)。三、raw_content 与 cleaned_content 对照解析 这是 UltraX 数据格式中最重要的两列直接构成一组天然的对照实验数据。raw_content原始文本的底稿内容UltraX 精炼之前的原始网页文本角色一切对照与审计的基准uid就是它的 MD5 哈希值用途需要复现原始训练效果如对比基线、或研究精炼前有哪些噪声时使用。cleaned_content精炼后的定稿内容经 UltraX 预测编辑操作并执行后的文本角色正式用于预训练的目标列——实验证明用cleaned_content训练的 1B 模型在 10 项基准上取得全部 5 个语料的最高平均分50 个任务-语料组合中赢下 34 个效果示例在 FineWeb 上UltraX 只用 16B tokens 即超过 Raw 与 ProX-C 用 20B tokens 的最终性能数据效率更高。如何理解两者的差异 两列的差异完全由processed_functions决定是确定性的编辑结果而非模糊的LLM 改写。典型差异形态删减型广告、导航栏、登录墙、版权声明等低价值段落被整段移除替换型行内噪声如乱码、模板占位符被就地替换为干净文本整篇处理型无价值页面错误页、登录墙被remove_all()整篇丢弃无操作型高质量文档执行keep_all()此时两列内容一致——这也是评估数据本底质量的便捷信号。想验证这一点只需在任意样本上对比raw_content与cleaned_content再用processed_functions逐条操作复原即可每一步都可复现、可审计。四、processed_functions从底稿到定稿的编辑脚本 ✂️该列记录了精炼模型预测并执行的操作序列函数空间详见 README.md只有 5 个函数含义keep_all()文档无需修改remove_all()整篇无价值如错误页、登录墙remove_lines(start, end)删除 start 到 end 的连续行含首尾replace_str(line, old, new)在指定行内替换子串add_line(base, sub_idx, content)在指定位置附近插入新行这种行级定位 小范围编辑的设计让 20B tokens 级别的精炼在工程上可靠执行滑动窗口推理、重叠感知聚合、歧义过滤等机制保障也让每条样本的改动逐行可追溯。五、uid 与 source让百万级样本可追溯、可筛选 ️uidraw_content的 MD5 哈希。天然去重键——若两个数据集分片中出现相同uid说明原始文本相同做数据配比、跨语料查重时直接用它即可。source源语料名称。把 5 个语料合并成一个大 parquet 训练时无需记文件名按source过滤/抽样/动态配比即可。六、实战上手两种加载方式 方式一直接从模型仓库加载推荐免下载大文件from datasets import load_dataset ds load_dataset(openbmb/UltraX, UltraX-FineWeb, splittrain) print(ds.column_names) # [uid, raw_content, cleaned_content, processed_functions, source]其余 4 个语料只需替换 config 名UltraX-RedPajama-V2、UltraX-AICC、UltraX-Ultra-FineWeb、UltraX-FineWeb-ProX-Doc完整配置见 README_ZH.md。方式二本地读取 parquet 分片克隆仓库后每个分片即一个标准 parquet 文件如 data/UltraX-AICC/UltraX-AICC-en-part-0001-of-0061.parquet用pandas.read_parquet或pyarrow.parquet均可直接读取按分片并行加载即可。七、使用建议与注意事项 ⚠️训练默认用cleaned_content需要与原始语料做消融对比时再切到raw_contentremove_all()样本的cleaned_content为空构建训练集前建议先过滤避免空文本进入 tokenize许可合规仓库基于 Apache 2.0 发布见 LICENSE但数据源自多个上游语料商用前请逐一核对各源数据集的许可条款更多细节管线流程、评测方法可查阅官方说明 README.md 与中文文档 README_ZH.md。掌握这套 5 列设计后你既能直接训练也能用raw_content/cleaned_content对照对精炼质量做抽样审计——UltraX 数据格式最贴心的地方就是把改了什么和为什么值得改都明明白白留给了你。【免费下载链接】UltraX-Preview项目地址: https://ai.gitcode.com/OpenBMB/UltraX-Preview创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
企业数字化 ERP 产品动态
相关推荐
F´ 框架 TokenBucket 令牌桶限流工具深度解析:突发流量控制与源码实践 嵌入式系统编程 【免费下载链接】fprime F - A flight software and embedded systems framework 项目地址: https://gitcode.com/gh_mirrors/fp/fprime 点击查看 免费下载 导读
本文围绕 F(F Prime)飞行软件与嵌入式系统框架中 Utils::Tok… · 2026/9/25 1:31:06
Proteus DHT11仿真教程:51单片机温湿度读取与LCD显示 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:31:00
OFDM PAPR抑制新方案:分组SLM结合幅值标记,免边带低复杂度 简介:针对正交频分复用系统中传统SLM方法计算复杂度高、需要额外带宽传输边带信息的问题,这份PDF资料提供了一种低复杂度改进方案。内容以学术论文形式完整呈现:先介绍正交频分复用峰均功率比问题及现有SLM改进思路,再给出发送端对… · 2026/9/25 1:31:00
【Python深度学习】Keras六步实现简单循环神经网络 Keras 作为高级神经网络库,为机器学习算法工程师提供了快速上手神经网络的便捷工具。本文将通过使用 Keras 和简单的 6 步操作,介绍如何利用循环神经网络(RNN)进行时间序列数据的预测。本文所涵盖的内容也是算法工程师求职面试中的常见考察题目之一,旨在测试求职者对神经网… · 2026/9/25 2:09:09
【Python深度学习】Classes类在Keras中常用方法 在 Python 编程中,class 类是面向对象编程的基本构建块之一,通过类的定义可以创建对象、实现属性和方法的封装。在机器学习开发中,类的应用尤为广泛,包括数据结构的创建、模型的定义和优化、回调函数的实现等。
特别是在 Keras 中,利用类可以实现强大的回调功能,以监控和… · 2026/9/25 2:09:09
Centos7.x在线/离线安装/升级Docker/Docker Compose 文章目录 前言 安装docker 1.升级docker 1.1.在线升级 1.2.离线升级 2.安装docker 2.1.在线安装docker 2.2.离线安装docker 3.配置镜像加速器 3.1.腾讯云 3.2.阿里云 安装docker-compose 1、在线安装 2、离线安装 安装runlike工具 前言
推荐:centos7系统(稳定,对docker支持友… · 2026/9/25 2:09:09
【Python深度学习】识别人类活动的一维卷积神经网络模型 人体活动识别(Human Activity Recognition, HAR)是一项根据运动传感器数据预测个体行为的技术,通过智能手机、智能手表或其他传感设备实时捕获数据,实现对个体活动状态的分析。一个经典的 HAR 数据集是 2012 年推出的“使用智能手机的活动识别数据集”,它由意大利热那亚大… · 2026/9/25 2:09:09
【Python深度学习】使用 PyTorch 计算导数 导数是微积分的核心概念之一,描述了自变量的变化如何影响函数的输出。在深度学习中,导数计算(特别是梯度计算)用于更新神经网络的参数,使得模型逐步优化。PyTorch 提供了强大的自动微分模块 Autograd,通过简洁的 API 支持用户轻松计算导数,使得在构建和优化神经网络时更… · 2026/9/25 2:09:08
omnet++构架与源码分析(1) omnet模型以及运行环境部分使用c开发,IDE以及插件使用Eclipse以及插件方式开发。其中c代码位于解压后的include与src目录;src下面分为:sim:仿真内核类的CC代码;各种头文件,都在include目录;comm… · 2026/9/25 2:09:02
创维E900V22D刷机全攻略:S905L3SB芯片兼容性解析与救砖实战 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:31
MQTT协议原理与Broker服务器搭建实战:从Mosquitto到EMQX /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:37