UltraX预训练实验结果完整解读1B模型、10大基准、34/50项SOTA【免费下载链接】UltraX-Preview项目地址: https://ai.gitcode.com/OpenBMB/UltraX-Preview这篇文章带你完整解读UltraX官方预训练实验结果OpenBMB 推出的大规模预训练数据精炼框架在 5 个英文语料上用1B 参数模型从零预训练 20B tokens在10 大基准上全部拿下最高平均分50 项任务-语料组合中赢得34 项 SOTA 实验设置1B 模型是怎么考出来的先看实验条件这是读懂全部数字的前提项目设置模型1B 参数 MiniCPM从零预训练不是微调训练量每个语料20B tokens语料5 个经 UltraX 精炼的英文语料每个约 20B tokens评测LightEval 零样本zero-shot设定对比基线Raw原始语料与 ProX-C文档级精炼基线也就是说这不是给好模型喂好数据的加分操作而是同等条件下比数据质量同样的 1B 模型、同样的训练 token 数只换训练语料看谁的成绩更好。这种控制变量设计正是结论可信的关键 ✅ 10 大基准每个在考什么评测覆盖 10 个主流常识与知识基准兼顾知识广度和推理深度基准考察内容ARC-C小学三年级科学推理挑战版ARC-E小学五年级科学推理简易版CSQA大学水平常识科学问答HellaSwag日常情境常识推理MMLU57 个学科的多任务知识大考OBQA物理常识问答PIQA物理交互常识SIQA社交意图常识推理WinoGrande代词消解与语言常识SciQ小学科学四选一5 个语料 × 10 个基准 50 个任务-语料组合这就是34/50的分母来源。 核心结论一34/50 项 SOTA 意味着什么UltraX 精炼语料在全部 5 个语料上的平均性能都是第一名并在 50 项组合中赢得34 项最佳68% 胜率。对新手来说平均第一比单项第一更重要它说明 UltraX 的精炼是全面提纯而不是在个别简单基准上刷分。5 个语料来源差异很大Common Crawl 网页、多源网页、HTML 高保真解析、质量过滤版、文档级精炼版全部夺冠说明方法具有泛化性而非只对某一类数据有效 核心结论二平均相对提升 2.00% 与 1.53%论文的关键数字相比Raw未精炼原始语料UltraX 平均相对提升约 2.00%相比ProX-C已相当强的文档级精炼基线UltraX 平均相对提升约 1.53%在预训练领域2% 的平均相对提升是重量级成果——通常这意味着同等算力下模型变聪明了或同等效果下训练成本更低。更值得注意的是 UltraX 还要和 ProX-C 比它赢过的不是一个弱基线而是业界公认优秀的精炼方法。⚡ 核心结论三数据效率——16B tokens 追平并反超 20B 基线这可能是最有说服力的一个发现在 FineWeb 语料上UltraX 仅训练16B tokens平均 45.49 分就已超过 Raw45.08 分和 ProX-C45.05 分训练满20B tokens的最终成绩。翻译成人话少喂 20% 的数据成绩反而更高—— UltraX 的每个 token 都更值钱对工程团队意味着真金白银的算力节省更早达到目标性能更短的训练周期说明精炼带来的不是噪声减少这么简单的效果而是有效信息密度的提升。数据质量优化的价值在这条曲线上体现得淋漓尽致 ⚡️ 数据在哪里5 大语料文件速查本仓库直接包含 5 个精炼语料的全部分片文件共 479 个 parquet 分片数据集源语料分片数数据目录UltraX-FineWebFineWebCommon Crawl 网页104data/UltraX-FineWeb/UltraX-RedPajama-V2RedPajama-v2多源网页110data/UltraX-RedPajama-V2/UltraX-AICCAICCHTML 高保真网页61data/UltraX-AICC/UltraX-Ultra-FineWebUltra-FineWeb质量过滤104data/UltraX-Ultra-FineWeb/UltraX-FineWeb-ProX-DocFineWeb-ProX-Doc文档级精炼100data/UltraX-FineWeb-ProX-Doc/每个 parquet 文件固定 5 列方便你做前后对比列名含义uid唯一标识raw_content 的 MD5 哈希raw_content精炼前的原始文本cleaned_contentUltraX 精炼后的文本processed_functions实际执行的编辑操作记录source源语料名称raw_content与cleaned_content并排存放是个贴心设计——你可以直接对比同一条样本的编辑前后差异理解精炼到底改了什么。示例文件可参考 data/UltraX-FineWeb/UltraX-FineWeb-en-part-0001-of-0104.parquet 为什么 UltraX 能赢方法速览看完结果用一分钟理解它背后的核心设计详见 README.md函数调用式精炼而非端到端改写传统方法要么靠人工规则要么让大模型整篇重写。UltraX 训练一个轻量精炼模型预测 5 种结构化编辑操作——keep_all无需修改、remove_all整篇无价值如错误页/登录墙、remove_lines删行、replace_str行内替换、add_line插入新行再在原文上确定性执行可控且可审计LAM DCR 流水线行级对齐映射LAM把原文与精炼文本逐行对齐动态上下文替换DCR把字符级编辑转成带唯一上下文锚定的可靠替换操作为大规模而生滑动窗口推理、重叠感知聚合、歧义过滤、同行操作合并、重复模式检测保障数亿级文档的可靠执行。一句话总结不是重写内容而是精准手术——这正是它能同时保证质量与效率的原因 快速上手3 步开始使用第 1 步按配置名加载对应语料5 个配置与数据集一一对应UltraX-FineWeb、UltraX-RedPajama-V2、UltraX-AICC、UltraX-Ultra-FineWeb、UltraX-FineWeb-ProX-Doc第 2 步训练时直接使用cleaned_content列作为输入文本raw_content留作对照与复现第 3 步若资源有限可优先从 FineWeb 语料入手——它的 16B tokens 反超实验就是数据效率的最佳例证。 新手常见疑问Q为什么不直接看单项分数要看平均分A单项可能有波动平均分反映整体能力水位。而 UltraX 是平均分全第一 单项 34/50 第一两个口径同时成立结论才站得住。Q20B tokens 对 1B 模型够吗A这是学界常见的小模型大语料验证设置——参数小、训练快但足以暴露数据质量差异是性价比极高的对比实验方案。QUltraX 适合我用吗A如果你的预训练语料来自网页抓取Common Crawl 类UltraX 的逐例精炼思路与这套现成精炼语料都值得直接借鉴或试用如果是代码/数学等垂域语料可参考其函数调用式精炼思路自建精炼管线。 结语回到文章开头的那组数字1B 模型、10 大基准、34/50 项 SOTA、2% 平均相对提升、16B tokens 反超 20B 基线——它们共同指向一个结论在预训练时代数据精炼就是免费的算力。UltraX 用函数调用式编辑把这种免费算力做成了可复现的工程方法而这 5 套精炼语料就放在仓库里随时可以验证。【免费下载链接】UltraX-Preview项目地址: https://ai.gitcode.com/OpenBMB/UltraX-Preview创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
企业数字化 ERP 产品动态
相关推荐
在 VoltAgent 中接入 Weights Biases 模型路由:wandb 提供方使用指南 人工智能AI AgentAgent 框架后端多智能体RAG工具调用Agent 记忆 【免费下载链接】voltagent AI Agent Engineering Platform built on an Open Source TypeScript AI Agent Framework 项目地址: https://gitcode.com/gh_mirrors/vo/voltagent 点击查看 免费下载 导… · 2026/9/25 14:54:24
从零搭建个人金融数据服务系统:全链路架构与关键技术实践 最近在整理沉淀项目时,我发现一个特别值得聊的题材:一套从零搭建的个人金融数据服务系统。这个标题叫"financial-services"的项目,实际上就是把散落在各个渠道的资产、账单、交易记录聚合起来,做成一套统一查询、统一分… · 2026/9/25 14:54:24
桌面通信自动沉淀客户资产:DeskcommCRM设计思路与落地实践 做CRM实施这些年,我见过太多客户管理系统半路夭折的例子。工具选得很大牌,销售却不填数据,管理层看不到真实进度,最后CRM变成通讯录。其实问题不在于销售懒,而是系统设计离一线操作太远。直到我接触DeskcommCRM这个方向… · 2026/9/25 14:54:17
ng-zorro-antd Flex 组件对齐方式(nzAlign)完全指南:交叉轴对齐实战与源码级原理解析 UI组件前端 【免费下载链接】ng-zorro-antd Angular UI Component Library based on Ant Design 项目地址: https://gitcode.com/gh_mirrors/ng/ng-zorro-antd 点击查看 免费下载 nz-flex 是 ng-zorro-antd 提供的块级弹性布局容器指令,对齐方式&#x… · 2026/9/25 15:28:14
AI如何应对PLC漏洞迁移?从行为基线到工控安全新范式 前阵子复盘一个汽车零部件产线的安全评估项目,我们在一台服役六年的PLC上翻出了不止一个“老朋友”:某个开源日志组件的旧版本、一套默认口令的Web管理后台,还有一个可以直接通过网口发起未授权读写的调试服务。那一刻我突然意识到࿰… · 2026/9/25 15:28:08
1000条数据蒸馏出领域专家模型:大模型蒸馏实战全指南 当初在团队里提出“1000条数据蒸馏领域模型”这个想法时,被质疑得挺狠的。大家都觉得大模型蒸馏怎么也得几万条高质量数据起步,1000条听着就像开玩笑。但结果还真跑通了——垂直领域的分类和抽取任务,用1000条经过精心构建的数据蒸馏出来的7B… · 2026/9/25 15:28:02
创维E900V22D刷机全攻略:S905L3SB芯片兼容性解析与救砖实战 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:31
MQTT协议原理与Broker服务器搭建实战:从Mosquitto到EMQX /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:37