尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
从ProX到UltraX:LLM预训练数据精炼方法演进史与UltraX-0.6B精炼模型完整详解
从ProX到UltraXLLM预训练数据精炼方法演进史与UltraX-0.6B精炼模型完整详解【免费下载链接】UltraX-Preview项目地址: https://ai.gitcode.com/OpenBMB/UltraX-PreviewOpenBMB 开源社区发布的UltraX-Preview数据集是 LLM 预训练数据精炼的最新成果它用 UltraX-0.6B 函数调用式精炼模型对五大英文预训练语料逐条做程序化编辑每个语料约 20B tokens。本文回顾从 ProX 到 UltraX 的数据精炼方法演进史详解精炼模型的工作原理与实测效果。为什么 LLM 预训练数据需要精炼大模型的预训练语料大多来自网页爬取原始文本里混杂着大量脏数据错误页面、登录墙、广告与导航按钮文本未清理干净的结构标记与重复模板局部脏段落混在正常文章中间如果直接丢进模型相当于让模型边学知识边学垃圾。预训练数据精炼的目标就是在保留原文信息的前提下把无价值内容精准删掉、把可修复内容改对。精炼方法演进从整篇改写到函数调用式编辑 LLM 数据精炼大致经历了三个阶段阶段代表方法做法主要局限规则与启发式过滤FineWeb 等语料流水线长度/比例阈值、质量分类器筛选只能粗粒度取舍无法修复局部脏数据端到端 LLM 改写ProXFineWeb-ProX 系列大模型整篇重写文档重写全文成本高可能引入幻觉、丢失原文函数调用式程序化编辑UltraX模型只输出结构化编辑指令在原文上确定性执行——ProX 开创性地证明用大模型改写预训练文档能显著提升下游效果但整篇重写有两个硬伤成本高全文都要过一遍大模型和不可控改写可能凭空创作。UltraX 的思路是让精炼模型不再直接生成新文本而是从有限的函数空间中预测编辑操作再由程序在原文明确定性地执行——像只下指令、不动手的外科医生改动最小、可审计、可扩展。UltraX-0.6B 精炼模型详解 UltraX-0.6B 是一个仅 0.6B 参数的轻量精炼模型训练与推理成本低适合大规模语料处理。它的工作流可以概括为三步1️⃣ 预测编辑操作模型从 5 个内置函数中选择操作形成编辑处方函数作用keep_all()文档无需修改原样保留remove_all()整篇无价值错误页、登录墙全部删除remove_lines(start, end)删除指定行区间replace_str(line, old, new)在指定行内替换子串add_line(base, sub_idx, content)在指定位置附近插入新行2️⃣ 行级对齐与上下文锚定LAM DCRLAMLine Alignment and Mapping在行级别对齐原始文本与精炼文本定位到底改了哪几行DCRDynamic Context Replacement把字符级编辑转化为带唯一上下文锚定的replace_str操作避免歧义匹配。3️⃣ 鲁棒的大规模执行针对工业级语料UltraX 采用滑动窗口推理 重叠感知操作聚合、歧义过滤、同行操作合并、重复模式检测等机制保证在 20B token 量级上稳定、可复现地执行。精炼效果1B 模型预训练实测 团队用 1B 参数的 MiniCPM 模型在每种语料的 20B tokens 上从零预训练并在 10 个基准ARC-C、MMLU、HellaSwag、PIQA 等做零样本评估关键结论UltraX 在全部 5 个语料上平均性能最高50 个任务-语料组合中拿下 34 个第一相比原始语料Raw和 ProX-C 精炼版平均相对提升分别约2.00%和1.53%数据效率更优在 FineWeb 上UltraX 仅用 16B tokens45.49 分就超过了 Raw 和 ProX-C 用满 20B tokens 的成绩45.08 / 45.05。换句话说同样的算力预算精炼后的数据每一 token 都更值钱。UltraX-Preview 五大精炼数据集一览 本仓库包含五个经 UltraX 精炼的英文预训练语料每个约 20B tokens数据集源语料说明数据目录UltraX-FineWebFineWeb大规模 Common Crawl 网页语料data/UltraX-FineWeb/UltraX-RedPajama-V2RedPajama-V2多源网页语料data/UltraX-RedPajama-V2/UltraX-AICCAICCHTML 解析的高保真网页语料data/UltraX-AICC/UltraX-Ultra-FineWebUltra-FineWeb质量过滤的 FineWeb 语料data/UltraX-Ultra-FineWeb/UltraX-FineWeb-ProX-DocFineWeb-ProX-DocProX 文档级精炼语料data/UltraX-FineWeb-ProX-Doc/每个 parquet 文件包含 5 列精炼前后对照一目了然列名说明uid唯一标识符原始文本的 MD5 哈希raw_content精炼前的原始文本cleaned_content经 UltraX 精炼后的文本processed_functions实际执行的编辑操作记录source源语料名称文件按 part 分片存放例如 UltraX-FineWeb-en-part-0001-of-0104.parquet。如何获取与使用 UltraX-Preview 数据集 方式一克隆本仓库git clone https://gitcode.com/OpenBMB/UltraX-Preview数据文件通过 Git LFS 管理克隆后data/目录下即为完整的 parquet 分片文件。方式二直接从模型平台加载以 datasets 库为例按配置名加载对应语料一行加载ds load_dataset(openbmb/UltraX, UltraX-FineWeb, splittrain)五个配置名分别为UltraX-FineWeb、UltraX-RedPajama-V2、UltraX-AICC、UltraX-Ultra-FineWeb、UltraX-FineWeb-ProX-Doc。使用提示项目基于 Apache 2.0 协议见 LICENSE但数据集基于多个源语料构建商用前请核对各源数据集的许可证更多细节可参考 README_ZH.md 与 README.md。结语从 ProX 的整篇改写到 UltraX 的函数调用式程序化编辑LLM 预训练数据精炼正走向更可控、更低成本、更可复现的方向。UltraX-0.6B 用轻量模型下指令 确定性执行的组合在 20B tokens 级别的真实预训练实验中全面领先为大规模数据精炼提供了一条可落地的新路径。【免费下载链接】UltraX-Preview项目地址: https://ai.gitcode.com/OpenBMB/UltraX-Preview创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED

相关推荐

S型曲线Demo:手把手理解扩散模型DDPM原理与实现

S型曲线Demo:手把手理解扩散模型DDPM原理与实现

简介:面向机器学习初学者的扩散模型微型demo,通过生成S型曲线演示扩散模型从随机噪声逐步还原数据分布的核心过程,特别适合刚接触生成模型、想绕过复杂公式直接看代码逻辑的读者。压缩包共8个文件,大小约9.74MB,主程序…

📅 2026/9/25 22:57:20
Robomongo 内嵌 esprima 2.7.3:ECMAScript 解析器在 MongoDB Shell 脚本解析中的集成与应用

Robomongo 内嵌 esprima 2.7.3:ECMAScript 解析器在 MongoDB Shell 脚本解析中的集成与应用

数据库客户端桌面应用 【免费下载链接】robomongo Native cross-platform MongoDB management tool 项目地址: https://gitcode.com/gh_mirrors/ro/robomongo 点击查看 免费下载 Robomongo(即 Robo 3T)是一款原生的跨平台 MongoDB 管理工具&…

📅 2026/9/25 22:57:20
网络RTT是什么?一文搞懂延迟、Ping值与卡顿优化

网络RTT是什么?一文搞懂延迟、Ping值与卡顿优化

你正跟朋友联机打游戏,语音里突然传来一句:"你RTT怎么这么高,卡成PPT了。"你愣了一下,想问什么是RTT,又觉得这时候追问有点丢人。其实RTT全称是Round-Trip Time,翻译过来就是往返时间。搞网络的人…

📅 2026/9/25 22:52:20
MORE NEWS

更多资讯

📰

SQL Server 2000+SP4个人版安装指南:从rar到可连接实例的完整避坑手册

简介:SQL Server 2000 SP4个人版安装程序包面向需要在单机或小团队环境中搭建关系型数据库的开发者与运维人员,尤其适合学习Transact-SQL语法、数据库引擎原理及早期SQL Server架构的技术人员。该版本集成SP4累积补丁与安全更新,在SQL注入防护…

📰

开源呼叫中心私有化部署:FreeSWITCH+AI语音实战指南

1. 为什么我开始认真考虑自建呼叫中心去年帮一个做本地生活服务的朋友算过一笔账,他们团队不到二十个坐席,用的某知名云呼叫中心标准版,一年下来账单接近三十万。这还不算完,想加一个智能语音导航模块,报价直接翻倍&am…

📰

工频与射频电磁辐射测量与防护实战指南

简介:本资源是一份面向公众健康科普与工程防护实践的实用型技术文档,聚焦日常生活中普遍存在的电磁辐射问题,适用于电子电气从业者、环境健康关注者及高校相关专业师生。内容系统梳理了自然源、医疗设备、家用电器与通信基站等多类辐射源的生…

📰

双目视觉立体标定与校正:从棋盘格到深度图的完整指南

简介:这份资源围绕双目立体视觉的立体标定与立体校正展开,面向已掌握OpenCV基础、希望深入立体匹配与三维重建的开发者与学习者。内容基于VS2013与OpenCV3.0环境,对左右相机采集的棋盘格标定图像完成立体标定与校正,为后续视差计算…

📰

阿里云K8s部署Vue2+SpringBoot2.5+Nacos2.0.3实战指南

简介:这份资源面向需要在阿里云Kubernetes集群上落地前后端分离项目的运维与后端开发人员,提供一套可直接参考的部署方案,解决Vue2前端、SpringBoot2.5服务与Nacos2.0.3注册配置中心在k8s中协同编排的问题。包内共16个文件,以8个y…

📰

央国企AI+数智化转型:从报告到落地的工程实践与避坑指南

简介:这份《2025央国企AI数智化转型研究报告》面向央国企管理者、数字化转型负责人及产业研究者,系统梳理AI与大数据在央国企落地中的战略路径、技术应用与生态协同问题。报告从发展现状、核心挑战与痛点切入,覆盖战略路径、技术数据、组织人…

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬