尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
UltraX-Preview数据格式实战指南:raw_content与cleaned_content对照解析5列设计
UltraX-Preview数据格式实战指南raw_content与cleaned_content对照解析5列设计【免费下载链接】UltraX-Preview项目地址: https://ai.gitcode.com/OpenBMB/UltraX-PreviewUltraX-Preview是 OpenBMB 开源社区发布的大规模预训练数据精炼数据集合集基于自适应程序化编辑Adaptive Programmatic Editing对 5 个英文语料逐例精炼每个语料约 20B tokens。它的 UltraX 数据格式采用简洁的5 列设计uid、raw_content、cleaned_content、processed_functions、source其中raw_content与cleaned_content的原始 vs 精炼对照是整个数据格式的核心价值。本文带你快速看懂每一列的含义与实战用法。一、30 秒认识 UltraX 数据集 UltraX 不是端到端地改写文本而是训练一个轻量精炼模型预测结构化编辑操作插入、删除、修改再在原始文本上确定性地执行。最终产出的每个样本都完整保留了修改前和修改后两个版本——这正是 5 列设计的由来。仓库内置 5 个精炼后的英文语料数据集目录源语料说明分片数data/UltraX-FineWeb/FineWeb大规模 Common Crawl 网页语料104data/UltraX-RedPajama-V2/RedPajama-v2多源网页语料110data/UltraX-AICC/AICCHTML 解析的高保真网页语料61data/UltraX-Ultra-FineWeb/Ultra-FineWeb质量过滤的 FineWeb 语料104data/UltraX-FineWeb-ProX-Doc/FineWeb-ProX-Doc文档级精炼语料100每个目录下的文件都是标准 parquet 分片命名规则为数据集名-en-part-序号-of-总数.parquet例如 UltraX-FineWeb-en-part-0001-of-0104.parquet。二、5 列设计总览每一列都在回答一个问题 UltraX 数据格式中每个 parquet 文件都包含且仅包含 5 列均为 string 类型列定义可在 README.md 的元数据中核对列名类型回答的问题uidstring这条样本是谁——唯一标识raw_contentstring原文长什么样——精炼前的原始文本cleaned_contentstring精炼后长什么样——UltraX 处理后的文本processed_functionsstring具体改了哪里——应用的编辑操作sourcestring它从哪来——源语料名称 记忆口诀谁(uid) → 原来什么(raw) → 现在什么(cleaned) → 怎么改的(functions) → 哪来的(source)。三、raw_content 与 cleaned_content 对照解析 这是 UltraX 数据格式中最重要的两列直接构成一组天然的对照实验数据。raw_content原始文本的底稿内容UltraX 精炼之前的原始网页文本角色一切对照与审计的基准uid就是它的 MD5 哈希值用途需要复现原始训练效果如对比基线、或研究精炼前有哪些噪声时使用。cleaned_content精炼后的定稿内容经 UltraX 预测编辑操作并执行后的文本角色正式用于预训练的目标列——实验证明用cleaned_content训练的 1B 模型在 10 项基准上取得全部 5 个语料的最高平均分50 个任务-语料组合中赢下 34 个效果示例在 FineWeb 上UltraX 只用 16B tokens 即超过 Raw 与 ProX-C 用 20B tokens 的最终性能数据效率更高。如何理解两者的差异 两列的差异完全由processed_functions决定是确定性的编辑结果而非模糊的LLM 改写。典型差异形态删减型广告、导航栏、登录墙、版权声明等低价值段落被整段移除替换型行内噪声如乱码、模板占位符被就地替换为干净文本整篇处理型无价值页面错误页、登录墙被remove_all()整篇丢弃无操作型高质量文档执行keep_all()此时两列内容一致——这也是评估数据本底质量的便捷信号。想验证这一点只需在任意样本上对比raw_content与cleaned_content再用processed_functions逐条操作复原即可每一步都可复现、可审计。四、processed_functions从底稿到定稿的编辑脚本 ✂️该列记录了精炼模型预测并执行的操作序列函数空间详见 README.md只有 5 个函数含义keep_all()文档无需修改remove_all()整篇无价值如错误页、登录墙remove_lines(start, end)删除 start 到 end 的连续行含首尾replace_str(line, old, new)在指定行内替换子串add_line(base, sub_idx, content)在指定位置附近插入新行这种行级定位 小范围编辑的设计让 20B tokens 级别的精炼在工程上可靠执行滑动窗口推理、重叠感知聚合、歧义过滤等机制保障也让每条样本的改动逐行可追溯。五、uid 与 source让百万级样本可追溯、可筛选 ️uidraw_content的 MD5 哈希。天然去重键——若两个数据集分片中出现相同uid说明原始文本相同做数据配比、跨语料查重时直接用它即可。source源语料名称。把 5 个语料合并成一个大 parquet 训练时无需记文件名按source过滤/抽样/动态配比即可。六、实战上手两种加载方式 方式一直接从模型仓库加载推荐免下载大文件from datasets import load_dataset ds load_dataset(openbmb/UltraX, UltraX-FineWeb, splittrain) print(ds.column_names) # [uid, raw_content, cleaned_content, processed_functions, source]其余 4 个语料只需替换 config 名UltraX-RedPajama-V2、UltraX-AICC、UltraX-Ultra-FineWeb、UltraX-FineWeb-ProX-Doc完整配置见 README_ZH.md。方式二本地读取 parquet 分片克隆仓库后每个分片即一个标准 parquet 文件如 data/UltraX-AICC/UltraX-AICC-en-part-0001-of-0061.parquet用pandas.read_parquet或pyarrow.parquet均可直接读取按分片并行加载即可。七、使用建议与注意事项 ⚠️训练默认用cleaned_content需要与原始语料做消融对比时再切到raw_contentremove_all()样本的cleaned_content为空构建训练集前建议先过滤避免空文本进入 tokenize许可合规仓库基于 Apache 2.0 发布见 LICENSE但数据源自多个上游语料商用前请逐一核对各源数据集的许可条款更多细节管线流程、评测方法可查阅官方说明 README.md 与中文文档 README_ZH.md。掌握这套 5 列设计后你既能直接训练也能用raw_content/cleaned_content对照对精炼质量做抽样审计——UltraX 数据格式最贴心的地方就是把改了什么和为什么值得改都明明白白留给了你。【免费下载链接】UltraX-Preview项目地址: https://ai.gitcode.com/OpenBMB/UltraX-Preview创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED

相关推荐

F´ 框架 TokenBucket 令牌桶限流工具深度解析:突发流量控制与源码实践

F´ 框架 TokenBucket 令牌桶限流工具深度解析:突发流量控制与源码实践

嵌入式系统编程 【免费下载链接】fprime F - A flight software and embedded systems framework 项目地址: https://gitcode.com/gh_mirrors/fp/fprime 点击查看 免费下载 导读 本文围绕 F(F Prime)飞行软件与嵌入式系统框架中 Utils::Tok…

📅 2026/9/25 1:31:07
面向一线员工的网络安全培训PPT设计方法

面向一线员工的网络安全培训PPT设计方法

简介:本资源是一份面向企业员工、高校师生及网络安全初学者的实用型培训课件,聚焦日常场景下的网络安全风险识别与防护实践。内容涵盖2017年六大典型网络安全事件深度剖析(如共享单车扫码诈骗、315曝光人脸识别漏洞、WannaCry勒索病毒、高考诈…

📅 2026/9/25 1:26:06
@primer/octicons-react-symbols 版本演进与 SVG Symbol 共享渲染机制解析

@primer/octicons-react-symbols 版本演进与 SVG Symbol 共享渲染机制解析

UI组件前端 【免费下载链接】octicons A scalable set of icons handcrafted with ❤️ by GitHub 项目地址: https://gitcode.com/gh_mirrors/oc/octicons 点击查看 免费下载 primer/octicons-react-symbols 是 Octicons 图标库中专为高频重复渲染场景设计的 Reac…

📅 2026/9/25 1:26:06
MORE NEWS

更多资讯

📰

Arduino PWM风扇控制:从原理到闭环调速实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📰

EMQX 修复解读:TimescaleDB/PostgreSQL 桥接动作在 JSON 数字字符串映射 FLOAT 列时返回结构化参数错误而非崩溃数据库连接进程

后端物联网消息队列通信 【免费下载链接】emqx The most scalable and reliable MQTT broker for AI, IoT, IIoT and connected vehicles 项目地址: https://gitcode.com/gh_mirrors/em/emqx 点击查看 免费下载 本文基于 EMQX 开源仓库 changes/ee/fix-17216.en.md…

📰

ClawHub 组织与命名空间认领(Org Namespace Claim)指南:从申诉流程到保留名单源码实现

后端前端AI 技能AI 插件搜索引擎 【免费下载链接】clawhub Skill Plugin Registry for OpenClaw 项目地址: https://gitcode.com/gh_mirrors/mo/clawhub 点击查看 免费下载 本文围绕 ClawHub 的「组织与命名空间认领」机制展开:当 org handle、包 scop…

📰

ctf-wiki 内核态 ROP 提权实战:状态保存、swapgs/iretq 返回用户态与强网杯 2018 core 全解析

文档网络安全教程 【免费下载链接】ctf-wiki Come and join us, we need you! 项目地址: https://gitcode.com/gh_mirrors/ct/ctf-wiki 点击查看 免费下载 本文是 ctf-wiki 内核 pwn 方向的核心技术指南,聚焦 Kernel ROP(返回导向编程&#…

📰

南京企业展厅一体化省心服务商合作案例盘点

苏州市墨堂展览设计有限公司,是扎根江浙沪、聚焦50-200万预算中型企业展厅的一体化服务商,核心为新能源、储能、智能制造、芯片半导体等技术型工业企业提供从前期策划到落地交付的全链条展厅服务。墨堂设计成立于2018年,团队配备展厅策划、空…

📰

【Dify】多阶段深度学习图像处理应用

深度学习驱动的多阶段图像处理工作流正在成为视觉内容生成与优化的重要工具。以模型节点协同方式,流程实现了图像的逐步增强和智能化处理,适合初学编程者理解与上手。 本文梳理了典型多模型工作流的操作流程,解析每个环节的节点作用与实现方式,展示多场景下的应用方法,为…

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬