尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
快速上手Unlimited-OCR:从零搭建环境到首次解析文档的10分钟完全教程
快速上手Unlimited-OCR从零搭建环境到首次解析文档的10分钟完全教程【免费下载链接】Unlimited-OCRUnlimited OCR Works: Welcome the Era of One-shot Long-horizon Parsing.项目地址: https://gitcode.com/gh_mirrors/un/Unlimited-OCRUnlimited-OCR 是一款面向长文档的开源 OCR 文档解析工具主打一次性长时程解析One-shot Long-horizon Parsing无论是单页扫描件还是整本 PDF它都能一口气读完并输出带版式的 Markdown 文本。本教程带你从零开始克隆仓库 → 配置推理环境 → 完成首次文档解析全程约 10 分钟。一、Unlimited-OCR 是什么长文档 OCR 解析的核心能力Unlimited-OCR 基于 DeepEncoder 视觉编码器 LLMR-SWA 滑窗注意力架构把阅读长文档拆成三步理解Understand→ 聚焦Focus→ 提取Extract因此能稳定处理长篇幅文档而不迷失方向。它提供三种官方推理后端可按需求任选其一后端适用场景特点Transformers快速体验、单张图代码最直观NVIDIA GPU 即可vLLM高并发服务部署社区已提供官方 RecipeSGLang批量解析图片目录/PDF配合 infer.py 一键并发推理吞吐最高二、第一步克隆 Unlimited-OCR 仓库1分钟git clone https://gitcode.com/gh_mirrors/un/Unlimited-OCR cd Unlimited-OCR仓库结构非常精简核心内容如下infer.pySGLang 并发推理脚本自动启动服务并批量解析wheel/sglang-0.0.0.dev11416g92e8bb79e-py3-none-any.whl适配本模型的 SGLang 本地安装包Unlimited-OCR.pdf论文原文想深挖原理可阅读README.md官方文档含全部三种后端的详细用法三、第二步快速搭建 SGLang 推理环境5分钟推荐用 uv 管理虚拟环境最快最省事要求 Python 3.12 NVIDIA GPU CUDA 12.9uv venv --python 3.12 source .venv/bin/activate # 安装本地 SGLang、kernels 与 PDF 转图依赖 uv pip install wheel/sglang-0.0.0.dev11416g92e8bb79e-py3-none-any.whl uv pip install kernels0.11.7 uv pip install pymupdf1.27.2.2 如果你只想跑一张图做体验也可以选 Transformers 路线pip install torch2.10.0 transformers4.57.1 Pillow12.1.1等完整依赖清单见 README.md。模型权重为baidu/Unlimited-OCR首次运行会自动从模型仓库下载请确保磁盘空间充足。四、第三步10分钟完成首次文档解析方式A用 infer.py 一键批量解析推荐infer.py 会自动启动 SGLang 服务、等待就绪、并发发送请求并在结束后打印吞吐统计tokens/s、平均解码耗时等。解析整个图片目录python infer.py \ --image_dir ./examples/images \ --output_dir ./outputs \ --concurrency 8 \ --image_mode gundam直接解析 PDF每页自动转为 300DPI 图片并并发解析python infer.py \ --pdf ./your_doc.pdf \ --output_dir ./outputs \ --concurrency 8每张输入图片对应输出一个同名.md文件PDF 则按页生成xxx_page_0001.md这样的分页结果打开即可看到解析出的正文与版式标记。相关参数定义见 infer.py#L303-L316。方式BTransformers 跑通第一张图如果想最快看到效果十几行代码就够了import torch from transformers import AutoModel, AutoTokenizer model_name baidu/Unlimited-OCR tokenizer AutoTokenizer.from_pretrained(model_name, trust_remote_codeTrue) model AutoModel.from_pretrained( model_name, trust_remote_codeTrue, use_safetensorsTrue, torch_dtypetorch.bfloat16, ).eval().cuda() model.infer( tokenizer, promptimagedocument parsing., image_fileyour_image.jpg, output_pathyour/output/dir, base_size1024, image_size640, crop_modeTrue, max_length32768, save_resultsTrue, )更多参数说明多图、PDF 转图参考 README.md#L60-L127。五、看看解析效果Unlimited-OCR 长时程演示下面是官方演示界面左侧输入整篇论文 PDF右侧 Tab 实时流式输出解析结果——可以看到 Unlimited-OCR 对长文档的一次性连续解析能力。六、常用选项速查按需定制解析任务选项默认值作用--image_dir-待解析图片目录--pdf-PDF 文件路径自动逐页转图--output_dir./outputs结果 Markdown 输出目录--concurrency8并发请求数显存充裕可调大--gpu0指定 CUDA 卡号--model_dirbaidu/Unlimited-OCR本地模型路径或远程模型 ID--image_modegundamgundam裁剪模式或base原图模式--server_log./log/sglang_server.log服务日志排查问题先看它两个小经验gundamvsbase单张图两种都支持多页/PDF 场景只支持baseimage_size1024。服务启动慢首次加载 3B 模型需要几十秒infer.py会轮询健康检查看到Server ready (xxs)才算就绪无需手动干预。七、常见问题 FAQQ1没有 NVIDIA GPU 能跑吗目前官方三种后端均面向 NVIDIA GPUCUDA 12.9暂不支持纯 CPU 推理。Q2显存大概需要多少模型为 3B MoESGLang 默认--mem-fraction-static 0.8建议 24GB 显存的消费级显卡起步显存吃紧可下调该参数。Q3解析结果全是乱码/重复怎么办检查输入图片分辨率PDF 建议保持 300DPI并确认使用的image_mode与输入类型匹配多页请用base。Q4想换 vLLM 部署可以吗可以官方已支持 vLLM 推理详见 README.md 中的说明与 Docker 镜像。八、继续探索完整用法与三种后端细节README.md想深入理解 R-SWA 长上下文机制Unlimited-OCR.pdf想参与开发先阅读 CONTRIBUTING.md欢迎提交 Issue 与 PR遇到问题查看 infer.py#L85-L136 的服务启动逻辑结合--server_log日志定位问题恭喜到这里你已经完成了 Unlimited-OCR 的环境搭建与首次文档解析。试着把一份真实 PDF 扔给infer.py10 分钟后收获一份结构化的 Markdown 文档吧 【免费下载链接】Unlimited-OCRUnlimited OCR Works: Welcome the Era of One-shot Long-horizon Parsing.项目地址: https://gitcode.com/gh_mirrors/un/Unlimited-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED

相关推荐

Gatsby YAML 单文件基准测试站点(gabe-yaml-text)深入解析

Gatsby YAML 单文件基准测试站点(gabe-yaml-text)深入解析

Gatsby YAML 单文件基准测试站点(gabe-yaml-text)深入解析 【免费下载链接】gatsby React-based framework with performance, scalability, and security built in. 项目地址: https://gitcode.com/gh_mirrors/ga/gatsby 本文基于 benchmarks/gab…

📅 2026/9/18 7:49:38
从写代码到管项目:Cursor Projects如何让AI成为你的开发施工队

从写代码到管项目:Cursor Projects如何让AI成为你的开发施工队

作为一个常年泡在 AI 编程工具里的人,我最近几乎把所有工作流都搬到了 Cursor 上,但真正让我觉得“AI 编程这件事终于变味了”的,是 Cursor Projects 这个功能。不是因为它让写代码更流畅,而是因为它彻底改变了我的角色——我从一…

📅 2026/9/18 7:49:38
账户异常调用复盘:OpenAI 智能体经 TaoToken 留痕

账户异常调用复盘:OpenAI 智能体经 TaoToken 留痕

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📅 2026/9/18 7:49:38
MORE NEWS

更多资讯

📰

MATLAB实现兰伯特问题的航天轨道设计与优化

1. 兰伯特问题概述:航天轨道设计的数学基石兰伯特问题(Lamberts Problem)是航天动力学中经典的轨道转移问题,核心是求解在两个已知位置向量之间、在给定时间内完成转移所需的轨道参数。这个问题由瑞士数学家约翰海因里希兰伯特在1…

📰

进口编码器停产替代:三条路线与现场实测复盘

上个月一个老朋友打电话过来,说他们产线上的一台进口编码器彻底买不到了,原厂发了停产通知,备件库里最后两只已经被他锁进柜子当宝贝。这种电话我这两年接过不少。编码器这个位置特别尴尬,它不像轴承、密封件那样有大把通用替代&a…

📰

ROS中航向角的正确求解:从四元数到yaw的数学与工程实践

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📰

PSP3爆料解析:15瓦芯片、低功耗模式与3-7小时续航的功耗账

前几天刷到一条爆料,说索尼下一代掌机(圈子里习惯先叫它PSP3)会用一颗15瓦级别的芯片,配合低功耗模式,续航能做到3到7小时,发布窗口指向2027年底。作为一个常年跟芯片功耗、电源管理打交道的人,…

📰

IT部门年终总结PPT全攻略:从运维数据到业务价值呈现

简介:一份面向IT部门管理者与信息部团队的年终总结PPT模板,聚焦年度目标复盘、技术项目实施、运维支持与来年规划四大模块,适合用于部门汇报、述职或年度复盘场景。压缩包内共1个文件,为PPTX演示文稿,约5.7MB&#xff…

📰

Iris中间件清单:13个内置中间件让你快速构建更安全的应用

Iris中间件清单:13个内置中间件让你快速构建更安全的应用 【免费下载链接】iris The fastest HTTP/2 Go Web Framework. New, modern and easy to learn. Fast development with Code you control. Unbeatable cost-performance ratio :rocket: 项目地址: https:/…

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬