尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
DeepSeek-OCR-2基准评测实战:如何在OmniDocBench v1.5上复现文档OCR性能
DeepSeek-OCR-2基准评测实战如何在OmniDocBench v1.5上复现文档OCR性能【免费下载链接】DeepSeek-OCR-2Visual Causal Flow项目地址: https://gitcode.com/gh_mirrors/de/DeepSeek-OCR-2本文带你完整走一遍DeepSeek-OCR-2的基准评测流程在主流文档理解基准OmniDocBench v1.5上批量运行文档 OCR 推理输出可评测的 Markdown 结果。无论你是想复现论文性能还是评估自己的文档解析链路都能按这份指南快速上手。一、30秒认识DeepSeek-OCR-2文档OCRDeepSeek-OCR-2论文主题Visual Causal Flow的核心思路很直观不再依赖 CLIP 类视觉编码器而是把语言模型本身当作视觉编码器LM as Vision Encoder探索更接近人类阅读方式的视觉编码图像先被 80M 的 Tokenizer 切块压缩再由 Qwen2500M按因果阅读顺序编码输出高压缩比的视觉 token推理时支持动态分辨率默认(0-6)×768×768 1×1024×1024对应(0-6)×144 256个视觉 token兼顾小图速度与大图细节。一句话它是面向文档转 Markdown场景的高性能 OCR 模型也是 OmniDocBench v1.5 上的标杆选手。相关原理细节可查阅项目附带的论文 DeepSeek_OCR2_paper.pdf。二、一键安装3步搭好评测环境 ️官方环境基线CUDA 11.8 PyTorch 2.6.0第 1 步克隆仓库git clone https://gitcode.com/gh_mirrors/de/DeepSeek-OCR-2 cd DeepSeek-OCR-2第 2 步创建 Conda 环境conda create -n deepseek-ocr2 python3.12.9 -y conda activate deepseek-ocr2第 3 步安装依赖pip install torch2.6.0 torchvision0.21.0 torchaudio2.6.0 --index-url https://download.pytorch.org/whl/cu118 pip install vllm-0.8.5cu118-cp38-abi3-manylinux1_x86_64.whl pip install -r requirements.txt pip install flash-attn2.7.3 --no-build-isolation 小贴士vLLM 与 Transformers 混装时若提示vllm 0.8.5cu118 requires transformers4.51.1之类冲突可忽略不影响推理运行。核心依赖清单见 requirements.txt。三、OmniDocBench v1.5 批量评测关键配置详解评测入口只有一个脚本run_dpsk_ocr2_eval_batch.py所有可调参数集中在 config.py。只需修改这几项配置项说明默认值MODEL_PATH模型路径Hugging Face 或本地权重deepseek-ai/DeepSeek-OCR-2INPUT_PATHOmniDocBench v1.5 图片目录需自行填写OUTPUT_PATHMarkdown 结果输出目录需自行填写MAX_CONCURRENCY并发数显存不足时调小100NUM_WORKERS图像预处理线程数64PROMPT文档转 Markdown 的评测提示词已配好评测脚本内置了几个关键细节直接影响成绩EXIF 方向校正correct_image_orientation()会根据 EXIF 标签自动旋转图片避免评测数据方向错误导致性能虚低N-gram 去重解码通过 ngram_norepeat.py 中的NoRepeatNGramLogitsProcessorngram40、window90抑制生成卡顿重复td等 token 已加白名单保护结果后处理自动清理公式冗余标记、剥离检测坐标片段输出干净的.md文件。四、跑通评测从图片到Markdown 确认config.py后只需一条命令cd DeepSeek-OCR2-master/DeepSeek-OCR2-vllm python run_dpsk_ocr2_eval_batch.py脚本执行流程读取INPUT_PATH下全部图片 → 多线程动态分辨率预处理 → vLLM 批量并发推理gpu_memory_utilization0.7→ 在OUTPUT_PATH生成与图片同名的 Markdown 文件。随后把OUTPUT_PATH交给 OmniDocBench 官方评测工具即可得到文本编辑距离、公式、表格、阅读顺序等指标。同一目录下还有两个姊妹脚本按需切换单图流式输出run_dpsk_ocr2_image.pyPDF 并发处理run_dpsk_ocr2_pdf.py五、常见问题快速排查 ✅显存不够 / OOM调小MAX_CONCURRENCY或降低gpu_memory_utilizationCUDA 11.8 下 Triton 报错脚本已自动设置TRITON_PTXAS_PATH确认 CUDA 路径为/usr/local/cuda-11.8即可没有 vLLM 环境可改用 Transformers 路线直接运行 run_dpsk_ocr2.py单图精度一致但速度较慢结果含坐标标记这是 grounding 模式的检测片段批量评测脚本已自动剥离单图模式可参考re_match()的实现。六、写在最后DeepSeek-OCR-2 用LM 当视觉编码器的 Visual Causal Flow 架构把文档 OCR 推向了新的压缩比与精度平衡点。按照本文流程你可以在一台 GPU 上完整复现它在 OmniDocBench v1.5 上的评测成绩并以此为基线对比自己的解析方案。动手跑起来才是理解这个模型最快的方式 【免费下载链接】DeepSeek-OCR-2Visual Causal Flow项目地址: https://gitcode.com/gh_mirrors/de/DeepSeek-OCR-2创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED

相关推荐

AndroidStudio老项目 macOS运行BlueTooth蓝牙串口助手(Android+Studio源码).rar

AndroidStudio老项目 macOS运行BlueTooth蓝牙串口助手(Android+Studio源码).rar

BlueTooth蓝牙串口助手(AndroidStudio源码).rar已经编译并安装了 打开app了。模拟器没有蓝牙,需要手机上运行app。 下载androidstudio2024。 safari下载中断了,怎么办 M4. Android Studio Koala | 2024.1.1 Patch 1 macos下载 M4…

📅 2026/9/28 20:43:04
AXI Memory Mapped IP核BAR配置全解析:从原理到性能优化

AXI Memory Mapped IP核BAR配置全解析:从原理到性能优化

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📅 2026/9/28 20:38:04
Vivado launch_simulation失败的三级定位与修复

Vivado launch_simulation失败的三级定位与修复

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📅 2026/9/28 20:38:04
MORE NEWS

更多资讯

📰

谁是省时神器?8款AI论文网站梯队榜,毕业季救星!

论文选题总在反复纠结,文献综述写得杂乱无章,查重修改一遍又一遍? 别担心!AI论文工具的出现,正为学术写作带来全新可能。本文将基于内容逻辑性、资料整合力、格式自动生成、查重优化效果四大核心指标,深度测…

📰

从合租分到退款清算:游戏租号平台分账系统的技术架构拆解

我是一名游戏租号平台的技术负责人,有过从 0 到 1 搭建租号平台交易、分账整套系统的经历,踩过支付限额、押金资金池、合租对账混乱等一系列坑。今天从一线落地的视角,聊聊游戏租号赛道的分账架构设计、技术难点以及选型思路,给做…

📰

视频孪生+穿云透雾:单目视频三维实时重构驱动边防线全域四维态势感知与非法越境智能预警

摘要:陆地边境、岸线边防区域具有地形复杂、植被茂密、雨雾沙尘多发、昼夜温差大、遮挡盲区密集、巡查跨度广、值守难度大的典型特征,传统边海防视频监测体系受恶劣天气、密林遮挡、夜间暗光干扰严重,存在画面通透度低、目标识别失效、二维感…

📰

AI资讯日报实战:从信息洪流到精选筛选的完整方法论

1. 一份"AI资讯日报"到底在解决什么问题每天早上打开手机,AI相关的推送能刷出几十条:某大厂发布新模型、某开源社区更新了工具链、某研究机构放出一篇论文、某创业公司拿到新一轮融资。信息量爆炸,但真正有价值的内容往往被淹没在标…

📰

Keil5 RTE组件管理:STM32工程搭建高效指南

1. 为什么RTE值得你花时间搞明白刚接触STM32那会儿,我最怕的就是建工程。新建一个Keil工程,面对满屏的库文件、启动文件、头文件路径,手忙脚乱地一个个往工程里拖,拖完编译一堆报错,不是缺这个就是少那个。后来用上Kei…

📰

Octop自托管AI助手平台:多用户共享部署与配置实战

1. 从一张账单说起:为什么我盯上了 Octop去年年底我拉了一下自己的订阅账单,发现一个很尴尬的事实:ChatGPT Plus、Claude Pro、还有两个国内模型的会员,加起来一个月小两百块。问题是这些额度我根本用不满,但每个平台又…

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬