DeepSeek-OCR-2快速上手:10行代码如何把任意文档图片精准转成Markdown

发布时间:2026/9/27 7:56:09

DeepSeek-OCR-2快速上手:10行代码如何把任意文档图片精准转成Markdown DeepSeek-OCR-2快速上手10行代码如何把任意文档图片精准转成Markdown【免费下载链接】DeepSeek-OCR-2Visual Causal Flow项目地址: https://gitcode.com/gh_mirrors/de/DeepSeek-OCR-2DeepSeek-OCR-2 是一款开源的深度学习 OCR 工具Visual Causal Flow 架构只需 10 行代码即可将文档图片、PDF 精准转换成 Markdown 格式支持动态分辨率与高并发批量识别对新手非常友好。一、DeepSeek-OCR-2 是什么DeepSeek-OCR-2 的核心思想是像人一样阅读它通过视觉因果流按人类视觉习惯的顺序编码图片内容并采用动态分辨率——默认最多将图片切分为 (0-6) 块 768×768 区域加 1 块 1024×1024 缩略图只消耗 144256 个视觉 token既省显存又保精度。相比传统 OCR它最大的优势是 直接输出结构化 Markdown标题、表格、公式、图片位置一应俱全️ 自动切出文档中的插图并引用⚡ 支持图片流式输出、PDF 高并发批量转换二、一键安装三步配好OCR环境官方环境为 CUDA 11.8 torch 2.6.0按 README 操作只需三步# 1. 克隆仓库 git clone https://gitcode.com/gh_mirrors/de/DeepSeek-OCR-2 # 2. 创建 Python 3.12 环境 conda create -n deepseek-ocr2 python3.12.9 -y conda activate deepseek-ocr2 # 3. 安装依赖vllm-0.8.5 的 whl 包需先下载 pip install torch2.6.0 torchvision0.21.0 torchaudio2.6.0 --index-url https://download.pytorch.org/whl/cu118 pip install vllm-0.8.5cu118-cp38-abi3-manylinux1_x86_64.whl pip install -r requirements.txt pip install flash-attn2.7.3 --no-build-isolation其余依赖Pillow、PyMuPDF、numpy 等都列在 requirements.txt 中。三、10行代码单张图片转Markdown最快的体验路径是 Transformers 推理直接参考 run_dpsk_ocr2.py核心只有 10 行from transformers import AutoModel, AutoTokenizer import torch model_name deepseek-ai/DeepSeek-OCR-2 tokenizer AutoTokenizer.from_pretrained(model_name, trust_remote_codeTrue) model AutoModel.from_pretrained(model_name, _attn_implementationflash_attention_2, trust_remote_codeTrue, use_safetensorsTrue) model model.eval().cuda().to(torch.bfloat16) prompt image\n|grounding|Convert the document to markdown. res model.infer(tokenizer, promptprompt, image_fileyour_image.jpg, output_pathyour/output/dir, base_size1024, image_size768, crop_modeTrue, save_resultsTrue)把image_file换成你自己的文档图片路径即可识别结果会保存到output_path。四、vLLM 路线图片流式识别 PDF批量转换追求速度就用 vLLM 推理所有参数集中在 config.py 中修改配置项作用INPUT_PATH/OUTPUT_PATH输入图片/PDF 与输出目录CROP_MODE是否启用动态分辨率切图MAX_CONCURRENCYPDF 并发数显存不足可调小cd DeepSeek-OCR2-master/DeepSeek-OCR2-vllm # 单张图片流式输出边识别边打印 python run_dpsk_ocr2_image.py # PDF高并发批量转换速度与上一代持平 python run_dpsk_ocr2_pdf.py # 基准测试批量评测OmniDocBench v1.5 python run_dpsk_ocr2_eval_batch.py对应源码分别是 run_dpsk_ocr2_image.py、run_dpsk_ocr2_pdf.py 和 run_dpsk_ocr2_eval_batch.py。五、识别结果长什么样以图片脚本为例输出目录会生成三类文件result.mmd清洗后的最终 Markdown图片占位符已被替换为![](images/0.jpg)result_ori.mmd模型原始输出含坐标标注信息result_with_boxes.jpg在原图上画出标题、文本块等定位框方便人工校对文档中的插图还会被自动裁剪到images/子目录配合 image_process.py 的动态分辨率逻辑大幅面扫描件的细节也不易丢失。六、常用Prompt速查表场景Prompt完整文档转 Markdown带布局image\n|grounding|Convert the document to markdown.纯文本提取无布局image\nFree OCR.小技巧识别结果出现长串重复时可检查 ngram_norepeat.py 中的去重处理器配置——它默认禁止 20 元组重复白名单保留表格 tokentd、/td让长表格识别更稳定。七、写在最后从克隆仓库到第一份 Markdown 产出整个过程不到 10 分钟。如果你想深入原理可以阅读项目自带的论文 DeepSeek_OCR2_paper.pdf。对于需要把扫描件、截图、PDF 批量转为 Markdown 的团队和个人来说DeepSeek-OCR-2 目前是最省心的开源选择之一 【免费下载链接】DeepSeek-OCR-2Visual Causal Flow项目地址: https://gitcode.com/gh_mirrors/de/DeepSeek-OCR-2创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
延伸阅读

更多相关文章

2026/9/27 7:56:09

状态机与 BPMN 怎么选?把同一个客户开通流程画两遍

状态机与 BPMN 怎么选?把同一个客户开通流程画两遍 《企业级 Workflow 实战:从审批流到 AI Agent》|第 04 篇 / 共 24 篇 本篇成果:同一案例的状态迁移表、可运行 Python 状态机、BPMN 2.0 XML 模型与结构校验。 阅读边界&#xf…

2026/9/27 7:56:09

电影网站开发背景实战案例:3个技巧让流量翻倍

电影网站开发背景实战案例:3个技巧让流量翻倍 别再被那些花里胡哨却丑得掉渣的模板网站坑了!我见过太多甲方拿着几百块的模板站来问为什么没流量,答案很简单:搜索引擎根本不想给这种“垃圾堆”排名。今天咱们不聊虚的,直接上 实战案例…

2026/9/27 8:41:11

哪个素材网站免费源码下载

5个免费素材站实测,建站不拖工期最佳实践 改个需求建站公司拖一周,这种绝望感谁懂?我见过太多设计师朋友,明明手里有图,脑子里有方案,结果卡在找素材、切图、写代码这三个环节,硬生生把三天能搞定的事拖成半个月。很多人以为慢在技术,其实慢在资源获…

2026/9/27 8:41:11

模板网站开发推荐:保姆级建站教程与SEO避坑指南

模板网站开发推荐:保姆级建站教程与SEO避坑指南 改个需求建站公司拖一周,后台权限还攥在别人手里,这种憋屈谁懂?很多独立站长或中小企业主在初期为了省钱选了模板建站,结果后期发现想改个Banner图都要排队,想加个功能得加钱,更崩溃的是网站做…

2026/9/27 8:36:11

公司网站做一年多少钱?保姆级建站教程避坑指南

公司网站做一年多少钱?保姆级建站教程避坑指南 改个需求建站公司拖一周,这种憋屈感每个被外包坑过的老板都懂。别急着换供应商,先看看你的合同里到底签了什么。很多创业者一上来就问【公司网站做一年多少钱】,其实这是个伪命题。价格取决于你选的是模板站…

2026/9/27 0:00:45

东莞市品牌网站建设报价常见报错与解决

东莞品牌网站建设报价单背后:一份保姆级建站教程避坑实录 网站做好了没人访问,这大概是很多老板最头疼的事。花了大几万做的品牌站,上线后流量惨淡,比路边摊还冷清。别急着骂外包公司,很多“东莞品牌网站建设报价”里藏着不少猫腻,比如用模板站冒充定制…

2026/9/27 0:00:45

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解 【免费下载链接】spirula-studio Cross-vendor 3D Gaussian Splatting trainer - video to splat to mesh, Vulkan or CUDA. 项目地址: https://gitcode.com/GitHub_Trending/sp/spirula-studio Sp…

2026/9/27 0:00:45

SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南 模板网站太丑不够用?别急着加滤镜,那是治标不治本。很多老板盯着后台流量掉得眼红,却还在纠结首页Banner的圆角是不是3像素。这就像穿着西装去挖土,姿势不对,努力白费。我整理这份 速查手册…

2026/9/27 0:00:45

东莞市品牌网站建设报价常见报错与解决

东莞品牌网站建设报价单背后:一份保姆级建站教程避坑实录 网站做好了没人访问,这大概是很多老板最头疼的事。花了大几万做的品牌站,上线后流量惨淡,比路边摊还冷清。别急着骂外包公司,很多“东莞品牌网站建设报价”里藏着不少猫腻,比如用模板站冒充定制…

2026/9/27 0:00:45

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解 【免费下载链接】spirula-studio Cross-vendor 3D Gaussian Splatting trainer - video to splat to mesh, Vulkan or CUDA. 项目地址: https://gitcode.com/GitHub_Trending/sp/spirula-studio Sp…

2026/9/27 0:00:45

SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南 模板网站太丑不够用?别急着加滤镜,那是治标不治本。很多老板盯着后台流量掉得眼红,却还在纠结首页Banner的圆角是不是3像素。这就像穿着西装去挖土,姿势不对,努力白费。我整理这份 速查手册…

2026/9/25 20:55:38

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/26 19:58:38

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/25 18:34:56

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
☎咨询二维码 ☎ ↑