发布时间:2026/8/30 13:34:51
Docling 完整教程:从 PDF 到 Markdown,三步把 20+ 种文档格式变成 AI 能读懂的样子 Docling 完整教程从 PDF 到 Markdown三步把 20 种文档格式变成 AI 能读懂的样子【免费下载链接】doclingGet your documents ready for gen AI项目地址: https://gitcode.com/GitHub_Trending/do/docling如果你要把企业里的 PDF、Word、PPT、HTML 甚至录音喂给大模型做 RAG第一步往往卡在文档读取上PDF 的表格被拆成碎片、Word 的层级结构丢了、扫描件纯靠运气。Docling 就是为这一层设计的开源文档解析引擎——它把 20 多种格式的文档统一解析成同一个结构化模型DoclingDocument再按需导出成 Markdown、JSON、HTML 等 AI 友好格式而且整条链路默认全部在本地运行数据不出机器。先看效果。下面这段 6 行代码能把任意 PDF 变成一个带完整结构的 Markdown 文档from docling.document_converter import DocumentConverter source report.pdf # 本地路径或 URL 都可以 converter DocumentConverter() doc converter.convert(source).document print(doc.export_to_markdown())输出不是简单的一坨纯文本而是保留了标题层级、表格以 Markdown 表格形式还原、公式和列表的结构化内容。这就是 Docling 文档解析的核心卖点格式进结构出。它是什么文档与生成式 AI 之间的入口层Docling 的定位可以一句话概括为生成式 AI 准备文档项目官方描述即 Get your documents ready for gen AI。它不是 PDF 转文字的工具而是一个完整的文档理解引擎输入侧覆盖办公文档DOCX/XLSX/PPTX、ODF、老式 DOC/XLS/PPT、学术与标记格式LaTeX、HTML、Markdown、AsciiDoc、EPUB、数据文件CSV、图像PNG/JPEG/TIFF/WEBP走 OCR、音频与视频WAV/MP3/MP4 等走 ASR 转录以及专利USPTO、期刊JATS、财报XBRL等专用 XML schema输出侧支持 Markdown、HTML、无损 JSON、纯文本、DocTags、WebVTT以及直接面向 RAG 的 JSONL 分块中间层是统一文档模型DoclingDocument标题、段落、表格、公式、图片、页面几何信息都挂在同一棵结构树上分块、序列化、导出全部基于它完成。完整的支持矩阵见 docs/usage/supported_formats.md文档模型的设计思路见 docs/concepts/docling_document.md。能力维度Docling 的做法传统转文字工具的差距表格专用 TableFormer 模型还原行列结构导出为结构化表格多读成一堆错位文本列信息丢失阅读顺序版面分析后按人类阅读顺序重排双栏文档不乱跳按物理坐标硬读左右栏交错公式/代码独立识别阶段公式转 LaTeX通常直接丢弃扫描件多引擎 OCR 可选EasyOCR、RapidOCR、Tesseract 等要么不支持要么精度一般本地化模型全部本地推理支持离线与内网环境多数方案依赖云服务三步上手安装、CLI、Python安装只需一行支持 macOS、Linux、Windows 的 x86_64 与 arm64pip install docling如果更习惯源码方式也可以克隆仓库需 Python 3.102.70 起不再支持 3.9git clone https://gitcode.com/GitHub_Trending/do/docling部分功能以 extras 形式提供按需安装比如pip install docling[vlm]装 VLM 管道依赖pip install docling[asr]装语音转录依赖完整列表在 docs/getting_started/installation.md。第一步用 CLI 转换一份 PDF。装完直接得到docling命令一条命令输出结构化 Markdown 到当前目录docling your_document.pdf想换视觉语言模型路线比如 GraniteDocling加两个参数即可docling --pipeline vlm --vlm-model granite_docling your_document.pdf第二步在 Python 里做同样的事。前面 6 行代码已经演示过默认管道如果你想同时拿到无损 JSON适合存档和二次加工result converter.convert(meeting_deck.pptx) md result.document.export_to_markdown() json_str result.document.export_to_json() # 无损序列化可再加载回 DoclingDocument第三步换个格式试试。同一个DocumentConverter不需要任何改动就能处理 DOCX、HTML、CSV、EPUB——格式识别和后端选择是自动的这也是它一个入口通吃多格式省心的地方。PDF 深度解析它比文字提取多做的那几件事对 PDF 这类版面复杂的输入Docling 走的是完整的版面理解流程而不只是读文字层版面检测识别页面上的文本块、表格区域、图片区域、公式区域阅读顺序判定把多栏、跨栏内容重排成符合人类阅读顺序的序列表格结构恢复TableFormer 模型推断行列与合并单元格输出带表头的结构化表格公式与代码识别公式转成 LaTeX代码块保留等宽结构图像分类与描述判断插图类型图表、照片、Logo可再接 VLM 生成描述。下面的示意图展示了解析后文档结构在层级上的组织方式——每个元素都知道自己属于哪一级标题之下想调整这些行为的开关都集中在PdfPipelineOptions上例如强制开启 OCR 或关闭公式识别来换速度from docling.datamodel.base_models import InputFormat from docling.datamodel.pipeline_options import PdfPipelineOptions from docling.document_converter import DocumentConverter, PdfFormatOption opts PdfPipelineOptions() opts.do_ocr True # 扫描件走 OCR opts.do_code_enrichment True # 开启代码块识别 converter DocumentConverter( format_options{InputFormat.PDF: PdfFormatOption(pipeline_optionsopts)} )解析结果中每个元素还可以附带置信度分数方便你在下游做质量过滤相关概念文档在 docs/concepts/confidence_scores.md。原理一瞥一份文档在 Docling 内部怎么流转不用深究源码也能建立心智模型整体链路是四段式对应代码组织上格式相关解析都在 docling/backend/每个格式一个后端类处理阶段版面、表格结构、OCR、阅读顺序、图表理解等都在 docling/models/stages/编排逻辑在 docling/pipeline/。官方架构全景图如下进阶技巧换 OCR 引擎、RAG 分块、离线部署技巧 1按场景挑 OCR 引擎。Docling 内置多引擎可切换扫描件质量差或语种特殊时值得换from docling.datamodel.pipeline_options import EasyOcrOptions opts PdfPipelineOptions() opts.do_ocr True opts.ocr_options EasyOcrOptions(lang[ch_sim, en]) # 中英混合扫描件引擎对照表Tesseract、RapidOCR、OcrMac、Nemotron 等见 docs/getting_started/installation.md 的 OCR engines 一节。技巧 2跳过自己写分块直接用原生 Chunker。接 RAG 时最常见的坑是分块把表格和标题切断。HybridChunker基于文档结构切分并做 token 感知的大小校正跨块的表格还会自动重复表头from docling.chunking import HybridChunker chunker HybridChunker() for chunk in chunker.chunk(doc): text chunker.contextualize(chunk) # 带上下文如所属标题的序列化文本 # 送进 embedding 模型即可三种分块器Hybrid / Hierarchical / LineBased的差异和适用场景见 docs/concepts/chunking.md 和配套示例 docs/examples/hybrid_chunking.ipynb。技巧 3内网与离线环境部署。模型默认首次使用时自动下载在 air-gapped 环境里先在有网机器上预取再指到本地路径docling-tools models download # 拉取全部默认模型到 ~/.cache/docling/modelsexport DOCLING_ARTIFACTS_PATH/local/path/to/models docling --artifacts-path/local/path/to/models your_document.pdf需要调用云端 OCR 或托管 LLM 时Docling 要求显式 opt-in 才会出网——本地优先、远程可选这对敏感数据场景是关键设计。细节见 docs/usage/advanced_options.md。生态集成接上你的 AI 框架Docling 的下游集成是即插即用级别官方维护了与主流框架的适配集成方式适用场景LangChain 的DoclingLoader在 LangChain 应用里直接加载已解析文档LlamaIndex 的DoclingReaderDoclingNodeParser构建 RAG 索引时保留结构信息Haystack、CrewAI、Kotaemon、txtai 等各类 Agent / RAG 框架的文档入口MCP Server让任意支持 MCP 的 Agent 直接调用文档解析API Serverdocling-serve把 Docling 作为 HTTP 服务跑供多客户端并发调用以 LangChain 为例加载后拿到的Document对象里已经带有 Docling 导出的结构化 Markdown可以直接接 embedding。集成清单与示例见 docs/integrations/index.md可运行的 RAG 示例LlamaIndex、Weaviate、Qdrant 等都放在 docs/examples/ 目录。边界与选型什么场景适合什么场景别硬上比较适合的场景把存量文档库批量变成 RAG 语料且对表格、标题层级质量有要求扫描件、老旧文档的数字化OCR 多引擎 版面重排数据合规要求严格、必须本地推理的企业环境输入格式很杂PDF 混 Word 混 HTML 混音频不想为每种格式单独写解析逻辑。需要权衡的场景只要纯文本、不要结构轻量方案直接抽文字层更省资源Docling 的模型管道是重装备大批量、超低延迟在线服务建议部署 API Server 并评估 GPU 吞吐单进程逐文件转换不是最优解首次运行要下载模型对首跑时间敏感的环境记得提前执行模型预取它输出的是结构化文档不做摘要、问答、抽取式总结这类理解任务——那是接在它下游的 LLM 的活。下一步从一份文档开始最快的验证方式是找一份难啃的文档——带双栏、带表格、最好还是扫描件的 PDF——跑一遍上面的 6 行代码重点看两处表格是否还原成了真正的表格阅读顺序是否通顺。这两点通过基本可以放心把它放进生产管线。项目路线图目前明确排了元数据提取标题、作者、参考文献、语言和复杂化学结构理解两项它由 IBM Research Zurich 发起现托管于 LF AI Data 基金会MIT 许可代码组织与贡献指南可参考 CONTRIBUTING.md。文档、示例和参考手册都在 docs/ 下建议从 docs/getting_started/quickstart.md 顺着读起。【免费下载链接】doclingGet your documents ready for gen AI项目地址: https://gitcode.com/GitHub_Trending/do/docling创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

2026/8/30 13:34:51

Spring AI 2.0 + Agent Utils:构建企业级AI编程助手的完整实践

关于标题里那个“Spring AI 2.0 Agent Utils 开发企业级 Claude Code 项目”,我先给一个明确结论:如果你以为这是讲 Claude Code 的安装命令、快捷键或 VSCode 插件配置,可以直接关掉;但如果你是想通过 Java / Spring AI 技术栈&…

2026/8/30 13:34:51

C语言实战:从零构建自习室管理系统,掌握数据结构与文件操作

简介:这是一套面向计算机专业本科生与嵌入式初学者的C语言综合实践项目——自习室管理系统设计源码,聚焦于真实场景下的资源调度与文件化管理问题,适用于课程设计、毕业设计及嵌入式系统入门开发。压缩包共172个文件,总大小24.33M…

2026/8/30 13:34:51

指针表盘与LCD同时不显示的嵌入式排查手册:从ADC采样到显示链路

前几天帮朋友调一个带指针表盘和 LCD 数显的小仪表,现象非常刺激:仿真软件里表盘的指针一动不动,接上实物 LCD 之后屏幕也是一片空白。两个看起来完全独立的显示链路同时罢工,这在调试中算比较少见的,但恰恰因为少见&a…

2026/8/30 13:49:54

X-NUCLEO-53L9A1评测:VL53L9A1多区ToF测距开发实战

1. 先搞清楚这块板子到底能干嘛说实话,第一次看到“X-NUCLEO-53L9A1”这个名字,很多人第一反应是:又是一块Nucleo扩展板?没错,它是意法半导体(ST)Nucleo生态里的一个评估扩展板,核心…

2026/8/30 13:49:54

Vibe Coding实战:从自然语言到AI编程的新范式

如果你最近在关注 AI 编程领域,大概率已经看到过“Vibe Coding”这个词。它最早由 Andrej Karpathy 在 2025 年初提出,随后迅速成为开发者社区讨论热度最高的话题之一。与此同时,吴恩达在大模型和 AI Agent 方向的动作一直备受关注——这套被…

2026/8/30 13:49:54

1M CAN总线挑战超高刷新率:全掌触觉矩阵协议优化实践

说到“1M CAN总线挑战超高刷新率”,很多人的第一反应是:1Mbps不是已经不低了吗?但如果把一整块手掌矩阵触觉反馈都挂在上面,情况立刻变复杂了。这个项目本质上要回答一个问题:在标准CAN 2.0只有1Mbps带宽的条件下&…

2026/8/30 13:44:54

遥操作需求降低210倍,开源具身模型Isaac 0.5解析

Perceptron 开源了一个具身基础模型版本 Isaac 0.5,核心卖点是“将遥操作需求降低 210 倍”。这个数字如果成立,机器人技能学习里最贵的人工演示环节,成本会被大幅压缩。简单说,原来要准备 210 份人工遥控操作演示,现在…

2026/8/30 0:03:35

vSound小提琴数字处理器实操指南:从接线到演出的完整配置

电小提琴或者原声小提琴插电演出,第一个绕不开的坎就是声音难听。原声琴的共鸣和空气感一旦进了拾音器,出来的往往是一坨干瘪、发尖、带着奇怪塑料味的信号。我当初第一次把琴接上乐队调音台,直接被主唱吐槽"你这声音像在锯钢丝"。…

2026/8/30 0:03:35

传感器接口IC如何攻克生物化学传感的微弱信号难题?

1. 从电极到比特流:为什么生物化学传感必须依赖专用接口IC 做生物化学传感的人都有过类似的经历:明明传感器本身性能很好,信号输出却一塌糊涂——噪声大、漂移明显、重复性差,怎么调都达不到预期。很多时候问题并不在传感器&#…

2026/8/30 0:03:35

STM32F411CEU6多通道ADC采集:扫描模式+DMA实现详解

1. 多通道 ADC 的用武之地把“Multichannel ADC”和“STM32F411CEU6”这两个关键字放在一起,其实就是嵌入式开发里最常遇到的一类需求:用一块不算贵的 MCU,同时采集多路模拟信号。STM32F411CEU6 是 48 引脚的 Cortex-M4F 主控,主频…

2026/8/30 0:03:35

vSound小提琴数字处理器实操指南:从接线到演出的完整配置

电小提琴或者原声小提琴插电演出,第一个绕不开的坎就是声音难听。原声琴的共鸣和空气感一旦进了拾音器,出来的往往是一坨干瘪、发尖、带着奇怪塑料味的信号。我当初第一次把琴接上乐队调音台,直接被主唱吐槽"你这声音像在锯钢丝"。…

2026/8/30 0:03:35

传感器接口IC如何攻克生物化学传感的微弱信号难题?

1. 从电极到比特流:为什么生物化学传感必须依赖专用接口IC 做生物化学传感的人都有过类似的经历:明明传感器本身性能很好,信号输出却一塌糊涂——噪声大、漂移明显、重复性差,怎么调都达不到预期。很多时候问题并不在传感器&#…

2026/8/30 0:03:35

STM32F411CEU6多通道ADC采集:扫描模式+DMA实现详解

1. 多通道 ADC 的用武之地把“Multichannel ADC”和“STM32F411CEU6”这两个关键字放在一起,其实就是嵌入式开发里最常遇到的一类需求:用一块不算贵的 MCU,同时采集多路模拟信号。STM32F411CEU6 是 48 引脚的 Cortex-M4F 主控,主频…

2026/8/28 16:16:48

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/28 16:16:50

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/28 11:06:45

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…