发布时间:2026/8/30 13:14:47
docling 完全指南:3 行代码完成多格式文档解析与 Markdown 转换 docling 完全指南3 行代码完成多格式文档解析与 Markdown 转换【免费下载链接】doclingGet your documents ready for gen AI项目地址: https://gitcode.com/GitHub_Trending/do/docling如果你正准备搭一套 RAG 系统而语料里混着扫描版论文、Word 合同和 Excel 台账第一件事大概就是把它们统一变成带结构的 Markdown。docling 做的就是这件事它是一个支持多格式文档解析与文档转换的开源工具把 PDF、DOCX、HTML 等输入统一读入同一个 DoclingDocument 数据模型再按需导出为 Markdown、HTML 或无损 JSON。以下内容基于仓库内 README、docs 目录与源码整理类名与参数均可在对应路径中找到。3 行代码跑通第一次 docling 入门转换安装很简单pip install docling需要 Python 3.10 及以上。最小可运行示例如下from docling.document_converter import DocumentConverter converter DocumentConverter() result converter.convert(thesis_scan.pdf) print(result.document.export_to_markdown())输出的是一段带标题层级、列表与表格结构的 Markdown 字符串官方 README 里给出的样例输出以## Docling Technical Report[...]开头。不想写 Python 的话终端里执行docling 文件名也能直接在当前目录生成 .md 文件。格式支持速览从 PDF 解析到音视频完整清单见 docs/usage/supported_formats.md这里按输入格式归纳输入格式常用输出典型场景PDF含扫描件Markdown、JSON、HTML学术论文解析、扫描件 OCRDOCX / PPTX / XLSXMarkdown、JSON办公报告摘要与入库HTML、Markdown、AsciiDoc、LaTeXMarkdown、DocLang网页抓取内容、排版文档转换PNG / JPEG / TIFF / WEBPMarkdown、JSON图片扫描件数字化WAV / MP3、MP4 等音视频文本、WebVTT会议录音、视频字幕转写USPTO / JATS / XBRL 等 XMLMarkdown、JSON专利、期刊、财报解析输出侧除 Markdown 与 HTML 外还有无损 JSON、Doctags 以及面向 RAG 的 ChunksJSONL也就是说分块这一步可以交给 docling 自己做。工作原理一套统一文档模型几条可插拔管道设计思路是“后端 管道”两层每个格式有自己的后端位于 docling/backend/负责把原始文件读出来而管道负责跑模型阶段。PDF 走 StandardPdfPipeline依次完成布局分析、OCR、表格结构等步骤且支持线程化流水线并行Word、HTML 这类本身就有结构信息的格式走 SimplePipeline直读即可。两条线的终点都是同一个 DoclingDocument它用树状结构记录页面、段落、表格与图片导出方法就挂在上面。文本条目还带有置信度机制见 docs/concepts/confidence_scores.md。docling 表格识别与 OCR 的关键开关一览表PDF 相关格式的行为由PdfPipelineOptions控制定义在 docling/datamodel/pipeline_options.py几个最值得知道的开关参数作用何时开启do_ocr对页面执行 OCR默认 True扫描件必须开纯数字 PDF 可关掉以省时do_table_structure检测表格并重建行列结构默认 True财报、论文表格类文档保持开启do_formula_enrichment公式识别并转 LaTeX默认 False解析含公式的学术论文时开启do_code_enrichment面向代码块的感知处理默认 False文档含大量代码或终端输出时开启images_scale生成图片的缩放倍数默认 1.0需要放大图表给下游视觉模型时调高只针对 PDF 调整配置from docling.datamodel.base_models import InputFormat from docling.datamodel.pipeline_options import PdfPipelineOptions from docling.document_converter import DocumentConverter, PdfFormatOption pdf_opts PdfPipelineOptions(do_ocrTrue, do_formula_enrichmentTrue) converter DocumentConverter( format_options{InputFormat.PDF: PdfFormatOption(pipeline_optionspdf_opts)} )OCR 引擎与表格模型细节还可以继续调ocr_options、table_structure_options两个子对象。docling RAG 集成接 LangChain 与 LlamaIndexLangChain 侧有官方扩展 DoclingLoader加载文档几行搞定from langchain_docling import DoclingLoader loader DoclingLoader(file_paththesis_scan.pdf) pages loader.load()LlamaIndex 侧拆成 Reader 与 Node Parser 两个组件前者读文件后者利用文档结构切出适合 embedding 的节点from llama_index.readers.docling import DoclingReader documents DoclingReader().load_data(file_pathreport.docx)集成文档见 docs/integrations/langchain.md。除此之外docling 自带 docling/chunking/ 分块模块可以直接对 DoclingDocument 生成层级式分块配合 JSONL 输出即可跳过下游框架的分块逻辑。仓库 examples 目录下的 rag_langchain.ipynb、rag_llamaindex.ipynb 给了完整可复现的 RAG 链路。生产环境建议本地化、敏感数据与批量重试全程本地运行模型权重下载到本地推理在自有 CPU/GPU 上完成适合处理敏感材料离线环境可把预置权重目录配到artifacts_path避免运行时联网。批量容错用convert_all(paths, raises_on_errorFalse)单个文件失败不会中断整批失败结果里带ConversionResult.status与错误明细方便记录后重试。资源护栏convert与convert_all都支持max_num_pages、max_file_size防止个别超大文件拖垮进程官方建议在批处理系统里再叠加文档级超时保护。横向扩展docling-serve 可以把转换能力部署成 HTTP 服务见 docs/usage/api_server/配套的客户端 SDK 在 docling/service_client/。模型增强是可选的图片描述、图表理解等 enrichment 能力按需开启详见 docs/usage/enrichments.md。常见问题扫描版 PDF 转出来为什么没有文字或很乱扫描件没有文本层需要保证do_ocrTrue且 OCR 引擎Tesseract、EasyOCR 等已正确安装管道会对缺文本层的页面自动走 OCR 补全。导出的 Markdown 里表格结构不对怎么排查表格是由结构模型重建的合并单元格多的复杂表格容易出错。可以换更准的表格模型table_structure_options或开启generate_page_imagesTrue后调用TableItem.get_image()导出表格原图人工核对。遇到 docling 不支持的格式会怎样不会静默通过默认raises_on_errorTrue时直接抛 ConversionError关掉后结果状态为 SKIPPED 或 FAILURE并在 errors 里写明原因。用allowed_formats白名单还能提前拦掉无关格式。写在最后docling 擅长的是把异构格式归一到一套结构化模型再稳定地导出 Markdown 或 JSON其中 PDF 的表格与公式理解在同类工具里完成度较高它不擅长的是内容层面的问答与摘要这部分仍需交给下游大模型。项目后续还会继续补充元数据抽取、化学结构理解等能力文档解析链路本身仍在快速迭代。【免费下载链接】doclingGet your documents ready for gen AI项目地址: https://gitcode.com/GitHub_Trending/do/docling创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

2026/8/30 13:09:47

前端实习面试全攻略:从高频考点到实战复盘

金三银四刚过,后台收到好几个学弟学妹的私信,都在问前端实习面试怎么准备。我去年这个时候也是这么过来的,把网上的前端面试题和前端面试八股文翻了个底朝天,结果真坐在面试官对面,才发现光背题远远不够。这篇面经不是…

2026/8/30 13:29:51

ESP32驱动双VL53L8CX:长线缆I²C与TCA9548A实战避坑指南

最近在折腾一套用 ESP32 同时驱动两个 VL53L8CX 传感器的小项目,传感器是一对 8x8 区域的 ToF 测距模组,主控和模组之间用 50cm 的 IC 线缆连接。上电以后遇到的情况非常典型:两个传感器要么一起失联,要么其中一个初始化到一半就挂…

2026/8/30 13:29:51

雌激素雄性化神经通路与性别特异性行为的机制解析

激素类论文标题不容易在一句话里看懂,这次我们来看这个比较典型的神经科学方向选题:“Estrogen masculinizes neural pathways and sex-specific behaviors”。直译过来就是“雌激素使神经通路和性别特异性行为雄性化”。 这个标题传递的信息密度不低&a…

2026/8/30 13:29:50

基于Spark Structured Streaming的新闻网实时分析系统设计与实践

简介:本资源是一套面向计算机专业本科生的毕业设计与课程设计实践项目,聚焦大数据实时分析场景,基于Spark 2.2构建新闻网数据流式处理与智能推荐系统。项目涵盖数据采集、实时清洗、热点统计、用户行为分析及个性化推荐等核心模块&#xff0c…

2026/8/30 13:24:48

滴滴校招测试开发工程师笔试题全解析:从用例设计到编程思路

每年秋招季总有几个公司的笔试让人印象特别深,2018年滴滴出行的校园招聘测试开发工程师笔试就是其中之一。那会儿网约车大战刚消停没多久,滴滴的岗位热度极高,测试开发工程师这个方向更是吸引了大批计算机、软件工程专业的应届生。我后来在面…

2026/8/30 0:03:35

vSound小提琴数字处理器实操指南:从接线到演出的完整配置

电小提琴或者原声小提琴插电演出,第一个绕不开的坎就是声音难听。原声琴的共鸣和空气感一旦进了拾音器,出来的往往是一坨干瘪、发尖、带着奇怪塑料味的信号。我当初第一次把琴接上乐队调音台,直接被主唱吐槽"你这声音像在锯钢丝"。…

2026/8/30 0:03:35

传感器接口IC如何攻克生物化学传感的微弱信号难题?

1. 从电极到比特流:为什么生物化学传感必须依赖专用接口IC 做生物化学传感的人都有过类似的经历:明明传感器本身性能很好,信号输出却一塌糊涂——噪声大、漂移明显、重复性差,怎么调都达不到预期。很多时候问题并不在传感器&#…

2026/8/30 0:03:35

STM32F411CEU6多通道ADC采集:扫描模式+DMA实现详解

1. 多通道 ADC 的用武之地把“Multichannel ADC”和“STM32F411CEU6”这两个关键字放在一起,其实就是嵌入式开发里最常遇到的一类需求:用一块不算贵的 MCU,同时采集多路模拟信号。STM32F411CEU6 是 48 引脚的 Cortex-M4F 主控,主频…

2026/8/30 0:03:35

vSound小提琴数字处理器实操指南:从接线到演出的完整配置

电小提琴或者原声小提琴插电演出,第一个绕不开的坎就是声音难听。原声琴的共鸣和空气感一旦进了拾音器,出来的往往是一坨干瘪、发尖、带着奇怪塑料味的信号。我当初第一次把琴接上乐队调音台,直接被主唱吐槽"你这声音像在锯钢丝"。…

2026/8/30 0:03:35

传感器接口IC如何攻克生物化学传感的微弱信号难题?

1. 从电极到比特流:为什么生物化学传感必须依赖专用接口IC 做生物化学传感的人都有过类似的经历:明明传感器本身性能很好,信号输出却一塌糊涂——噪声大、漂移明显、重复性差,怎么调都达不到预期。很多时候问题并不在传感器&#…

2026/8/30 0:03:35

STM32F411CEU6多通道ADC采集:扫描模式+DMA实现详解

1. 多通道 ADC 的用武之地把“Multichannel ADC”和“STM32F411CEU6”这两个关键字放在一起,其实就是嵌入式开发里最常遇到的一类需求:用一块不算贵的 MCU,同时采集多路模拟信号。STM32F411CEU6 是 48 引脚的 Cortex-M4F 主控,主频…

2026/8/28 16:16:48

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/28 16:16:50

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/28 11:06:45

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…