发布时间:2026/8/29 15:27:29
MinerU 多语言OCR完整指南:12个语言组覆盖60+种文字的识别路径 MinerU 多语言OCR完整指南12个语言组覆盖60种文字的识别路径【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU一批扫描版 PDF 里混着俄文、阿拉伯文、泰文时你过去的做法大概率是拿默认中文 OCR 模型先跑一遍结果错字连片再按语种换工具、逐页重跑。MinerU 的多语言OCR能力就是解决这个断点的它把 PP-OCR 系列的语言识别模型接进了文档解析管线你只需要在解析时指定一个语言组识别结果就能直接进入结构化输出不用再为每种文字单独搭流程。MinerU 3.4.4 版本里这条能力集中在--lang参数背后12 个可选语言组合计覆盖60 种语言文字且除个别语种外共用同一个文本检测模型换语言组不用重新下载检测权重。 能力盘点12个语言组各管什么MinerU 的--lang参数接受 12 个取值每个取值对应一组「检测模型 识别模型 字符字典」的组合语言组覆盖语言识别模型字典ch默认中文、英文、日文、繁体中文、拉丁语系ch_PP-OCRv6_small_recppocrv6_dict.txtch_server同chmedium 模型精度更高ch_PP-OCRv6_medium_recppocrv6_dict.txtkorean韩文、英文korean_PP-OCRv5_recppocrv5_korean_dict.txtta泰米尔文、英文ta_PP-OCRv5_recppocrv5_ta_dict.txtte泰卢固文、英文te_PP-OCRv5_recppocrv5_te_dict.txtka卡纳达文ka_PP-OCRv3_recka_dict.txtth泰文、英文th_PP-OCRv5_recppocrv5_th_dict.txtel希腊文、英文el_PP-OCRv5_recppocrv5_el_dict.txtarabic阿拉伯文、波斯文、维吾尔文、乌尔都文、普什图文、库尔德文、信德文、俾路支文、英文arabic_PP-OCRv5_recppocrv5_arabic_dict.txteast_slavic俄文、白俄文、乌克兰文、英文eslav_PP-OCRv5_recppocrv5_eslav_dict.txtcyrillic西里尔文字体系 30 种俄文、哈萨克文、蒙古文、鞑靼文、巴什基尔文等cyrillic_PP-OCRv5_recppocrv5_cyrillic_dict.txtdevanagari天城文字体系 13 种印地文、马拉地文、尼泊尔文、梵文等devanagari_PP-OCRv5_recppocrv5_devanagari_dict.txt两个值得注意的点第一cyrillic和devanagari是「文字体系级」分组一个参数覆盖几十种语言代价是对单一语言的针对性不如east_slavic这类「语种级」分组第二绝大多数语言组共用ch_PP-OCRv6_small_det这个统一的检测模型只有ka仍走 v3 世代的多语言检测模型。 原理速览检测和识别如何分工多语言识别的核心思路是「检测与识别解耦」检测负责「框出哪里有字」识别负责「读出字是什么」换语言组只动识别侧检测模型基本不动。语言参数支持别名自动归一ru会映射到east_slavichi映射到devanagarien、japan、latin统一归到ch组。--lang仅对pipeline 后端生效其他后端不受该参数影响。 上手路径从安装到拿到多语言结果第 1 步安装 MinerU# 安装 MinerU 及全部解析依赖 uv pip install -U mineru[all]第 2 步指定语言组解析文档# 用阿拉伯语组解析 PDF指定 pipeline 后端结果输出到 output/ mineru -p doc.pdf -o output --backend pipeline -l arabic首次运行会自动下载所需模型权重国内网络可用环境变量MINERU_MODEL_SOURCEmodelscope切换模型源。解析完成后output/目录下会生成 Markdown、content list JSON 和图片文件。第 3 步验证结果打开生成的.md文件重点抽查非拉丁文字段落和数字、标点。若个别语种效果不佳再回到语言组选择上调整见下文取舍部分。⚙️ 关键参数真正影响识别效果的 4 个选项参数作用建议值-l / --lang决定加载哪个识别模型和字典直接决定识别精度默认ch确认文档语种后显式指定chvsch_server覆盖语言相同ch_server用 medium 模型精度更高但更慢GPU 环境且对精度敏感时用ch_server-b / --backend解析后端--lang只在pipeline下生效多语言OCR场景用pipeline-m / --methodauto会优先利用 PDF 自带文字层ocr强制走 OCR扫描版/图片文档显式用ocr⚖️ 边界与取舍什么场景好用什么场景别用单语种或主语种明确的文档是多语言OCR效果最好的场景显式指定语言组后识别模型和字典聚焦在该文字体系上比让默认模型「猜」要稳定得多。而中英混排的文档其实不用额外配置——默认的ch组本身就覆盖中文、英文、日文、繁体和拉丁语系。反过来的取舍也要心里有数。俄文文档用east_slavic比用覆盖面更广的cyrillic更准阿拉伯语系 8 种语言共享一个模型组其中弱势语种如俾路支文的识别率会明显低于阿拉伯文本身。含大量复杂公式或跨页表格的扫描件pipeline 后端的整体质量不如 hybrid / VLM 后端而这两个后端又不接受--lang参数——这是目前要接受的权衡。另外ka卡纳达文仍是 v3 世代的模型同组里其他语言已升级到 v5遇到该语种可以预期效果相对弱一档。最后如果你的 PDF 本身带文字层非扫描件直接走auto方法利用文字层即可完全不需要经过 OCR。➡️ 下一步先跑一遍仓库内置示例demo/pdfs/demo1.pdf确认全链路通畅再把手头的多语言文档接进来API 方式调用与输出文件结构见 docs/zh/usage/quick_usage.md。提示本文基于 v3.4.4 版本编写不同版本行为可能不同以实际版本为准。【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

2026/8/29 15:27:29

LIS2DH12低功耗振动检测实战:寄存器配置与管道泄漏监测经验

用 LIS2DH12 做低功耗振动检测:从寄存器配置到管道泄漏实站经验 这两年我做低功耗传感节点,用得最多的三轴加速度计就是 ST 的 LIS2DH12。这颗芯片名字里带“nano”,封装确实小,2x2x1mm 的 LGA 塑封,焊盘间距 0.5mm&am…

2026/8/29 15:22:29

模拟退火算法:从物理退火到优化求解的完整指南

1. 项目概述:从“烧铁淬火”到求解复杂优化 如果你在数学建模或者算法优化的圈子里待过一阵子,肯定不止一次听过“模拟退火”这个名字。它听起来有点玄乎,像是把冶金工业里的东西搬到了计算机里。我第一次接触它,是为了解决一个经…

2026/8/29 15:37:30

Taste-Skill:3步让AI生成的页面摆脱“一眼AI“味

Taste-Skill:3步让AI生成的页面摆脱"一眼AI"味 【免费下载链接】taste-skill Taste-Skill - gives your AI good taste. stops the AI from generating boring, generic slop 项目地址: https://gitcode.com/GitHub_Trending/ta/taste-skill 让AI…

2026/8/29 15:37:30

深入解析LC串并联谐振:从基础原理到LLC变换器与滤波器设计实践

1. 项目概述:从“谐振”现象说起在电子电路的世界里,尤其是涉及信号处理、能量传输和频率选择的场景,“谐振”是一个绕不开的核心概念。我第一次被这个概念震撼,是在调试一个简单的收音机电路时,仅仅通过调节一个可变电…

2026/8/29 15:37:30

大模型评测防作弊:数据污染检测与抗过拟合评测流程

最近关于大模型评测的话题又引起了不小的讨论。有研究人员在独立测试国内某头部大模型时发现,模型在公共测试环境中的表现与换用一套全新题目后的表现存在明显差距,甚至怀疑模型通过某种方式“绕过”了测试环境。消息一出,技术圈讨论很多&…

2026/8/29 15:32:29

AI对年轻人思维与幸福感的冲击:技术防护与可控使用方案

“我讨厌人工智能对年轻人的思想和幸福所做的一切。”这句话正在从一句私人抱怨,变成越来越多技术人、家长和教育者绕不开的议题。作为一个每天接触大模型、AI绘画、AI视频、AI编程助手和各类智能体的开发者,我也在反复观察同一件事:AI 到底在…

2026/8/28 16:16:17

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/28 16:16:21

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/28 16:16:22

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/29 0:01:10

etc目录下的profile.d文件目录设置环境变量和全局脚本shell

一、设置环境变量etc目录下的profile.d文件目录 /etc/profile.d1、编写 vi test.sh文件内容# jdk变量 export ZHK_HOME/root export PATH$PATH:$ZHK_HOME/test # 可以取出来ZHK_HOME变量给ZZZ_HOME赋值 export ZZZ_HOME${ZHK_HOME}/test2、刷新 执行source /etc/profile 命令使…

2026/8/29 0:01:10

【JavaScript】内存管理-垃圾回收机制-内存泄露

内存管理 C 语言这样的底层语言一般都有底层的内存管理接口,比如 malloc()和free()。 而 JavaScript 是在创建变量(对象,字符串等)时自动进行了分配内存,并且在不使用它们时“自动”释放。释放的过程称为垃圾回收。 整…

2026/8/29 0:01:10

Labgrid-MCP:为嵌入式硬件实验室接入AI Agent操控能力

Labgrid-MCP 的目标是把 MCP(Model Context Protocol)能力延伸到真实嵌入式硬件实验室:AI Agent 通过一个标准化的 MCP Server,就能查看目标板状态、控制上电断电、复位开发板、读取串口日志,甚至执行镜像刷写。对于经…

2026/8/28 16:16:48

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/28 16:16:50

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/28 11:06:45

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…