发布时间:2026/8/29 15:12:28
MinerU 多语言 OCR 实战指南:12 个语言参数完整对照 MinerU 多语言 OCR 实战指南12 个语言参数完整对照【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerUMinerU 的多语言 OCR 靠 CLI 的-l语言参数实现指定文档所属语言pipeline 就会切换到对应的识别模型与字典。非中英语种的扫描件默认参数下容易识别错乱指定语言后输出仍是带图片的结构化 markdown。快速上手三条命令解析一份阿拉伯语文档先安装并确认模型源可达国内网络切到 ModelScopepip install MinerU export MINERU_MODEL_SOURCEmodelscope # 仅国内网络需要然后默认语言跑一遍再指定语言对比# -l 缺省为 ch覆盖中文/英文/日文/繁体/拉丁 mineru -p your.pdf -o output/ -b pipeline # 阿拉伯语系文档只多一个参数 mineru -p your.pdf -o output/ -b pipeline -l arabic两点说明-l只对pipeline后端生效默认的hybrid-engine或vlm-engine会忽略它该参数没有自动检测取值不传时按ch处理。工作原理-l 参数走到哪一步语言参数的链路很短从参数入口到模型选择一条直线12 个公开语言值与别名定义在 mineru/utils/ocr_language.pyen、japan、ru、ar等别名会先归一到基础值再进模型未知取值直接抛ValueError。语言参数只决定识别模型 字典的选型文本检测环节是共用的识别侧底座来自 PaddleOCR 系列模型。hybrid 与 vlm 后端不读取该参数所以换语言没变化通常不是语言的问题是后端选错了。能力全景哪份文档该用哪个 -l12 个取值按文字体系分组。统一输出输出目录下按文件生成 markdown、裁剪图片与中间 JSON。解析场景-l 输入可识别范围备注中/英/日/繁混排ch默认中文、英文、日文、繁体中文、拉丁ch_server为中文模型的服务端变体韩文korean韩文、英文泰文th泰文、英文希腊文el希腊文、英文阿拉伯语系arabic阿拉伯、波斯、维吾尔、乌尔都、普什图、库尔德、信德、平衡奇、英文8 种文字共用一个模型东斯拉夫east_slavic俄、白俄、乌克兰、英文西里尔宽cyrillic俄、保加利亚、蒙古、哈萨克等 34 种覆盖东斯拉夫三语之外的西里尔文字天城文devanagari印地、马拉地、尼泊尔等 14 种南亚单语ta/te/ka泰米尔 / 泰卢固 / 卡纳达ka不含英文实战场景两类日常工作批量解析俄文合同mineru -p contracts/ -o output/ -b pipeline -l east_slavic目录输入受支持contracts/下每个 PDF 各自生成一个子目录markdown 文件名与原文件对应。预期效果俄文正文完整西里尔字母与数字混排如 1 200 000 руб.不丢字若合同含较多保加利亚语内容改用cyrillic。阿拉伯语手册走 API 提交curl -X POST http://127.0.0.1:8000/file_parse \ -F filesmanual.pdf \ -F backendpipeline \ -F lang_listarabic \ -F return_mdtruelang_list表单字段与 CLI 的-l对应列表长度小于文件数时首值会复用到剩余文件。接口同步返回解析结果markdown 直接在响应里取出。参数调优与避坑5 条自查项现象加了 -l 没有任何变化。原因后端不是pipeline默认hybrid-engine会忽略该参数。解法追加-b pipeline。现象报Language xxx not supported。原因取值不在 12 个白名单内常见误写是fr、de、vi。解法除希腊文外没有独立的欧洲语言参数回退到ch其拉丁范围可覆盖。现象传auto报错。原因该参数没有自动检测取值缺省就是ch。解法按文档主导语言手工指定。现象西里尔文文档识别不全。原因用了east_slavic它只覆盖俄/白俄/乌三语。解法保加利亚、蒙古、哈萨克等改用cyrillic。现象模型下载失败。原因网络到不了默认模型源。解法export MINERU_MODEL_SOURCEmodelscope后重跑。性能与能力口径MinerU 没有公布多语言 OCR 的官方精度或提速基准因此不引用具体提升数字。以下数值均直接取自源码统计项数值口径公开语言参数数量12ocr_language.py 中PUBLIC_OCR_LANGUAGES单参数最大覆盖34 种语言cyrillic描述逐条计数默认语言值chCLI-l的缺省值别名映射示例en/japan→ chru/be/uk→ east_slavicnormalize_ocr_model_lang需要自测精度时建议每种语系准备 20~50 页测试集对同页分别在ch与目标语言取值下跑一遍人工比对识别结果。延伸阅读多语言能力收敛在一个参数上先判断文档文字体系选对应的-l取值确认后端为pipeline识别结果就与输入匹配。mineru/utils/ocr_language.py语言白名单、别名与归一化逻辑的完整实现docs/zh/usage/cli_tools.mdCLI 全部参数的官方说明【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

2026/8/29 15:12:28

OpenViking 快速开始:从安装到 add-resource 的完整新手教程

OpenViking 快速开始:从安装到 add-resource 的完整新手教程 【免费下载链接】OpenViking Self-evolving Context Database for AI Agents. Unify Agent Memory, Knowledge RAG and Skills. 项目地址: https://gitcode.com/GitHub_Trending/op/OpenViking Op…

2026/8/29 15:07:28

微信小程序点餐系统实战:订单状态机与并发扣库存详解

简介:微信小程序作为轻量级应用形态,已成为餐饮数字化的重要载体。而点餐系统的核心不仅是前端交互,更涉及后端服务、数据库设计和并发一致性等工程问题。Spring Boot结合MyBatis Plus提供了高效的后端开发框架,MySQL作为持久层保…

2026/8/29 15:07:28

MATLAB函数调用机制全解析:从搜索路径到性能优化

1. 从“函数或变量无法识别”说起:为什么你需要理解MATLAB函数调用 如果你在MATLAB命令行里敲入一个函数名,回车,然后看到那个刺眼的红色错误提示:“函数或变量 ‘xxx’ 无法识别”,这大概是每个MATLAB用户&#xff0c…

2026/8/29 15:22:29

模拟退火算法:从物理退火到优化求解的完整指南

1. 项目概述:从“烧铁淬火”到求解复杂优化 如果你在数学建模或者算法优化的圈子里待过一阵子,肯定不止一次听过“模拟退火”这个名字。它听起来有点玄乎,像是把冶金工业里的东西搬到了计算机里。我第一次接触它,是为了解决一个经…

2026/8/29 15:22:29

美赛四天高效作战计划:逆向规划与弹性时间管理指南

1. 项目概述:一份竞赛“行军图”的诞生 如果你正在准备参加美国大学生数学建模竞赛,或者你曾经是其中一员,那么你肯定对“时间安排”这四个字有着刻骨铭心的体会。这不仅仅是一场比赛,更像是一场为期四天、高强度的“学术马拉松”…

2026/8/29 15:22:29

MATLAB regress函数实战:一元线性回归参数检验与模型诊断全解析

1. 项目概述:从数据到洞察,一元线性回归的实战价值 在数据分析、工程建模乃至科研的无数场景里,我们常常面对成对出现的数据点:(x1, y1), (x2, y2), … 一个最朴素也最强大的问题随之而来:这两个变量之间,到…

2026/8/29 15:22:29

AI辅助论文阅读:用Python搭建从PDF解析到智能问答的完整工作流

在 AI 研究圈子里,“OpenAI 研究员:我们都不读论文了”这类标题经常被当作一种调侃,但它背后确实反映了一个真实变化:论文数量增长太快,单靠从头到尾精读,已经很难覆盖一个方向的最新进展。很多研究员开始用…

2026/8/28 16:16:17

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/28 16:16:21

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/28 16:16:22

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/29 0:01:10

etc目录下的profile.d文件目录设置环境变量和全局脚本shell

一、设置环境变量etc目录下的profile.d文件目录 /etc/profile.d1、编写 vi test.sh文件内容# jdk变量 export ZHK_HOME/root export PATH$PATH:$ZHK_HOME/test # 可以取出来ZHK_HOME变量给ZZZ_HOME赋值 export ZZZ_HOME${ZHK_HOME}/test2、刷新 执行source /etc/profile 命令使…

2026/8/29 0:01:10

【JavaScript】内存管理-垃圾回收机制-内存泄露

内存管理 C 语言这样的底层语言一般都有底层的内存管理接口,比如 malloc()和free()。 而 JavaScript 是在创建变量(对象,字符串等)时自动进行了分配内存,并且在不使用它们时“自动”释放。释放的过程称为垃圾回收。 整…

2026/8/29 0:01:10

Labgrid-MCP:为嵌入式硬件实验室接入AI Agent操控能力

Labgrid-MCP 的目标是把 MCP(Model Context Protocol)能力延伸到真实嵌入式硬件实验室:AI Agent 通过一个标准化的 MCP Server,就能查看目标板状态、控制上电断电、复位开发板、读取串口日志,甚至执行镜像刷写。对于经…

2026/8/28 16:16:48

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/28 16:16:50

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/28 11:06:45

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…