发布时间:2026/9/5 23:26:33
Umi-OCR 离线 OCR 教程:3 步跑通截图、批量图片与 PDF 文字识别 Umi-OCR 离线 OCR 教程3 步跑通截图、批量图片与 PDF 文字识别【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款免费、开源、完全离线的 OCR 识别工具。截图、批量图片、扫描版 PDF 都能提取文字全程在本机完成不需要联网、不上传。它能帮你做什么能力典型场景截图 OCR提取网页正文、聊天截图、屏幕代码中的文字批量图片 OCR一次性识别几十张图片逐张给出文字与置信度PDF 文档识别扫描版 PDF 转可编辑文本或生成可搜索的双层 PDF二维码识别与生成读取图片中的二维码/条形码从文本生成码图忽略区域批量识别时排除水印、页眉页脚干扰命令行与 HTTP 接口从脚本、批处理或其他程序调用识别能力快速上手本节带你从获取软件包到第一次识别成功。获取从仓库根目录下载发布包Umi-OCR_Rapid_v2.1.5.7z无压缩软件可用自解压包或克隆源码git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR。解压绿色免安装版解压到任意目录即可不依赖特定路径。启动双击Umi-OCR.exeLinux 版为umi-ocr.sh。首次截图识别打开「截图OCR」标签页点左侧工具栏的截屏图标在屏幕上拖出矩形框选松开后识别自动完成。取回结果右侧「记录」面板中右键文字选「复制」即可带出。核心功能逐一拆解截图 OCR 识别从屏幕到可复制文字定位单次、即时的屏幕文字提取适合网页正文与截图。操作路径进入「截图OCR」标签页 → 点截屏图标或Esc取消截图→ 拖框选区 → 结果出现在右侧「记录」区。也支持在别处复制图片后直接粘贴进来识别。识别结果可划选、编辑右键菜单提供「复制」「全选」等选项。关键参数排版解析方案默认「多栏-按自然段换行」自动处理多栏排版与换行纠正文本方向处理倾斜、倒置文字。批量图片 OCR 步骤定位一次处理本地图片文件夹不用逐张打开。操作路径「批量OCR」标签页 → 点「选择图片」可加入文件或整个文件夹支持 jpg、png、webp、tiff 等格式无数量上限→ 在右侧「设置」里确认语言与排版参数 → 点「开始任务」。顶部进度条实时显示耗时与完成进度「记录」面板逐张列出识别文本并标注每条的置信度列表可随时用「清空」重置。关键参数结果保存格式txt、csv、md 等限制图像边长识别超大长图时调高数值避免精度损失。PDF 文字识别扫描版转可编辑文本定位把扫描版 PDF 变成可编辑文本或可搜索的双层 PDF。操作路径「文档识别」标签页加入文档支持 pdf、xps、epub 等格式可多个文件一起排队。识别后按页整理为纯文本保存也可生成双层 PDF——保留原始扫描画面上面叠加文字层之后在 PDF 里直接搜索、复制版式观感不变。关键参数忽略区域排除页眉页脚文字规则与批量页一致任务完成后可设置自动关机/休眠适合夜间挂机跑大批量任务。二维码识别与生成定位图片扫码与从文本造码二者都支持。操作路径截图、粘贴或拖入图片即可读取其中的二维码、条形码支持一图多码共 19 种协议生成页输入文本即可得到码图可设置纠错等级与尺寸。调优与避坑本节列出直接影响输出质量的参数组合按文档类型对号入座。排版方案匹配文档类型。引擎先找出文字块再按你指定的方式排序换行选对方案比任何调参都有效选项适用文档说明多栏-按自然段换行报纸、网页等多栏排版自动分栏切段最为通用单栏-保留缩进代码截图、缩进文本保留原始缩进便于复制代码多栏-无换行表格数据、密集文本不额外换行输出连续文本单栏-总是换行每行独立短句每行文字后强制换行用「忽略区域」排除干扰。在批量页设置中打开忽略区域编辑器按住右键在水印、页眉页脚处画矩形框尽量画大、完全包住整块位于框内的文字会被舍弃。留意置信度。识别记录中置信度明显偏低时换更清晰的图或在「文字识别 → 限制图像边长」中调高数值。倾斜文字开方向纠偏。开启「纠正文本方向」后引擎先判断文字方向再识别准确率提升、速度略降。接入你的工作流命令行入口就是主程序本身前提是「全局设置」页允许 HTTP 服务默认开启主机选「仅本地」即可umi-ocr --screenshot umi-ocr --path D:/xxx.png --output result.txt umi-ocr --help其他程序则走 HTTP 接口默认监听127.0.0.1:1224图片识别调用 POST/api/ocrdata.format设为text即只返回纯文本curl -X POST http://127.0.0.1:1224/api/ocr -H Content-Type: application/json \ -d {base64: 图片Base64字符串, options: {data.format: text}}高频问题识别时必须联网吗不需要。所有识别由本地引擎完成断网可用命令行与接口走的也只是系统本地环回不经物理网卡。支持哪些系统Windows 7 x64 与 Linux x64绿色免安装解压即用。识别语言怎么切换在「截图OCR」或「批量OCR」的设置面板中选择简体、英文、日文、繁体等模型库混合语言文档按文字主体选语言即可。倾斜或倒置的文字能识别吗可以。开启「纠正文本方向」选项后引擎会先判断文字方向再识别。识别结果能保存到哪里默认展示在右侧「记录」面板可复制或导出用命令行时加--output参数可直接写入文本文件--output_append则追加写入。从一张截图到一批 PDFUmi-OCR 把日常最常见的文字提取场景都收在本地完成解压之后就能直接用。相关资源命令行手册 · HTTP 接口文档 · 更新日志【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

2026/9/5 23:26:33

霞鹜文楷字体配置指南:3 步把 LXGW WenKai 装进 VSCode 和终端

霞鹜文楷字体配置指南:3 步把 LXGW WenKai 装进 VSCode 和终端 【免费下载链接】LxgwWenKai An open-source Chinese font derived from Fontworks Klee One. 一款开源中文字体,基于 FONTWORKS 出品字体 Klee One 衍生。 项目地址: https://gitcode.c…

2026/9/5 23:26:33

taosExplorer 上手指南:TDengine可视化管理的六个日常场景

taosExplorer 上手指南:TDengine可视化管理的六个日常场景 【免费下载链接】TDengine High-performance, scalable time-series database designed for Industrial IoT (IIoT) scenarios 项目地址: https://gitcode.com/GitHub_Trending/tde/TDengine taosEx…

2026/9/6 0:06:59

调试记录2026

2026年7月20日 Depth Anything V3生成的点云,效果看上去还可以 在Photoshop中进行高斯模糊(模拟失焦)后再检测,依然可以保持尺相对度: 更大的高斯模糊 在图片中添加纯色块 2026年8月10日 MUJOCO动力学仿真

2026/9/6 0:06:59

基于CNN的调制信号识别:MATLAB实现时频图分类实战

简介:本资源是一套面向通信工程与信号处理方向学习者、研究者的深度学习实践方案,聚焦调制信号自动检测与识别这一典型无线通信任务,解决传统方法依赖人工特征、低信噪比下性能下降等痛点。压缩包共12个文件(10.73MB)&…

2026/9/6 0:06:59

超人VS蜘蛛侠:拆解超级IP的影响力与传播方法论

把“蜘蛛侠 vs 超人”放在 CSDN 上聊,可能很多人第一反应是走错片场了。但如果把这两个角色看成“两个持续运营了 80 多年的文化产品”,你会发现,这场比较本质上是两个不同 IP 策略的长期结果对比:超人赢在定义了整个超级英雄题材…

2026/9/6 0:06:59

超人会飞不算本事:系统稳定依赖清晰规则与边界设计

开头先不绕弯子。“#斯坦李吐槽dc 所以超人是无缘无故会飞的嘛哈哈哈哈哈哈哈锤哥真是技术人才啊!#雷神 #复联”这类调侃式短标题,第一波冲击力在于它把两个宇宙的角色塞进同一个吐槽箱里,但细想一下就能发现,它真正碰到的根本不是…

2026/9/5 23:56:35

基于U-Net的道路场景语义分割实战:从数据增强到类别不平衡优化

简介:本资源是一个面向深度学习初学者与计算机视觉实践者的道路目标语义分割实战项目,聚焦自动驾驶与智能交通场景下的像素级图像理解任务,基于U-Net架构与PyTorch框架实现端到端训练与推理。压缩包共7个文件(5个Python脚本、1个环…

2026/9/6 0:06:59

超人会飞不算本事:系统稳定依赖清晰规则与边界设计

开头先不绕弯子。“#斯坦李吐槽dc 所以超人是无缘无故会飞的嘛哈哈哈哈哈哈哈锤哥真是技术人才啊!#雷神 #复联”这类调侃式短标题,第一波冲击力在于它把两个宇宙的角色塞进同一个吐槽箱里,但细想一下就能发现,它真正碰到的根本不是…

2026/9/6 0:06:59

超人VS蜘蛛侠:拆解超级IP的影响力与传播方法论

把“蜘蛛侠 vs 超人”放在 CSDN 上聊,可能很多人第一反应是走错片场了。但如果把这两个角色看成“两个持续运营了 80 多年的文化产品”,你会发现,这场比较本质上是两个不同 IP 策略的长期结果对比:超人赢在定义了整个超级英雄题材…

2026/9/6 0:06:59

基于CNN的调制信号识别:MATLAB实现时频图分类实战

简介:本资源是一套面向通信工程与信号处理方向学习者、研究者的深度学习实践方案,聚焦调制信号自动检测与识别这一典型无线通信任务,解决传统方法依赖人工特征、低信噪比下性能下降等痛点。压缩包共12个文件(10.73MB)&…

2026/9/6 0:06:59

超人会飞不算本事:系统稳定依赖清晰规则与边界设计

开头先不绕弯子。“#斯坦李吐槽dc 所以超人是无缘无故会飞的嘛哈哈哈哈哈哈哈锤哥真是技术人才啊!#雷神 #复联”这类调侃式短标题,第一波冲击力在于它把两个宇宙的角色塞进同一个吐槽箱里,但细想一下就能发现,它真正碰到的根本不是…

2026/9/6 0:06:59

超人VS蜘蛛侠:拆解超级IP的影响力与传播方法论

把“蜘蛛侠 vs 超人”放在 CSDN 上聊,可能很多人第一反应是走错片场了。但如果把这两个角色看成“两个持续运营了 80 多年的文化产品”,你会发现,这场比较本质上是两个不同 IP 策略的长期结果对比:超人赢在定义了整个超级英雄题材…

2026/9/6 0:06:59

基于CNN的调制信号识别:MATLAB实现时频图分类实战

简介:本资源是一套面向通信工程与信号处理方向学习者、研究者的深度学习实践方案,聚焦调制信号自动检测与识别这一典型无线通信任务,解决传统方法依赖人工特征、低信噪比下性能下降等痛点。压缩包共12个文件(10.73MB)&…

2026/9/5 2:45:13

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/5 2:30:42

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/5 2:46:50

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…