Umi-OCR 实战教程三个场景跑通截图取字、批量识别与 PDF 搜索全程离线【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR截图里想抠出文字、一文件夹扫描件没法一张张处理、PDF 全文搜索一片空白——这些事 Umi-OCR 都能一次办到。它是一款免费开源的离线 OCR 软件解压即用不上传图片、不依赖网络识别全部在你自己的电脑里完成。解压后三步跑通第一次识别发布包是.7z压缩包也有.7z.exe自解压版支持 Windows 7 x64 与 Linux x64没有安装器。解压后双击Umi-OCR.exeLinux 下运行umi-ocr.sh首次打开界面语言会跟随系统自动切换。进「全局设置」页语言、主题、字体、开机自启、OCR 引擎插件都在这里顺手把自启加上。切到「截图 OCR」页按快捷键唤起截图快捷键在该页设置里改鼠标框选区域按Esc可随时取消。识别完成后文字出现在右侧「记录」栏点一下即复制最短路径就此跑通截图 → 识别 → 复制。 把教程截图里的代码直接贴进 IDE想把教程、视频截图里的代码拷进编辑器手敲一遍既慢又容易漏空格普通识别还会把缩进吞掉这一节就解决这件事。在「截图 OCR」页框选代码区域。打开右侧设置面板把「排版解析」选为单栏-保留缩进——它专为代码设计行首缩进和行中空格原样保留。识别完成后在记录栏选中结果直接复制。验证很简单粘进 IDE 或 Markdown 预览缩进层级和原图一致、没有多余空格就过关了。坑预警默认的「多栏-按自然段换行」是为报纸式排版设计的自动识别栏序、按段换行拿它处理代码会丢掉缩进反过来多栏报纸、公文这类文档保持默认的多栏方案即可阅读顺序会自动排对。批量识别整个扫描图文件夹输出 txt 或 Excel几十上百张扫描文档、票据或拍照图一张一张过不现实批量页一次处理完。打开「批量 OCR」页点「选择图片」或直接拖入文件夹。输入支持jpg / jpe / jpeg / jfif / png / webp / bmp / tif / tiff无数量上限。选定输出格式txt / jsonl / md / csv(Excel)。点「开始任务」列表逐张显示识别耗时与置信度。验证随机抽 3 张对照左侧预览和右侧记录置信度0~1低于 0.8 的几张重点人工核对。常见坑有两个每张图都有固定位置的水印或 LOGO 时进右侧设置的忽略区域编辑器按住右键画矩形把水印罩住——只有整个文本块完整落在框内才会被丢弃所以框画大一点更稳图片像素超大的长图先把「设置 → 文字识别 →限制图像边长」从默认 960 调到 2880 或 4320否则图片会先被压缩、小字发糊。把扫描版 PDF 变成可搜索的文件PDF 是纯图片扫描件全文搜索一片空白想引用一句话却找不到在哪页文档识别页v2.1.0 及以上版本就是干这个的。打开「文档识别」标签页拖入文件支持pdf / xps / epub / mobi / fb2 / cbz。只想要正文的话设定忽略区域把页眉页脚排除掉。任务完成后得到双层可搜索 PDF原图还在底层识别出的文字藏在顶层。验证打开生成的 PDF用 CtrlF 搜一个只出现在正文里的词能直接跳到对应页说明文字层写对了。坑预警页眉、页脚、页码的文字会被原样识别进结果记得提前画好忽略区域省得返工想挂机批量跑大批文档可在设置里勾「任务完成后自动关机」。记牢这 5 个设置项缩进、大图、多栏日常基本只用得着这几项其余保持默认设置项何时用建议值为什么排版解析代码截图单栏-保留缩进保留行首缩进与行中空格粘了就能用排版解析多栏报纸、长文档多栏-按自然段换行默认方案自动处理多栏阅读顺序限制图像边长高分辨率大图、小字多2880 或 4320默认 960 会先压缩大图小字易糊语言/模型库纯英文文档、纯代码models/config_en.txt有专门的英文模型库英文场景更准OCR 引擎插件初次使用Rapid-OCR自带兼容性好、速度够用也可在全局设置切换 Paddle-OCR界面改动会自动存到UmiOCR-data/.settingsini 格式可以手改改完执行umi-ocr --reload重载即可v2.1.5 以上支持。 用命令行与 HTTP 接入 OCR 自动化跨进程调用依赖本地 HTTP 服务默认开启主机保持「仅本地」即可默认端口1224。两条路任选命令行umi-ocr即Umi-OCR.exe的简写umi-ocr --screenshot --clip # 截图取字结果进剪贴板 umi-ocr --path D:/docs --output 结果.txt # 整个文件夹批量识别 umi-ocr --qrcode_read D:/code.png # 识别二维码HTTP 接口任何语言都能接GET http://127.0.0.1:1224/api/ocr/get_options # 查询全部参数与默认值 POST http://127.0.0.1:1224/api/ocr # 传 base64 图片 options返回识别文本请求体是一个 JSONbase64放图片编码options放「语言/模型库」「排版解析」等选项。完整参数表见 图片识别接口文档文档识别也有上传/查询/下载接口细节看 api_doc.md。四个常见识别问题速查症状原因解决识别顺序错乱、读不通排版解析方案与图片排版不匹配代码选「单栏-保留缩进」多栏文档用默认多栏方案大图里小字认错默认边长 960 先把图片压缩了「限制图像边长」调到 2880 或 4320水印、LOGO、页眉混进结果该区域的文本块被一起识别批量/文档识别中画忽略区域整个文本块罩住命令行或 HTTP 调用无反应HTTP 服务没开全局设置勾选允许 HTTP 服务主机选「仅本地」把 Umi-OCR 当成你电脑里随叫随到的文字提取组件截图取字、批量导出、PDF 补文字层入口都固定离线完成、图片不出机器。建议先在截图页练熟再上批量与文档页各命令的完整参数在 命令行手册接口用法汇总在 HTTP 接口手册。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
企业数字化 ERP 产品动态
相关推荐
Keil C251 L121报错解析:80251堆栈初始化与链接器配置实战 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/24 14:54:59
OPC单人AI开发者的交付困境:技术原型到商业项目之间的能力缺口 随着大模型工具链普及,OPC(Open Personal Creator)单人开发者可以快速完成技术 Demo。但大量开发者会遇到一个现实难题:Demo 效果出色,却很难转化成可稳定交付的商业项目。很多人把问题归结为缺少算力、缺少数据集&… · 2026/9/24 14:54:59
YOLO11行人检测:VOC/COCO/YOLO数据转换与GPU/CPU/Mac三平台训练实战 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/24 14:54:59
KernelSU GKI LKM 模式切换指南 KernelSU GKI LKM 模式切换指南 【免费下载链接】KernelSU A Kernel based root solution for Android 项目地址: https://gitcode.com/GitHub_Trending/ke/KernelSU
KernelSU 是一款基于 Android 内核的 root 方案,通过在内核里钩住系统事件来授权和管理模块… · 2026/9/24 15:25:04
【银河麒麟】桌面系统安装某软件后部分目录挂载失败 【问题描述】一台银河麒麟V10桌面系统,安装某软件之后,部分目录挂载失败,无法正常进入图形界面,报错如下:/lib/aarch64-linux-gnu/libmount.so.1: version "MOUNT_2.33" not found (required by mount)【排查… · 2026/9/24 15:25:04
ESP32-C3 AI工牌拆解:低成本硬件如何实现语音交互 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/24 15:24:44
SquareLine Studio与LVGL 8.3嵌入式UI开发实战指南 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/24 15:24:27
AWS SDK for .NET 文档示例仓库完全指南:目录结构、运行前置条件与 DynamoDB 入门实战 示例工程教程后端 【免费下载链接】aws-doc-sdk-examples Welcome to the AWS Code Examples Repository. This repo contains code examples used in the AWS documentation, AWS SDK Developer Guides, and more. For more information, see the Readme.md file below. 项目地… · 2026/9/24 15:24:27
基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程 简介:这是一套面向计算机、人工智能、自动化等专业学生与教师的毕业设计级项目资源,围绕YOLOv8实现渔船作业监控系统,可用于毕设、课程设计、大作业或项目立项演示。压缩包共97个文件,约24.21MB,以70个Python源码文件为… · 2026/9/24 0:00:13
1D-CNN时间序列建模实战:从Conv1d原理到工业落地 简介:面向时间序列数据建模的一维卷积神经网络完整实现,适合深度学习入门者及需要快速验证时序模型的研究者,能够从音频、文本、传感器或股价等序列中挖掘局部特征与时间依赖。压缩包体积很小,只有3KB,内含3个Python脚… · 2026/9/24 0:00:26
柔软的L:汉语语流中被忽视的舌肌张力控制 1. 这个“L”不是字母表里的L,而是舌尖上的L最近在几个方言群和语音教学社群里,反复看到有人发一句:“也说字母L:柔软的长舌”。初看以为是英语发音课笔记,点开才发现全是方言爱好者、播音系学生、语言康复师甚至戏曲演… · 2026/9/24 0:00:44