Umi-OCR 免费离线 OCR 完整指南截图、批量、PDF 一次跑通还能嵌进脚本【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款开源、免费、离线运行的 OCR 软件解压即用识别全程不联网图片不会上传到任何服务器。它内置 PaddleOCR 与 RapidOCR 两套离线引擎预装中、英、日、韩、西里尔等多国语言模型库截图识别、批量图片、PDF 双层文档、二维码四件事都能干Windows 7 x64 和 Linux x64 均支持。如果你经常从屏幕抠文字、整理扫描文档或想把文字识别能力写进自动化脚本这套工具可以直接上手。两步拿到能跑的 Umi-OCR 获取只要两步下载官方发行版.7z压缩包需解压工具或.7z.exe自解压包双击即释放。解压后直接双击Umi-OCR.exe启动没有安装步骤界面语言首次启动跟随系统之后在全局设置里手动切换。注意Linux 下入口是umi-ocr启动脚本用法相同。四步完成第一次截图识别 第一次出结果按这个顺序走打开截图OCR标签页。按默认快捷键CtrlShiftA唤起截图软件内可重新录制屏幕变暗后框选文字区域。右侧识别记录栏出现文字鼠标划选即可复制。要改错字就直接编辑文本再复制。两条省时间的小技巧在别处复制图片后直接粘贴进软件就能识别按Esc随时取消截图。记录栏还支持一次勾选多条记录批量复制。抠屏幕上的文字目标把屏幕上的一段文字变成可编辑、可复制的纯文本。操作按CtrlShiftA唤起截图框选目标区域。结果出现在识别记录栏划选复制多段内容可勾选多条记录一次性复制。粘贴来的图片同样走这个流程。关键选项——OCR文本后处理—排版解析决定文字块的顺序和换行对应接口参数tbpu.parser方案取值什么时候用多栏-按自然段换行multi_para通用文档默认值多数场景不用动单栏-保留缩进single_code代码截图保留行首缩进和行内空格多栏-总是换行multi_line每行独立的结构化内容不做处理none只要引擎原始输出后处理自己做边界这个流程为小范围、快进快出设计几十上百张图请走批量页竖排文字需要引擎本身支持才行。几百张图丢进一个任务跑完目标一个目录的图片一次出结果不用一张张点。操作打开批量OCR页拖入文件或整个文件夹数量不设上限。选定输出格式txt、jsonl、md、csv(Excel)结果按图存成对应文件。进右栏设置的忽略区域编辑器按住右键拖出矩形框圈住水印、LOGO、页眉页脚。启动任务过夜的大批任务可勾完成后自动关机/待机。输入格式jpg, jpe, jpeg, jfif, png, webp, bmp, tif, tiff。边界忽略区域的单位是整块文字不是单字——只有完全落在框内的文本块才被丢弃画框时把水印可能出现的位置全包住。文档类文件PDF 等别丢这页去文档识别页。给扫描件加一层可搜索文字目标PDF 扫描件变成能复制、能检索、版式不变的双层文档。操作打开文档识别页拖入文件。选择输出双层可搜索 PDF——原图在下、文字层在上。用忽略区域框掉每页固定的页眉页脚该页同样支持。跑完可设自动关机/休眠。支持格式pdf, xps, epub, mobi, fb2, cbz。纯扫描件跑 OCR已有文本层也可直接提取原文。边界只想要文本、不想要 PDF 输出时把页面拆成图片走批量页更快。把识别能力嵌进脚本目标不点鼠标用命令行或 HTTP 接口调识别。两个入口共用同一个本地 HTTP 服务默认开启端口1224只走本地回环全局设置→高级里可确认开关把主机改为其他地址后局域网也能访问。最短示例是命令行umi-ocr --screenshot --clip umi-ocr --path D:/scan -- D:/out.txt第一行截屏识别并复制到剪贴板第二行识别整个文件夹并写入文本文件--等价于--output。指令支持前缀简写--help查全量。要程序化调用向POST /api/ocr传 base64 图片返回code为100即成功先用GET /api/ocr/get_options查当前引擎实际接受哪些参数。完整定义见 docs/http/api_ocr.md。边界后端并发能力弱脚本里别发并发请求一条命令跑完前别叠下一条。记住这张表覆盖 80% 的调参需求️ 常用参数就这几个参数默认值作用人话ocr.languagemodels/config_chinese.txt语言模型库英文换models/config_en.txt另有日文、韩文、西里尔库ocr.limit_side_len960限制图像边长值小跑得快调大2880/4320大图小字更准ocr.clsfalse纠正文本方向处理倾斜、倒置文字开起来会慢些tbpu.parsermulti_para排版解析方案按文字块排版方式选见上表tbpu.ignoreArea[]忽略区域矩形坐标[[左上x,y],[右下x,y]]data.formatdict接口返回格式dict带坐标明细text只回纯文本注意ocr.*前缀的参数仅对 PaddleOCR 引擎生效换引擎前先查参数接口。所有值保存在./UmiOCR-data/.settingsini 格式界面里改和手改文件等价改完执行umi-ocr --reload重新加载即可。进阶入口 接口与指令的完整定义在两份手册里按场景查即可命令行全量指令docs/README_CLI.mdHTTP 接口目录图片、文档、二维码、命令行转发docs/http/README.md文档识别走 5 步流程上传→轮询→生成→下载→清理docs/http/api_doc.md 附 Python 与 Web 示例代码照着抄就行。避坑速查6 个高频问题❓识别不准、漏字多先对语言库中英混排先试中文库倾斜文字开ocr.cls大图小字把ocr.limit_side_len从 960 调到 2880/4320。九成情况出在这三步。中文识别成乱码语言库和文字不匹配。PaddleOCR 引擎在设置里选models/config_chinese.txt其他引擎先调/api/ocr/get_options确认它实际接受什么参数别照搬。批量任务跑得慢批量是逐张串行的图多自然久。排查顺序先把边长限制调回 960再对比 RapidOCR 与 PaddleOCR 的耗时普通清晰图片低配机器上 RapidOCR 往往更快。HTTP 调用偶发ECONNREFUSED后端组件性能有限长任务连续调用有小概率报错重新发一次即可并发调用会放大问题串行发请求。忽略区域没生效单位是整块文字文本块必须完全落在框内才被丢弃压边的一整块保留。把框画大包住水印可能出现的全部位置。内存占用偏高软件自带引擎内存清理不用的标签页关掉只留当前在用的。过夜大批量任务建议直接开完成后自动关机/待机。收尾怎么选、去哪查一句话选型只抠屏幕文字用截图页CtrlShiftA框选就出结果几百张扫描件丢批量页并顺手框掉水印要可检索的 PDF走文档识别页出双层文件嵌进自动化直接打 1224 端口的 HTTP 接口或命令行别动鼠标。延伸资料命令行手册docs/README_CLI.mdHTTP 接口手册docs/http/README.md图片识别接口细节docs/http/api_ocr.mdPython 源码UmiOCR-data/py_src/配置文件UmiOCR-data/.settings参数对齐识别就跑得稳。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
企业数字化 ERP 产品动态
相关推荐
Modbus RTU通讯间歇性丢包排查:轮询间隔与ADPRW指令时序优化 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/24 14:29:17
一个卖自动化的行业,为什么在高价招“替机器理解现实的人“ 当答案变便宜,真正值钱的,是替机器把答案接进现实的那个人。2026 年 5 月,OpenAI 做了一件和它"卖模型"的人设不太搭的事:专门成立了一家叫 OpenAI Deployment Company(部署公司) 的实体… · 2026/9/24 14:28:57
Play Framework(Scala)Body Parsers 完全指南:从内置解析器到自定义流式解析 后端Web框架 【免费下载链接】playframework The Community Maintained High Velocity Web Framework For Java and Scala. 项目地址: https://gitcode.com/gh_mirrors/pl/playframework 点击查看 免费下载 HTTP 请求由头部(Header)与请求体… · 2026/9/24 15:03:17
RK3588适配IMX586实战:MIPI CSI硬件链路与V4L2驱动深度调试 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/24 15:03:17
Skia demos.skia.org 本地运行指南:用本地 CanvasKit 构建调试 Web 2D 演示 图形学 【免费下载链接】skia Skia is a complete 2D graphic library for drawing Text, Geometries, and Images. See documentation for contribution instructions. 项目地址: https://gitcode.com/gh_mirrors/ski/skia 点击查看 免费下载 导读
本文围绕 Skia… · 2026/9/24 15:02:58
经典游戏 Hammurabi 的 MiniScript 移植:Basic Computer Games 单文件实现与运行指南 示例工程 【免费下载链接】basic-computer-games An updated version of the classic "Basic Computer Games" book, with well-written examples in a variety of common MEMORY SAFE, SCRIPTING programming languages. See https://coding-horror.github.io/basic… · 2026/9/24 15:02:39
欧姆龙NJ/NX PLC的FINS通信与Node-RED可视化实战指南 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/24 15:02:14
基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程 简介:这是一套面向计算机、人工智能、自动化等专业学生与教师的毕业设计级项目资源,围绕YOLOv8实现渔船作业监控系统,可用于毕设、课程设计、大作业或项目立项演示。压缩包共97个文件,约24.21MB,以70个Python源码文件为… · 2026/9/24 0:00:13
1D-CNN时间序列建模实战:从Conv1d原理到工业落地 简介:面向时间序列数据建模的一维卷积神经网络完整实现,适合深度学习入门者及需要快速验证时序模型的研究者,能够从音频、文本、传感器或股价等序列中挖掘局部特征与时间依赖。压缩包体积很小,只有3KB,内含3个Python脚… · 2026/9/24 0:00:26
柔软的L:汉语语流中被忽视的舌肌张力控制 1. 这个“L”不是字母表里的L,而是舌尖上的L最近在几个方言群和语音教学社群里,反复看到有人发一句:“也说字母L:柔软的长舌”。初看以为是英语发音课笔记,点开才发现全是方言爱好者、播音系学生、语言康复师甚至戏曲演… · 2026/9/24 0:00:44