Umi-OCR离线OCR完整指南:截图、批量图片与PDF文档识别一次到位
Umi-OCR离线OCR完整指南截图、批量图片与PDF文档识别一次到位【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR一句话定位免费离线OCR软件到底能做什么Umi-OCR 是一款免费、开源、完全离线的 OCR 文字识别软件截屏识别、批量图片识别、PDF 文档识别、二维码扫描与生成一应俱全解压即用、无需注册联网。一句话概括它的价值它把文字识别引擎整个搬进你的电脑让截图、图片和扫描件里的文字全部在本地完成提取——不吹不黑这是目前把离线和好用平衡得相当好的方案之一。要不要用离线OCR与在线工具、商业软件的一张对比表先别急着下载用一张表看清它和主流替代方案的差异再决定值不值得投入时间对比维度Umi-OCR在线OCR网站商业OCR套装联网与隐私完全本地图片不出电脑图片需上传服务器多数需联网授权价格免费、开源免费额度有限或按次收费授权费不便宜批量能力无数量上限支持暂停与自动关机大多限量视版本而定PDF处理扫描件可转双层可搜索PDF少见或需付费通常专业版才有上手成本解压即用、免安装打开网页即可安装激活平台Windows 7 x64 / Linux x64任意有浏览器的设备视产品而定扩展性命令行、HTTP接口、插件切换引擎基本没有有API但多另收费 提示判断标准很简单——如果你的图片不想离开硬盘或者你有一批扫描件要归档Umi-OCR 就是那个成本最低、隐私最稳的选项。谁适合、谁不需要先划清边界再投入时间适合你如果你是 Windows 或 Linux 用户日常要处理截图、扫描件、带水印的图片你需要把扫描版 PDF 变成可搜索的归档文件你对数据隐私敏感合同、论文、票据不想上传到别人的服务器或者你想让批量挂机识别几百张图这种需求自动化。不需要你如果你用 Mac目前只支持 Windows 与 Linux你只是偶尔识别一两张图、也不介意上传那打开网页可能更快你需要把表格图片直接转成 Excel表格识别还在远期计划中或者你期待图片翻译这类能力——Umi-OCR 只做文字识别翻译同样在计划列表里躺着。五分钟拿到第一个结果从下载解压到首次截图识别目标很朴素在五分钟内让软件帮你识别出第一段文字。下载取本仓库的发布包 Umi-OCR_Rapid_v2.1.5.7z自带 Rapid-OCR 引擎兼容性好电脑没装解压软件就选.7z.exe自解压包。解压解压到不含中文和空格的目录例如D:/Tools/Umi-OCR。为什么这是绿色软件无需安装但路径里的中文/空格偶尔会引发莫名其妙的兼容问题一步规避最省心。启动双击Umi-OCR.exeLinux 下运行umi-ocr.sh。首次启动会自动匹配你的系统语言界面由多个标签页组成——截图OCR、批量OCR、文档识别、二维码、全局设置用哪个点哪个还可以锁住常用标签防误关。识别切到截图OCR标签页按快捷键唤起截图框划出目标区域。松开鼠标结果几秒内出现在右侧记录栏。还有一个更快的方式在聊天窗口里复制任意一张图片回到 Umi-OCR 直接粘贴它照样识别。到这一步你的第一个正反馈就拿到了——看到文字→复制文字从此是一条肌肉记忆。进阶玩法按能力档位分层从入门到折腾入门档把看到文字就复制练成肌肉记忆排版方案默认选多栏-按自然段换行OCR 引擎吐出的文字是散装的这套方案会自动识别多栏布局、按自然段断行覆盖大多数阅读场景。什么时候才需要换遇到两栏/三栏论文、代码截图这类特殊排版时再切换对比。结果栏可以直接当草稿纸识别记录支持原地改错、划选多条一起复制识别完顺手整理成你要的格式不用再经过记事本中转。竖排文字不用管排版解析会自动处理横排与竖排从右到左的文本顺序前提是你的 OCR 引擎本身支持竖排。 提示如果你经常处理代码截图切到单栏-保留缩进行首缩进和行中空格会被保留下来输出基本能保持代码结构。熟练档批量图片与扫描PDF的提速方法忽略区域让水印和页眉页脚自动隐身在批量识别页右侧设置里进入忽略区域编辑器按住右键画矩形框把水印、LOGO、页眉页脚可能出现的位置都框住识别时这些区域内的文字会被自动排除。记住关键机制只有完全处于矩形框内部的整个文本块才会被忽略所以宁可框大一点别漏。文档识别把扫描版PDF变成可搜索文件支持pdf、xps、epub、mobi、fb2、cbz六种格式。Umi 会优先提取 PDF 自带的文本层速度快、零识别误差遇到纯扫描页才自动切到 OCR你也可以主动选整页强制OCR。最实用的输出是双层可搜索PDF——外观跟原扫描件一模一样但文字可以搜索、复制、划线v2.1.2 起还能输出单层纯文本 PDF体积更小、更好编辑。挂机任务一条龙批量图片和文档任务都支持完成后自动关机/待机v2.1.2 起支持暂停任务只要软件不退出待机休眠后回来继续跑。 提示文档识别里的忽略区域可以按页码范围设置适合统一排除整本扫描件的页眉页脚——框一次全册生效。折腾档命令行、HTTP接口与引擎插件的自定义空间如果你想把它嵌入自己的工作流图形界面只是冰山一角umi-ocr --screenshot --clip umi-ocr --path D:/扫描件.png --output result.txt umi-ocr --qrcode_create 你好Umi-OCR D:/qrcode.png 256三条命令分别对应截屏识别并直接进剪贴板、识别指定图片输出到文件、生成二维码。所有指令支持前几个字母简写--sc等价于--screenshot。注意一个前提命令行依赖本地 HTTP 服务做进程间通信请确认全局设置里 HTTP 服务是开启的默认开启只监听本地环回、不经过物理网卡数据不会外泄。HTTP 接口默认端口 1224提供图片 OCR、文档识别、二维码识别/生成等接口几十行代码就能封装一个上传图片→返回 JSON的本地小服务。引擎与界面语言随意换全局设置里可以切换 OCR 插件——默认内置 Rapid-OCR兼容性好和 PaddleOCR速度稍快界面语言支持简中、繁中、英、日、葡、俄、泰米尔语。界面语言和识别语言是两码事界面用中文照样可以识别日文书籍。性能与资源实测体积、内存、速度与兼容性取舍从一个真会用的人的角度给你四条实测经验体积与安装整个程序界面OCR引擎打包在单个压缩包里解压即用、免安装拷到另一台电脑目录就能带走。想要干净环境就删目录不留注册表垃圾。内存如果用的是 PaddleOCR 插件v2.1.4 起默认内存占用被限制在系统总内存的一半以内任务停止约 30 秒后会自动释放一次内存。还想更省去插件配置里调低线程数即可。速度与长图单张截图识别通常几秒内出结果批量几百张图挂机跑即可。遇到像素超大的长图识别不全正确做法是去文字识别设置里调高限制图像边长而不是盲目放大原图——过度放大增加噪声反而降低准确率。兼容性Windows 7 x64 起Linux 需要 glibc 2.31 以上覆盖 Debian-11、Ubuntu-20也支持 Docker 部署。如果你的机器出现截屏闪烁、界面错位八成是显卡渲染兼容问题去 全局设置→界面和外观→渲染器 切换方案或直接关闭硬件加速通常能解决。 提示追求稳定选 Rapid 版追求速度换 Paddle 版内存紧张就少开标签页用多少开多少程序会自己省。社区与生态官方文档、插件目录与版本演进Umi-OCR 是一个长期维护的开源项目配套资源都在仓库里按需取用命令行手册docs/README_CLI.md含截屏、路径、二维码、高级指令的完整用法HTTP 接口文档docs/http/README.md 与 docs/http/api_doc.md更新日志CHANGE_LOG.md每个版本的改动一目了然插件目录UmiOCR-data/plugins/程序运行时存放 OCR 引擎插件的位置切换引擎在此发生多语言翻译dev-tools/i18n/社区译者协作维护Weblate 在线协作版本演进只需要记住五个节点v2.1.0上线文档识别v2.1.2新增单层纯文本 PDF 输出与任务暂停v2.1.3登陆 Linux 并支持 Docker 部署v2.1.4将 PaddleOCR 默认内存限制为系统内存一半v2.1.5加入日志机制、双栏布局、超大文件夹异步加载并修复了 PDF 页面旋转导致的文本错位——如果你手头有旋转过方向的扫描件务必用最新版。收尾三句话行动建议适合谁Windows/Linux 上经常与截图、扫描件、PDF 打交道的你。怎么开始下载解压即用先跑通一张截图识别拿正反馈再按档位逐步解锁批量与文档识别。遇到问题先看哪先翻 CHANGE_LOG.md 和 docs 目录再试渲染器→忽略区域→限制图像边长这三个旋钮九成麻烦都能解决。下一步动作很具体现在就去下载 Umi-OCR_Rapid_v2.1.5.7z解压、启动、按一下截图快捷键。从这一刻起扫描版 PDF 和带水印的图片都不再需要在线工具和手动抄录了。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考