Umi-OCR 离线OCR识别完全上手指南从第一张截图到批量PDF处理【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR如果你受够了打开在线OCR网站→上传图片→等待→复制结果→被限制次数那么这款免费、开源、离线运行的 OCR识别 工具很可能是你期待已久的答案。本文的主角 Umi-OCR 不需要联网、不需要注册、解压即用内置多国语言识别库还能一口气处理几百张图片甚至整本扫描版PDF。接下来我会用先讲是什么、再教怎么用、最后说何时用的思路带你从零开始掌握这套完整工作流。为什么要专门写一篇入门指南先看一组反常识的事实很多朋友的电脑里其实已经装了截图工具但截图之后文字还是要靠手敲也有人下载过万能OCR软件打开却发现要么收费、要么必须联网、要么识别出来乱七八糟。Umi-OCR 想解决的正是这三个最常见的痛点——免费、离线、准确。它不是一个只能截屏的小工具而是一整套可扩展的 OCR识别 工作台截图识别、批量识别、PDF文档识别、二维码扫描与生成全部集成在同一个绿色软件里。三分钟认识这个三合一工作台Umi-OCR v2 的界面由多个标签页组成你可以像浏览器一样自由开关、排列它们。真正需要记的只有四个标签页一句话概括适合谁截图OCR按下快捷键截屏立刻转文字日常办公、读论文、抄资料批量OCR拖入上百张图片排队识别导出处理截图集、电子书插图文档识别PDF/XPS/EPUB 转文本或双层PDF扫描件数字化、合同归档全局设置语言、主题、快捷键、启动项所有人建议先逛一圈小提示软件支持 Windows 7 x64 与 Linux x64下载.7z或.7z.exe自解压包解压后双击Umi-OCR.exe即可启动全程不需要安装向导。第一个实操30秒完成一次截图识别这是你上手最快的一个场景。切换到截图OCR标签页默认截图快捷键就能唤起取景框框选屏幕上任何区域松开鼠标右侧立刻出现识别结果左下角还会显示置信度。几个立刻能用的操作划选复制在左侧预览图或右侧识别结果上直接用鼠标划选文字复制不用逐行手抄。粘贴识别在别处复制了图片比如微信聊天截图回到 Umi-OCR 直接 CtrlV 粘贴就能识别。文字叠加识别出的文本会以半透明方式叠加在原图上方便你核对哪句对应哪块发现错误点一下就能改。识别结果怎么排版取决于排版解析方案。大多数场景选默认的多栏-按自然段换行即可如果是代码截图务必切换到单栏-保留缩进否则缩进和空格会丢失。批量处理的高效姿势几百张图一次搞定当图片多到一张张截屏不现实时批量OCR标签页就是主力。它支持jpg/png/webp/bmp/tif等常见格式没有数量上限拖入整个文件夹也可以任务完成后还能自动关机。这里有一个普通用户很容易忽略、但实战价值极高的功能——忽略区域很多截图或扫描件带水印、页眉、页脚、LOGO如果让 OCR识别 去读这些干扰元素结果会混进大量垃圾文字。在右栏设置中打开忽略区域编辑器按住鼠标右键框选干扰区任务执行时这些区域内的文字会被整体跳过。注意一个细节忽略区域按文本块生效而不是按单个字符。所以框选时宁可画大一点把水印所有可能出现的位置都包住效果才稳定。输出的保存格式支持txt、jsonl、md、csv。给个选择建议要写报告选 md要丢进 Excel 选 csv要做数据分析选 jsonl。进阶玩法让扫描版PDF开口说话这是 Umi-OCR 最能体现降维打击的地方。普通的 PDF 查看器只能看不能选字而文档识别标签页支持pdf / xps / epub / mobi / fb2 / cbz六种格式输出物可以是普通文本也可以是双层可搜索PDF——视觉上保持原排版底层埋了识别出的文字以后在任意阅读器里都能直接搜索、复制。处理扫描件时有一个必须理解的参数内容提取模式它决定了一页里既有图片又有文本时怎么办模式行为适用场景混合OCR/原文本默认图片区域走OCR文本层直接拷贝大多数电子书、原生PDF整页强制OCR整页都按图片识别扫描质量一般、想统一处理仅OCR图片只识别页面里的图片区域图文混排的杂志仅拷贝原有文本不识别只提取文本层本身就是文字版PDF其他实用参数一并介绍页数范围可以写成1-5,10-15只处理指定页密码选项支持带加密的文档忽略区域同样适用于 PDF批量处理学术论文时用来排除统一格式的页眉页脚非常顺手。给程序员的礼物命令行与HTTP接口如果上面这些界面操作还不够Umi-OCR 还开放了完整的命令行与 HTTP 接口方便你把它嵌进自动化脚本。命令行示例Umi-OCR.exe是程序入口也支持umi-ocr简写# 鼠标截屏并识别 umi-ocr --screenshot # 识别指定图片/文件夹结果输出到文件 umi-ocr --path D:/scans --output result.txt # 识别二维码图片 umi-ocr --qrcode_read D:/qrcode.png # 生成一个二维码图片 umi-ocr --qrcode_create https://example.com D:/code.png 256命令行依赖本地 HTTP 服务进行进程间通信默认在全局设置中已开启主机选仅本地即可不会暴露到局域网外。HTTP 接口的典型流程是上传文件 → 轮询任务状态 → 下载结果默认端口1224。用 Python 调用图片识别只需几行import base64, requests with open(test.png, rb) as f: img_b64 base64.b64encode(f.read()).decode() res requests.post( http://127.0.0.1:1224/api/ocr, json{base64: img_b64, ocr.language: models/config_chinese.txt}, ) print(res.json()[data])完整的接口与参数说明见 docs/http/README.md 和 docs/README_CLI.md仓库里还附带了可直接运行的 api_doc_demo.py 示例。识别质量调优把准确率从够用拉到好用同样的图片参数不同识别结果可能天差地别。三个关键旋钮值得记住参数作用低配建议常规建议限制图像边长边长超限的图片会被压缩越大越清晰但越慢9601920~2880纠正文本方向cls自动摆正倾斜、倒置的文字关闭复杂文档开启并行任务数同时跑几个识别任务128GB内存实操经验三条扫描件发虚时先在外部工具里做一次锐化提对比度往往比盲目调高图像边长更有效。纯英文文档就切英文模型中日混排再选多语言模型别让引擎猜语言。输出jsonl格式的结果里带置信度字段批量处理完可以按置信度排序只人工复核低分项省时又精准。常见问题与避坑盘点Q识别速度很慢怎么办A优先把限制图像边长从2880降到960并把并行任务数调到与内存匹配的值。识别精度损失通常很小速度却能提升好几倍。Q截图时界面闪烁、UI错位A这是渲染器兼容性问题到全局设置 → 界面和外观 → 渲染器换一种渲染方案或关闭硬件加速。Q想换界面语言或主题A同样在全局设置里改。语言/Language支持简体中文、繁体中文、英文、日文、俄语等多种界面语言主题有多套亮/暗可选。Q中英文界面切换后找不到设置项A先记住固定位置——全局设置标签页永远在最右设置项顺序不随语言变化。Q批量任务中途断电了Av2.1.2 起支持暂停任务只要软件不退出休眠唤醒后可以继续但进程被杀就没法恢复了长任务建议分小批次跑。动手试试然后把它变成日常习惯回顾一下全文的三个关键点三合一截图、批量、PDF 三大 OCR识别 场景都在这一个免费离线软件里不用再装一堆工具。两个王牌功能忽略区域帮你踢掉水印干扰双层PDF让扫描件变得可搜索。可编程命令行与 HTTP 接口让 OCR 能力可以嵌入你自己的脚本和工作流。今天的建议很简单下载后先截一次屏感受速度再拖一个真实文件夹进去跑一遍批量任务最后找一份扫描版 PDF 试试双层导出。等你熟悉了这四个标签页很多曾经要手动打字的活儿都可以放心交给它了。版本更新与历史功能清单可以参考 CHANGE_LOG.md遇到问题还可以在项目 Issues 中反馈。希望这篇指南能帮你真正用起来把省下的时间花在更有价值的事情上。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考