离线OCR实测:3个场景一条链路,Umi-OCR把截图、批量图片与扫描PDF全拿下
离线OCR实测3个场景一条链路Umi-OCR把截图、批量图片与扫描PDF全拿下【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR收件箱里又躺进一份扫描版合同想引用其中一段条款全选、复制屏幕上只有一行无法从此PDF复制文字。网页版识别站倒是能用可限大小、限次数更别提敏感文件得先上传到别人的服务器。与其来回折腾不如在电脑里养一个本地离线OCR引擎。今天要聊的Umi-OCR就是这样一款完全开源的离线工具Windows、Linux都能跑解压即用识别全程在本地完成图片和文档始终留在你的硬盘上。这篇文章不按功能清单流水账而是顺着我日常的使用链路来讲收料 → 上量 → 攻坚 → 出货恰好对应截图识别、批量图片、扫描版PDF和结果整理这四件最常干的事。拿到工具从一个压缩包开始全程零安装Umi-OCR是绿色软件从项目发布页下载.7z或.7z.exe自解压包解压到任意目录就能启动Windows双击Umi-OCR.exeLinux执行umi-ocr.sh。两个小提醒目录路径尽量别带中文和空格如果电脑装了杀软建议先把软件目录加进白名单——它内置本地OCR引擎和运行库部分杀软会误报提前加白能省掉后续为什么闪退的烦恼。第一次启动软件会自动跟随系统语言切换界面。主体是几个标签页——截图OCR、批量OCR、文档识别、二维码、全局设置跟浏览器标签栏一样点哪个用哪个。链路第一环 · 收料截屏识别把屏幕上的一切抓成字日常最高频的动作就是看到一段文字想立刻复制。切到截图OCR标签页按快捷键唤起截图框划出目标区域识别结果马上出现在右侧记录栏。实测下来有几个习惯特别顺手不截屏也能识别。在聊天窗口复制一张图片回Umi-OCR直接粘贴照样出文字凭空省一步。结果能二次编辑。识别错的字直接在记录栏里改划选多条记录合并复制顺手就把格式整理好了。竖排排版不慌。排版解析会自动处理横排和从右到左的竖排文本只要OCR引擎本身支持竖排即可。这一环解决的是随抓随用。可要是手里攒了几百张图一张张截就太亏了得上第二环。链路第二环 · 上量几百张图片拖进去剩下的交给它批量OCR标签页支持把图片直接拖进窗口jpg、png、webp、bmp、tif、tiff常见格式都认一次拖几百张没有数量上限。我实测过一回三百多张课程截图一起丢进去全程不到两分钟跑完右侧逐张显示耗时、置信度和识别结果。跑完之后结果可以按需导出成txt、jsonl、md、csv四种格式csv用Excel直接打开做资料归档非常顺。它还照顾到了深夜挂机场景——任务结束后支持自动关机或待机图扔进去睡一觉起来结果已经在文件夹里等着了。v2.1.2起还支持任务中途暂停软件不退出就能接着跑。批量识别有个高频痛点图片角落的水印、LOGO、页眉页脚每次都混进结果里还得人工删。Umi-OCR的忽略区域功能就是为这个设计的——在右侧设置里进入忽略区域编辑器按住右键在图上画出矩形框把水印可能出现的位置全部框住识别时这些区域自动排除。做学术论文批量转换时把统一的页眉页脚一次框掉输出立刻干净很多。这里有个机制必须记住只有完全处于矩形框内部的整个文本块才会被忽略不是单个字符。所以框画得大一点总没错把水印可能出现的位置全包住漏框一次结果里就会混进一行杂音。链路第三环 · 攻坚扫描版PDF翻新成能搜索能复制的文档如果说前两环是热身文档识别才是重头戏。它支持pdf、xps、epub、mobi、fb2、cbz六种格式扫描版PDF是最典型的应用场景。工作方式可以一句话说清先把PDF拆开区分出本来就有的文本层和需要识别的扫描图片层扫描页交给本地引擎逐页认字最后再按阅读顺序拼回去。其中两个点让我印象最深双层可搜索PDF。对扫描件做完OCR输出底层原图、上层透明文字的双层PDF外观和原扫描件一模一样但文字可以搜索、复制、划线。给公司做历史合同归档、给学校做论文数字化这个功能都能直接顶上去。灵活的提取模式。默认优先提取PDF自带的文本层速度快、零识别误差只有遇到纯扫描页才自动切到OCR你也可以主动选整页强制OCR或反过来只提取原文本。v2.1.2起还能输出单层纯文本PDF想要体积小、好编辑的文件就选它。文档识别同样支持忽略区域而且能按页码范围设置专门用来排除扫描件的页眉页脚。另外提醒一句如果扫描件本身旋转过方向务必用最新版本v2.1.5修复了PDF页面旋转导致的文本错位问题。链路第四环 · 出货排版方案与多语言让结果像人排的OCR引擎吐出来的文字往往是散装的谁先谁后得看排版解析怎么安排。Umi-OCR内置了多套预设方案选对方案输出才符合阅读习惯方案适合场景多栏-按自然段换行两栏/三栏论文、书籍自动断行最常用多栏-总是换行每句独立成行方便后续按行处理多栏-无换行整段强制合并成一行单栏-按自然段换行单栏文档段落自然换行单栏-保留缩进代码截图专用保留行首缩进和行中空格不做处理OCR引擎原始输出不做任何整理单栏-保留缩进值得单独表扬把代码截图扔进去输出能基本保持缩进结构配合截图识别写文档时抄代码能省太多事。要是拿不准选哪个直接上多栏-按自然段换行准没错它能覆盖大多数场景。顺带分清两件事界面语言和识别语言库是两码事。前者管按钮菜单长什么样后者管OCR引擎认哪种文字。比如界面用中文、日常识别日文书籍二者完全可以搭配使用。界面语言在全局设置 → 语言/Language切换识别语言在各标签页的文字识别设置里单独选择或下载。顺手拧的三个旋钮大图、内存与渲染器用久了会遇到三类问题每个都对应一个旋钮长图识别不完整→ 调高限制图像边长。默认边长限制是为了平衡速度与内存遇到像素特别大的长截图适当调高数值即可。注意别盲目放大原图过度放大会增加噪声反而拉低准确率。内存占用偏高→ 用PaddleOCR插件的话v2.1.4起默认把内存占用限制在系统总内存一半以内想进一步压去插件配置里调低线程数。截屏闪烁或界面错位→ 多半是显卡渲染兼容问题去全局设置 → 界面和外观 → 渲染器切换渲染方案或直接关硬件加速通常能解决。折腾党通道命令行、HTTP接口与引擎切换图形界面对多数人已经够用但想把它嵌进自己的自动化流程还有两条程序化通道。命令行模式的入口就是主程序本身几个常用姿势# 截屏识别结果直接进剪贴板 umi-ocr --screenshot --clip # 识别指定图片结果输出到文件 umi-ocr --path D:/扫描件.png --output result.txt # 识别整个文件夹含子目录 umi-ocr --path D:/scans -- all_result.txt # 生成二维码 umi-ocr --qrcode_create 你好Umi-OCR D:/qrcode.png 256配合快捷键工具还能实现按一个键自动截指定屏幕区域并识别的操作。完整参数和简写规则见项目内命令行手册 docs/README_CLI.md。HTTP接口软件启动后本地HTTP服务提供OCR、文档识别、二维码等接口文档在 docs/http/api_doc.md。几十行代码就能封装成局域网小工具实现上传图片 → 返回JSON识别结果。服务默认只监听本地环回、不经过物理网卡数据不会外泄。引擎方面软件内置Rapid-OCR兼容性好与PaddleOCR速度快一些双引擎全局设置里随时切换项目还有独立插件库支持扩展更多OCR引擎。写在最后下次再收到扫描版PDF或者文件夹里躺着一堆带水印的截图别再对着网页上传键犹豫了。解压、打开、框选——你的电脑本来就有能力自己读这些字Umi-OCR只是把那把剪刀递到了你手里。把图喂给它然后起身接杯水回来拿结果这大概就是离线OCR最舒服的样子。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考