免费开源离线OCR软件Umi-OCR实战指南:截图识别、批量图片文字提取、扫描PDF转可搜索文档一键搞定
免费开源离线OCR软件Umi-OCR实战指南截图识别、批量图片文字提取、扫描PDF转可搜索文档一键搞定【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款完全免费、开源的离线 OCR 文字识别软件支持 Windows 与 Linux 平台。它无需安装、不联网即可完成截图识别文字、批量图片文字提取、扫描 PDF 转可搜索文档以及二维码扫描与生成。如果你手头压着大量课件截图、扫描版图书或没有文字层的旧 PDF又不想把资料上传到云端这篇文章可以帮你快速摸清它的全部能力。一、功能总览速查表在深入每个模块之前先用一张表建立整体认知。Umi-OCR 的主界面由多个独立标签页组成想用哪个功能就打开对应页面还能锁定标签防止误关。功能模块核心用途入口位置典型适用场景截图OCR框选屏幕任意区域即时识别图中文字截图OCR 标签页课件截图、网页文章、代码片段、聊天记录批量OCR一次性识别大量本地图片可导出多种格式批量OCR 标签页手机拍摄的书页照片、历史图片归档文档识别提取电子文档文字或对扫描件 OCR输出双层可搜索 PDF文档识别 标签页扫描版 PDF、epub/mobi 等电子书转可检索文档二维码识别或生成二维码、条形码二维码 标签页扫码跳转、批量生成二维码图片全局设置调整语言、主题、字体、快捷键与渲染方式全局设置 标签页界面个性化、适配不同显示环境二、截图识别文字框选即得结果即时呈现截图 OCR 是日常使用频率最高的功能适合处理屏幕上任何可见的文字内容。操作流程打开截图OCR标签页软件会给出预设截图快捷键可在设置中修改。按下快捷键屏幕出现取景框用鼠标框住目标区域。松开鼠标识别结果立即显示在右侧记录栏。识别结果支持直接编辑也可以划选多条记录一次性复制。左侧图片预览栏同样支持鼠标划选复制。如果剪贴板里已经有一张图直接粘贴到软件中也能触发识别无需先保存成文件。排版解析方案让结果更符合阅读习惯OCR 原始输出往往是一行行机械堆叠的文本阅读体验一般。Umi-OCR 内置的文本后处理—排版解析方案可以整理结果顺序与换行预设方案包括单栏-保留缩进适合代码截图行首缩进与行中空格原样保留。多栏-按自然段换行适合双栏论文页面左右栏按阅读顺序输出不会交叉错乱。多栏-总是换行 / 无换行控制每段语句是否强制换行或合并为一行。不做处理保留 OCR 引擎的原始输出。这些方案还能自动处理横排与竖排从右到左排版。识别代码、表格、论文、漫画对白等不同内容时切换对应方案可以显著提升结果可用性。三、批量图片文字识别几百张图一次跑完课件是零散的书页却是成堆的。批量 OCR 页面专门解决大量图片需要逐个识别的重复劳动。支持与限制速览输入格式jpg、png、webp、bmp、tif/tiff 等常见位图格式。导出格式txt、jsonl、md、csvExcel。任务量无数量上限几百张图片可一次性加入任务队列。自动化支持任务完成后自动关机或待机适合睡前挂机。忽略区域一键排除水印与页眉页脚批量识别照片时手机时间水印、页角阴影、Logo 常常混入识别结果。此时可以使用忽略区域功能在批量识别页右栏设置中进入忽略区域编辑器。按住鼠标右键在水印可能出现的区域绘制矩形框。任务执行时框内文字会被整块忽略。注意忽略区域按整个文本块判定而不是单个字符因此矩形框尽量画大一些完整包裹住水印所有可能出现的位置。四、扫描 PDF 转可搜索文档老书页也能全文检索扫描版 PDF 没有文字层翻起来像看照片既不能搜索也不能复制。文档识别页面专门解决这类问题。支持格式pdf、xps、epub、mobi、fb2、cbz。两种工作方式对扫描件执行 OCR输出双层可搜索 PDF——底层保留扫描原图顶层覆盖透明文字层。成品既能一页页看原貌又能全文搜索、划词复制。对自带文字层的电子文档直接提取原有文本速度快、无需识别。关键设置处理长文档时同样可以设置忽略区域把页眉、页脚、页码、书名排除在识别范围外避免干扰混入正文。多本数百页的书可同时排队处理配合自动关机功能一夜之间就能把整个文献库变成可检索状态。五、二维码扫描与生成一图多码19 种码制二维码页面同时提供识别与生成两种能力扫码截图、粘贴或拖入本地图片读取其中的二维码与条形码支持一图多码即一张图片包含多个码时可以全部识别。生成码输入文本即可生成二维码图片支持设置码制协议与纠错等级。支持的协议包括 QRCode、Aztec、DataMatrix、PDF417、Code128、EAN13、UPCA 等共 19 种覆盖日常扫码与部分工业场景需求。六、全局设置与个性化三分钟搭好你的识别环境首次启动时Umi-OCR 会根据系统语言自动切换界面语言。进入全局设置页可以进一步定制语言简体中文、繁体中文、英文、日文等多语言切换。主题多套亮色与暗色主题可选。字体与缩放调整界面文字大小与字体适配不同分辨率屏幕。渲染器与硬件加速如果遇到截屏闪烁或界面错位切换到不同渲染方案或关闭硬件加速即可。快捷键修改截图快捷键让唤起动作更顺手。自启与快捷方式一键设置开机自启或创建桌面快捷方式。七、三分钟快速上手清单如果你不想逐页阅读直接按下面的步骤跑一遍即可上手下载.7z发行包并解压双击Umi-OCR.exe启动无需安装。首次打开进入全局设置确认界面语言与主题符合习惯。打开截图OCR标签页按快捷键框选一段文字验证识别效果。按需调整排版解析方案让输出更贴近阅读习惯。处理批量图片时切到批量OCR标签页拖入图片并设置忽略区域后开始任务。处理扫描 PDF 时切到文档识别标签页选择输出双层可搜索 PDF。需要自动化时参考命令行手册与 HTTP 接口文档接入外部脚本。八、扩展能力命令行与 HTTP 接口Umi-OCR 不止是一个图形界面工具它还开放了两种调用方式适合开发者与自动化场景命令行调用入口为 Umi-OCR.exeumi-ocr --screenshot触发鼠标截屏识别。umi-ocr --clipboard识别剪贴板中的图片。umi-ocr --path 图片或文件夹路径识别指定路径的图片可同时传入多个路径。umi-ocr --qrcode_read 图片路径/umi-ocr --qrcode_create 文本 输出路径二维码识别与生成。HTTP 接口提供图片 OCR、文档识别、二维码识别/生成等接口方便把 OCR 能力嵌入自己的小工具或服务中。接口细节见 HTTP 接口说明 与 命令行手册。多语言界面简体中文、繁体中文、英文、日文、俄文等语言切换均由社区在 Weblate 平台上持续协作翻译。界面本地化做得较完整英文资料阅读量大的用户切到英文界面也不会觉得别扭。九、常见问题 FAQ问Umi-OCR 需要联网吗不需要。识别引擎与语言库全部内置本地全程离线运行文档不会离开你的电脑。问支持哪些平台Windows 7 x64 及以上、Linux x64。发布包为.7z压缩包或.7z.exe自解压包后者可在未安装压缩软件的电脑上直接解压。问截屏时出现闪烁或界面错位怎么办在全局设置 → 界面和外观 → 渲染器中切换不同渲染方案或直接关闭硬件加速。问识别超大的长图失败怎么办到页面的设置 → 文字识别 → 限制图像边长中调高数值即可。问图片上的水印干扰识别结果怎么办在批量 OCR 或文档识别中启用忽略区域绘制矩形框覆盖水印可能出现的位置。问界面语言能不能改回中文可以。全局设置 → 语言/Language 中手动切换软件首次启动也会按系统语言自动选择。问OCR 引擎可以更换吗可以。软件支持插件机制可导入不同的离线 OCR 引擎并在全局设置中切换。十、总结与获取方式Umi-OCR 的核心价值可以概括为三点完全离线、零学习成本、批量能力扎实。截图、批量图片、扫描 PDF、二维码四条主流程都集中在显眼入口不需要复杂配置就能跑通忽略区域、排版解析、自动关机这些细节设计则专门解决真实使用中水印干扰长文档排版乱批量任务耗时等痛点。项目完全开源、免费无任何使用限制功能演进记录在项目的更新日志CHANGE_LOG.md中持续公开。想查阅源码的开发者可以通过git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR获取仓库。如果你也积压着一批扫描件与截图不妨下载最新发行版挑一份最头疼的文档实测一遍。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考