用 GOT-OCR2_0-4bit 搭建个人文档数字化工作流发票、报告、票据一站式识别【免费下载链接】GOT-OCR2_0-4bit项目地址: https://ai.gitcode.com/hf_mirrors/mlx-community/GOT-OCR2_0-4bit每天面对堆积如山的发票、报告和票据手动录入既费时又容易出错。GOT-OCR2_0-4bit 是一款开源的本地 OCR 识别模型能一键把图片中的文字提取为可编辑文本让你在 Mac 上轻松搭建个人文档数字化工作流实现发票识别、报告识别、票据识别的一站式处理全程无需上传文件、无需联网数据完全留在自己的电脑里。GOT-OCR2_0-4bit 是什么一张表看懂这款开源 OCR 模型GOT-OCR2_0-4bit 是通用 OCR 模型 GOT-OCR2.0 的 4 比特量化版本由 mlx-community 社区发布。它基于 Apple 的 MLX 框架开发专为 Apple Silicon 芯片M 系列 Mac优化把 5.6 亿参数的模型压缩到只有457MB普通笔记本也能轻松跑起来。核心参数数值模型参数量5.6 亿560M量化位数4-bitgroup size 64磁盘占用457 MB推理峰值内存约 1.83 GB实测生成速度272.9 tok/sM 系列芯片支持上下文32k 长文本窗口 一句话总结体积小、速度快、内存占用低特别适合作为个人电脑上的常驻 OCR 工具。为什么要用本地 OCR 做文档数字化5 个无法拒绝的理由发票、合同、医疗报告都属于敏感信息把它交给在线 OCR 服务总让人不放心。GOT-OCR2_0-4bit 的价值正在于此隐私安全识别全程在本地完成敏感票据不出电脑杜绝数据泄露风险完全免费开源 Apache-2.0 协议无按次计费、无额度限制⚡速度飞快实测 272.9 tok/s一张发票几秒钟出结果占用极小磁盘 457MB、内存峰值 1.83GB8GB 内存的 Mac 也能流畅运行精度可靠8-bit 版本输出与官方 bf16 版本逐字节一致4-bit 版本的识别误差也微乎其微发票识别、报告识别、票据识别怎么用两种指令搞定一切GOT-OCR2_0-4bit 不是聊天模型它只认两种口令就像给识别任务下指令一样简单OCR:输出纯文本适合发票金额、报告正文、票据信息等常规文字提取OCR with format:输出带格式的结构化内容表格、数学公式、乐谱都能保留排版结构这两种指令在 modeling_GOT.py 中定义还支持更进阶的玩法区域识别指定图片坐标框只识别某一块区域比如只提取发票上的金额栏颜色识别按颜色定位文字例如只提取红色批注多页文档通过 chat_crop 方法支持跨多页的连续识别️渲染导出识别结果可经 render_tools.py 渲染成 HTML还原版式Mac 上快速部署 GOT-OCR2_0-4bit三步搭建文档数字化工作流第一步准备环境一台 Apple Silicon 芯片的 MacM1/M2/M3/M4 均可安装 Python 3.9 与 MLX 相关依赖pip install mlx mlx-vlm注意需要支持 GOT-OCR 2.0 的 mlx-vlm 版本第二步获取模型git clone https://gitcode.com/hf_mirrors/mlx-community/GOT-OCR2_0-4bit cd GOT-OCR2_0-4bit第三步开始识别python -m mlx_vlm generate \ --model . \ --image invoice.png \ --prompt OCR: \ --max-tokens 1024把invoice.png换成你的发票、报告或票据截图几秒钟后终端就会输出识别好的文字。想要表格结构把提示词换成OCR with format:即可。进阶技巧让识别结果真正数字化单纯的文字输出只是第一步想要搭建完整的个人文档数字化工作流你还可以这样做批量归档写一个循环脚本把文件夹里的票据逐一识别并导出为 Markdown/TXT️结构化入库用OCR with format:识别表格类票据配合正则把金额、日期、发票号拆成字段存入 Excel 或数据库版式还原使用 render_tools.py 的渲染能力把识别结果转成接近原版的 HTML 页面结合 AI 总结把识别出的文本交给大模型做摘要、分类、报销单自动填写实测精度发票识别准确率到底怎么样开发者用 6 种真实场景文档发票、化验单、快递单、收据、规格表、旋转收据做了严格测试模型版本字段准确率内容准确率数字准确率生成速度峰值内存bf16 原版0.8680.9610.972138.3 tok/s2.50 GB8-bit0.8680.9610.972210.8 tok/s2.06 GB4-bit本仓库0.8950.9470.962272.9 tok/s1.83 GB可以看到4-bit 版本用不到 5% 的精度损失换来了近2 倍的速度提升和 25% 的内存节省对个人日常使用来说完全是划算的交换。常见问题 FAQQ需要多大内存的 MacA8GB 内存即可流畅运行峰值占用约 1.83GB16GB 会更从容。Q支持中文发票吗A支持。模型为多语言设计中文、英文票据均可识别且可配合区域识别精准提取。Q识别必须联网吗A识别过程完全本地化仅首次下载模型权重时需要联网。Q和在线 OCR 工具比优势在哪A免费无限制、数据不出本机、速度更快还能处理表格公式等复杂结构。总结GOT-OCR2_0-4bit 用 457MB 的体积、1.83GB 的内存和接近原版的识别精度把专业级 OCR 能力装进了普通人的 Mac。无论是整理报销发票、归档行业报告还是录入纸质票据它都能帮你把图片变成数据真正实现个人文档数字化工作流的一站式识别。现在就 clone 下来把第一张发票交给它试试吧【免费下载链接】GOT-OCR2_0-4bit项目地址: https://ai.gitcode.com/hf_mirrors/mlx-community/GOT-OCR2_0-4bit创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考