本地 PDF、图片字段提取到 Excel:用文档工作台的完整流程 本地 PDF、图片字段提取到 Excel用文档工作台的完整流程标签OCR、PDF、Excel、文档处理、本地部署碰到一摞 PDF 和图片要整理目标是提取指定的信息输出 Excel——这时候直接跑全文 OCR 往往不管用。举个例子交付表要姓名、编号、日期、金额四列。全文识别给你一大段文字你还是得自己从每一页里挨个找这四个字段再手动填表。下面是我用的方法文档工作台全程本地处理把 PDF 和图片里的字段抽出来导出 Excel。截图里的 LocalDoc Studio 是当前客户端界面名字。什么情况下适用先看你的任务符不符合这四条输入是 PDF、图片或者混装两者的文件夹。每页要取的信息比较固定。最后要的是 Excel。文件不能往外传得在本地处理。如果你的需求是直接写进业务系统、处理没定义字段的复杂表、或者要求不管什么版面都零误差——那这个流程不一定合适得先把交付标准定清楚。1. 导入 PDF、图片或文件夹上传页面里单个文件也行整个文件夹也行。PDF 按页拆图片进队列。动手前确认一件事一页是不是 Excel 的一行如果一页里有多条记录或者一条记录跨页先定义拆分规则。图 1左边导文件右边配字段。2. 配字段两种方式自己新建字段名顺带加描述。导入现成的 Excel 模板列名自动变成字段。比如目标表是客户名称单据编号日期金额就在文档工作台里配这四个同名字段。导出时它们就是 Excel 列名。到这一步真正要紧的不是能不能做全文识别——当然能做——而是字段定义了没有。没定义字段全文结果有但没法按字段导出 Excel。3. 本机识别和提取字段配好OCR 和字段提取都在你电脑上跑PDF、图片或文件夹 → 配好字段 → 文档工作台本地识别与提取 → Excel图 2任务结果可以对照原图和全文识别内容。省掉的是反复读页、定位字段、整理成表的体力活。复杂材料的业务判断该你判断还是你判断。4. 对照原图复核导出之前在文档工作台里把原图、全文、字段结果放一起看。重点盯这几类模糊、倾斜、扫描质量差的页面。编号、日期、金额——不能错。同一字段在每页位置不一样的。字段含义可能有歧义的。图 3原始文档和字段结果左右对照方便人工复核。工具跑完一轮不等于就能直接交。模糊的、格式怪的、业务上拿不准的还是得人来确认。5. 按字段导出 Excel确认完字段变成列名页面结果填成行。多页可以一次导出。图 4导出后字段就是列名。这张 Excel 可以拿去录入系统、做分析、继续整理——接上你已有的流程就行。适用边界只跑本地不处理云端文档。当前输入的正式支持是 PDF、图片、文件夹其他格式没验证过。不保所有文档、所有字段都零误差版面复杂、图片模糊、对准确率有硬要求的人工复核省不了。说到底好用的流程不是先转 PDF 再说而是先把那张 Excel 要什么列想清楚再让工具去认、去提、去导出。下载文档工作台下载链接https://pan.quark.cn/s/9a25a85ba730#/list/share