AutoGluon 文档分类:三行代码打通扫描件到标签的多模态链路
AutoGluon 文档分类三行代码打通扫描件到标签的多模态链路【免费下载链接】autogluonFast and Accurate ML in 3 Lines of Code项目地址: https://gitcode.com/GitHub_Trending/au/autogluon月底财务要批量归档一批扫描的发票与合同逐份人工判断类型极其耗时。AutoGluon 多模态文档分类模块用三行代码打通这条链路OCR 识别、特征融合与 LayoutLM 微调全部自动完成。能力全景 multimodal 模块覆盖文档分类的完整链路其数据格式是路径列 标签列与 Label Studio 导出的标注格式直接兼容能力项说明适用场景文档图片分类扫描件经 OCR 后由 LayoutLM 微调发票、合同等单页扫描件PDF 分类页面解析后直接使用文本与版面信息多页简历、档案、电子文书嵌入提取extract_embedding 输出文档向量相似检索、重复文档检测部署导出ONNX 导出、整体 save/load离线服务与云端部署框架同时支持文本、图像与文档 Transformer 模型族文档模型之间的差异主要是输入模态只用文本加边界框还是连页面图像一起输入。最小可运行路径依赖安装共两处pip install autogluon.multimodal以及系统层的 Tesseract 与 PopplerUbuntu 下sudo apt install tesseract-ocr poppler-utils。下面这段代码完成加载数据、训练与评估import pandas as pd from autogluon.multimodal import MultiModalPredictor train_data pd.read_csv(rvl_cdip/train_data.csv) # 需含 doc_path 与 label 列 predictor MultiModalPredictor(labellabel) predictor.fit(train_datatrain_data, time_limit120) print(predictor.evaluate(train_data, metrics[accuracy]))运行后输出准确率指标在官方三类扫描文档样本数据上3 类分类准确率可达 90% 以上predict_proba还能返回各类别的概率分布。核心机制解读三行代码之所以可行来自三条内部机制OCR 管线输入为扫描件图像pytesseractTesseract 的 Python 封装逐字符提取文本与包围盒坐标输出结构化的文本 位置表格扫描件 OCR 自动识别无需手写。多模态文档特征融合输入为 OCR 文本与框坐标LayoutLMv3 额外加入页面图像Transformer 在逐层表示中对齐文本与空间特征输出可分类的文档级表示。预训练模型选型默认 checkpoint 为 microsoft/layoutlmv3-base是带版面感知能力的文档模型若只用文本与框坐标layoutlm-base-uncased 更轻量训练耗时更短。PDF 输入时框架先经 Poppler 解析文本与版面OCR 分支仅在图像输入时启用纯文本 PDF 不产生识别开销。模型输入适用场景layoutlmv3-base默认文本 包围盒 页面图像复杂版面、多栏 PDFlayoutlm-base-uncased文本 包围盒单页扫描件、快速实验场景变体与关键参数单页扫描件使用默认配置即可追求更快收敛时把model.document_transformer.checkpoint_name显式设为microsoft/layoutlm-base-uncased。多页 PDFPDF 分类模型训练时单页文本长、显存占用高建议降低并行与批大小env.num_workers: 4、env.batch_size: 2模型保留 layoutlmv3-base 以利用版面信息。长文本与过拟合单页文本超过 512 token 时调大model.document_transformer.max_seq_length小数据集过拟合则下调optimization.learning_rate。参数默认值调优建议影响model.document_transformer.checkpoint_namemicrosoft/layoutlmv3-baseCPU 环境换 layoutlm-base-uncased版面理解能力与训练耗时model.document_transformer.max_seq_length512长文档调至 1024超出部分文本被截断optimization.learning_rate5e-5过拟合时降至 1e-5收敛速度与泛化落地与集成 向量检索extract_embedding为每份文档输出固定维度向量可直接用于合同相似匹配与重复文档聚类。ONNX 导出export_onnx将训练好的模型转为 ONNX 格式以便高吞吐推理示例见 examples/automm/production/onnx_text.py。迁移部署predictor 对象可整体 save/load配合云端教程即可部署到 SageMaker 或私有环境。数据侧可复用 Label Studio 的结构化标注格式下图为文本标签导出示例资源索引文档预测教程总览入门教程扫描件分类实战 notebook实操代码PDF 分类 notebookPDF 场景多模态模块源码模块源码Document Transformer 模型实现模型实现ONNX 生产部署示例生产部署【免费下载链接】autogluonFast and Accurate ML in 3 Lines of Code项目地址: https://gitcode.com/GitHub_Trending/au/autogluon创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考