10 个高效提示词模板:用 lift-oQ3.5 把图片/PDF 变成结构化 JSON
10 个高效提示词模板用 lift-oQ3.5 把图片/PDF 变成结构化 JSON【免费下载链接】lift-oQ3.5项目地址: https://ai.gitcode.com/hf_mirrors/mlx-community/lift-oQ3.5想把手里的发票、合同、PDF 一键变成结构化 JSON本文为你准备了 10 个可直接复制的高效提示词模板配合在苹果芯片上本地运行的视觉大模型lift-oQ3.5就能把图片/PDF 里的信息稳定抽取成干净、整齐的 JSON 数据全程无需云端 API也不会上传任何敏感文件。lift-oQ3.5 是什么为什么适合图片/PDF 转 JSONlift-oQ3.5 是开源视觉语言模型 datalab-to/lift9B Qwen3.5的 MLX 量化版本核心定位就是结构化抽取输入一张图片或一份 PDF输出符合你预设字段的 JSON。它采用约 4.0 bits/weight 的逐层混合精度量化oQ模型文件只有约 4.9 GB通过 mlx-vlm 在 Apple Silicon 上本地运行生成速度可达约 109 token/秒甚至比许多云接口还快。关键指标lift-oQ3.5基础模型datalab-to/lift9B Qwen3.5 视觉语言模型核心能力图片 / PDF → 结构化 JSON 抽取量化方式oQ 逐层混合精度约 4.0 bits/weight模型体积约 4.9 GB峰值内存约 6.5 GB生成速度约 109 token/秒M5 Max 实测运行框架mlx-vlmApple Silicon上游 FP 版本在 Datalab 的 225 份文档基准上字段抽取准确率达 90.2%量化后的表现依然可靠。模型的量化参数见仓库中的config.jsonquantization字段生成参数与 EOS 修复见generation_config.json对话格式见chat_template.jinja完整使用说明见README.md。30 秒上手本地运行图片转 JSON 的两种方式方式一命令行一键抽取最简单的用法一条命令搞定uvx --from mlx-vlm mlx_vlm.generate \ --model mlx-community/lift-oQ3.5 \ --image invoice.png \ --prompt Extract the invoice as JSON. \ --max-tokens 800方式二OpenAI 兼容服务 JSON Schema 约束更推荐的方式是启动一个本地服务然后用 OpenAI SDK 调用解码时通过 JSON Schema 强制约束输出保证 100% 是合法 JSONuvx --from mlx-vlm mlx_vlm.server --model mlx-community/lift-oQ3.5 --port 8080启动后把base_url指向http://127.0.0.1:8080/v1在response_format里传入json_schema模型就会严格按照你定义的结构输出。这个 schema 约束解码 正是 lift 系列模型最擅长的能力也是它区别于普通 OCR 大模型的根本原因。写好提示词的 4 个核心技巧在复制模板之前先记住这 4 条原则能显著提升成功率列全字段清单把想要的字段名一个个写清楚比笼统说 提取信息 准确得多指定输出格式明确要求 只输出 JSON不要多余文字避免模型啰嗦声明字段类型标注字符串/数字/数组让数字不会被当成文本把温度设为 0结构化抽取追求确定性temperature0可让结果稳定可复现。10 个可直接复制的提示词模板下面 10 个模板覆盖了日常办公中最常见的文档类型直接复制修改即可使用。示例中的字段名建议保留英文模型更稳定提示语用中文即可。模板 1发票识别提示词模板 适合增值税发票、电子发票、小票截图。核心关键词发票转 JSON、发票识别提示词。请从这张发票图片中抽取信息只输出 JSON - invoice_number字符串发票号码 - date字符串格式 YYYY-MM-DD 的开票日期 - seller_name字符串销售方名称 - buyer_name字符串购买方名称 - total_amount数字价税合计金额 - tax_amount数字税额 - line_items数组每项含 description商品名称和 amount金额模板 2证件信息提取提示词模板 适合身份证、护照、驾照等证件照片。请仅在你有权处理的场景下使用。识别这张证件图片输出 JSON字段 name姓名、gender性别、ethnicity民族、birth_date出生日期、 id_number证件号码、address住址、issuing_authority签发机关、 valid_period有效期。缺失的字段输出 null。模板 3合同关键条款提取提示词模板 ✍️适合多页 PDF 合同把长文本压缩成结构化条款。阅读这份 PDF 合同抽取以下关键信息并输出 JSON contract_title合同名称、parties当事人数组含 name 和 role、 effective_date生效日期、contract_amount合同金额数字、 payment_terms付款条款摘要、termination_clause解除条款摘要、 signature_date签署日期。每项摘要不超过 50 字。模板 4表格图片转 JSON 模板 适合把截图、拍照的表格变成可直接入库的数据。把图片中的表格完整转为 JSON 数组第一行作为字段名 每行数据对应一个对象数字保留两位小数空单元格输出 null 不要遗漏任何行和列。模板 5名片信息结构化模板 批量录入名片时非常好用。识别这张名片输出 JSONname姓名、title职位、company公司、 phone电话、email邮箱、website网址、address地址。 无法识别的字段输出 null不要猜测。模板 6简历解析提示词模板 ‍适合 HR 或求职者批量整理简历把 PDF 简历转成统一格式。解析这份简历 PDF输出 JSON candidate_name姓名、contact联系方式含 email 和 phone、 education教育经历数组含 school、degree、period、 work_experience工作经历数组含 company、role、period、highlights 数组、 skills技能数组。经历按时间倒序排列。模板 7医疗化验单结构化模板 适合化验单、体检报告截图方便录入健康数据。识别这张化验单图片输出 JSON report_type报告类型、hospital医院名称、patient_name患者姓名、 test_date检查日期、items指标数组每项含 name指标名、 result结果、unit单位、reference_range参考范围、 flag偏高/偏低/正常可用 HIGH/LOW/NORMAL。缺失字段输出 null。模板 8收据小票识别模板 适合购物小票、外卖单、餐饮账单的报销整理。识别这张收据图片输出 JSONstore_name商户名称、date日期、 items商品数组含 description 和 price、subtotal小计、 tax税费、total合计、payment_method支付方式。 金额用数字类型输出。模板 9银行对账单结构化模板 适合把纸质或 PDF 对账单转成电子账本。阅读这份银行对账单输出 JSON statement_period账单周期、account_holder户名、 opening_balance期初余额、transactions交易数组每项含 date、description、amount收入为正支出为负、balance_after余额、 closing_balance期末余额。模板 10多页 PDF 文档结构化提取模板 适合研究报告、论文、技术文档的快速建档。阅读这份多页 PDF输出 JSONdocument_type文档类型、title标题、 author作者、page_count页数、key_topics主题关键词数组最多 5 个、 summary摘要不超过 150 字、key_dates关键日期数组含 date 和 event。进阶用 JSON Schema 锁定输出结构如果你在跑服务模式建议为每个模板配上 JSON Schema解码时会强制校验从根本上杜绝格式错误。以发票为例{ type: object, properties: { invoice_number: {type: string}, date: {type: string}, total_amount: {type: number}, line_items: { type: array, items: { type: object, properties: {description: {type: string}, amount: {type: number}} } } }, required: [invoice_number, total_amount] }加上 Schema 后即使提示词写得比较随意输出也一定是合法且类型正确的 JSON非常适合接入自动化流程。常见问题与排查输出一直不结束 / 刷出大量|im_end|本仓库的generation_config.json已修复 EOSeos_token_id: [248044, 248046]直接使用即可如果你自行从上游转换需要重新应用这个修复。结果不是合法 JSON优先使用服务模式 JSON Schema 约束并把temperature设为 0。复杂表格或模糊图片识别不准量化越低精度损耗越大遇到困难文档可先放大/旋转图片或换用更高精度的兄弟版本如 oQ5、oQ6。多页 PDF 内容太多适当调大max_tokens如 1500–2000或按页拆分后逐页抽取再合并。总结这 10 个提示词模板覆盖了发票、证件、合同、表格、名片、简历、医疗单据、小票、银行对账单和 PDF 文档等高频场景配合 lift-oQ3.5 的本地运行能力和 JSON Schema 约束解码你就能搭建一套完全本地化、私密可靠的 图片/PDF 转结构化 JSON 工作流。先从模板 1 的发票识别开始试试吧你会很快感受到结构化抽取带来的效率提升【免费下载链接】lift-oQ3.5项目地址: https://ai.gitcode.com/hf_mirrors/mlx-community/lift-oQ3.5创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考