10 个高效提示词模板:用 lift-oQ3.5 把图片/PDF 变成结构化 JSON
2026/8/20 17:24:40 网站建设 项目流程

10 个高效提示词模板:用 lift-oQ3.5 把图片/PDF 变成结构化 JSON

【免费下载链接】lift-oQ3.5项目地址: https://ai.gitcode.com/hf_mirrors/mlx-community/lift-oQ3.5

想把手里的发票、合同、PDF 一键变成结构化 JSON?本文为你准备了 10 个可直接复制的高效提示词模板,配合在苹果芯片上本地运行的视觉大模型lift-oQ3.5,就能把图片/PDF 里的信息稳定抽取成干净、整齐的 JSON 数据,全程无需云端 API,也不会上传任何敏感文件。

lift-oQ3.5 是什么?为什么适合图片/PDF 转 JSON?

lift-oQ3.5 是开源视觉语言模型 datalab-to/lift(9B Qwen3.5)的 MLX 量化版本,核心定位就是结构化抽取:输入一张图片或一份 PDF,输出符合你预设字段的 JSON。它采用约 4.0 bits/weight 的逐层混合精度量化(oQ),模型文件只有约 4.9 GB,通过 mlx-vlm 在 Apple Silicon 上本地运行,生成速度可达约 109 token/秒,甚至比许多云接口还快。

关键指标lift-oQ3.5
基础模型datalab-to/lift(9B Qwen3.5 视觉语言模型)
核心能力图片 / PDF → 结构化 JSON 抽取
量化方式oQ 逐层混合精度,约 4.0 bits/weight
模型体积约 4.9 GB
峰值内存约 6.5 GB
生成速度约 109 token/秒(M5 Max 实测)
运行框架mlx-vlm(Apple Silicon)

上游 FP 版本在 Datalab 的 225 份文档基准上字段抽取准确率达 90.2%,量化后的表现依然可靠。模型的量化参数见仓库中的config.jsonquantization字段),生成参数与 EOS 修复见generation_config.json,对话格式见chat_template.jinja,完整使用说明见README.md

30 秒上手:本地运行图片转 JSON 的两种方式

方式一:命令行一键抽取

最简单的用法,一条命令搞定:

uvx --from mlx-vlm mlx_vlm.generate \ --model mlx-community/lift-oQ3.5 \ --image invoice.png \ --prompt "Extract the invoice as JSON." \ --max-tokens 800

方式二:OpenAI 兼容服务 + JSON Schema 约束

更推荐的方式是启动一个本地服务,然后用 OpenAI SDK 调用,解码时通过 JSON Schema 强制约束输出,保证 100% 是合法 JSON:

uvx --from mlx-vlm mlx_vlm.server --model mlx-community/lift-oQ3.5 --port 8080

启动后把base_url指向http://127.0.0.1:8080/v1,在response_format里传入json_schema,模型就会严格按照你定义的结构输出。这个 "schema 约束解码" 正是 lift 系列模型最擅长的能力,也是它区别于普通 OCR 大模型的根本原因。

写好提示词的 4 个核心技巧

在复制模板之前,先记住这 4 条原则,能显著提升成功率:

  1. 列全字段清单:把想要的字段名一个个写清楚,比笼统说 "提取信息" 准确得多;
  2. 指定输出格式:明确要求 "只输出 JSON,不要多余文字",避免模型啰嗦;
  3. 声明字段类型:标注字符串/数字/数组,让数字不会被当成文本;
  4. 把温度设为 0:结构化抽取追求确定性,temperature=0可让结果稳定可复现。

10 个可直接复制的提示词模板

下面 10 个模板覆盖了日常办公中最常见的文档类型,直接复制修改即可使用。示例中的字段名建议保留英文(模型更稳定),提示语用中文即可。

模板 1:发票识别提示词模板 📄

适合增值税发票、电子发票、小票截图。核心关键词:发票转 JSON、发票识别提示词。

请从这张发票图片中抽取信息,只输出 JSON: - invoice_number:字符串,发票号码 - date:字符串,格式 YYYY-MM-DD 的开票日期 - seller_name:字符串,销售方名称 - buyer_name:字符串,购买方名称 - total_amount:数字,价税合计金额 - tax_amount:数字,税额 - line_items:数组,每项含 description(商品名称)和 amount(金额)

模板 2:证件信息提取提示词模板 🪪

适合身份证、护照、驾照等证件照片。请仅在你有权处理的场景下使用。

识别这张证件图片,输出 JSON,字段: name(姓名)、gender(性别)、ethnicity(民族)、birth_date(出生日期)、 id_number(证件号码)、address(住址)、issuing_authority(签发机关)、 valid_period(有效期)。缺失的字段输出 null。

模板 3:合同关键条款提取提示词模板 ✍️

适合多页 PDF 合同,把长文本压缩成结构化条款。

阅读这份 PDF 合同,抽取以下关键信息并输出 JSON: contract_title(合同名称)、parties(当事人,数组,含 name 和 role)、 effective_date(生效日期)、contract_amount(合同金额,数字)、 payment_terms(付款条款摘要)、termination_clause(解除条款摘要)、 signature_date(签署日期)。每项摘要不超过 50 字。

模板 4:表格图片转 JSON 模板 📊

适合把截图、拍照的表格变成可直接入库的数据。

把图片中的表格完整转为 JSON 数组:第一行作为字段名, 每行数据对应一个对象;数字保留两位小数;空单元格输出 null; 不要遗漏任何行和列。

模板 5:名片信息结构化模板 👔

批量录入名片时非常好用。

识别这张名片,输出 JSON:name(姓名)、title(职位)、company(公司)、 phone(电话)、email(邮箱)、website(网址)、address(地址)。 无法识别的字段输出 null,不要猜测。

模板 6:简历解析提示词模板 🧑‍💻

适合 HR 或求职者批量整理简历,把 PDF 简历转成统一格式。

解析这份简历 PDF,输出 JSON: candidate_name(姓名)、contact(联系方式,含 email 和 phone)、 education(教育经历数组,含 school、degree、period)、 work_experience(工作经历数组,含 company、role、period、highlights 数组)、 skills(技能数组)。经历按时间倒序排列。

模板 7:医疗化验单结构化模板 🩺

适合化验单、体检报告截图,方便录入健康数据。

识别这张化验单图片,输出 JSON: report_type(报告类型)、hospital(医院名称)、patient_name(患者姓名)、 test_date(检查日期)、items(指标数组,每项含 name(指标名)、 result(结果)、unit(单位)、reference_range(参考范围)、 flag(偏高/偏低/正常,可用 HIGH/LOW/NORMAL)。缺失字段输出 null。

模板 8:收据小票识别模板 🧾

适合购物小票、外卖单、餐饮账单的报销整理。

识别这张收据图片,输出 JSON:store_name(商户名称)、date(日期)、 items(商品数组,含 description 和 price)、subtotal(小计)、 tax(税费)、total(合计)、payment_method(支付方式)。 金额用数字类型输出。

模板 9:银行对账单结构化模板 🏦

适合把纸质或 PDF 对账单转成电子账本。

阅读这份银行对账单,输出 JSON: statement_period(账单周期)、account_holder(户名)、 opening_balance(期初余额)、transactions(交易数组,每项含 date、description、amount(收入为正,支出为负)、balance_after(余额))、 closing_balance(期末余额)。

模板 10:多页 PDF 文档结构化提取模板 📚

适合研究报告、论文、技术文档的快速建档。

阅读这份多页 PDF,输出 JSON:document_type(文档类型)、title(标题)、 author(作者)、page_count(页数)、key_topics(主题关键词数组,最多 5 个)、 summary(摘要,不超过 150 字)、key_dates(关键日期数组,含 date 和 event)。

进阶:用 JSON Schema 锁定输出结构

如果你在跑服务模式,建议为每个模板配上 JSON Schema,解码时会强制校验,从根本上杜绝格式错误。以发票为例:

{ "type": "object", "properties": { "invoice_number": {"type": "string"}, "date": {"type": "string"}, "total_amount": {"type": "number"}, "line_items": { "type": "array", "items": { "type": "object", "properties": {"description": {"type": "string"}, "amount": {"type": "number"}} } } }, "required": ["invoice_number", "total_amount"] }

加上 Schema 后,即使提示词写得比较随意,输出也一定是合法且类型正确的 JSON,非常适合接入自动化流程。

常见问题与排查

  • 输出一直不结束 / 刷出大量<|im_end|>本仓库的generation_config.json已修复 EOS(eos_token_id: [248044, 248046]),直接使用即可;如果你自行从上游转换,需要重新应用这个修复。
  • 结果不是合法 JSON?优先使用服务模式 + JSON Schema 约束,并把temperature设为 0。
  • 复杂表格或模糊图片识别不准?量化越低精度损耗越大,遇到困难文档可先放大/旋转图片,或换用更高精度的兄弟版本(如 oQ5、oQ6)。
  • 多页 PDF 内容太多?适当调大max_tokens(如 1500–2000),或按页拆分后逐页抽取再合并。

总结

这 10 个提示词模板覆盖了发票、证件、合同、表格、名片、简历、医疗单据、小票、银行对账单和 PDF 文档等高频场景,配合 lift-oQ3.5 的本地运行能力和 JSON Schema 约束解码,你就能搭建一套完全本地化、私密可靠的 "图片/PDF 转结构化 JSON" 工作流。先从模板 1 的发票识别开始试试吧,你会很快感受到结构化抽取带来的效率提升!

【免费下载链接】lift-oQ3.5项目地址: https://ai.gitcode.com/hf_mirrors/mlx-community/lift-oQ3.5

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询