
lift-bf16 vs 其他量化版本18GB全精度模型的性能与效率深度对比【免费下载链接】lift-bf16项目地址: https://ai.gitcode.com/hf_mirrors/mlx-community/lift-bf16lift-bf16是基于qwen3_5架构的9B视觉语言模型专为结构化数据提取如PDF、图像到JSON格式转换设计是datalab-to/lift模型的MLX格式bf16全精度转换版本无量化处理可通过mlx-vlm在Apple Silicon上运行。各版本核心参数对比不同量化版本的lift模型在存储大小、内存占用和生成速度等方面存在显著差异以下是详细对比RepoMethod≈bpwSizePeak RAM*Gen*lift-bf16本文介绍版本full bf161618 GB19.9 GB31 t/slift-oQ8oQ≈8.69.7 GB12.3 GB58 t/slift-oQ6oQ≈67.7 GB9.4 GB73 t/slift-oQ5oQ≈56.7 GB8.4 GB83 t/slift-oQ4oQ≈4.65.6 GB7.2 GB100 t/slift-oQ3.5oQ≈4.04.9 GB6.5 GB109 t/slift-oQ3oQ≈3.54.6 GB6.2 GB119 t/s注峰值RAM和生成速度是在Macbook Pro M5 Max 128GB 40 GPU上对单图像发票提取进行测量的结果仅为指示性数据非基准测试。性能与效率分析存储与内存占用lift-bf16作为全精度模型存储大小达到18GB相比最低量化的lift-oQ3版本4.6GB存储需求约为其3.9倍。在内存占用方面lift-bf16的峰值RAM为19.9GB而lift-oQ3仅需6.2GB内存占用差距明显。对于存储资源有限或设备内存较小的用户低量化版本更具优势。生成速度生成速度上lift-bf16为31 t/s随着量化程度的提高生成速度逐渐加快lift-oQ3达到119 t/s是lift-bf16的约3.8倍。这意味着在处理大量数据或对实时性要求较高的场景中低量化版本能显著提升效率。模型质量上游全精度lift9B在Datalab的225文档基准测试中字段得分90.2%全文档得分20.9%。测试表明各量化版本均能正确提取简单测试发票但低比特宽度版本在更复杂或对抗性文档上的性能可能会下降目前尚未进行大规模重新基准测试。适用场景选择优先选择lift-bf16的情况对模型输出质量要求极高尤其是处理复杂、关键的结构化数据提取任务。拥有充足的存储和内存资源如高性能的Apple Silicon设备128GB内存及以上。不追求极致的生成速度更注重结果的准确性和完整性。优先选择低量化版本的情况设备存储或内存有限需要在较小资源下运行模型。对生成速度有较高要求如批量处理大量文档或实时响应场景。处理的文档结构相对简单对模型精度要求不是特别严苛。快速开始使用生成CLI方式通过以下命令可快速使用lift-bf16模型进行图像文本生成uvx --from mlx-vlm mlx_vlm.generate \ --model mlx-community/lift-bf16 \ --image invoice.png \ --prompt Extract the invoice as JSON. \ --max-tokens 800OpenAI兼容服务器 结构化输出lift模型专为 schema 约束提取而构建mlx_vlm.server可在解码时通过llguidance强制执行 JSON Schema确保输出有效且类型正确。 启动服务器uvx --from mlx-vlm mlx_vlm.server --model mlx-community/lift-bf16 --port 8080使用Python客户端调用import base64, json from openai import OpenAI client OpenAI(base_urlhttp://127.0.0.1:8080/v1, api_keylocal) img base64.b64encode(open(invoice.png, rb).read()).decode() schema { type: object, properties: { invoice_number: {type: string}, total: {type: number}, line_items: {type: array, items: {type: object, properties: { description: {type: string}, amount: {type: number}}}}, }, required: [invoice_number, total], } resp client.chat.completions.create( modelmlx-community/lift-bf16, messages[{role: user, content: [ {type: text, text: Extract this invoice.}, {type: image_url, image_url: {url: fdata:image/png;base64,{img}}}, ]}], response_format{type: json_schema, json_schema: {name: invoice, schema: schema}}, temperature0.0, max_tokens800, ) print(json.loads(resp.choices[0].message.content))注意事项eos修复已应用generation_config.json中设置了eos_token_id: [248044, 248046]。上游模型仅设置了248044但聊天回合以|im_end|248046结束若不进行此修复读取generation_config的MLX服务器将无法停止并会大量输出|im_end|。如果从源重新转换需重新应用此修复。许可证代码采用Apache-2.0许可证权重采用修改后的OpenRAIL-M许可证免费用于研究、个人使用和年收入低于500万美元的初创公司不得用于与Datalab API竞争的用途。详情请参见基础模型。总结lift-bf16作为全精度模型在输出质量上具有潜在优势适合对精度要求高的场景但存储和内存占用较大生成速度较慢。而各低量化版本在存储、内存和速度方面表现更优适合资源有限或对效率要求高的场景。用户可根据实际需求和设备条件选择最适合的模型版本进行结构化数据提取工作。【免费下载链接】lift-bf16项目地址: https://ai.gitcode.com/hf_mirrors/mlx-community/lift-bf16创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考