MiniCPM-V 4.0 全解析:4.1B 参数端侧多模态大模型的能力、评测与部署指南
【免费下载链接】MiniCPM-VA Pocket-Sized MLLM for Ultra-Efficient Image and Video Understanding on Your Phone项目地址: https://gitcode.com/GitHub_Trending/mi/MiniCPM-V
MiniCPM-V 4.0 是 MiniCPM-V 系列主打端侧高效部署的多模态大模型(MLLM),以仅 4.1B 总参数量实现了超越 MiniCPM-V 2.6(8.1B)与 GPT-4.1-mini-20250414 的视觉理解表现,并可在 iPhone 16 Pro Max 上流畅运行。本文以 docs/minicpm_v4_zh.md 为骨架,结合仓库源码与说明文档,完整展开该模型的架构、三组核心评测数据、端侧实测体验以及 llama.cpp / Ollama / vLLM / SGLang / LLaMA-Factory 等多框架使用方式,帮助你评估其能力边界并快速完成部署选型。
MiniCPM-V 4.0 模型总览:架构与核心特性
MiniCPM-V 4.0 是 MiniCPM-V 系列中一款高效模型,构建于SigLIP2-400M 视觉编码器与MiniCPM4-3B 语言骨干之上,参数总量约4.1B(该模型文档归档于 2026-05-09,仓库 README.md 的新闻记录显示其于 2025.08.02 开源)。它延续了 MiniCPM-V 2.6 在单图、多图和视频理解三方面的能力,同时大幅提升了推理效率。官方文档归纳了三大核心特性:
- 🔥 领先的视觉能力:MiniCPM-V 4.0 在 OpenCompass(8 个主流 benchmark 的综合评测)上取得平均69.0分,超越了 MiniCPM-V 2.6(8.1B,65.2 分)、Qwen2.5-VL-3B-Instruct(3.8B,64.5 分)以及广泛使用的闭源模型 GPT-4.1-mini-20250414(68.9 分);在多图理解与视频理解任务上同样表现出色。
- 🚀 卓越的效率:专为端侧设备优化,可在 iPhone 16 Pro Max 上流畅运行,首 token 延迟低至 2 秒、解码速度达 17.9 tokens/s,且无发热问题;在并发请求场景下也表现出领先的吞吐率。
- 💫 易于使用:支持 llama.cpp、Ollama、vLLM、SGLang、LLaMA-Factory 及本地 Web Demo 等多种推理方式,并开源了可在 iPhone 和 iPad 上运行的 iOS App。
从仓库结构看,该系列统一采用「视觉编码器 + resampler + LLM」的组合范式,如 chat.py 中MiniCPMV2_6类所示,家族模型的推理入口均遵循model.chat(image=..., msgs=..., tokenizer=...)的 API 惯例,MiniCPM-V 4.0 作为同系列模型延续了这一调用风格。
单图理解:OpenCompass 综合评测结果
下表为官方文档给出的 OpenCompass 单图理解评测结果(覆盖 OpenCompass 均值、OCRBench、MathVista、HallusionBench、MMMU、MMVet、MMBench V1.1、MMStar、AI2D 共 9 项指标),对比模型包括 GPT-4v、Gemini-1.5-Pro、GPT-4.1-mini、Claude 3.5 Sonnet 四款闭源模型,以及 Qwen2.5-VL、InternVL2.5、MiniCPM-V 2.6、MiniCPM-o 2.6 等开源模型:
| model | Size | Opencompass | OCRBench | MathVista | HallusionBench | MMMU | MMVet | MMBench V1.1 | MMStar | AI2D |
|---|---|---|---|---|---|---|---|---|---|---|
| Proprietary | ||||||||||
| GPT-4v-20240409 | - | 63.5 | 656 | 55.2 | 43.9 | 61.7 | 67.5 | 79.8 | 56.0 | 78.6 |
| Gemini-1.5-Pro | - | 64.5 | 754 | 58.3 | 45.6 | 60.6 | 64.0 | 73.9 | 59.1 | 79.1 |
| GPT-4.1-mini-20250414 | - | 68.9 | 840 | 70.9 | 49.3 | 55.0 | 74.3 | 80.9 | 60.9 | 76.0 |
| Claude 3.5 Sonnet-20241022 | - | 70.6 | 798 | 65.3 | 55.5 | 66.4 | 70.1 | 81.7 | 65.1 | 81.2 |
| Open-source | ||||||||||
| Qwen2.5-VL-3B-Instruct | 3.8B | 64.5 | 828 | 61.2 | 46.6 | 51.2 | 60.0 | 76.8 | 56.3 | 81.4 |
| InternVL2.5-4B | 3.7B | 65.1 | 820 | 60.8 | 46.6 | 51.8 | 61.5 | 78.2 | 58.7 | 81.4 |
| Qwen2.5-VL-7B-Instruct | 8.3B | 70.9 | 888 | 68.1 | 51.9 | 58.0 | 69.7 | 82.2 | 64.1 | 84.3 |
| InternVL2.5-8B | 8.1B | 68.1 | 821 | 64.5 | 49.0 | 56.2 | 62.8 | 82.5 | 63.2 | 84.6 |
| MiniCPM-V-2.6 | 8.1B | 65.2 | 852 | 60.8 | 48.1 | 49.8 | 60.0 | 78.0 | 57.5 | 82.1 |
| MiniCPM-o-2.6 | 8.7B | 70.2 | 889 | 73.3 | 51.1 | 50.9 | 67.2 | 80.6 | 63.3 | 86.1 |
| MiniCPM-V-4.0 | 4.1B | 69.0 | 894 | 66.9 | 50.8 | 51.2 | 68.0 | 79.7 | 62.8 | 82.9 |
值得关注的几个结论:
- 参数量减半、性能反超:MiniCPM-V 4.0 仅用 4.1B 参数,OpenCompass 平均分(69.0)即超过自家 8.1B 的 MiniCPM-V 2.6(65.2),也超过同量级竞品 Qwen2.5-VL-3B(64.5)与 InternVL2.5-4B(65.1)。
- 逼近并局部超越闭源模型:69.0 分高于 GPT-4.1-mini-20250414 的 68.9,接近 Claude 3.5 Sonnet 的 70.6。
- OCR 能力突出:OCRBench 得分894,为同表所有模型中最高,甚至超过 8.7B 的 MiniCPM-o-2.6(889),体现了强文本识别能力。
专项能力:图表、文档、数学与幻觉抑制
在更细分的单图任务上,官方文档给出了图表理解(ChartQA)、整体感知(MME)、真实世界问答(RealWorldQA)、场景文本(TextVQA)、文档问答(DocVQA)、数学推理(MathVision、DynaMath、WeMath)以及幻觉抑制(Obj Hal 的 CHAIRs/CHAIRi、MM Hal 的 score/hall rate)等指标:
| model | Size | ChartQA | MME | RealWorldQA | TextVQA | DocVQA | MathVision | DynaMath | WeMath | CHAIRs↓ | CHAIRi↓ | score avg@3↑ | hall rate avg@3↓ |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Proprietary | |||||||||||||
| GPT-4v-20240409 | - | 78.5 | 1927 | 61.4 | 78.0 | 88.4 | - | - | - | - | - | - | - |
| Gemini-1.5-Pro | - | 87.2 | - | 67.5 | 78.8 | 93.1 | 41.0 | 31.5 | 50.5 | - | - | - | - |
| GPT-4.1-mini-20250414 | - | - | - | - | - | - | 45.3 | 47.7 | - | - | - | - | - |
| Claude 3.5 Sonnet-20241022 | - | 90.8 | - | 60.1 | 74.1 | 95.2 | 35.6 | 35.7 | 44.0 | - | - | - | - |
| Open-source | |||||||||||||
| Qwen2.5-VL-3B-Instruct | 3.8B | 84.0 | 2157 | 65.4 | 79.3 | 93.9 | 21.9 | 13.2 | 22.9 | 18.3 | 10.8 | 3.9 | 33.3 |
| InternVL2.5-4B | 3.7B | 84.0 | 2338 | 64.3 | 76.8 | 91.6 | 18.4 | 15.2 | 21.2 | 13.7 | 8.7 | 3.2 | 46.5 |
| Qwen2.5-VL-7B-Instruct | 8.3B | 87.3 | 2347 | 68.5 | 84.9 | 95.7 | 25.4 | 21.8 | 36.2 | 13.3 | 7.9 | 4.1 | 31.6 |
| InternVL2.5-8B | 8.1B | 84.8 | 2344 | 70.1 | 79.1 | 93.0 | 17.0 | 9.4 | 23.5 | 18.3 | 11.6 | 3.6 | 37.2 |
| MiniCPM-V-2.6 | 8.1B | 79.4 | 2348 | 65.0 | 80.1 | 90.8 | 17.5 | 9.0 | 20.4 | 7.3 | 4.7 | 4.0 | 29.9 |
| MiniCPM-o-2.6 | 8.7B | 86.9 | 2372 | 68.1 | 82.0 | 93.5 | 21.7 | 10.4 | 25.2 | 6.3 | 3.4 | 4.1 | 31.3 |
| MiniCPM-V-4.0 | 4.1B | 84.4 | 2298 | 68.5 | 80.8 | 92.9 | 20.7 | 14.2 | 32.7 | 6.3 | 3.5 | 4.1 | 29.2 |
解读要点:
- 文档与场景文本:DocVQA 92.9、TextVQA 80.8,明显高于前代 MiniCPM-V 2.6(90.8 / 80.1),在 4B 级别开源模型中处于第一梯队。
- 数学推理:WeMath 32.7、DynaMath 14.2、MathVision 20.7,均显著优于 MiniCPM-V 2.6(20.4 / 9.0 / 17.5),说明 4.0 在数学类任务上亦有代际提升。
- 幻觉抑制出色:MM Hal 的 hallucination rate(29.2)是同表开源模型中最低的,低于 MiniCPM-V 2.6(29.9)与 Qwen2.5-VL-7B(31.6);CHAIRs 6.3 与 8.7B 的 MiniCPM-o-2.6 持平,表明模型在降低对象级幻觉方面表现稳健。
多图与视频理解:Mantis、Blink 与 Video-MME
MiniCPM-V 4.0 继承了 MiniCPM-V 2.6 的多图与视频理解能力,官方文档给出的评测结果如下(Video-MME 分含字幕 wo subs / 不含字幕 w subs 两种设置):
| model | Size | Mantis | Blink | Video-MME wo subs | Video-MME w subs |
|---|---|---|---|---|---|
| Proprietary | |||||
| GPT-4v-20240409 | - | 62.7 | 54.6 | 59.9 | 63.3 |
| Gemini-1.5-Pro | - | - | 59.1 | 75.0 | 81.3 |
| GPT-4o-20240513 | - | - | 68.0 | 71.9 | 77.2 |
| Open-source | |||||
| Qwen2.5-VL-3B-Instruct | 3.8B | - | 47.6 | 61.5 | 67.6 |
| InternVL2.5-4B | 3.7B | 62.7 | 50.8 | 62.3 | 63.6 |
| Qwen2.5-VL-7B-Instruct | 8.3B | - | 56.4 | 65.1 | 71.6 |
| InternVL2.5-8B | 8.1B | 67.7 | 54.8 | 64.2 | 66.9 |
| MiniCPM-V-2.6 | 8.1B | 69.1 | 53.0 | 60.9 | 63.6 |
| MiniCPM-o-2.6 | 8.7B | 71.9 | 56.7 | 63.9 | 69.6 |
| MiniCPM-V-4.0 | 4.1B | 71.4 | 54.0 | 61.2 | 65.8 |
可见 MiniCPM-V 4.0 在Mantis 多图评测上取得 71.4,超过自家 8.7B 的 MiniCPM-o-2.6(71.9 之下、接近 8.1B 的 2.6 版本 69.1)与所有同表小参数模型;Video-MME(w subs)65.8 优于 8.1B 的 MiniCPM-V 2.6(63.6),在多图与视频理解上与更大参数模型保持同一水平——这也是「小参数、强多模态」定位的直接证据。
端侧部署实测:iPhone 16 Pro Max 上的运行体验
MiniCPM-V 4.0 的核心卖点之一是端侧(on-device)部署。官方文档记录,开发团队在iPhone 16 Pro Max上部署了 MiniCPM-V 4.0 的 iOS demo,实测表现如下:
- 首 token 延迟低至 2 秒(first token delay < 2s);
- 解码速度超过 17 tokens/s;
- 无发热问题,适合长时间交互场景;
- 在并发请求场景下吞吐率指标领先。
配套开源的iOS App 同时支持 iPhone 与 iPad,官方演示录屏均为未经加速等任何编辑的真实屏幕录制。下图为官方公布的典型能力展示样例(含数学推理等多任务案例)与 iPhone 16 Pro Max 上的中英文实时演示片段:
仓库中还保留了iphone_en_information_extraction.gif、iphone_cn_funny_points.gif等信息抽取、趣味多轮交互场景的英文与中文录屏(见 assets/minicpmv4),可用于直观了解其在真实手机上的响应速度与交互质量。如果你关心端侧部署的完整流程(模型转换、量化、Xcode 工程集成等),官方推荐参考结构清晰的 MiniCPM-V CookBook 中的 iOS demo 章节,其中涵盖详细部署指南与真实示例。
灵活易用:多框架推理与生态支持
MiniCPM-V 4.0 在推理方式上提供了丰富的选择,官方明确支持以下途径:
- llama.cpp:面向 CPU / 端侧的高效推理,配合 GGUF 量化模型使用;
- Ollama:一键本地拉起模型服务,适合个人开发者快速体验;
- vLLM:高吞吐、显存友好的服务化部署;
- SGLang:高性能推理框架,适合生产级并发服务;
- LLaMA-Factory:在推理之外同时提供微调生态接入;
- 本地 Web Demo:仓库内即可启动交互式演示;
- iOS App:面向 iPhone / iPad 的端侧原生体验。
仓库 README.md 的「Supported Inference and Training Frameworks」一节给出了 MiniCPM-V 4.0 在各框架下的部署文档入口(vLLM / SGLang / llama.cpp / Ollama 四列均指向 Cookbook 中的minicpm-v4专项指南),与本文档声明完全一致。对于需要快速上手部署的场景,可在 Cookbook 中按「vLLM → 服务化、llama.cpp/Ollama → 本地与端侧、SGLang → 高并发」的路径选择最合适的框架。
仓库内的微调支撑与工程佐证
围绕 MiniCPM-V 4.0,当前仓库还提供了可落地的训练与推理工程支撑:
- 官方微调脚本:finetune/readme.md 明确列出官方微调脚本支持MiniCPM-V 4.0(与 MiniCPM-o 2.6、MiniCPM-V 2.6 等并列),默认基于 transformers Trainer 与 DeepSpeed。脚本中通过
LLM_TYPE指定语言骨干类型——按注释约定,MiniCPM-V 4.0 对应llama,其他模型如 MiniCPM-V-2.6 对应qwen。训练数据采用「id + image(单图路径或<image_XX>占位符字典)+ conversations」的 JSON 结构,既支持单图 SFT,也支持多图占位符插入,并建议多图 SFT 时设置MODEL_MAX_LENGTH=4096。 - 统一推理入口:chat.py 提供了家族统一的
MiniCpmvChat入口类,通过model_path自动路由到 OmniLMM-12B、MiniCPM-Llama3-V 2.5、MiniCPM-V 2.6 等对应实现(MiniCPMV2_6还支持multi_gpus=True的多卡分发推理,其attn_implementation='sdpa'、torch_dtype=torch.bfloat16的加载约定可作为同系列模型加载的参考)。 - 量化与多卡:仓库 docs/inference_on_multiple_gpus.md、docs/minicpm_v2dot6_zh.md 等文档提供了系列模型的多卡推理与量化部署经验,可作为 MiniCPM-V 4.0 在低显存环境下的部署参考。
总结与适用场景
综合官方文档与仓库信息,MiniCPM-V 4.0 的定位可以概括为:以 4.1B 参数达到 8B 级视觉理解水平、并以端侧可部署性为核心设计目标的多模态模型。其能力画像如下:
- 适合的场景:手机 / 平板等端侧实时图像与视频理解、低延迟交互应用、隐私敏感的边缘计算场景、需要高吞吐的并发服务;
- 能力优势:单图理解(OpenCompass 69.0、OCRBench 894)、图表文档理解(ChartQA 84.4、DocVQA 92.9)、数学推理(WeMath 32.7)与幻觉抑制(hall rate 29.2)均相对前代 2.6 有代际提升,多图(Mantis 71.4)与视频(Video-MME w subs 65.8)能力保持系列水准;
- 工程生态:llama.cpp / Ollama / vLLM / SGLang / LLaMA-Factory / 本地 Web Demo / iOS App 多路径覆盖,配合 Cookbook 可快速完成从本地体验到生产部署的迁移。
如果你正在为端侧多模态应用或轻量级视觉服务选型,MiniCPM-V 4.0 是同时兼顾「性能上限」与「部署下限」的有力候选;进一步了解其英文版介绍可阅读 docs/minicpm_v4_en.md。
【免费下载链接】MiniCPM-VA Pocket-Sized MLLM for Ultra-Efficient Image and Video Understanding on Your Phone项目地址: https://gitcode.com/GitHub_Trending/mi/MiniCPM-V
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考