# 可在端侧运行的小型视觉语言模型

哪个小型视觉语言模型能在你的手机、Mac 或浏览器上运行？按规模、视频、浏览器与 MLX 支持、许可对比 FastVLM、SmolVLM2、LFM2.5-VL、Gemma 4、Gemma 3n、Qwen3-VL、Moondream、MiniCPM-V 与 PaliGemma 2。

Canonical URL: https://aiidelist.com/zh/blog/on-device-vlm-comparison-zh

Language: zh

Published: 2026-09-24

Updated: 2026-09-24

端侧 VLM 中心

视觉语言模型能回答关于图像的问题。下列模型足够小，可以运行在笔记本、手机或支持 WebGPU 的浏览器中。先用表格筛选，再打开与 FastVLM 的一对一对比。

| 模型 | 开发方 | 规模 | 图像 | 视频 | 多图 | 浏览器 | MLX | 许可 | 适合 |
| --- | --- | --- | --- | --- | --- | --- | --- | --- | --- |
| [FastVLM](https://huggingface.co/collections/apple/fastvlm-68ca64a85e3c2a03f32a7098)2025 | Apple | 0.5B · 1.5B · 7B |  |  |  | 是 |  | Apple AMLR | 高分辨率图像下的低首 Token 延迟；浏览器与 Apple Silicon |
| [SmolVLM2](https://huggingface.co/blog/smolvlm2)2025 | Hugging Face | 256M · 500M · 2.2B |  |  |  | 部分规模 |  | Apache 2.0 | 带视频理解的超小模型；宽松许可 |
| [LFM2.5-VL](https://huggingface.co/LiquidAI/LFM2.5-VL-3B)2026 | Liquid AI | 450M · 3B |  |  |  | 是 |  | LFM Open License | 端侧的目标定位、屏幕、文档与工具调用 |
| [Gemma 4](https://ai.google.dev/gemma/docs/core/model_card_4)2026 | Google | E2B · E4B · 12B · 26B-A4B · 31B |  |  |  | 取决于运行时 |  | Gemma Terms | 广泛多模态（图像、视频帧、E2B/E4B 的音频）与代理式用途 |
| [Gemma 3n](https://ai.google.dev/gemma/docs/gemma-3n)2025 | Google | E2B · E4B |  |  |  | 取决于运行时 |  | Gemma Terms | 面向手机、支持音频输入与逐层嵌入的模型 |
| [Qwen3-VL](https://huggingface.co/collections/Qwen/qwen3-vl)2025 | Alibaba | 2B · 4B · 8B (small) |  |  |  | 部分规模 |  | Apache 2.0 | 小型稠密模型中出色的 OCR、文档与视频能力 |
| [Moondream](https://huggingface.co/vikhyatk/moondream2)2024–2025 | Moondream | 2B · 3 (9B MoE, 2B active) |  |  |  | 部分规模 |  | Apache 2.0 / BSL | 小体积下的指点、检测与描述 |
| [MiniCPM-V](https://huggingface.co/openbmb/MiniCPM-V-4_5)2025 | OpenBMB | 4.5 (8B) |  |  |  | 否 |  | Apache 2.0 code · MiniCPM weights | 笔记本上的高分辨率图像与视频理解 |
| [PaliGemma 2](https://huggingface.co/collections/google/paligemma-2)2024 | Google | 3B · 10B · 28B |  |  |  | 否 |  | Gemma Terms | 用于检测、分割与描述微调的基座 |

“浏览器”表示至少一个规模有维护中的 WebGPU/Transformers.js 或 ONNX 版本。“取决于运行时”的模型通过 MediaPipe、LiteRT 等厂商运行时运行，而非 Transformers.js。

数据于 2026-09-17 按官方模型卡与公告核对。发现过期信息可通过本站 GitHub 反馈。

## 与 FastVLM 一对一对比

[FastVLM vs SmolVLM2](/zh/blog/fastvlm-vs-smolvlm2-zh) · [FastVLM vs LFM2.5-VL](/zh/blog/fastvlm-vs-lfm2-5-vl-zh) · [FastVLM vs Gemma 4 / 3n](/zh/blog/fastvlm-vs-gemma-zh) · [FastVLM vs LLaVA-OneVision](/zh/blog/fastvlm-vs-llava-onevision-zh)[在你的设备上测试 FastVLM](/zh/blog/benchmark-fastvlm-device-zh)

## 如何选择

1. 先看任务：OCR 与文档需要更高输入分辨率；视频需要在帧上训练过的模型；目标定位需要输出格式支持框。
2. 再看运行时：浏览器 Demo 需要 ONNX 权重；iPhone 应用需要 MLX 或 Core ML；Linux 服务器则没有限制。
3. 然后看许可：Apache 2.0 模型最容易发布；Apple AMLR 与 Gemma 条款有必须阅读的条件。
4. 最后在自己的设备上测量——公开基准的协议各不相同，不能跨厂商直接比较。
