# 测试你的设备

用 WebGPU 在你自己的 GPU 上测量 FastVLM-0.5B 的模型加载、首 Token 时间和每秒 Token 数，然后分享结果。完全在浏览器内运行。

Canonical URL: https://aiidelist.com/zh/blog/benchmark-fastvlm-device-zh

Language: zh

Published: 2026-09-24

Updated: 2026-09-24

可先使用上方的交互工具，再阅读下面的说明与常见问题。

浏览器 AI 基准 · FASTVLM-0.5B

看看真实的视觉语言模型在你的硬件上跑得多快。测试只下载一次 FastVLM-0.5B，用固定的图片和问题运行两次，并报告热运行结果：加载时间、首 Token 和解码速度。除了你选择分享的数字，没有任何内容离开设备。

你的设备

浏览器

—

操作系统

—

GPU 适配器

正在检测…

WebGPU

正在检测…

shader-f16

正在检测…

浏览器报告内存

—

方法：通过 Transformers.js 与 WebGPU 运行 FastVLM-0.5B ONNX（q4，fp16 嵌入）；固定的 1024 像素收据样例与提示词；一次预热、一次测量；tokens/s = 生成 Token 数 ÷（图片→回答 − 首 Token）。数值受 GPU、驱动、浏览器和其他标签页影响。

图片和回答留在本机。使用统计记录步骤名与耗时；GPU 名称与分享文本只包含在你复制的链接里。

## 这个数字意味着什么

- 低于 10 tokens/s：改用 Python、MLX 或 Core ML 运行 FastVLM，或选择 SmolVLM-256M 等更小模型。
- 10–60 tokens/s：单图问答没问题，每次回答需要几秒。
- 高于 60 tokens/s：交互使用很流畅；可以尝试原生运行 1.5B 以获得更好的准确率。较新的 Apple Silicon Mac 通常远高于 100。
[对比端侧 VLM](/zh/blog/on-device-vlm-comparison-zh) · [打开图片 Playground](/zh/fastvlm/demo#image-playground)
