Apple 视觉语言模型

FastVLM

用图片提问,在浏览器中体验,再选择 Python 或 WebGPU 构建自己的应用。

FastVLM 将 FastViTHD 视觉编码器与语言模型结合。先根据设备和任务选择模型大小,再确认权重格式、运行环境和内存需求。

浏览器演示使用社区转换的 FastVLM-0.5B ONNX 模型;首次加载约 1.1 GB。

Concept illustration of a laptop examining a photo of a tangerine and cup, with an image card and blue question bubble

从适合你的模型开始

模型大小、训练阶段和运行环境是三个不同的选择。此站的浏览器演示运行 0.5B;更大的模型需要合适的本地环境。

FastVLM 0.5B

浏览器与轻量实验

适合先用自己的图片验证描述、文字读取和图表问答。

体验 0.5B

FastVLM 1.5B

本地开发

了解 Stage3 权重,并区分 PyTorch、Transformers 与 Apple 原生应用所需的文件。

阅读 Stage3 指南

FastVLM 7B

更高的公布基准分数

比较官方测试结果,并在目标硬件上测量实际延迟与内存占用。

比较模型

从首次回答到自己的应用

正确理解基准结果

公布的分数只适用于各自的数据集和测试条件,不能直接预测浏览器转换版在你设备上的效果。请在同一测试行内比较模型,并用自己的图片复核。

查看分数与测试条件

官方资料

相关模型和浏览器工具