FastVLM 0.5B
浏览器与轻量实验
适合先用自己的图片验证描述、文字读取和图表问答。
体验 0.5BApple 视觉语言模型
用图片提问,在浏览器中体验,再选择 Python 或 WebGPU 构建自己的应用。
FastVLM 将 FastViTHD 视觉编码器与语言模型结合。先根据设备和任务选择模型大小,再确认权重格式、运行环境和内存需求。
浏览器演示使用社区转换的 FastVLM-0.5B ONNX 模型;首次加载约 1.1 GB。

模型大小、训练阶段和运行环境是三个不同的选择。此站的浏览器演示运行 0.5B;更大的模型需要合适的本地环境。
浏览器与轻量实验
适合先用自己的图片验证描述、文字读取和图表问答。
体验 0.5B本地开发
了解 Stage3 权重,并区分 PyTorch、Transformers 与 Apple 原生应用所需的文件。
阅读 Stage3 指南更高的公布基准分数
比较官方测试结果,并在目标硬件上测量实际延迟与内存占用。
比较模型公布的分数只适用于各自的数据集和测试条件,不能直接预测浏览器转换版在你设备上的效果。请在同一测试行内比较模型,并用自己的图片复核。
查看分数与测试条件