# AIMv2：Apple 面向多模态模型的开放视觉编码器

AIMv2 是 Apple 的开放视觉编码器系列（0.3B–2.7B），采用多模态自回归目标预训练。提供 224/336/448 像素与原生分辨率 checkpoint，支持 PyTorch、JAX 与 MLX。

Canonical URL: https://aiidelist.com/zh/blog/aimv2-zh

Language: zh

Published: 2026-09-24

Updated: 2026-09-24

APPLE AIMV2 · MULTIMODAL AUTOREGRESSIVE VISION ENCODERS

AIMv2 让视觉 Transformer 以自回归方式同时重建图像块与文本 token。Apple 报告其在大多数多模态理解基准上优于 CLIP 与 SigLIP，同时保持易于训练与扩展。checkpoint 开放，参考代码支持 PyTorch、JAX 与 MLX。

[GitHub：apple/ml-aim](https://github.com/apple/ml-aim)[Hugging Face 集合](https://huggingface.co/collections/apple/aimv2-6720fe1558d94c7805f7688c)[体验图文相似度（MobileCLIP）](/zh/blog/image-text-similarity-zh)

## AIMv2 对端侧视觉的意义

VLM 的上限取决于视觉编码器。AIMv2 提供训练配方简单、分辨率多样的编码器系列：手机级骨干可选 0.3B，文档密集任务可选 2.7B 原生分辨率版本。FastVLM 使用自己的 FastViTHD 编码器；当你自行构建多模态模型时，AIMv2 是通用的替代选择。

<a id="run"></a>

## 用 Transformers 提取图像向量

Hugging Face checkpoint 可通过 AutoModel 与 trust_remote_code 加载。对 token 特征做均值池化即可得到每张图片一个向量，用于相似检索、聚类或作为小型分类器的输入。

Python · transformers

```text
from PIL import Image
from transformers import AutoImageProcessor, AutoModel

model_id = "apple/aimv2-large-patch14-224"   # 0.3B; also 224/336/448, -native and -lit variants
processor = AutoImageProcessor.from_pretrained(model_id)
model = AutoModel.from_pretrained(model_id, trust_remote_code=True).eval()

inputs = processor(images=Image.open("photo.jpg").convert("RGB"), return_tensors="pt")
features = model(**inputs).last_hidden_state      # (1, tokens, hidden)
embedding = features.mean(dim=1)                  # one pooled vector per image
```

## Apple Silicon 上的 MLX

官方 ml-aim 包通过 MLX 后端提供同样的 checkpoint，是在没有 CUDA 的 Mac 上实验的最快方式。请以所安装版本的仓库 README 为准确认具体 API。

MLX · official package

```text
pip install "git+https://github.com/apple/ml-aim.git#subdirectory=aim-v2"

# Python
from aim.v2.utils import load_pretrained
model = load_pretrained("aimv2-large-patch14-224", backend="mlx")   # or "torch" / "jax"
```

## AIMv2、MobileCLIP2 与 SigLIP 的区别

MobileCLIP2 是为低延迟调优的对比式图文模型，适合手机上的零样本分类与检索（也用于本站的浏览器工具）。SigLIP 是许多 VLM 内部常见的对比式编码器。AIMv2 以生成式目标和更大规模面向编码器角色，是训练自有 VLM 时更适合微调的选择。

## 常见问题

**AIMv2 能在浏览器运行吗？**

核对时尚无维护中的 Transformers.js 移植版。本站的浏览器相似度工具使用 MobileCLIP-S0；AIMv2 更适合通过 Python 或 MLX 使用。

**应该从哪个规模开始？**

aimv2-large-patch14-224（0.3B）是实用的默认选择。文字密集的图片可换用 336/448 像素或原生分辨率版本；只有在算力充足时才考虑 1.2B–2.7B。

## 速览

**任务**

面向检索、分类与 VLM 骨干的图像编码器

**规模**

0.3B · 0.6B · 1.2B · 2.7B 参数

**分辨率**

224 / 336 / 448 像素、原生分辨率版本、蒸馏 ViT-L、零样本 “lit” 版本

**后端**

PyTorch · JAX · MLX（官方）· Hugging Face Transformers

**发布**

2024 年 11 月 · CVPR 2025 · arXiv 2411.14402

**许可**

Hugging Face 上的 Apple ML Research 许可（apple-amlr）

核对于 2026-09-17

## 官方来源

- [GitHub: apple/ml-aim](https://github.com/apple/ml-aim)
- [Paper (arXiv 2411.14402)](https://arxiv.org/abs/2411.14402)
- [Hugging Face collection](https://huggingface.co/collections/apple/aimv2-6720fe1558d94c7805f7688c)

## 相关页面

- [MobileCLIP2 指南](/zh/blog/mobileclip2-zh)
- [FastVLM 模型](/zh/blog/fastvlm-models-zh)
- [全部 Apple 模型](/zh/blog/apple-ai-models-zh)
- [全部 Apple 模型](/zh/blog/apple-ai-models-zh)
