Google · 图像生成与编辑

Nano Banana 2.1

Google 的高效图像生成与编辑模型

支持生成和编辑 1K–4K 图像,最多可结合 14 张参考图,保持人物与产品的一致性,并生成清晰可读的文字。面对复杂的视觉任务,还可以调整思考级别。

  • Google
  • 图像生成
  • 图像编辑
  • Gemini 3.6 Flash
  • 1K · 2K · 4K
  • 最多 14 张参考图
  • 发布于 2026年10月6日

最近核实:2026年10月7日,依据 Google、Google DeepMind 和 Arena 的资料。来源

暗色影棚中并排展示三幅香蕉主题作品:摄影、琥珀色玻璃与黄色折纸。

概念配图

同一主题,三种视觉表达

通过摄影、材质设计与插画,让同一个创意呈现不同面貌。

本文概念配图由 OpenAI 图像生成工具制作。

Nano Banana 2.1 参数速览

开发方
Google
模型 ID
类型
图像生成与编辑
基础模型
Gemini 3.6 Flash
发布日期
2026年10月6日
输入
文本、图像、视频、PDF
输出
图像、文本
分辨率
1K(默认) · 2K · 4K
宽高比
14 种,包含 1:4, 4:1, 1:8, 8:1
参考图
最多 14 张(10 张物体图 + 4 张人物图)
思考能力
最低 · 中等(默认) · 高
Token 上限(API)
输入 131,072 · 输出 32,768
搜索信息引用
支持
批量 API
支持
图像输出
1K 图像每张 $0.0336 起

Nano Banana 2.1 的主要改进

01

编辑能力提升

在 Google 的编辑评测中,开启思考的版本在多人物一致性上得分 1106(Nano Banana 2 为 978),蒙版编辑为 1049(前代为 965),多参考图编辑为 1066(前代为 988)。

02

1K、2K 图像价格减半

1K 图像输出降至每张 0.0336 美元,2K 为 0.0504 美元,约为 Nano Banana 2 的一半。4K 的降幅较小,从 0.151 美元降至 0.113 美元。

03

视觉推理

可调节的思考级别与 Google 搜索信息引用,适合制作信息图和依赖事实的视觉内容。Google 的信息图事实准确性得分从 Nano Banana 2 的 0.179 提升至 0.521。

Nano Banana 2.1 能做什么

一台带黑色镜头和红色按钮的黄色相机,分别置于素色影棚、阳光场景和暗色影棚中。

概念配图

切换场景,保留产品特征

用概念配图展示如何改变环境、光线与氛围,同时保留产品的辨识度。

奶油色海报上写有 Make Something Bright,搭配黑色粗体字、黄色圆形与琥珀色玻璃,旁边摆放同风格的方形印刷品。

概念配图

文字排版与画面构图

将简短标题、几何图形与写实材质纹理融入一张概念海报。

文生图

通过提示词生成 1K、2K 或 4K 图像,支持 14 种宽高比。

对话式编辑

通过多轮对话逐步编辑图像,例如在保留其他元素的同时,翻译信息图中的文字。

多参考图合成

单次请求最多可结合 14 张参考图,其中物体参考图最多 10 张,人物参考图最多 4 张。

人物与产品一致性

更换场景时,最多可保持 4 个人物与 10 个产品或物体的一致性。

文字排版与信息图

为信息图、菜单、图表和营销素材生成清晰且有风格的文字,但小字号和长文本仍是薄弱环节。

结合搜索信息生成

调用 Google 搜索,让天气图表、活动配图等内容反映最新信息。

超宽与超长画幅

支持 1:4、4:1、1:8 和 8:1 画幅;Google 在本次更新中修复了这些比例在 2K、4K 下出现的拼接伪影。

  • 图像生成支持
  • 多轮图像编辑支持
  • 思考能力支持
  • Google 搜索信息引用支持
  • 批量 API支持
  • 上下文缓存不支持
  • 结构化输出不支持
  • 函数调用不支持
  • 代码执行不支持

Nano Banana 2.1 价格

图像输出按每百万图像 Token $30.00 计费;一张 1K 图像消耗 1,120 个 Token。批量请求的费率减半。 该模型在 Gemini API 中没有免费额度。

Nano Banana 2.1 单张图像价格
分辨率图像 Token 数标准批量
1K1,120$0.0336$0.0168
2K1,680$0.0504$0.0252
4K3,780$0.113$0.0567

每 1,000 张图像的费用

Nano Banana 2.1 每 1,000 张图像的费用
分辨率标准批量
1K$33.60$16.80
2K$50.40$25.20
4K$113.40$56.70

按图像 Token 数乘以 Token 单价计算,因此 4K 显示的是每张 $0.1134 的未舍入费用;Google 公布的舍入价格为 $0.113。

具体哪些项目会收费?

图像输出

每百万图像 Token $30.00,批量请求为 $15.00。这通常是费用中的主要部分。

输入 Token

文本、图像和视频输入按每百万 Token $1.50 计费,批量请求为 $0.75。参考图也计入输入。

文本与思考输出

每百万 Token $7.50,批量请求为 $3.75。思考级别越高,通常输出的思考 Token 越多;思考过程中的中间图像不收费。

搜索信息引用

每月 5,000 次免费搜索请求,由 Gemini 3.x 系列模型共享;超出后每 1,000 次收费 14 美元。

$0.0336 仅为图像输出费用。提示词、参考图、思考 Token、多轮编辑和搜索信息引用请求会另外计费,因此实际请求的总费用通常更高。

Nano Banana 2.1 / Nano Banana 2 / Nano Banana Pro 价格对比

单张图像的标准价格
模型1K2K4K
Nano Banana 2.1$0.0336$0.0504$0.113
Nano Banana 2$0.067$0.101$0.151
Nano Banana Pro$0.134$0.134$0.24

在 1K 下,Nano Banana 2.1 每张图像的价格约为 Nano Banana Pro 的四分之一($0.0336 对比 $0.134)。4K 的价差缩小至 $0.113 对比 $0.24。这三款模型的批量价格均约为标准价格的一半。

Nano Banana 2.1 评测

以下为厂商评测结果,来源:Google DeepMind 模型卡。Elo 来自人工并排对比评测;信息图的事实准确性由自动评估器对单个输出评分。

Google 评测:文生图

文生图 评测
评测项目Nano Banana 2.1(开启思考)Nano Banana 2.1(关闭思考)Nano Banana 2(开启思考)Nano Banana Pro
整体偏好1050 ± 141015 ± 13990 ± 7935 ± 8
信息图设计1048 ± 171001 ± 17961 ± 12912 ± 12
信息图事实准确性0.5210.3280.1790.265

Google 评测:图像编辑

图像编辑 评测
评测项目Nano Banana 2.1(开启思考)Nano Banana 2.1(关闭思考)Nano Banana 2(开启思考)Nano Banana Pro
常规编辑1026 ± 12980 ± 15938 ± 11939 ± 10
单人物一致性1028 ± 141021 ± 14981 ± 10991 ± 9
多人物一致性1106 ± 141068 ± 14978 ± 101011 ± 10
蒙版/涂鸦编辑1049 ± 151042 ± 16965 ± 12927 ± 12
产品一致性1024 ± 18981 ± 18955 ± 22965 ± 14
风格化1062 ± 201036 ± 17991 ± 12990 ± 12
多参考图编辑1066 ± 221041 ± 20988 ± 13989 ± 12
来源:Google DeepMind 模型卡(厂商评测)

第三方评测

盲测偏好榜单与厂商评测衡量的维度不同,分数不能直接对照。Arena 的早期得分标记为初步结果,会随投票增加而变化。

Arena 榜单排名
榜单排名得分投票数状态
Arena 文生图榜单#51328 ± 95,312初步结果, 2026年10月6日
Arena 图像编辑榜单#61428 ± 612,985初步结果, 2026年10月6日

Nano Banana 2.1 思考级别

通过 generation_config.thinking_level 设置思考级别。以下为本站的使用建议,并非 Google 官方建议。

速度最快

minimal

适合场景

  • 简单图像生成
  • 背景替换
  • 缩略图制作
  • 批量处理

默认

medium

适合场景

  • 日常内容制作
  • 广告与营销配图
  • 多元素场景
  • 常规图像编辑

更充分的推理

high

适合场景

  • 文字排版与信息图
  • 使用多张参考图
  • 复杂或多步骤编辑
  • 基于搜索信息的图像

Nano Banana 2.1 分辨率与宽高比

分辨率参数中的 K 必须大写。下表列出的是 1:1 画幅的像素尺寸;其他宽高比沿用同一分辨率档位。

分辨率规格
分辨率1:1 像素尺寸图像 Token 数
1K(默认)1024 × 10241,120
2K2048 × 20481,680
4K4096 × 40963,780

支持 14 种宽高比

  • 1:1
  • 2:3
  • 3:2
  • 3:4
  • 4:3
  • 4:5
  • 5:4
  • 9:16
  • 16:9
  • 21:9
  • 1:4
  • 4:1
  • 1:8
  • 8:1

高亮显示的超宽/超长画幅(1:4, 4:1, 1:8, 8:1)在 2K 和 4K 下的拼接伪影已于本次更新中修复。

Nano Banana 2.1 参考图限制

单次请求最多使用 14 张参考图。

14 张参考图并不代表支持 14 个人物:人物一致性最多覆盖 4 人,物体或产品参考图最多为 10 张。

Nano Banana 2.1 提示词结构

实用的提示词写法:先说明哪些内容必须保留,再描述希望做出的变化。

  1. 保持不变的内容保持产品的形状、标志和包装不变。
  2. 场景将产品放在简约高端影棚中的抛光黑色石面上。
  3. 光线使用柔和的定向光,并带有细腻的反射。
  4. 构图采用主体居中的商业广告构图。
  5. 文字排版在画面上方三分之一区域添加标题“DESIGNED FOR TOMORROW”。
  6. 输出输出 16:9、具有电影质感的广告图。
保持产品的形状、标志和包装不变。

将产品放在简约高端影棚中的抛光黑色石面上。

使用柔和的定向光,并带有细腻的反射。

采用主体居中的商业广告构图。

在画面上方三分之一区域添加标题“DESIGNED FOR TOMORROW”。

输出 16:9、具有电影质感的广告图。

Nano Banana 2.1 API

模型 ID 以下保留 Google 原始示例,使用 Interactions API。

生成图像

python
from google import genai
from PIL import Image
import base64

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-nano-banana-2.1",
    input="Create a picture of a nano banana dish in a fancy restaurant with a Gemini theme",
)

with open("generated_image.png", "wb") as f:
    f.write(base64.b64decode(interaction.output_image.data))

编辑图像

python
from google import genai
import base64

client = genai.Client()

with open("/path/to/cat_image.png", "rb") as f:
    image_bytes = f.read()

interaction = client.interactions.create(
    model="gemini-nano-banana-2.1",
    input=[
        {
          "type": "text",
          "text": "Create a picture of a nano banana dish in a fancy restaurant with a Gemini theme"
        },
        {
            "type": "image",
            "data": base64.b64encode(image_bytes).decode('utf-8'),
            "mime_type": "image/png"
        }
    ],
)

with open("generated_image.png", "wb") as f:
    f.write(base64.b64decode(interaction.output_image.data))

宽高比与分辨率

python
from google import genai
import base64

client = genai.Client()

prompt = "Da Vinci style anatomical sketch of a dissected Monarch butterfly. Detailed drawings of the head, wings, and legs on textured parchment with notes in English."

interaction = client.interactions.create(
    model="gemini-nano-banana-2.1",
    input=prompt,
    response_format={
        "type": "image",
        "mime_type": "image/jpeg",
        "aspect_ratio": "1:1",
        "image_size": "1K"
    },
)

print(interaction.output_text)

with open("butterfly.png", "wb") as f:
    f.write(base64.b64decode(interaction.output_image.data))

设置思考级别

python
from google import genai
from PIL import Image
import base64
import io

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-nano-banana-2.1",
    input="A futuristic city built inside a giant glass bottle floating in space",
    generation_config={"thinking_level": "high"},
)

print(interaction.output_text)

image = Image.open(io.BytesIO(base64.b64decode(interaction.output_image.data)))

image.show()

使用多张参考图

python
from google import genai
from google.genai import types
from PIL import Image
import base64

prompt = "An office group photo of these people, they are making funny faces."

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-nano-banana-2.1",
    input=[
        {
            "type": "text",
            "text": prompt,
        },
        {
            "type": "image",
            "data": base64.b64encode(image_bytes).decode('utf-8'),
            "mime_type": "image/png"
        },
        {
            "type": "image",
            "data": base64.b64encode(image_bytes).decode('utf-8'),
            "mime_type": "image/png"
        },
        {
            "type": "image",
            "data": base64.b64encode(image_bytes).decode('utf-8'),
            "mime_type": "image/png"
        },
        {
            "type": "image",
            "data": base64.b64encode(image_bytes).decode('utf-8'),
            "mime_type": "image/png"
        },
        {
            "type": "image",
            "data": base64.b64encode(image_bytes).decode('utf-8'),
            "mime_type": "image/png"
        },
    ],
    response_format={
        "type": "image",
        "aspect_ratio": "5:4",
        "image_size": "2K"
    },
)

with open("office.png", "wb") as f:
    f.write(base64.b64decode(interaction.output_image.data))

Google 搜索信息引用

python
from google import genai
import base64

client = genai.Client()

prompt = "Visualize the current weather forecast for the next 5 days in San Francisco as a clean, modern weather chart. Add a visual on what I should wear each day"

interaction = client.interactions.create(
    model="gemini-nano-banana-2.1",
    input=prompt,
    tools=[{"type": "google_search"}],
    response_format={
        "type": "image",
        "mime_type": "image/jpeg",
        "aspect_ratio": "16:9"
    },
)

with open("weather.png", "wb") as f:
    f.write(base64.b64decode(interaction.output_image.data))
查看官方 API 文档

开发者注意事项

使用 Interactions API

Google 示例使用 google-genai(Python)和 @google/genai(JavaScript)SDK 中的 interactions.create;generateContent 图像指南目前已标记为旧版。

以 API 端点的 Token 限制为准

API 标注的上限为 131,072 个输入 Token 和 32,768 个输出 Token。模型卡中 Gemini 3.6 Flash 基础模型的输入上限虽为 100 万 Token,实际接入仍应遵循端点限制。

不支持缓存、结构化输出和函数调用

不支持上下文缓存、结构化输出、函数调用和代码执行,因此不能直接替换所有 Gemini 文本工作流中的模型。

分辨率中的 K 必须大写

image_size 必须填写 1K、2K 或 4K,K 需大写;小写值会被拒绝。默认值为 1K。

思考过程中的图像免费,文本仍计费

思考过程中生成的中间图像不收费,但思考输出的 Token 会按文本/思考输出费率计费。

搜索信息引用额度共享

每月 5,000 次免费搜索信息引用请求,由同一项目中的所有 Gemini 3.x 模型共享。

Nano Banana 2.1 局限

  • 小字号文字可能模糊,1K 分辨率下尤为明显。
  • 长段落和整页文字的生成仍不稳定。
  • 输入图与输出图中的人物特征不一定能完全一致。
  • 蒙版或涂鸦编辑可能只执行部分指令,也可能残留涂画痕迹。
  • 可能混淆左右等空间方位指令。
  • 信息图中的事实仍需核实:Google 自身评测的信息图事实准确性得分为 0.521。
  • 每张生成图像都带有 SynthID 水印。

已知问题依据 Google 模型卡与 API 文档整理。

Nano Banana 2.1 与 Nano Banana Pro 对比

依据 Google 的价格与评测结果做简要对比,后续将补充详细对比指南。

模型对比
Nano Banana 2.1Nano Banana 2Nano Banana Pro
1K 图像$0.0336$0.067$0.134
4K 图像$0.113$0.151$0.24
Google 整体偏好(Elo)1050 ± 14990 ± 7935 ± 8
模型 IDgemini-nano-banana-2.1gemini-3.1-flash-imagegemini-3-pro-image

与 Nano Banana 2 相比,Nano Banana 2.1 在所有分辨率下的价格都更低,并在上方 Google 的每项文生图与编辑评测中领先。

与 Nano Banana Pro 相比,Nano Banana 2.1 在所有分辨率下的价格都更低,并在上方 Google 的每项文生图与编辑评测中领先。

Nano Banana 2.1 常见问题

Nano Banana 2.1 是什么?

Nano Banana 2.1 是 Google 的高效图像生成与编辑模型,基于 Gemini 3.6 Flash,支持文本、图像、视频、pdf输入,可输出图像和文本。

Nano Banana 2.1 什么时候发布?

Google 于 2026年10月6日 发布了 Nano Banana 2.1。

Nano Banana 2.1 的模型 ID 是什么?

在 Gemini API 中使用 gemini-nano-banana-2.1。

Nano Banana 2.1 怎么收费?

图像输出按张计费:1K 为 $0.0336,2K 为 $0.0504,4K 为 $0.113。批量价格约减半,分别为 $0.0168、$0.0252 和 $0.0567。每百万输入 Token 为 $1.50,每百万文本/思考输出 Token 为 $7.50。

Nano Banana 2.1 比 Nano Banana Pro 便宜吗?

是的。1K 图像每张为 $0.0336,Nano Banana Pro 为 $0.134;4K 图像每张为 $0.113,对方为 $0.24。

Nano Banana 2.1 和 Nano Banana 2 的价格有何区别?

1K 和 2K 图像的价格约为 Nano Banana 2(分别为 $0.067 和 $0.101)的一半;4K 则从 $0.151 降至 $0.113。

Nano Banana 2.1 支持 4K 吗?

支持。可输出 1K / 2K / 4K 图像,默认为 1K。参数中的 K 必须大写。

Nano Banana 2.1 最多支持多少张参考图?

最多 14 张,其中物体参考图最多 10 张,人物参考图最多 4 张。

Nano Banana 2.1 有哪些思考级别?

可选 minimal / medium / high,默认为 medium,通过 generation_config.thinking_level 设置。

Nano Banana 2.1 支持图像编辑吗?

支持,包括多轮对话式编辑、蒙版编辑和多参考图编辑。

Nano Banana 2.1 API 有免费额度吗?

没有,Google 价格页未提供该模型的免费额度。

Nano Banana 2.1 不支持哪些功能?

Gemini API 列明不支持以下功能:上下文缓存、结构化输出、函数调用、代码执行。

Nano Banana 2.1 生成的图像有水印吗?

有,每张生成图像都带有 SynthID 水印。

资料来源与核实时间

最近核实于 2026年10月7日。价格、使用限制和榜单排名可能变化,请在确定预算前查看原始来源。

浏览全部模型