
Nano Banana 2 以主流价格提供高质量的图片生成和对话式编辑功能,延迟时间短。它是 Gemini 3 Pro Image 的高效版本,针对速度和高吞吐量开发者使用情形进行了优化。
主要更新:
新增了输出分辨率选项:
新增了对 0.5K、2K 和 4K 的支持,默认值为 1K
新的图片搜索定位功能:
集成文本和图片搜索结果,以便利用实时网络数据为生成提供信息
支持,但“思考”功能处于开启或关闭状态
新增了 1:4、4:1、1:8 和 8:1 宽高比
提高了宽高比合规性
提高了图片质量和一致性
改进了 i18n 文本呈现

Gemini 3.1 Flash Image 是 Google Cloud 在 Vertex AI 上推出的一款面向图像理解与图像生成场景的生成式 AI 模型。官方将其定位为一款在图像能力与成本之间取得平衡的产品,既强调对图片内容的理解能力,也强调生成图片时的效率与性价比。目前,该模型处于公开预览版阶段,模型版本为 gemini-3.1-flash-image-preview,发布日期为 2026 年 2 月 26 日。
从能力定位来看,Gemini 3.1 Flash Image 主要针对“看图”和“生图”两类任务进行了优化。它支持的输入类型包括文本和图片,输出则可以是文本和图片。这意味着,用户既可以通过文字提示生成图片,也可以结合已有图片执行理解、分析或进一步生成相关内容。
在上下文与生成规模方面,这一模型提供了较大的处理空间。官方给出的输入 token 上限为 131,072,输出 token 上限为 32,768。同时,在使用 Gemini 3.1 Flash Image 生成图片时,每张图片最多消耗 2,520 个 token。这说明它不仅支持较长的输入上下文,也兼顾了图片生成任务中的资源控制。
在功能支持方面,Gemini 3.1 Flash Image 已支持系统指令、token 统计以及思考型能力。不过,一些开发者常见能力当前尚未纳入支持范围,例如代码执行、函数调用、Gemini Live API、隐式上下文缓存、显式上下文缓存、Vertex AI RAG 引擎以及聊天补全。这表明该模型的重点仍集中在图像相关的生成与理解任务,而不是通用型多能力代理场景。
从接入与计费方式来看,Gemini 3.1 Flash Image 支持预配吞吐量、标准即用即付以及批量预测。但它不支持弹性即用即付和优先级即用即付。对于希望在 Vertex AI 中稳定调用模型能力的企业和开发者来说,这些使用选项决定了它更适合哪些部署和成本管理方式。
在输入限制方面,官方给出了较为详细的技术规范。整体输入大小上限为 500 MB。如果是图片输入,每个提示中最多可包含 14 张图片;若通过内嵌数据或控制台直接上传,单个文件最大为 7 MB;若通过 Google Cloud Storage 提供,单个文件最大为 30 MB。该模型支持的图片 MIME 类型包括 image/png、image/jpeg、image/webp、image/heic 和 image/heif。此外,它支持多种常见宽高比,包括 1:1、3:2、2:3、3:4、4:3、4:5、5:4、9:16、16:9 和 21:9。
对于文档类输入,Gemini 3.1 Flash Image 同样提供了明确限制。每个提示中可容纳的文件数量,取决于 128,000 个 token 的上下文窗口所能支持的规模;单个文件的页数上限,则受 65,536 个 token 的上下文窗口所支持的页数约束。文件大小方面,通过 API 或 Cloud Storage 导入时,单个文件最大为 50 MB;通过 Google Cloud 控制台直接上传时,单个文件最大为 7 MB。在文档类型上,当前支持 application/pdf 和 text/plain。
在生成参数上,Gemini 3.1 Flash Image 提供了较典型的采样控制选项。温度参数范围为 0.0 到 2.0,默认值为 1.0;topP 范围为 0.0 到 1.0,默认值为 0.95;candidateCount 默认为 1;而 topK 没有给出可调默认值。这些参数设置说明,该模型既支持更稳定的输出,也可以通过调节参数提高生成结果的多样性。
在区域可用性上,官方页面显示该模型当前支持全球可用,部署位置为全局。同时,页面还给出了该模型的知识截点日期为 2025 年 1 月。这意味着模型所掌握的知识更新截至该时间点,后续世界知识变化不一定天然包含在模型内部知识中。
模型 IDgemini-3.1-flash-image-preview支持的输入和输出
输入:
文本、图片
输出:
文本和图片
token 数量上限
输入 token 数量上限:131,072
输出 token 数上限:32,768
功能
支持
系统指令
统计 token 数量
思考型
不支持
代码执行
函数调用
Gemini Live API
隐式上下文缓存
显式上下文缓存
Vertex AI RAG 引擎
聊天补全
使用选项
支持
预配的吞吐量
标准即用即付
批量预测
不支持
弹性即用即付
优先级即用即付
输入大小限制500 MB技术规范图片
每个提示的图片数量上限:14
内嵌数据或通过控制台直接上传的每个文件的文件大小上限: 7 MB
Google Cloud Storage 中每个文件的文件大小上限: 30 MB
每个提示的输出图片数量上限:受限于 32,768 个输出 token
支持的宽高比:1:1、3:2、2:3、3:4、4:3、4:5、5:4、9:16、16:9 和 21:9
支持的 MIME 类型:
image/png、image/jpeg、image/webp、image/heic、image/heif
文档
每个提示的文件数量上限: 128,000 个 token 的上下文窗口支持的数量
每个文件的页数上限: 65,536 个 token 的上下文窗口支持的页数
每个文件的文件大小上限: 50 MB(通过 API 和 Cloud Storage 导入)或 7 MB(通过 Google Cloud 控制台直接上传)
支持的 MIME 类型:
application/pdf、 text/plain
参数默认值
温度:0.0-2.0(默认值为 1.0)
topP:0.0-1.0(默认值为 0.95)
topK:-
candidateCount:1
支持的区域模型可用性
全球
全局
知识截点日期2025 年 1 月版本
gemini-3.1-flash-image-preview
发布阶段:公开预览版
发布日期:2026 年 2 月 26 日
Gemini 3.1 Flash Image 生成模型专为速度和效率而设计,可有效提供快速的互动式回答和高吞吐量。
预览版模型在成为稳定版之前可能会发生变化,并且速率限制更严格。
免费层级付费层级,每 100 万个令牌(美元)输入价格不可用$0.25(文字/图片)输出价格不可用1.50 美元(文字和思考) 60.00 美元(图片) 相当于每 500 像素的图片 0.045 美元* 每 1,000 像素的图片 0.067 美元*、 每 2,000 像素的图片 0.101 美元*, 以及每 4,000 像素的图片 0.151 美元*。使用 Google 搜索建立依据**不可用每月 5,000 次提示(免费),之后基于文本和图片的接地功能按每次搜索查询收费 0.014 美元。用于改进我们的产品是否
* 图片输出的费用为每 100 万个 token 60 美元。 输出 512 像素的图片会消耗 747 个 token,相当于每张图片 0.045 美元。以 1K (1024x1024 像素) 分辨率输出图片会消耗 1,120 个 token,相当于每张图片 $0.067。以 2K (2048x2048 像素) 分辨率输出图片会消耗 1,680 个 token,相当于每张图片 0.101 美元。以 4K (4096x4096 像素) 分辨率输出图片会消耗 2,520 个 token,相当于每张图片 0.151 美元。
**客户向 Gemini 提交的请求可能会导致系统向 Google 搜索发送一个或多个查询。您需要为每次单独的搜索查询付费。通过“基于 Google 搜索进行接地”功能检索到的上下文(文本或图片)不会作为输入令牌收费。
神马中转API价格
可以在神马中转API尝鲜测试使用

首页-工作台-操练场选择模型gemini-3.1-flash-image-preview,输入问题测试使用或者API接入(支持gemini、openai、dall-e格式)

总体而言,Gemini 3.1 Flash Image 是一款围绕图像理解与图像生成打造的 Vertex AI 模型。它具备文本与图片双输入、文本与图片双输出的能力,拥有较大的上下文窗口,支持多种图片格式、宽高比和使用方式,并在成本与性能之间寻求平衡。对于希望在 Google Cloud 生态内开展图像生成、图像分析及多模态交互的开发者来说,这款模型提供了一个面向实际应用、同时具备一定扩展性的预览选择。