Gemini深度用户的Banana图像多方面测试
隐居寒天
2025年11月29日 10:34
收录于文集
共6篇

作为Gemini重度用户,在Gemini 3.0发布后自然对其能力提升有显著的知觉。Gemini作为理工与逻辑领域之前无可争议的最强模型,其绘图能力在更新前却非常糟糕;尽管其多模态能力很好。当下,Nano Banana Pro的绘图能力有了十足长进,可以从多维度以人类视角进行一些测试和批评。从结果上看,基本可以令人满意并具备使用价值,尽管所有图片都有显而易见的问题(几乎每张图片我都抽了十几次卡选择了效果最好的)。

总的来说,现在的Gemini 3.0在图像方面,实拍图能力远超了绘画;示意图表由于无法分区修改导致实用性稍差;绘画方面钢笔画的表现最好。绘画上厚涂有明显的问题,粉笔画似乎完全没有学习过,更为细分的绘画风格词汇没有学习过。色彩把握在下面的测试中表现比较好。镜子等可以通过比较现象级的物理性质,理论上只学图像能较易学会的部分,在实拍图中表现勉强可以让人接受;在绘画中要差得多,完全无法接受的程度。依赖于模型自身的物理推理能力的部分完成的都相当不好,即便Gemini 3.0 Think实质上已经具备了在文字层面推理并矫正错误部分的能力。

注:上传的照片与绘画并未存储在谷歌服务器中,不会用于人工智能模型的后续训练。实际测试的内容很多,尤其是对同一个修改在实拍与不同风格绘画的表现差异,文中选了我觉得最优代表性的。

目录

  1. 示意图

  2. 笔触与线条归纳

  3. 光影

  4. 透视变化

  5. 色彩理解

  6. 复杂任务

  7. 镜子

  8. 透镜与光学效果

1.示意图

这个是看到各类逆天ai涩图后有感而发做的测试,用以画那种在ppt上出现比较合适的示意图。

输入:

风暴鸌

飞羽结构

我要做一个暴风鸌的讲解图。先将原图主体放在正中央,然后进行扩展,分解构造出她的各种细节(用局部放大图的方式呈现,环绕在周围用箭头链接表示对应关系),并标注出你的结构解说(细节特征,习性指南,设计思路穿插生命周期):

1:各种关键生物结构的单独特写(多图)

2:翅膀展示(单图),展示右侧翅膀的上示图,并按照图片(图2)规范各级飞羽与相关结构的位置

3:生命周期中不同阶段的典型形态,主要要包含生活方式、交配产卵、以及使用鼻管喷黄色液体自卫(多图)

4:成体连续的多种形态对比(三图):飞行、站立、浮水

5:一张你认为在这个生物身上最具有特色的生物结构(线稿),并说明特点

其他需求:

不要原图复制。

所有标注为手写简体中文。

所有细节尽可能使用彩绘。

输出:

gemini需要输出多次去抽卡到一些效果比较好的图片。这里我放其中两张较好的。

输出示意图1

可以看到,这个图的主要问题在于,右上角的图虽然正确的给出了翅膀的俯视图,但是其标注有多重问题。

输出示意图2

这个图的主要问题在于,右上角的图翅膀并非风暴鸌该有的样子,同时,其飞羽标注有一些错误。

综合两个图来看,gemini并没有理解两张图片之间的关系,无法将示意图的含义以特征匹配的方式与实物图融合。同时,在其他读图测试中,面对饼图流程图等论文常见图标,gemini的理解能力也并不太好。更进一步的,Gemini目前缺乏两个功能,1:无在回答正确时固定种子;2:无法让他单独修改图片的某一特定区域而其他区域保持不变。如果多次修图,图片的其他部分会随着次数的增加而产生变形,尤其是其中的文字。

图片中我未在prompt给出的知识使用良好,对注解使用了3 thinking,展现了不错的多模态能力;值得一提的是左下角图片中的幼鸟画的是很贴切的,不好这种贴切信息的来源大抵是文字的知识库,在多次画图中幼鸟都很稳定。

2.笔触与线条归纳

输入图片

b站视频截图

输出

跳过不必要展示的中间步骤

厚涂

修改图片元素并部分变为钢笔画风格

从厚涂的输出上来看,最明显的问题是对人物与北京交接部分的处理。Gemini会在分界线一侧添加与边缘平行的笔触,这显然是非常不合理,也不符合人类绘画习惯的。其次,Gemini在白色衣服褶皱中塞了很大量的藏色,而很少去描绘人皮肤阴影处的紫色,整体风格一致性上略有不足。最后,对右侧砖墙的处理实在有点难顶……

如果使用两种风格拼接,就可以避免纯厚涂中最不合理的点。这张图更改了左侧人物、变更了中间人物的姿势。钢笔画部分基本令人满意。左侧人物衬衣被书包勒住所产生的褶皱大部分得到了正确的归纳,肩带下部附近稍有别扭。中间女生的右肩背部线条有问题,衣褶通常会在正肩处消失,而图片延伸的过前显得肩膀有些错位;不过倒是画出了新衬衣袖子的折痕。女生小臂的肌肉结构没问题,但手腕处的血管明显过于靠外了。

3.光影

这一部分主要想看对原本不存在光源的部分加光源,以及对烟雾半透效果的把握

输入图片

F-22猛禽实拍照片

输出

跳过不必要的中间步骤

添加光源并换为水彩风格,画的时候他还能认出来这是架F-22

基于水彩画的实拍风格

基本令人满意,较好的展现了雾被照亮时的样子,同时展现了一定的透光性;同时考虑到了飞机驾驶舱反射的远处外海面。这里的主要问题是云雾的质感很不好,边缘过于分明;此外还有雾的透光性过强了,左翼这种浓度和厚度的雾气并不能这么轻易的看到水平尾翼轮廓。这个“实拍”图的想法是被光照的地方就是透过的,不被光照的地方就是不透的。然而现实中经常观察云雾的人知道,云雾里看到的是丁达尔现象的那种光柱和影子,如果光源、物体、眼近似在一条直线上,应当是放射状的光影才对。这种依赖物理推理的部分对当代的大模型都是非常困难的。

困难版

困难版光影

试了几十次,完全做不了

4.透视变化

输入图片

网图,且分辨率有限

输出

跳过不必要的中间步骤

广角镜头

基于广角镜头图片生成的望远镜头

广角下,所有的空间直线会投影到圆锥曲线上;他的广角能画成这样相当的出乎我的意料。原图的车牌挂的歪了一点,他也很好的还原了这个感觉。最大的不足在进气格栅上下的镀铬装饰条上,由于原图的清晰度很低,Gemini或许难以判断那两个条中间有没有弯折。尤其是上部的装饰条,过了中间的棱线后就画上了较厚的阴影,这是有一些错误的。下部装饰条也情况类似,对中间段处理不佳。望远镜头只有一个小瑕疵,座椅画的过低了。

5.色彩理解

输入图片

输入图片

输出与原图

输出图片

原图,iPhone8,摄于大兴安岭地区

Gemini成功识别到了这是个日出/日落。最大的问题是原图左上的那一些红光区域,Gemini绘制成了白色。这种白色是很不合理的,它往往来自于局部稀疏的云透过的天空光线,因此白色区域往往和黑色区域拥有一个连续且模糊的边界。这里的亮部处于一个暗部之内,两侧都是很暗的云底,不可能有这样边界分明的狭窄透光区,只能是被照亮的部分。右上角的红色被识别为“太阳照亮”或者“云层透光”都具有合理性,我认为Gemini没有问题。但是,Gemini输出的图片最上面的那一束光似乎暗示了他知道这种气象下会有画面最上部的云被照亮,只是他选择了一个完全不合适的位置;又或者是他的训练集里含有了过多的带有镜头组反光的照片,加了个镜头组反光……色调上,Gemini给出的结果不是很符合现实中人眼能看到的日出日落,更符合加某些滤镜的效果;一般来说如果看到更偏黄(而不是偏红)的太阳光时,云的颜色不会这么发青。

6.复杂任务 输入

输入图1

输入图2

输入图3

输入图4

输入图5

生成一张绘画图片,主体是Su-33(图4,图5,展示了机背与机腹),绘画风格(笔触、用色、光影)使用图1(船),构图与飞机的姿态使用图2的前景(f104),背景更使用图3(魔鬼塔)的背景(魔鬼塔,云,火烈鸟);注意水面的倒影应当是飞机腹部,注意透视关系

输出

这里输出的尝试次数比较多,我选择几张还行的

输出图1

输出图2

我选Su-33就冲为了看这种型面很多的物体。两张图的问题都很显然,镜面的透视完全不对,图1相对较好,主要是腹鳍、棘轮等垂直面透视爆炸,图2在透视完全爆炸的基础上,还有倒影与真是飞机不一致的问题。

对于真向量,垂直镜子的分量方向相反,平行镜子的分量方向不变;对于赝向量,垂直镜子的分量方向不变,平行镜子的分量方向相反。Gemini在考虑镜中透视时,时常会把“转动”这一个赝向量当做真向量处理,或者做一个平面的轴对称,这是有大问题的事情。

镜子应该算是比较现象级的物理性质,只学图像就能学会。但是,图1有一个物理上的问题,在整体环境光为暖色的时候,发动机尾焰会偏向蓝色。这种物理性质的推理对于现在的模型来说还是比较难的。理论上只要图像数据足够多这些物理现象都可以被复现,但是现实一点来说这类图片肯定是不够的,得靠模型自身的物理推理能力。

相似任务

相似任务

可以看到,Gemini是把所有输入合成一张大图给模型的,因此无法识别具体的图片,编号/顺序。在这种飞机和镜面距离较劲的时候,镜面的透视好了很多。这张图的主要问题在左翼。

7.镜子

那么自然的,根据上面这个任务的完成情况,需要单独尝试下镜子。由于表现不佳,仅展示较好的实拍风格。

输入

摄于西安

以此为人物绘制电影中的经典镜头,她面向镜子观察自己的脸,摄影机在斜侧面,同时看到真实人物的侧脸与镜中人物的斜侧;注意镜子内外的一致性与透视

输出

输出图片

镜中的人物透视并没有一眼乱来,但是后面的家具很混沌。柜子的光影表现和灯完全对不上,看起来更像是由吸顶灯带来的照明。身前的桌子问题更大,从人物的姿态和相对于桌子的位置来说,这是一个窄桌,而从镜子反射来看,这是一个长桌。因此对于人眼来说,下意识的会觉得镜中桌面高于了实际桌面。以上种种说明Gemini对镜面的学习还相当不足,非实拍风格的镜面比实拍要差很多,这里不做更多展示了。

8.透镜

输入图片

摄于哥本哈根

凸透镜/放大镜输出

跳过不必要的中间步骤

放大镜与光学畸变

更大倍率的放大镜与更重的光学效果

他对放大镜的学习还真的相对较多。考虑了还行的畸变,甚至有放大镜本身对背后光源的反光,尽管位置不对,但算他努力过了。更大倍率的放大镜上完全不对,他把色散加到了边框上,一般来说,透镜边缘的色散要出现在透镜无框且边缘有一个光滑面的情况下。

凹透镜输出

凹透镜输出

很遗憾,他似乎没见过手持带柄的高倍率凹透镜,prompt改了十几遍也不行。他的凹透镜效果还不错,但是,首先他没有考虑原本在焦外的部分会被凹透镜挪进焦内;其次他的边缘光学畸变是反的,做成凸透镜的效果了。

封面

请你生成一张使用于哔哩哔哩专栏的封面图。专栏的内容是演示Gemini 3.0与Banana Pro的画图能力,我希望图可以包含多模态与潜在扩散模型的科学示意,包含Gemini或者Google的元素。风格使用彩色铅笔与水笔手绘,图中不要包含文字或哔哩哔哩元素。……请保持多模态与潜在扩散模型的示意、Gemini、Banana Pro与Google的元素都在画面中,将图片的长宽比变为现在的2.5倍,改善排版以获得更好的排版……抽卡若干次