模型对比
同一提示词,4 个 AI 生图模型:结果到底差多少?
使用相同人像提示词,对比 GPT Image 2、Seedream 4.5、Nano Banana Pro 和 Nano Banana 的文字、光线、材质及指令遵循表现。

文章目录
本文整理自 2026 年 6 月发布的英文模型对比文章,以下评分与评价对应当时这组人像样本。
图像生成模型越来越多:Nano Banana、Nano Banana Pro、GPT Image 2、字节的 Seedream……但真要生成一张满意的图片时,问题很实际:
- 同一个需求,换不同模型,结果究竟差多少?
- 每换一个模型都重新调提示词,很费劲。
- 横向比较还要在多个平台之间切换、重复注册。
所以我做了一个小实验:固定一段提示词,交给四个模型,观察差异,再整理成选型速查表。 实验在 CVY.AI 完成,用同一个提示词切换模型即可。
第一步:用模板固定提示词
对比的前提是提示词稳定、可复用。否则看到的差异,可能只是每次输入不同造成的。我把提示词拆成几个固定部分:
[主体] + [风格/媒介] + [构图/镜头] + [光线/氛围] + [细节] + [画幅]
下面是本次实验使用的人像提示词。保留英文原文,便于复用同一份输入:
Subject: a young woman in a casual wool coat, half body, glancing toward camera
Style: cinematic realism, warm film tone
Composition: 85mm telephoto, shallow depth of field
Light: golden-hour, a glowing storefront neon sign reading "CAFE" in the blurred background, rim light on hair
Details: natural skin, windswept hair strands, no over-smoothing
Aspect ratio: 3:4 vertical
它描述的是:一位穿羊毛外套的年轻女性,半身回望镜头;电影感写实、温暖胶片色调;85mm 长焦与浅景深;黄金时刻的光线、背景中的“CAFE”霓虹招牌,以及发丝边缘光;保留自然皮肤和被风吹动的头发,3:4 竖构图。
特意加入 “CAFE”招牌,是为了比较模型的文字渲染。整理成连续的提示词后,四个模型使用完全相同的输入。
可以保留几套常用模板,例如人像、产品、场景、社交媒体封面,之后只替换主体。CVY.AI 的提示词模板也可以作为改写的起点。
第二步:同一提示词,比较四个模型

GPT Image 2:这组测试的综合表现最好
- 提示词遵循: 被风吹动的头发自然且有动感,人物回望的姿态也增加了画面的叙事感。
- 文字渲染: “CAFE”拼写正确,霓虹光晕与背景散景融合得好。
- 光线与氛围: 黄金时刻的逆光、发丝边缘光和温暖胶片色调都得到了较完整的呈现。
- 细节与材质: 皮肤保留了自然纹理;羊毛外套的质感稍软,但整体表现扎实。
- 评价: 在本次样本中,氛围与指令准确性比较均衡,最贴近“电影感写实”的要求。
Seedream 4.5:视觉冲击力最强
- 提示词遵循: 构图符合要求,但被风吹起的头发略显刻意,有一些成束感。
- 文字渲染: “CAFE”清晰,霓虹光线很亮。
- 光线与氛围: 对黄金时刻与轮廓光的表现更强烈,视觉冲击明显,但弱化了提示词要求的柔和胶片感。
- 细节与材质: 羊毛外套的纹理不错,皮肤虽然有雀斑,仍带一点平滑感。
- 评价: 这张样本精致、醒目,适合作为偏商业视觉方向的参考。
Nano Banana Pro:微观纹理突出,光线遵循不足
- 细节与材质: 羊毛外套的颗粒、自然面部细节和皮肤纹理,是这张样本最明显的优势。
- 文字渲染: “CAFE”清楚,但霓虹灯管的结构稍硬,与环境光融合得不够自然。
- 光线与氛围: 没有充分呈现黄金时刻和温暖胶片色调,光线偏平,接近阴天下午,发丝边缘光也不明显。
- 提示词遵循: 头发凌乱,但缺少“被风吹动”的动态感。
- 评价: 如果重点是近距离观察材质,这张样本很有优势;本次对光线和氛围的指令则完成得较弱。
Nano Banana:基础表现
- 提示词遵循: 头发整齐,基本没有表现“被风吹动”的要求。
- 文字渲染: 在“E”附近出现额外的发光重音符号,文字变成了“CAFÈ”。
- 光线与氛围: 夕阳感较弱,缺少电影感,背景虚化也略显生硬。
- 细节与材质: 外套更像平面的毡布,皮肤细节在这组样本中最少。
- 评价: 这次遗漏了多项指令,整体表现落后于另外三张。
第三步:选型速查表
星级表示本次样本中的相对表现:
| 模型 | 提示词遵循 | 文字渲染 | 光线与氛围 | 细节与材质 | 适合尝试的方向 |
|---|---|---|---|---|---|
| Nano Banana | ⭐⭐ | ⭐⭐ | ⭐⭐ | ⭐⭐⭐ | 快速平面草稿 |
| Nano Banana Pro | ⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐ | ⭐⭐⭐⭐⭐ | 写实材质与纹理 |
| GPT Image 2 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | 电影感与叙事画面 |
| Seedream 4.5 | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ | 视觉冲击较强的商业画面 |
没有一个模型在每个维度都领先。比较的价值,是找到更适合任务的模型:有的擅长氛围,有的擅长纹理,有的更容易得到醒目的商业效果。
一套可复用的生成流程
- 从模板开始: 选接近需求的模板,替换主体。
- 按任务选模型: 根据想要的效果选择,再用相同提示词比较。
- 需要方向时加入参考图: 用已有图片补充文字难以表达的构图或风格。
- 小步迭代: 保存有效的提示词、模型选择和满意样图,让每次生成都有参考。
我在 CVY.AI 中完成模板选择、多模型比较和文生图/图生图迭代。这套比较方法也适用于其他支持多模型的工具。
用同一套提示词横向生成,能直观看到差异。把提示词结构化,既便于公平比较,也便于后续复用;最终仍应按实际任务和生成结果选择模型。
原文出处
- AI 生图模型对比
- GPT Image 2
- Nano Banana
- Seedream

