跳转到主要内容
返回博客

模型对比

同一提示词,4 个 AI 生图模型:结果到底差多少?

使用相同人像提示词,对比 GPT Image 2、Seedream 4.5、Nano Banana Pro 和 Nano Banana 的文字、光线、材质及指令遵循表现。

CVY.AI
约 5 分钟阅读
更新于
四个 AI 模型的人像生成结果对比
文章目录

本文整理自 2026 年 6 月发布的英文模型对比文章,以下评分与评价对应当时这组人像样本。

图像生成模型越来越多:Nano Banana、Nano Banana Pro、GPT Image 2、字节的 Seedream……但真要生成一张满意的图片时,问题很实际:

  • 同一个需求,换不同模型,结果究竟差多少?
  • 每换一个模型都重新调提示词,很费劲。
  • 横向比较还要在多个平台之间切换、重复注册。

所以我做了一个小实验:固定一段提示词,交给四个模型,观察差异,再整理成选型速查表。 实验在 CVY.AI 完成,用同一个提示词切换模型即可。

第一步:用模板固定提示词

对比的前提是提示词稳定、可复用。否则看到的差异,可能只是每次输入不同造成的。我把提示词拆成几个固定部分:

[主体] + [风格/媒介] + [构图/镜头] + [光线/氛围] + [细节] + [画幅]

下面是本次实验使用的人像提示词。保留英文原文,便于复用同一份输入:

Subject: a young woman in a casual wool coat, half body, glancing toward camera
Style: cinematic realism, warm film tone
Composition: 85mm telephoto, shallow depth of field
Light: golden-hour, a glowing storefront neon sign reading "CAFE" in the blurred background, rim light on hair
Details: natural skin, windswept hair strands, no over-smoothing
Aspect ratio: 3:4 vertical

它描述的是:一位穿羊毛外套的年轻女性,半身回望镜头;电影感写实、温暖胶片色调;85mm 长焦与浅景深;黄金时刻的光线、背景中的“CAFE”霓虹招牌,以及发丝边缘光;保留自然皮肤和被风吹动的头发,3:4 竖构图。

特意加入 “CAFE”招牌,是为了比较模型的文字渲染。整理成连续的提示词后,四个模型使用完全相同的输入。

可以保留几套常用模板,例如人像、产品、场景、社交媒体封面,之后只替换主体。CVY.AI 的提示词模板也可以作为改写的起点。

第二步:同一提示词,比较四个模型

同一人像提示词在 GPT Image 2、Seedream 4.5、Nano Banana Pro 和 Nano Banana 中的生成结果

GPT Image 2:这组测试的综合表现最好

  • 提示词遵循: 被风吹动的头发自然且有动感,人物回望的姿态也增加了画面的叙事感。
  • 文字渲染: “CAFE”拼写正确,霓虹光晕与背景散景融合得好。
  • 光线与氛围: 黄金时刻的逆光、发丝边缘光和温暖胶片色调都得到了较完整的呈现。
  • 细节与材质: 皮肤保留了自然纹理;羊毛外套的质感稍软,但整体表现扎实。
  • 评价: 在本次样本中,氛围与指令准确性比较均衡,最贴近“电影感写实”的要求。

Seedream 4.5:视觉冲击力最强

  • 提示词遵循: 构图符合要求,但被风吹起的头发略显刻意,有一些成束感。
  • 文字渲染: “CAFE”清晰,霓虹光线很亮。
  • 光线与氛围: 对黄金时刻与轮廓光的表现更强烈,视觉冲击明显,但弱化了提示词要求的柔和胶片感。
  • 细节与材质: 羊毛外套的纹理不错,皮肤虽然有雀斑,仍带一点平滑感。
  • 评价: 这张样本精致、醒目,适合作为偏商业视觉方向的参考。

Nano Banana Pro:微观纹理突出,光线遵循不足

  • 细节与材质: 羊毛外套的颗粒、自然面部细节和皮肤纹理,是这张样本最明显的优势。
  • 文字渲染: “CAFE”清楚,但霓虹灯管的结构稍硬,与环境光融合得不够自然。
  • 光线与氛围: 没有充分呈现黄金时刻和温暖胶片色调,光线偏平,接近阴天下午,发丝边缘光也不明显。
  • 提示词遵循: 头发凌乱,但缺少“被风吹动”的动态感。
  • 评价: 如果重点是近距离观察材质,这张样本很有优势;本次对光线和氛围的指令则完成得较弱。

Nano Banana:基础表现

  • 提示词遵循: 头发整齐,基本没有表现“被风吹动”的要求。
  • 文字渲染: 在“E”附近出现额外的发光重音符号,文字变成了“CAFÈ”。
  • 光线与氛围: 夕阳感较弱,缺少电影感,背景虚化也略显生硬。
  • 细节与材质: 外套更像平面的毡布,皮肤细节在这组样本中最少。
  • 评价: 这次遗漏了多项指令,整体表现落后于另外三张。

第三步:选型速查表

星级表示本次样本中的相对表现:

模型提示词遵循文字渲染光线与氛围细节与材质适合尝试的方向
Nano Banana⭐⭐⭐⭐⭐⭐⭐⭐⭐快速平面草稿
Nano Banana Pro⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐写实材质与纹理
GPT Image 2⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐电影感与叙事画面
Seedream 4.5⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐视觉冲击较强的商业画面

没有一个模型在每个维度都领先。比较的价值,是找到更适合任务的模型:有的擅长氛围,有的擅长纹理,有的更容易得到醒目的商业效果。

一套可复用的生成流程

  1. 从模板开始: 选接近需求的模板,替换主体。
  2. 按任务选模型: 根据想要的效果选择,再用相同提示词比较。
  3. 需要方向时加入参考图: 用已有图片补充文字难以表达的构图或风格。
  4. 小步迭代: 保存有效的提示词、模型选择和满意样图,让每次生成都有参考。

我在 CVY.AI 中完成模板选择、多模型比较和文生图/图生图迭代。这套比较方法也适用于其他支持多模型的工具。

用同一套提示词横向生成,能直观看到差异。把提示词结构化,既便于公平比较,也便于后续复用;最终仍应按实际任务和生成结果选择模型。

原文出处

本文翻译整理自作者的英文文章:DEV · Hashnode · Medium。

  • AI 生图模型对比
  • GPT Image 2
  • Nano Banana
  • Seedream

把下一个想法变成图片。

打开生成器,输入自己的提示词,或从一个示例开始尝试。

打开图片生成器