GPT-6 图片生成 · 概念评审

GPT-6 图片生成:用简报在两个概念之间做选择

一个圆润的和一个多切面的象牙白陶瓷造型分别立在两个炭灰色底座上,一根琥珀色玻璃棒指向其中一个
原创抽象配图,灵感来自在两个概念之间经过深思熟虑的选择。

两个生成的概念可能看起来都不错,却都没有完成任务。一个可能把产品淹没在道具中;另一个可能没有给标题留出空间。只凭个人喜好做选择,决定就很难解释,也很容易被推翻。

在 Ciyo 中,GPT Image 2.5 Flare 负责生成图片,GPT-6 Astra 可以对图片进行评审。OpenAI 列出的 Astra 直接输出形式是文本,因此由 Astra 负责规划和评审,由图片模型生成像素。本教程比较了为虚构的 Fold 笔记本发布帖制作的两个真实概念,它们于 2026 年 9 月 18 日生成并完成评审。这里展示的是一次设计决策,而不是广告效果测试。

写出能在图片中看到的标准

生成之前,先把简报转化为四项审核人一看就能回答的检查。对于 Fold 的发布帖,我们使用的是:象牙白笔记本是明确的主角;氛围平静,贴合办公桌前工作的人;画面上方三分之一保持简洁,用于放置标题;没有额外的品牌物品。

避免使用“会带来转化”或“显得高级”之类的标准。它们无法通过单张图片来检查,而模型对它们的看法也不能作为证据。

生成两个真正不同的概念

在 Image Generator 中使用 GPT Image 2.5 Flare,比例设为 1:1。要改变的是创意,而不只是颜色:概念 A 把合上的笔记本放在工作日的办公桌上;概念 B 则采用俯拍平铺的方式展示摊开的笔记本。两张几乎相同的图片,会让评审无从判断。

两条提示词中固定的部分要保持一致,包括标题留白和不含文字的规则,这样比较才公平。

选项越好,选择反而越难。2026 年 9 月 15 日,Larus Canus(@MrLarus)分享了用 Images 2.5 制作的四个海报方向,每一个都把大面积色块与一个微缩场景搭配在一起:春日风景、陶窑、植物拓印和靛蓝染色。当每个方向看起来都不错时,一套固定的标准能把“我喜欢哪一个”变成“哪一个符合简报”。

概念 B 的提示词(中文译文;概念 A 的最后两句与之相同)
为虚构文具店 Fold 制作一条方形 Instagram 发布帖的概念 B。俯拍平铺:象牙白亚麻笔记本摊开在空白的米色内页上,一支铅笔横放在跨页上,背景是浅灰色纸张,光线柔和均匀,传达出重新开始的感觉。画面上方三分之一保持简洁,以便之后添加标题。不要文字,不要标志,不要人物。

让 Astra 打分,而不是夸奖

在画布上选中两张图片,请 GPT-6 Astra 针对每项标准给出通过或未通过的判定,为每个概念指出一个可见的问题,并给出一个推荐。告诉它不要生成或编辑任何内容。固定的格式能让回答更容易与你自己的看法进行比较。

在我们的运行中,智能体面板在回答之前显示了一个 Inspect images 步骤,因此评分针对的是画布上的真实图片。

Ciyo 工作区中,画布上选中了两张概念图片,智能体面板中是评分请求,其后是 Inspect images 步骤
完整工作区:画布上选中了两个概念,智能体面板显示请求和 Inspect images 步骤。

把结论与图片进行对照

Astra 判定概念 A 有两项标准未通过:笔记本电脑、茶和其他道具与笔记本争夺注意力,而且植物和笔记本电脑的边缘侵入了画面上方三分之一。概念 B 四项全部通过。它被指出的问题是:摊开的跨页遮住了大部分象牙白封面。

在接受结论之前,先自己看看图片。这次指出的问题都能看到:深色的笔记本电脑边缘确实会吸引视线,而平铺构图展示的确实是内页而非封面。如果评审指出了你看不到的问题,先问清楚它在哪里,再据此行动。

Astra 对两个概念的评分
标准概念 A:办公桌场景概念 B:俯拍平铺
笔记本是明确的主角未通过通过
平静的办公氛围通过通过
上方三分之一保持简洁未通过通过
没有额外的品牌物品通过通过
Ciyo 工作区显示画布上的办公桌场景和平铺两个概念,旁边是 GPT-6 Astra 给出的通过与未通过结论
2026 年 9 月 18 日的真实概念与结论。Astra 推荐概念 B,并指出它对封面的表现不足。

把指出的弱点带入下一轮

胜出的概念很少是最终成品。概念 B 的弱点很具体:封面材质很难看清。这就成为下一版的唯一指令,例如让笔记本半合,同时露出内页和封面。修正这一点时,所有已通过的标准都保持不变。

记录另一个概念落选的原因。如果负责人之后要求生活场景图,这条记录能说明是哪些道具导致了失败。

把决策与投放效果分开

这次评审决定的是哪个概念符合简报。它无法说明哪条帖子会获得更多点击。如果你需要效果方面的证据,就把不同版本发布给真实受众并衡量结果;不要把模型的偏好当作测试。

每一轮都使用同样的四项标准。稳定的检查清单能让各轮结果可以相互比较,也能防止简报随着最新一张图片的内容而不断偏移。

关于概念评审的问题

图片是 GPT-6 Astra 生成的吗?

在这个工作流中,图片由 GPT Image 2.5 Flare 生成。Astra 负责规划和评审;OpenAI 列出的 Astra 直接输出模态是文本。

我能信任 Astra 给出的通过或未通过评分吗?

把它当作第二位审核人。请自己对照图片检查每一项评分,尤其是在事关重大时。

胜出的概念在广告中效果更好吗?

不得而知。这次评审衡量的是与简报的契合程度。只有面向真实观众的实际测试才能衡量效果。

对照简报做决定

在 Ciyo 中生成两个概念,并请 GPT-6 Astra 按照你的标准为它们打分。