GPT-6 图片生成 · 概念评审
GPT-6 图片生成:用简报在两个概念之间做选择

两个生成的概念可能看起来都不错,却都没有完成任务。一个可能把产品淹没在道具中;另一个可能没有给标题留出空间。只凭个人喜好做选择,决定就很难解释,也很容易被推翻。
在 Ciyo 中,GPT Image 2.5 Flare 负责生成图片,GPT-6 Astra 可以对图片进行评审。OpenAI 列出的 Astra 直接输出形式是文本,因此由 Astra 负责规划和评审,由图片模型生成像素。本教程比较了为虚构的 Fold 笔记本发布帖制作的两个真实概念,它们于 2026 年 9 月 18 日生成并完成评审。这里展示的是一次设计决策,而不是广告效果测试。
写出能在图片中看到的标准
生成之前,先把简报转化为四项审核人一看就能回答的检查。对于 Fold 的发布帖,我们使用的是:象牙白笔记本是明确的主角;氛围平静,贴合办公桌前工作的人;画面上方三分之一保持简洁,用于放置标题;没有额外的品牌物品。
避免使用“会带来转化”或“显得高级”之类的标准。它们无法通过单张图片来检查,而模型对它们的看法也不能作为证据。
生成两个真正不同的概念
在 Image Generator 中使用 GPT Image 2.5 Flare,比例设为 1:1。要改变的是创意,而不只是颜色:概念 A 把合上的笔记本放在工作日的办公桌上;概念 B 则采用俯拍平铺的方式展示摊开的笔记本。两张几乎相同的图片,会让评审无从判断。
两条提示词中固定的部分要保持一致,包括标题留白和不含文字的规则,这样比较才公平。
选项越好,选择反而越难。2026 年 9 月 15 日,Larus Canus(@MrLarus)分享了用 Images 2.5 制作的四个海报方向,每一个都把大面积色块与一个微缩场景搭配在一起:春日风景、陶窑、植物拓印和靛蓝染色。当每个方向看起来都不错时,一套固定的标准能把“我喜欢哪一个”变成“哪一个符合简报”。
为虚构文具店 Fold 制作一条方形 Instagram 发布帖的概念 B。俯拍平铺:象牙白亚麻笔记本摊开在空白的米色内页上,一支铅笔横放在跨页上,背景是浅灰色纸张,光线柔和均匀,传达出重新开始的感觉。画面上方三分之一保持简洁,以便之后添加标题。不要文字,不要标志,不要人物。一条中文帖子,展示了四个 Images 2.5 海报概念;提示词和设计均属于发帖者。我们的评分工作流是一次原创的改编。
让 Astra 打分,而不是夸奖
在画布上选中两张图片,请 GPT-6 Astra 针对每项标准给出通过或未通过的判定,为每个概念指出一个可见的问题,并给出一个推荐。告诉它不要生成或编辑任何内容。固定的格式能让回答更容易与你自己的看法进行比较。
在我们的运行中,智能体面板在回答之前显示了一个 Inspect images 步骤,因此评分针对的是画布上的真实图片。

把结论与图片进行对照
Astra 判定概念 A 有两项标准未通过:笔记本电脑、茶和其他道具与笔记本争夺注意力,而且植物和笔记本电脑的边缘侵入了画面上方三分之一。概念 B 四项全部通过。它被指出的问题是:摊开的跨页遮住了大部分象牙白封面。
在接受结论之前,先自己看看图片。这次指出的问题都能看到:深色的笔记本电脑边缘确实会吸引视线,而平铺构图展示的确实是内页而非封面。如果评审指出了你看不到的问题,先问清楚它在哪里,再据此行动。
| 标准 | 概念 A:办公桌场景 | 概念 B:俯拍平铺 |
|---|---|---|
| 笔记本是明确的主角 | 未通过 | 通过 |
| 平静的办公氛围 | 通过 | 通过 |
| 上方三分之一保持简洁 | 未通过 | 通过 |
| 没有额外的品牌物品 | 通过 | 通过 |

把指出的弱点带入下一轮
胜出的概念很少是最终成品。概念 B 的弱点很具体:封面材质很难看清。这就成为下一版的唯一指令,例如让笔记本半合,同时露出内页和封面。修正这一点时,所有已通过的标准都保持不变。
记录另一个概念落选的原因。如果负责人之后要求生活场景图,这条记录能说明是哪些道具导致了失败。
把决策与投放效果分开
这次评审决定的是哪个概念符合简报。它无法说明哪条帖子会获得更多点击。如果你需要效果方面的证据,就把不同版本发布给真实受众并衡量结果;不要把模型的偏好当作测试。
每一轮都使用同样的四项标准。稳定的检查清单能让各轮结果可以相互比较,也能防止简报随着最新一张图片的内容而不断偏移。
关于概念评审的问题
图片是 GPT-6 Astra 生成的吗?
在这个工作流中,图片由 GPT Image 2.5 Flare 生成。Astra 负责规划和评审;OpenAI 列出的 Astra 直接输出模态是文本。
我能信任 Astra 给出的通过或未通过评分吗?
把它当作第二位审核人。请自己对照图片检查每一项评分,尤其是在事关重大时。
胜出的概念在广告中效果更好吗?
不得而知。这次评审衡量的是与简报的契合程度。只有面向真实观众的实际测试才能衡量效果。
对照简报做决定
在 Ciyo 中生成两个概念,并请 GPT-6 Astra 按照你的标准为它们打分。