模型 · System One

评判四个变体,以及决策模型补上的那道缺口

四张比例略有不同的象牙色纸面板斜靠在炭灰色搁板上,第二张前面摆着一支石墨量规
受以一块面板比对其他几块这一构思启发的原创抽象编辑插图。

生成选项是容易的那一半。在它们之间做选择,是吃掉一整个下午的那一半,也是大多数创作工具留给你自己的那一半。

于是我们认真地跑了一遍评审流程:为一家虚构的港口咖啡馆做了四张方形促销图,写了四条标准,并让一个模型对每张图按每条标准打分。结果很有用,也正好暴露出像 Jev 这种类型化决策模型旨在消除的弱点。Ciyo 无法运行 Jev —— 它不生成图像也不生成视频,也不在我们的任何一个模型注册表之中 —— 所以本文展示今天能用的部分,并标出该由别的东西接手的那道缝。

四个变体,一个优惠

简报是为虚构的港口酒吧 Pier Six Coffee 做的一个周末饮品促销:Salted Maple Cold Brew,售价 4.50,仅限周六和周日,面向在港口散步的人。我们于 2026年9月21日 在 Ciyo 上跑了一遍。原始简报产出了一张图;另外三张是刻意生成的替代方案——玻璃杯的特写、在港口栏杆旁端着的杯子,以及台面上方的俯拍。

四个候选是现实的数量。多到无法全部记在脑子里,又少到一个人真的会把每一张都看一遍。

Ciyo 画布并排展示的四张方形咖啡促销图
在 dev.ciyo.ai 上的 Ciyo,2026年9月21日。同一周末优惠的四个变体,由一份简报和三条后续指令生成。

在你看之前先把标准写出来

让一次评审流程值得做的纪律,是在看到候选之前就写下你要评判什么。否则你只是在为已经喜欢的那张找理由。

四条标准,每条都是一道有答案的问题:饮品是否最先抓住视线;价格在小图尺寸下是否可读;预留的标题位置是否真的清晰;整体是否读起来像周末港口的场景。每一条,没见过这个品牌的人都能核对。

我们发出的评审指令
读取画布上的4张帖子。按4条独立标准,对每张从1到5打分,逐条单独发问:(1) 饮品是否最先抓住视线,(2) 4.50的价格在小图尺寸下是否可读,(3) 顶部标题区是否真的清晰,(4) 是否读起来像周末港口场景。给我一张表,每行一张帖子、每列一条标准,然后说出你会发布哪一张,以及唯一的理由。

返回了什么

成功了。模型以小图尺寸读完了全部四张,产出一张四乘四的表,每个格子里都附了简短理由,并点名了一个胜出者:在港口栏杆旁端着的杯子,「因为它最直观地映照了读者周末在港口散步的情景」。这是一个站得住脚的回答,是拿我们最先写下的标准对照得出的。

它也捕捉到了那个唯一的真实失败。台面上的俯拍在「读起来像周末港口场景」上得了 1 分,并备注说没有任何可见的港口线索,周末全靠文案传达。这恰恰是一个人在下午四点、对着第四个变体时会漏掉的东西。

Ciyo 智能体面板,显示一张四乘四的打分表,每个格子都有理由、并标出了胜出者
在 dev.ciyo.ai 上的 Ciyo,2026年9月21日。GPT-6 Astra 按四条书面标准对四个变体打分,并在下方给出推荐。

暴露弱点的那个数字

16 个单元格。其中 15 个回来的是 4 或 5。整张表里唯一起到区分作用的分数,就是那个 1。

所以这张表是个好的故障探测器,却是差的排序器。它能可靠地告诉你哪个变体坏了。它不能可靠地告诉你存活下来的三个变体里哪个最好,因为在「一到五」的量表上它不用中间段。

这不是这个模型或这条指令的缺陷。当一个判断不得不表达成一句含有数字的话时,就会这样。

这次评审流程定下来和没定下来的
问题回答得好吗原因
有没有变体是坏的?俯拍在港口场景上得了 1 分,且给出了具体理由
好的里面哪个最好?16 个单元格里有 15 个是 4 或 5;量表没能把它们区分开
明天打分还会一样吗?未知我们只跑过一次;可重复性恰恰是散文式打分器最弱的地方。
人还是应该看一眼吗?这里没有任何东西决定一个品牌的调性,而胜出者只是基于一条理由被选出的

System One 模型会落在何处

这就是那道缝。一个类型化的决策模型不会写一句含有分数的话;它返回你声明了类型的一个值,附带概率和一个置信度数值,并且再问一次会返回同样的值。

放到这个具体任务上,意味着四个 Score 问题加一份明确的评分量表——不是「1 到 5」,而是四个带书面定义的具名等级——对每张帖子评估,再加上一个用于整体判定的 Choice,并带明确的 `needs_a_human` 选项。合并规则写在你自己代码里:付费投放时可以让可读性重于氛围,自然投放时反过来。

你将获得的不是更好的品味。而是一个每次运行都意味相同的分数,一个用来决定何时该让人来看的置信度的值,以及一条不用重写指令就能读和修改的规则。

你会失去的是理由。告诉我们俯拍没有港口线索的那个格子是散文,而决策模型不生产散文。实际中,有意思的设计是两者兼备:给排序和路由用类型化的分数,给解释它的那句话用语言模型。

Jev 在这里做不到什么,直说

它无法看帖子。TypeSafe 自己的文档写明,state 必须是一个字符串、一个 JSON 对象,或一组文本值的数组,并且图像、音频和视频目前还不支持。视觉评审流程超出了这个模型今天能接受的范围。

它也不能制作变体。它不生成图像也不生成视频,正因如此它不在 Ciyo 的任何一个模型注册表里,也正因如此 Ciyo 无法提供它。

所以这篇文章观点的诚实版本是一个文本形状的:决策模型可以评判简报、图注、替代文本、营销元数据和一张渲染图的结构化描述——也就是创意工作里本来就是文字的那些部分。图片仍然需要眼睛,而今天那双眼睛是你自己的,或是一个视觉模型的。

尽管如此,还是跑一遍评审流程。在你看之前把标准写下来,就是价值的大部分,而且你手头任何模型都能用。

评审流程的问题

Jev 能给我的广告变体打分吗?

不是图片。它文档里写明的 state 只有文本——一个字符串、一个 JSON 对象,或一组文本值的数组——所以图片在它今天接受的范围之外。它能打分的是简报、图注或结构化描述。

为什么几乎每个分数回来都是 4 或 5?

因为把判断表达成写出来的数字,散文模型会把量表往顶端压缩。每个格子里写下的理由,承载的信息比那些数字更多。

尽管如此,评审流程还值得跑吗?

值得。它在做出来的那个下午就捕捉到了一处真实的失败;而无论用哪个模型打分,看之前把标准写下来都是好处的大部分。

Ciyo 运行 Jev 吗?

不。它不生成图像也不生成视频,也不在 Ciyo 的任何模型注册表里。本文的打分是由 GPT-6 Astra 完成的,而 Ciyo 确实运行它。

跑你自己的评审流程

生成四个变体,在看之前写下四条标准,并让智能体对每一个变体都打分。