新模型 · 对比
做创意规划,用 Claude Opus 5.5 还是 Fable 5.1?

Anthropic 于 2026年9月22日发布了 Claude Opus 5.5,并表示它在大多数工作上达到 Claude Fable 5.1 的水平,而运行成本比 Opus 5 低 40%。对在 claude.ai 里规划宣传图片的人来说,这两个模型现在就在同一个模型菜单里。
9月23日,我们用 Medium 推理强度给两者同一份虚构面包店简报,只看一件对小商家要紧的事:各自把哪些店主从没说过的内容摆到了顾客面前。
Anthropic 的说法
Anthropic 的公告用它自己的基准测试比较了这两个模型。Opus 5.5 在其中多数项目上得分更高:Terminal-Bench 4.0 上 66.4% 对 55.8%,GDPval-AA 上 1846 对 1735,在读图表测试 Chartography(使用工具)上 89.0% 对 88.4%。这些是 Anthropic 的数字。
在 claude.ai 里,菜单把 Fable 5.1 描述为用于应对你最艰巨的挑战,把 Opus 5.5 描述为最适合雄心勃勃的工作、能力最强。两者都提供 Low、Medium、High 和 Extra 四档推理强度。
| 基准测试 | Opus 5.5 | Fable 5.1 |
|---|---|---|
| Terminal-Bench 4.0 | 66.4% | 55.8% |
| GDPval-AA v2.1 | 1846 | 1735 |
| Humanity's Last Exam(人类最后的考试,使用工具) | 67.7% | 65.6% |
| Chartography(使用工具) | 89.0% | 88.4% |
这次测试
Kettle & Crumb 是一家虚构的面包店,将在 10月3日(星期六)推出售价 $9 的南瓜黑麦酸种面包,共 60 个,预订在前一个星期四截止,不打折,也不配送。简报要求写一份简短的创意简报、三条 4:5 图像提示词和一段配文,并要求模型把猜测放进一个名为「假设」的列表,而不是把它们当作事实陈述。
你正在为一家小型社区面包店策划一条 Instagram 帖子。只使用下面的事实。如果你需要事实里没有的信息,请把它写进一个名为「假设」的列表,不要把它当作事实来陈述。
事实:
- 面包店:Kettle & Crumb,14 Alder Street
- 新品:南瓜黑麦酸种面包,10月3日(星期六)上市
- 价格:每个 $9
- 上市当天只有 60 个
- 预订于 10月1日(星期四)截止,通过我们主页简介里的链接预订
- 不打折,不配送
- 受众:已经在 Instagram 上关注我们、住在附近的人
请给我三样东西:
1. 一份不超过 80 词的创意简报。
2. 三条不同的图像提示词,用于一张 4:5 的照片。图片中不得出现任何文字、字母或标志。
3. 一段不超过 60 词的配文。Opus 5.5 先把假设摆出来
Opus 5.5 用了大约一分钟,开头就列出五条假设:面包的外观;因为不配送,所以到店自取;预订计入那 60 个面包之内;货币;以及视觉风格。它的图像提示词是我们测试过的所有模型里最丰富的——切开的一片、泛橙色的面包芯、一个小南瓜、傍晚的侧光。
这些猜测没有一条进入配文。配文只写了日期、地点、价格、60 个面包和星期四的截止时间。

Fable 5.1 列出了猜测,然后照样用了
Fable 5.1 大约 45 秒就完成了,也写了一份合理的「假设」清单。但它的简报把这次上市写成只能自取,它的配文对顾客说 'Pickup at 14 Alder Street only'(仅限在 14 Alder Street 自取)和 'See you Saturday morning'(星期六早上见)。这两点都是它自己标记过的猜测。
追问要求写一段星期五的配文,带上平时的优惠和营业时间,而事实里从没给过这些。两个模型都留下了占位符,没有编造。Opus 还指出,到星期五时预订已经截止;Fable 的配文则承诺,可能会有几个面包摆上货架,留给直接到店的顾客。

这些提示词产出了什么
我们把 Opus 的第一条提示词带进 Ciyo 的图像生成器(GPT Image 2.5 Flare,4:5,1K,2 点额度)。照片遵循了每一个细节:切开的一片、泛色的面包芯、背后的南瓜。图片继承的正是规划模型给出的细节,所以当产品的外观已知时,为更丰富的提示词付费是值得的。
Ciyo 不运行 Claude Opus 5.5,也不运行 Fable 5.1;它的智能体提供的是 Ciyo Agent 和 GPT-6 Astra。从规划到出图之间的那一步,就是复制和粘贴。

该用哪一个
如果是规划帖子,选 Opus 5.5。在我们这一次测试里,它写出了最有用的提示词,并把猜测放在了店主看得到的地方。Fable 的失误正是零售业里要紧的那种:一个错误的自取承诺,到了柜台前就会变成一次投诉。
无论选哪个,发布之前都要对照事实读一遍配文。一次测试只是一个例子,不是一个比率。
Anthropic 的发布说法
本文检验的那个说法,出自 Anthropic 自己的发布帖。
2026-09-22 由 Anthropic 的 Claude 账号发布。帖子说,Opus 5.5 在大多数任务上达到 Fable 5.1 的水平,运行成本比 Opus 5 低 40%。我们这一次创意简报测试与这个说法相符,但那只是一项任务,不是基准测试。
Opus 5.5 对比 Fable 5.1
Claude Opus 5.5 比 Fable 5.1 更好吗?
Anthropic 报告称,它在大多数工作上达到 Fable 的水平,并在若干基准测试上得分更高。在我们的创意简报测试里,Opus 没有把猜测写进配文,Fable 写进去了。
哪个更快?
在我们这一次测试里,Fable 5.1 大约 45 秒完成,Opus 5.5 大约一分钟,两者都是 Medium 推理强度。
有哪个编造了折扣或营业时间吗?
没有。被要求写事实里没有的优惠和营业时间时,两者都用了占位符。
我能在 Ciyo 里用 Opus 5.5 吗?
不能。Ciyo 的智能体提供 Ciyo Agent 和 GPT-6 Astra。把 Opus 写的提示词贴进 Ciyo 的图像生成器即可。
把详细的提示词变成图片
把提示词贴进 Ciyo 的图像生成器,在同一块画板上并排比较不同版本。