新模型 · 比較
做創意規劃,該用 Claude Opus 5.5 還是 Fable 5.1?

Anthropic 在 2026 年 9 月 22 日發布 Claude Opus 5.5,並表示它在多數工作上有 Claude Fable 5.1 的水準,執行成本卻比 Opus 5 低 40%。對在 claude.ai 裡規劃行銷活動圖片的人來說,兩者現在並列在同一個模型選單裡。
9 月 23 日,我們用 Medium 推理強度,把同一份虛構麵包店需求交給兩者,只看一件對小店家要緊的事:各自把哪些老闆從沒說過的東西擺到了顧客面前。
Anthropic 的說法
Anthropic 的公告用它自己的基準測試比較兩者。Opus 5.5 在其中多數項目得分較高:Terminal-Bench 4.0 為 66.4% 對 55.8%,GDPval-AA 為 1846 對 1735,而在使用工具的圖表判讀測試 Chartography 上為 89.0% 對 88.4%。這些是 Anthropic 的數字。
在 claude.ai 的選單裡,Fable 5.1 被描述為用來應付你最艱難的挑戰,Opus 5.5 則是做有野心的工作時能力最強的模型。兩者都提供 Low、Medium、High 與 Extra 四種推理強度。
| 基準測試 | Opus 5.5 | Fable 5.1 |
|---|---|---|
| Terminal-Bench 4.0 | 66.4% | 55.8% |
| GDPval-AA v2.1 | 1846 | 1735 |
| Humanity's Last Exam(使用工具) | 67.7% | 65.6% |
| Chartography(使用工具) | 89.0% | 88.4% |
這次的測試
Kettle & Crumb 是一家虛構的麵包店,在 10 月 3 日星期六推出每條 $9 的南瓜裸麥酸種麵包,共 60 條,預購在前一個星期四截止,不打折也不外送。需求要一份簡短的創意簡報、三段 4:5 的影像提示詞和一則貼文文案,並要模型把猜測放進一份名為「假設」的清單,而不是把它們當成事實陳述。
你正在為一家小型社區麵包店規劃一則 Instagram 貼文。只能使用下面的事實。如果你需要事實裡沒有的東西,請把它寫進一份名為「假設」的清單,而不要把它當成事實陳述。
事實:
- 麵包店:Kettle & Crumb,14 Alder Street
- 新產品:南瓜裸麥酸種麵包,10 月 3 日星期六上市
- 價格:每條 $9
- 上市當天只有 60 條
- 預購於 10 月 1 日星期四截止,透過我們個人簡介裡的連結
- 不打折,不外送
- 受眾:已經在 Instagram 上追蹤我們、住在附近的人
請給我三樣東西:
1. 一份不超過 80 字的創意簡報。
2. 三段不同的影像提示詞,用於一張 4:5 的照片。影像中不得出現任何文字、字母或標誌。
3. 一則不超過 60 字的貼文文案。Opus 5.5 先把假設擺在前面
Opus 5.5 花了大約一分鐘,開頭就列出五個假設:麵包的外觀、因為不外送所以要親自取貨、預購算在那 60 條之內、幣別,以及視覺風格。它的影像提示詞是我們測過的模型裡最豐富的——一片帶橘色調內部組織的切片、一顆小南瓜、傍晚的側光。
這些猜測沒有一個進入貼文文案。文案只寫了日期、地點、價格、60 條和星期四的截止日。

Fable 5.1 列出了猜測,然後照樣用了
Fable 5.1 大約 45 秒就完成,也寫了一份合理的假設清單。但它的簡報把這次上市說成只限自取,貼文文案也告訴顧客「Pickup at 14 Alder Street only」(僅限 14 Alder Street 自取)和「See you Saturday morning」(星期六早上見)。這兩點都是它自己標記過的猜測。
追問要的是一則星期五的貼文文案,內容包括平常的優惠和營業時間,而這些事實從來沒有提供。兩個模型都留下佔位文字,而沒有捏造。Opus 還指出,到了星期五預購已經截止;Fable 的文案則承諾可能會有幾條麵包擺上貨架,留給現場來買的客人。

這些提示詞做出了什麼
我們把 Opus 的第一段提示詞帶進 Ciyo 的影像生成器(GPT Image 2.5 Flare,4:5,1K,2 點)。照片照著每個細節做了:切開的那一片、帶色調的內部組織、後方的南瓜。圖片繼承的是規劃模型給的細節,所以當產品外觀已知時,為更豐富的提示詞付錢是值得的。
Ciyo 不執行 Claude Opus 5.5 或 Fable 5.1;Ciyo 的 Agent 提供 Ciyo Agent 與 GPT-6 Astra。從規劃到成圖之間的那一步,就是複製貼上。

該用哪一個
規劃貼文,選 Opus 5.5。在我們這一次的測試裡,它寫出最有用的提示詞,也把猜測放在老闆看得到的地方。Fable 的失誤正是零售業最在意的那種:一個錯誤的取貨承諾,到了櫃檯就會變成客訴。
不論選哪一個,發文前都要拿貼文文案和事實對照一遍。一次測試只是一個例子,不是一個比率。
Anthropic 的發布說法
本文所檢驗的說法,出自 Anthropic 自己的發布貼文。
Anthropic 的 Claude 帳號於 2026-09-22 發布。貼文說 Opus 5.5 在多數任務上有 Fable 5.1 的水準,執行成本比 Opus 5 低 40%。我們這一次的創意簡報測試與此相符,但那只是一項任務,不是基準測試。
Opus 5.5 對 Fable 5.1
Claude Opus 5.5 比 Fable 5.1 好嗎?
Anthropic 報告說它在多數工作上有 Fable 的水準,並在幾項基準測試上得分更高。在我們的創意簡報測試裡,Opus 沒讓猜測進入貼文文案,Fable 則有。
哪個比較快?
在我們的測試裡,Fable 5.1 大約 45 秒完成,Opus 5.5 大約一分鐘,兩者都是 Medium 推理強度。
有哪個捏造了折扣或營業時間嗎?
沒有。被要求寫出事實裡沒有的優惠和營業時間時,兩者都用了佔位文字。
我能在 Ciyo 裡用 Opus 5.5 嗎?
不能。Ciyo 的 Agent 提供 Ciyo Agent 與 GPT-6 Astra。把 Opus 的提示詞貼進 Ciyo 的影像生成器即可。
把一段詳細的提示詞變成圖
把提示詞貼進 Ciyo 的影像生成器,在同一張畫板上並排比較不同版本。