新模型 · 比較

做創意規劃,該用 Claude Opus 5.5 還是 Fable 5.1?

炭黑石板上兩件雕塑般的容器,一件是修長的象牙白,一件是寬口的石墨色,兩者之間有一滴琥珀色玻璃
原創抽象編輯插畫,於 Ciyo 中以 GPT Image 2.5 Sunburst 生成。

Anthropic 在 2026 年 9 月 22 日發布 Claude Opus 5.5,並表示它在多數工作上有 Claude Fable 5.1 的水準,執行成本卻比 Opus 5 低 40%。對在 claude.ai 裡規劃行銷活動圖片的人來說,兩者現在並列在同一個模型選單裡。

9 月 23 日,我們用 Medium 推理強度,把同一份虛構麵包店需求交給兩者,只看一件對小店家要緊的事:各自把哪些老闆從沒說過的東西擺到了顧客面前。

Anthropic 的說法

Anthropic 的公告用它自己的基準測試比較兩者。Opus 5.5 在其中多數項目得分較高:Terminal-Bench 4.0 為 66.4% 對 55.8%,GDPval-AA 為 1846 對 1735,而在使用工具的圖表判讀測試 Chartography 上為 89.0% 對 88.4%。這些是 Anthropic 的數字。

在 claude.ai 的選單裡,Fable 5.1 被描述為用來應付你最艱難的挑戰,Opus 5.5 則是做有野心的工作時能力最強的模型。兩者都提供 Low、Medium、High 與 Extra 四種推理強度。

摘自 Anthropic 公告的部分結果,2026-09-22
基準測試Opus 5.5Fable 5.1
Terminal-Bench 4.066.4%55.8%
GDPval-AA v2.118461735
Humanity's Last Exam(使用工具)67.7%65.6%
Chartography(使用工具)89.0%88.4%

這次的測試

Kettle & Crumb 是一家虛構的麵包店,在 10 月 3 日星期六推出每條 $9 的南瓜裸麥酸種麵包,共 60 條,預購在前一個星期四截止,不打折也不外送。需求要一份簡短的創意簡報、三段 4:5 的影像提示詞和一則貼文文案,並要模型把猜測放進一份名為「假設」的清單,而不是把它們當成事實陳述。

交給兩個模型的需求
你正在為一家小型社區麵包店規劃一則 Instagram 貼文。只能使用下面的事實。如果你需要事實裡沒有的東西,請把它寫進一份名為「假設」的清單,而不要把它當成事實陳述。

事實:
- 麵包店:Kettle & Crumb,14 Alder Street
- 新產品:南瓜裸麥酸種麵包,10 月 3 日星期六上市
- 價格:每條 $9
- 上市當天只有 60 條
- 預購於 10 月 1 日星期四截止,透過我們個人簡介裡的連結
- 不打折,不外送
- 受眾:已經在 Instagram 上追蹤我們、住在附近的人

請給我三樣東西:
1. 一份不超過 80 字的創意簡報。
2. 三段不同的影像提示詞,用於一張 4:5 的照片。影像中不得出現任何文字、字母或標誌。
3. 一則不超過 60 字的貼文文案。

Opus 5.5 先把假設擺在前面

Opus 5.5 花了大約一分鐘,開頭就列出五個假設:麵包的外觀、因為不外送所以要親自取貨、預購算在那 60 條之內、幣別,以及視覺風格。它的影像提示詞是我們測過的模型裡最豐富的——一片帶橘色調內部組織的切片、一顆小南瓜、傍晚的側光。

這些猜測沒有一個進入貼文文案。文案只寫了日期、地點、價格、60 條和星期四的截止日。

claude.ai 畫面,顯示 Opus 5.5 的假設清單、一份 68 個詞的創意簡報和三段詳細的影像提示詞
claude.ai 中的 Claude Opus 5.5,Medium,2026 年 9 月 23 日。

Fable 5.1 列出了猜測,然後照樣用了

Fable 5.1 大約 45 秒就完成,也寫了一份合理的假設清單。但它的簡報把這次上市說成只限自取,貼文文案也告訴顧客「Pickup at 14 Alder Street only」(僅限 14 Alder Street 自取)和「See you Saturday morning」(星期六早上見)。這兩點都是它自己標記過的猜測。

追問要的是一則星期五的貼文文案,內容包括平常的優惠和營業時間,而這些事實從來沒有提供。兩個模型都留下佔位文字,而沒有捏造。Opus 還指出,到了星期五預購已經截止;Fable 的文案則承諾可能會有幾條麵包擺上貨架,留給現場來買的客人。

長條圖,顯示進入公開貼文文案的猜測數:Opus 5.5 0、Fable 5.1 3,並列出 GPT 模型作為對照
每個模型只跑一次,2026-09-23。Fable 把三個猜測都列為假設,卻仍然用進了貼文文案。

這些提示詞做出了什麼

我們把 Opus 的第一段提示詞帶進 Ciyo 的影像生成器(GPT Image 2.5 Flare,4:5,1K,2 點)。照片照著每個細節做了:切開的那一片、帶色調的內部組織、後方的南瓜。圖片繼承的是規劃模型給的細節,所以當產品外觀已知時,為更豐富的提示詞付錢是值得的。

Ciyo 不執行 Claude Opus 5.5 或 Fable 5.1;Ciyo 的 Agent 提供 Ciyo Agent 與 GPT-6 Astra。從規劃到成圖之間的那一步,就是複製貼上。

Ciyo 畫板上並排兩張麵包照片:一張是灰底上未切開的素面麵包,另一張是木頭砧板上切開的麵包和一顆南瓜
Ciyo,2026 年 9 月 23 日:右邊的圖來自 Opus 5.5 的提示詞;左邊的來自 GPT-6 Sol 的提示詞。

該用哪一個

規劃貼文,選 Opus 5.5。在我們這一次的測試裡,它寫出最有用的提示詞,也把猜測放在老闆看得到的地方。Fable 的失誤正是零售業最在意的那種:一個錯誤的取貨承諾,到了櫃檯就會變成客訴。

不論選哪一個,發文前都要拿貼文文案和事實對照一遍。一次測試只是一個例子,不是一個比率。

Anthropic 的發布說法

本文所檢驗的說法,出自 Anthropic 自己的發布貼文。

Opus 5.5 對 Fable 5.1

Claude Opus 5.5 比 Fable 5.1 好嗎?

Anthropic 報告說它在多數工作上有 Fable 的水準,並在幾項基準測試上得分更高。在我們的創意簡報測試裡,Opus 沒讓猜測進入貼文文案,Fable 則有。

哪個比較快?

在我們的測試裡,Fable 5.1 大約 45 秒完成,Opus 5.5 大約一分鐘,兩者都是 Medium 推理強度。

有哪個捏造了折扣或營業時間嗎?

沒有。被要求寫出事實裡沒有的優惠和營業時間時,兩者都用了佔位文字。

我能在 Ciyo 裡用 Opus 5.5 嗎?

不能。Ciyo 的 Agent 提供 Ciyo Agent 與 GPT-6 Astra。把 Opus 的提示詞貼進 Ciyo 的影像生成器即可。

把一段詳細的提示詞變成圖

把提示詞貼進 Ciyo 的影像生成器,在同一張畫板上並排比較不同版本。