Ciyo · GPT-6
GPT-6 Astra 与 Claude Fable 5.1 怎样选?面向创作工作的比较

OpenAI 于 2026 年 9 月 3 日发布 GPT-6 Astra,比 Anthropic 发布 Claude Fable 5.1 晚两天。两个模型都接收文本与图片输入、返回文本,公开的 API 标价也相同:每百万输入 token 10 美元,每百万输出 token 50 美元。因此“哪个更适合设计工作”是一个合理的问题,却没有简单答案。
本文依据截至 2026 年 9 月 7 日的官方文档做比较,来源包括两家厂商的模型页面、价格页面、OpenAI 的发布评测,以及一个独立指数。我们没有在两个模型之间跑过受控的创作对比测试。凡是来自某一厂商自测的数字,文中都会说明。
先看真正不同的参数
Astra 模型页面列出 1,050,000 token 上下文窗口、922,000 token 最大输入和 128,000 token 最大输出。Fable 5.1 列出 1M token 上下文窗口和 128K token 最大输出。两者都接收文本与图片,只返回文本,所以任何一个模型都不能独自产出一张成品图片。
推理的控制方式不同。Astra 提供从 low 到 max 的推理程度设置。Fable 5.1 使用始终开启的自适应思考,由一个默认为 high 的 effort 参数引导。Astra 的知识截止日期是 2026 年 4 月 30 日;Fable 5.1 列出的可靠知识截止日期是 2026 年 6 月。在做任何以审美为准的比较之前,先把这些事实记录下来。
| 项目 | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|
| API 模型 | gpt-6-astra | claude-fable-5-1 |
| 输入 / 输出 | 文本与图片 / 文本 | 文本与图片 / 文本 |
| 上下文窗口 | 1,050,000 token | 1M token |
| 最大输出 | 128,000 token | 128K token |
| 推理控制 | 推理程度:low 至 max | 自适应思考,effort 默认 high |
| 知识截止日期 | 2026 年 4 月 30 日 | 2026 年 6 月(可靠) |
标价相同,计费方式不同
按标准价,两个模型都收取每百万输入 token 10 美元、每百万输出 token 50 美元,推理或思考 token 也都按输出计费。差异出现在细节里。Astra 的缓存输入为每百万 token 1 美元;Fable 5.1 的缓存读取为每百万 0.25 美元,是 Astra 的四分之一,而它的五分钟缓存写入为 12.50 美元,与 Astra 的缓存写入相同。
长请求的差距更大。Astra 请求的输入一旦超过 272,000 token,整次请求就按每百万 20 美元输入、75 美元输出计费。Anthropic 的价格页面说明,Claude 4.6 及之后的模型按标准价包含完整的 1M 上下文。反复发送一整本品牌手册的团队,会从两个标价相同的模型那里收到不同的账单。
两个模型同时出现的评测行
OpenAI 的发布文章公布了一张带有 Claude Fable 5.1 列的表格。AutomationBench 一行报告 Astra 为 41.4%,Fable 5.1 为 31.4%。BenchCAD 通过生成 CAD 代码重建 3D 物体,报告为 95.9% 对 84.3%,并附脚注说明 Claude 的成绩反映了 Anthropic 系统卡中描述的三处修改。Terminal-Bench 4.0 的数字是 57.9% 和 55.8%。
同一张表也有 Fable 5.1 领先的行。在带工具的 Humanity’s Last Exam 中,Astra 得 57.2%,Fable 5.1 得 65.0%。在独立汇总指数 Artificial Analysis Intelligence Index v4.1.1 中,Astra 得 61.2,Fable 5.1 得 65.7。在 Artificial Analysis Coding Agent Index 中,Claude Opus 5 以 68.1 领先于 Astra 的 67.0。这里的每个数字都是各推理程度下的最高成绩。
这些评测行没有衡量什么
没有任何公开的评测行给字体排印、版面层级、色彩判断或品牌一致性打分。OpenAI 列出一项内部 Design Tasks 评测,Astra 为 50.0%,GPT-5.6 Sol 为 47.4%,但任务内容不公开,也没有给出 Fable 5.1 的成绩。Intelligence Index 是十项评测的加权平均,覆盖智能体、编程、科学推理和通用知识,其中没有一项是图片质量测试。
对创作团队来说,有用的解读范围更窄。计算机操作类的行,例如 Astra 在 OSWorld 2.0 上的 72.6%,说明的是操作设计软件和执行视觉 QA 的能力。长上下文类的行说明的是阅读大型参考资料包的能力。一张图片的质量仍然来自图片模型和你的审核,而不是这些表格。
工具决定图片究竟怎样生成
Astra 的模型页面列出了 image_generation 工具,以及网页搜索、文件搜索、代码解释器、计算机操作、MCP 和技能。在一次 Responses API 请求中,Astra 可以策划画面、调用图片工具,并在同一轮返回渲染结果。像素来自 GPT Image 2 图片模型,与 Astra 自身的 token 分开计费。
Anthropic 的文档把 Fable 5.1 描述为输入文本与图片、输出文本,并提供计算机操作、浏览器操作、代码执行、网页搜索和网页抓取等服务端工具。这份列表里没有第一方的图片生成工具。因此基于 Claude 的流程会把渲染步骤交给外部图片模型,这正是 Ciyo 这样的画布用 GPT Image 2 做的事,与需求由哪个助手写成无关。
两个模型分别在设计师的哪些工具里
Astra 在 Pro、Business 和 Enterprise 套餐的 ChatGPT 中以 GPT-6 Pro 的名称出现,Plus 套餐则随开放进度在 ChatGPT Work 和 Codex 中包含 Astra。在 API 中它是 gpt-6-astra,OpenAI 还列出了 Microsoft Azure 和 AWS Bedrock。Fable 5.1 可在 Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry 以及 AWS 上的 Claude Platform 使用。
实际结果是,你现有的账号往往决定了第一次测试用哪个模型。比较质量之前,先确认哪个产品提供了这个模型。持有 Plus 套餐的设计师已经可以在 Work 或 Codex 中运行 Astra,而 API 开发者可以用同一个脚本、同一份需求运行两个模型。
一份宣传需求的费用算例
假设一次请求包含 20,000 个未缓存输入 token 和 4,000 个输出 token。按标准短上下文价格,两个模型都是 0.40 美元。现在把它重复二十次,其中同一段 15,000 token 的品牌资料走缓存。在 Astra 上,缓存部分每次请求 0.015 美元;在 Fable 5.1 上是 0.00375 美元。二十次请求的差额约为 0.23 美元,单看很小,对跑几百个版本的代理机构则会放大。
推理对费用的影响比缓存更大。两家厂商都把隐藏推理按每百万 token 50 美元的输出价计费,所以一次思考了 30,000 token 的请求在写出第一个字之前就已花费 1.50 美元。每次测试都要记录推理设置,因为拿 max 档的 Astra 与默认设置的 Fable 5.1 比较,无论比质量还是比费用都不公平。
做一组自己能判断的对照任务
选三类与你工作相似的任务:一份含冲突约束的需求、一次基于截图的落地页审阅,以及一次涉及多个交付物的修改。在看到任何输出之前定好验收条件。使用完全相同的参考资料、两边相同的推理程度,图片则使用同一个图片模型,这样画面差异不会被误当作策划差异。
记录模型标识、日期、推理程度、token 用量、工具费用、耗时和纠正次数。条件允许时对审核者隐藏模型名。任何一家厂商发布材料中的单个惊艳案例,都不能证明它适合你的产品摄影或手机版面;几项有代表性的任务经盲审后得出的结果才可以。
一个公平的结论应该是什么样
有用的结论具体且带日期:例如 2026 年 9 月某个模型在你的包装需求上需要更少修改,或者两者都合格、由缓存输入价格决定默认选择。把测试条件放在结论旁边,价格或模型变化时重新评估。Anthropic 承诺 Fable 5.1 至少可用到 2027 年 9 月 1 日,所以现在做出的决定有余地再次测试。
对渲染这一步来说,策划模型的选择不如参考图、输出尺寸和审核循环重要。在 Ciyo 中,你可以把任一助手写的需求带到画布,用 GPT Image 2 生成,并排比较选中的结果,而不必改变由哪个模型写方案。
继续阅读
关于 Astra 与 Fable 5.1 的常见问题
Claude Fable 5.1 比 GPT-6 Astra 便宜吗?
按标价不是:两者都列出每百万 token 10 美元输入、50 美元输出。Fable 5.1 的缓存读取为 0.25 美元,Astra 为 1 美元;Astra 在输入超过 272,000 token 后输入价翻倍,而 Anthropic 对完整的 1M 上下文按标准价计费。
Claude Fable 5.1 能生成图片吗?
它的文档列出文本与图片输入、文本输出,没有第一方图片生成工具。Astra 可以调用由 GPT Image 2 渲染的图片工具。两种流程里,最终像素都由独立的图片模型生成。
哪个模型更适合设计?
公开评测无法定论。Astra 在 OpenAI 报告的计算机操作和 CAD 行领先;Fable 5.1 在独立的 Intelligence Index 和 Humanity’s Last Exam 上领先。请在一致条件下测试自己的需求。
测试策划模型时保持图片模型不变
把同一份需求和参考资料带到 Ciyo,用按量付费积分调用 GPT Image 2 生成,比较两个助手分别帮你策划出的结果。