Ciyo · GPT-6
面向设计师的 GPT-6 Astra 评测成绩解读

OpenAI 的 GPT-6 Astra 发布文章公布了几十项评测成绩,覆盖计算机操作、专业工作、编程、科学、网络安全、对齐和长上下文。大多数由 OpenAI 自己测得,少数来自一个独立指数。几乎没有一项衡量设计师最关心的事:最终的图片好不好。
本文以创作团队的视角读这张表,依据截至 2026 年 9 月 7 日的发布文章和 Artificial Analysis 的方法说明。它解释每项相关评测要求模型做什么,哪些行对 Astra 有利、哪些行对 Claude 有利,以及怎样使用这些数字而不把它们误当作对你工作的裁决。
读任何数字之前先弄清表怎么读
发布文章说明,评测成绩取各推理程度下的最高值。因此 72.6% 可能来自最贵的设置,而不是你日常需求会用的设置。脚注同样重要:Claude 的 BenchCAD 成绩反映了 Anthropic 系统卡中描述的三处修改,还有两行 Claude 成绩来自 Mythos,即安全措施较少的 Fable 版本。
有几行标为内部评测,包括 Design Tasks、Data Science Tasks 和 Database Migration Tasks。它们的内容不公开,因此无法复现。把它们当作 OpenAI 对自身优先级的描述,而不是独立证据。下文所有数字除非另有说明,都是厂商报告的成绩。
计算机操作:操作你已经拥有的软件
OSWorld 2.0 要求智能体在真实桌面软件中完成任务。OpenAI 报告 Astra 为 72.6%,GPT-5.6 Sol 为 65.7%,Claude Opus 5 为 70.2%,并补充说在延迟模拟中 Astra 每项任务约 40 分钟完成,Sol 约 75 分钟。ScreenSpot-Pro 测试在不使用工具的情况下定位专业应用中的界面元素,报告 Astra 为 92.7%,Sol 为 76.9%。
Agents’ Last Exam 覆盖真实软件中的专业任务,包括媒体制作,报告 Astra 为 59.3%,Opus 5 为 55.5%,Sol 为 53.6%。对设计师来说,这些行描述的是通过界面驱动编辑器、浏览器或 3D 工具的能力,不描述在那里做出来的东西品味如何。
带创作角度的专业工作行
BenchCAD 测试模型能否通过编写 CAD 代码,从多视角渲染图重建 3D 物体。Astra 带工具报告为 95.9%,Sol 为 83.3%,Fable 5.1 在脚注条件下为 84.3%。OpenScore String Quartets 衡量从图片读取乐谱;Astra 在 1 减 OMR-NED 指标上得 0.84,Sol 为 0.19,结构化视觉阅读能力大幅提升。
内部 Design Tasks 一行显示 Astra 为 50.0%,Sol 为 47.4%,Claude Fable 5 为 35.8%,没有 Fable 5.1 的数字。被 OpenAI 归入专业工作的 AutomationBench 显示 Astra 为 41.4%,Fable 5.1 为 31.4%。这些是公开表格里最接近设计工作的行,而设计那一行恰恰是你无法查看的。
| 评测 | GPT-6 Astra | GPT-5.6 Sol | 表中最佳 Claude |
|---|---|---|---|
| OSWorld 2.0 | 72.6% | 65.7% | 70.2%(Opus 5) |
| ScreenSpot-Pro,不用工具 | 92.7% | 76.9% | 87.3%(Fable 5,Mythos) |
| Agents’ Last Exam | 59.3% | 53.6% | 55.5%(Opus 5) |
| BenchCAD | 95.9% | 83.3% | 84.3%(Fable 5.1,修改版) |
| 内部 Design Tasks | 50.0% | 47.4% | 35.8%(Fable 5) |
| MRCR v2,512K 至 1M | 96.3% | 73.8% | 未显示 |
独立指数讲的是另一个故事
Artificial Analysis Intelligence Index v4.1.1 出现在 OpenAI 自己的表格中:Astra 61.2,Sol 60.9,Claude Fable 5.1 65.7,Claude Opus 5 63.1,Gemini 3.8 Flash 58.7。Artificial Analysis 9 月 3 日的文章把 Astra 描述为智能水平与 Sol 相当,输出 token 少约 10%,价格则高 2.5 倍。
该指数是十项评测的加权平均,涵盖智能体、编程、科学推理和通用类别,其中智能体和通用工作各占 30% 权重。当前版本列出 AA-Briefcase、GDPval-AA v2、Terminal-Bench、SciCode、Humanity’s Last Exam 等。没有一项是视觉或品牌评测,所以在这个指数上领先,是推理广度领先,不是设计领先。
长上下文:读完整本品牌手册
OpenAI MRCR v2 要求模型在长文档中找到八根“针”。Astra 在 256K 至 512K token 区间报告为 100.0%,512K 至 1M 区间为 96.3%,Sol 对应为 91.5% 和 73.8%。对创作团队来说,实际含义是大型参考资料包,例如品牌手册加上过往宣传项目,更有可能被准确使用。
检索质量只是一半。输入超过 272,000 token 后,Astra 请求按长上下文档计费,输入价翻倍。高 MRCR 成绩让一百万 token 的请求变得可行;价格页面决定它对日常任务是否合理。
委托任务时值得关注的对齐行
OpenAI 报告了一项内部计算机操作安全评测,数值越低越好:Astra 2.4%,Sol 22.0%,Fable 5.1 9.5%。它还报告了一项内部幻觉评测,Astra 4.2%,Sol 12.2%,并称 Astra 错误描述自身能力的可能性比 Sol 低三倍。
如果你打算让模型代你操作设计软件或浏览器,这些行描述的是发生意外操作的风险。它们是内部的、厂商报告的成绩,因此支持的是开启审批的谨慎试用,而不是在客户账号上无人值守地运行。
评测没有覆盖什么
没有公开的图片生成成绩,因为 Astra 不直接生成图片;图片模型是 GPT Image 2,需要单独评估。没有字体排印、可读性、色彩或品牌一致性评测。也没有衡量模型初稿之后人工还需要多少修改。
文章中的费用说法是 OpenAI 条件下的估算,例如 Terminal-Bench Science 的结果比 Fable 5.1 的估算 API 费用低约 31%。token 效率的引述,包括一位客户报告创作流程中最多减少 20% token,描述的是别人的流水线。你自己的日志是唯一适用于你产品的费用基准。
把表格变成测试计划
用这些行决定测什么,而不是买什么。计算机操作结果提示你在实际软件中测试一项重复的编辑任务。BenchCAD 和 Blender 演示提示你测试一个脚本化 3D 场景。MRCR 提示你测试完整品牌手册是否提高了文案规则的遵守率。每项测试都应在运行前写好通过条件。
在你今天使用的模型上跑同样的任务。固定推理程度、参考资料和图片模型,记录时间、费用和纠正次数。当内部设计行说 50.0% 时,有用的回应是在十份真实需求上测量自己的通过率,那才是你能为之辩护的数字。
关于这些数字的简短阅读清单
读发布文章,获取完整表格以及关于推理程度、修改和 Mythos 的脚注。读 Artificial Analysis 的方法说明,了解指数由哪些评测组成、如何加权。读模型页面,了解长上下文行背后的参数。然后在旁边读你自己带日期的结果。
对图片工作来说,决定仍然很实际。Astra 负责策划和指挥;GPT Image 2 负责渲染;审核者负责批准。在 Ciyo 中你可以直接测试后两步,每次生成前都显示价格,并比较任何你选择的策划模型产出的结果。
继续阅读
关于 Astra 评测的常见问题
GPT-6 Astra 在每项评测上都是最好的吗?
不是。在 OpenAI 自己的表格中,Claude Fable 5.1 在带工具的 Humanity’s Last Exam 和 Artificial Analysis Intelligence Index 上领先,Claude Opus 5 在 Coding Agent Index 上领先。Astra 在表中显示的计算机操作、CAD、科学和长上下文行领先。
这些评测有衡量图片质量的吗?
没有。Astra 返回文本,图片通过调用图片工具生成。图片模型 GPT Image 2 是独立模型,没有任何公开评测行给字体排印、版面或品牌一致性打分。
“各推理程度下的最高值”对我的费用意味着什么?
成绩可能来自最高的推理设置,其中隐藏推理 token 按输出计费。你日常使用的设置可能成绩更低、费用也更低,所以应在实际会用的推理程度下测试。
测量评测跳过的那一步
在 Ciyo 中用 GPT Image 2 生成同一份需求,保留你会发布的结果,把自己的通过率记在厂商表格旁边。