Ciyo · GPT-6
為設計師解讀 GPT-6 Astra 的基準測試

OpenAI 的 GPT-6 Astra 發布文章公布了數十個基準測試分數,涵蓋電腦操作、專業工作、程式設計、科學、資安、對齊和長上下文。大多數由 OpenAI 自行產生,少數來自一個獨立指數。幾乎沒有一項衡量設計師最在意的事:最終的圖片好不好。
本文以創作團隊的角度閱讀那張表,依據 2026 年 9 月 7 日核對的發布文章與 Artificial Analysis 方法說明。它解釋每項相關評測要求模型做什麼、哪些列對 Astra 有利、哪些對 Claude 有利,以及怎樣使用這些數字,而不把它們誤當成對你工作的裁決。
看任何數字之前,先學會讀這張表
發布文章說明評測分數是任一推理程度下的最高值。因此 72.6% 可能來自最昂貴的設定,而不是你處理日常需求時會用的設定。附註同樣重要:Claude 的 BenchCAD 分數反映了 Anthropic 系統卡中描述的三項修改,另有兩個 Claude 列來自 Mythos,也就是安全措施較少的 Fable 版本。
有幾列標示為內部評測,包括 Design Tasks、Data Science Tasks 和 Database Migration Tasks。它們的內容不公開,所以無法重現。把它們當成 OpenAI 對自身優先事項的描述,而不是獨立證據。除非另有說明,下文的每個數字都是廠商自行回報的。
電腦操作:操作你已經擁有的軟體
OSWorld 2.0 要求智慧體在真實桌面軟體中完成任務。OpenAI 回報 Astra 為 72.6%,GPT-5.6 Sol 為 65.7%,Claude Opus 5 為 70.2%,並補充在延遲模擬中,Astra 每項任務約 40 分鐘完成,Sol 約 75 分鐘。測試在專業應用程式中不用工具定位介面元素的 ScreenSpot-Pro,回報 Astra 為 92.7%,Sol 為 76.9%。
Agents’ Last Exam 涵蓋真實軟體中的專業任務,包括媒體製作,回報 Astra 為 59.3%,Opus 5 為 55.5%,Sol 為 53.6%。對設計師來說,這些列描述的是透過介面驅動編輯器、瀏覽器或 3D 工具的能力。它們不描述在那裡做出來的東西有沒有品味。
帶有創作角度的專業工作列
BenchCAD 測試模型能否透過撰寫 CAD 程式碼,從多視角渲染圖重建 3D 物件。使用工具的 Astra 回報為 95.9%,Sol 為 83.3%,附註條件下的 Fable 5.1 為 84.3%。OpenScore String Quartets 衡量從圖片讀取樂譜;Astra 在 1 減 OMR-NED 指標上得 0.84,Sol 為 0.19,在結構化視覺閱讀上是一次大幅躍升。
內部 Design Tasks 列顯示 Astra 為 50.0%,Sol 為 47.4%,Claude Fable 5 為 35.8%,沒有 Fable 5.1 的數字。OpenAI 歸在專業工作類的 AutomationBench,顯示 Astra 為 41.4%,Fable 5.1 為 31.4%。這些是公開列中最接近設計工作的,而設計這一列恰好也是你無法檢視的那一列。
| 評測 | GPT-6 Astra | GPT-5.6 Sol | 顯示的最佳 Claude |
|---|---|---|---|
| OSWorld 2.0 | 72.6% | 65.7% | 70.2%(Opus 5) |
| ScreenSpot-Pro,不用工具 | 92.7% | 76.9% | 87.3%(Fable 5,Mythos) |
| Agents’ Last Exam | 59.3% | 53.6% | 55.5%(Opus 5) |
| BenchCAD | 95.9% | 83.3% | 84.3%(Fable 5.1,經修改) |
| 內部 Design Tasks | 50.0% | 47.4% | 35.8%(Fable 5) |
| MRCR v2,512K 至 1M | 96.3% | 73.8% | 未顯示 |
獨立指數說的是另一個故事
Artificial Analysis Intelligence Index v4.1.1 出現在 OpenAI 自己的表格中:Astra 61.2、Sol 60.9、Claude Fable 5.1 65.7、Claude Opus 5 63.1、Gemini 3.8 Flash 58.7。Artificial Analysis 9 月 3 日的文章描述 Astra 在智慧程度上與 Sol 持平,輸出 token 少了約 10%,價格則高出 2.5 倍。
該指數是十項評測的加權平均,涵蓋智慧體、程式設計、科學推理和一般類別,其中智慧體與一般工作各占 30% 的權重。目前版本列出 AA-Briefcase、GDPval-AA v2、Terminal-Bench、SciCode、Humanity’s Last Exam 等。沒有一項是視覺或品牌評測,所以在這個指數上領先,是推理廣度的領先,不是設計的領先。
長上下文:讀完整本品牌手冊
OpenAI MRCR v2 要求模型在一份長文件中找出八根針。Astra 在 256K 至 512K token 回報為 100.0%,在 512K 至 1M 為 96.3%,Sol 則分別為 91.5% 與 73.8%。對創作團隊來說,實際的意義是大型參考資料包,例如品牌手冊加上過去的宣傳活動,更有可能被準確使用。
檢索品質只是一半。輸入超過 272,000 token 的 Astra 請求按長上下文級距計費,輸入費率翻倍。高 MRCR 分數讓一百萬 token 的請求變得可行;價格頁面則決定它對日常任務是否合理。
委派任務時要看的對齊列
OpenAI 回報一項內部電腦操作安全基準,數值越低越好:Astra 2.4%、Sol 22.0%、Fable 5.1 9.5%。它也回報一項內部幻覺基準,Astra 為 4.2%,Sol 為 12.2%,並表示 Astra 誤述自身能力的可能性比 Sol 低三倍。
如果你打算讓模型代替你操作設計軟體或瀏覽器,這些列描述的是發生非預期動作的風險。它們是內部且由廠商自行回報的,所以只能支持在開啟審批的情況下謹慎試用,而不是在客戶帳號上無人看管地使用。
基準測試沒有涵蓋的部分
沒有公開的圖片生成分數,因為 Astra 不直接產生圖片;渲染器是 GPT Image 2,另行評測。沒有排版、可讀性、色彩或品牌一致性的評測。沒有衡量人在模型初稿之後還需要多少編輯的指標。
文章中的費用宣稱是 OpenAI 條件下的估算,例如 Terminal-Bench Science 的結果估計 API 費用比 Fable 5.1 低約 31%。token 效率的引述,包括某客戶回報在創作流程上最多減少 20% 的 token,描述的是別人的管線。你自己的記錄才是唯一適用於你產品的費用基準。
把表格變成測試計畫
用這些列決定要試什麼,而不是要買什麼。電腦操作結果建議在你實際使用的軟體中測試一項重複性的編輯任務。BenchCAD 和 Blender 示範建議測試一個腳本化的 3D 場景。MRCR 建議測試完整品牌手冊是否能提高文案規則的遵守程度。每項測試都應在執行前寫好通過條件。
在你目前使用的模型上執行相同任務。固定推理程度、參考資料和渲染器,並記錄時間、費用和糾正次數。當內部設計列說 50.0% 時,有用的回應是在十份真實需求上衡量你自己的通過率,那才是你能為之辯護的數字。
數字的簡短閱讀清單
讀發布文章,取得完整表格以及關於推理程度、修改和 Mythos 的附註。讀 Artificial Analysis 的方法說明,了解哪些評測構成指數以及如何加權。讀模型頁面,取得長上下文列背後的規格。然後把你自己標好日期的結果放在旁邊一起讀。
對圖片工作而言,決定仍然務實。Astra 可以規劃和指揮;GPT Image 2 渲染;審核者核准。在 Ciyo 中你可以直接測試後兩步,每次生成的價格在執行前顯示,並比較任何你選擇的策劃模型所產生的輸出。
繼續閱讀
關於 Astra 基準測試的常見問題
GPT-6 Astra 在每項基準測試上都是最好的模型嗎?
不是。在 OpenAI 自己的表格中,Claude Fable 5.1 在使用工具的 Humanity’s Last Exam 和 Artificial Analysis Intelligence Index 上領先,Claude Opus 5 在 Coding Agent Index 上領先。Astra 在顯示的電腦操作、CAD、科學和長上下文列上領先。
這些基準測試有衡量圖片品質的嗎?
沒有。Astra 回傳文字,並呼叫圖片工具產生圖片。渲染器 GPT Image 2 是獨立模型,也沒有任何公開的列在評分排版、版面或品牌一致性。
「任一推理程度下的最高分」對我的費用意味著什麼?
分數可能來自最高的推理設定,其中隱藏的推理 token 按輸出計費。你的日常設定可能得分較低、費用也較低,所以請在你實際會用的推理程度上測試。
衡量基準測試跳過的那一步
在 Ciyo 中用 GPT Image 2 生成同一份需求,保留你會發布的輸出,並把你自己的通過率記錄在廠商表格旁邊。