Ciyo · GPT-6
デザイナー向けGPT-6 Astraベンチマーク解説

OpenAIのGPT-6 Astra公開記事は、コンピューター操作、専門業務、コーディング、科学、サイバーセキュリティ、アライメント、長いコンテキストにわたる数十のベンチマークスコアを公開しています。大半はOpenAIが測定したものです。いくつかは独立した指標に由来します。デザイナーが最も気にすること、つまり最終的な画像がよいかどうかを測るものは、ほとんどありません。
本記事は、2026年9月7日に確認した公開記事とArtificial Analysisの手法を使い、その表を制作チームの視点で読みます。関係する各評価がモデルに何を求めるか、どの行がAstraに有利でどの行がClaudeに有利か、そして数値をあなたの仕事への評決と取り違えずに使う方法を説明します。
数値を読む前に表の読み方を知る
公開記事は、評価スコアが推論量の各設定での最大値だと明記しています。したがって72.6%という値は、日常の指示で使う設定ではなく、最も費用のかかる設定から出た可能性があります。脚注も重要です。ClaudeのBenchCADスコアはAnthropicのシステムカードに記載された三つの変更を反映し、Claudeの二つの行は安全対策の少ないFableのバージョンであるMythosに由来します。
Design Tasks、Data Science Tasks、Database Migration Tasksなど、いくつかの行は社内評価と表示されています。内容は非公開で、再現できません。独立した証拠ではなく、OpenAIによる自社の優先順位の説明として扱います。以下の内容は、特に断りがない限りすべて提供元の報告です。
コンピューター操作: すでに持っているソフトを動かす
OSWorld 2.0は、実際のデスクトップソフト内でタスクを完了するようエージェントに求めます。OpenAIはAstraが72.6%、GPT-5.6 Solが65.7%、Claude Opus 5が70.2%と報告し、遅延シミュレーションではAstraがタスク当たり約40分、Solが約75分で完了したと付け加えています。ツールなしで業務用アプリケーションの画面要素を探すScreenSpot-Proは、Astraが92.7%、Solが76.9%と報告されています。
Agents’ Last Examは、メディア制作を含む実際のソフトでの専門業務を対象とし、Astraが59.3%、Opus 5が55.5%、Solが53.6%と報告されています。デザイナーにとってこれらの行は、エディター、ブラウザー、3Dツールをその画面から操作する能力を示します。そこで作られるものの趣味のよさは示しません。
創作に関係する専門業務の行
BenchCADは、複数視点のレンダリングからCADコードを書いて3Dオブジェクトを再構築できるかを試します。Astraはツールありで95.9%、Solは83.3%、Fable 5.1は脚注付きの条件で84.3%と報告されています。OpenScore String Quartetsは画像から楽譜を読む評価で、1マイナスOMR-NEDの指標でAstraが0.84、Solが0.19です。構造化された視覚情報の読み取りで大きく伸びています。
社内のDesign Tasksの行は、Astraが50.0%、Solが47.4%、Claude Fable 5が35.8%で、Fable 5.1の数値はありません。OpenAIが専門業務に分類するAutomationBenchは、Astraが41.4%、Fable 5.1が31.4%です。これらはデザインの仕事に最も近い公開行ですが、デザインの行はまさに中身を確認できない行でもあります。
| 評価 | GPT-6 Astra | GPT-5.6 Sol | 表示された最高のClaude |
|---|---|---|---|
| OSWorld 2.0 | 72.6% | 65.7% | 70.2%(Opus 5) |
| ScreenSpot-Pro、ツールなし | 92.7% | 76.9% | 87.3%(Fable 5、Mythos) |
| Agents’ Last Exam | 59.3% | 53.6% | 55.5%(Opus 5) |
| BenchCAD | 95.9% | 83.3% | 84.3%(Fable 5.1、変更あり) |
| 社内Design Tasks | 50.0% | 47.4% | 35.8%(Fable 5) |
| MRCR v2、512Kから1M | 96.3% | 73.8% | 表示なし |
独立した指標は別の物語を語る
Artificial Analysis Intelligence Index v4.1.1はOpenAI自身の表にも載っています。Astraが61.2、Solが60.9、Claude Fable 5.1が65.7、Claude Opus 5が63.1、Gemini 3.8 Flashが58.7です。Artificial Analysisの9月3日の記事は、Astraが知性ではSolと同等で、出力トークンを約10%少なく使い、価格は2.5倍だと説明しています。
この指標は、エージェント、コーディング、科学的推論、一般の各カテゴリーにわたる十の評価の加重平均で、エージェントと一般の作業がそれぞれ30%の重みです。現行版にはAA-Briefcase、GDPval-AA v2、Terminal-Bench、SciCode、Humanity’s Last Examなどが含まれます。視覚やブランドの評価はないため、この指標での優位は推論の幅の優位であり、デザインの優位ではありません。
長いコンテキスト: ブランドブック全体を読む
OpenAI MRCR v2は、長い文書から八つの針を見つけるようモデルに求めます。Astraは256Kから512Kトークンで100.0%、512Kから1Mで96.3%と報告され、Solは91.5%と73.8%です。制作チームにとっての実用的な読み方は、ブランドブックと過去のキャンペーンのような大きな参考資料一式が、より正確に使われやすいということです。
取り出しの品質は話の半分にすぎません。入力272,000トークンを超えるAstraのリクエストは長いコンテキストの価格帯で課金され、入力単価が2倍になります。高いMRCRスコアは100万トークンのリクエストを可能にしますが、日常の仕事で妥当かどうかは料金ページが決めます。
任せるときに重要なアライメントの行
OpenAIは、低いほどよい社内のコンピューター操作安全性ベンチマークを報告しています。Astraが2.4%、Solが22.0%、Fable 5.1が9.5%です。社内のハルシネーションベンチマークもAstraが4.2%、Solが12.2%と報告し、Astraが自身の能力を偽って伝える可能性はSolの3分の1だとしています。
モデルにデザインソフトやブラウザーを代わりに操作させる予定なら、これらの行は意図しない操作のリスクを表します。社内かつ提供元の報告なので、承認を有効にした慎重な試行を正当化するものであり、顧客のアカウントでの無人利用を正当化するものではありません。
ベンチマークが扱わないこと
画像生成の公開スコアはありません。Astraは画像を直接生成せず、描画モデルはGPT Image 2で別に評価されるためです。タイポグラフィ、可読性、色、ブランドの一貫性の評価もありません。モデルの初稿の後に人がどれだけ編集を必要とするかの尺度もありません。
記事の費用に関する主張は、Fable 5.1より推定API費用が約31%低いTerminal-Bench Scienceの結果のように、OpenAIの条件での推定です。創作の作業で最大20%少ないトークンという顧客の報告を含むトークン効率の引用は、他者のパイプラインを説明しています。あなたの製品に当てはまる唯一の費用ベンチマークは、自分のログです。
表をテスト計画に変える
行は、何を買うかではなく何を試すかを決めるために使います。コンピューター操作の結果は、実際のソフトでの反復的な編集作業のテストを示唆します。BenchCADとBlenderのデモは、スクリプトで作る3Dシーンのテストを示唆します。MRCRは、ブランドブック全体が文章ルールの順守を改善するかのテストを示唆します。各テストには、実行前に書いた合格条件が必要です。
同じタスクを、今使っているモデルでも実行します。推論量、参考資料、描画モデルを固定し、時間、費用、訂正を記録します。社内のデザインの行が50.0%と言うとき、有用な対応は、実際の十件の指示で自分の承認率を測ることです。それは自分で説明できる数値になります。
数値のための短い読書リスト
完全な表と、推論量、変更、Mythosに関する脚注は公開記事で読みます。指標を構成する評価と重み付けはArtificial Analysisの手法で読みます。長いコンテキストの行の背後にある仕様はモデルページで読みます。そして、日付を付けた自分の結果をその横で読みます。
画像の仕事では判断は実務的なままです。Astraが計画して指示し、GPT Image 2が描画し、レビュー担当者が承認します。Ciyoでは後の二つの工程を直接試せます。各生成の価格は実行前に表示され、選んだどの企画モデルの出力とも比較できます。
あわせて読む
Astraのベンチマークに関する疑問
GPT-6 Astraはすべてのベンチマークで最高のモデルですか?
いいえ。OpenAI自身の表では、ツールありのHumanity’s Last ExamとArtificial Analysis Intelligence IndexでClaude Fable 5.1が、Coding Agent IndexでClaude Opus 5が上回ります。Astraは表示されたコンピューター操作、CAD、科学、長いコンテキストの行で上回ります。
これらのベンチマークのどれかは画質を測っていますか?
いいえ。Astraはテキストを返し、画像には画像ツールを呼び出します。描画モデルのGPT Image 2は別のモデルで、タイポグラフィ、レイアウト、ブランドの一貫性を採点する公開行はありません。
「推論量の各設定での最大値」は費用にとって何を意味しますか?
スコアは最も高い推論設定から出た可能性があり、そこでは非表示の推論トークンが出力として課金されます。日常の設定ではスコアが低く費用も安い場合があるため、実際に使う推論量で試してください。
ベンチマークが飛ばす工程を測る
同じ指示をCiyoのGPT Image 2で生成し、公開できる出力を残し、提供元の表の横に自分の承認率を記録できます。