Ciyo · GPT-6

شرح اختبارات أداء GPT-6 Astra للمصممين

مسطرة نحاسية وأثقال زجاجية كهرمانية مدرّجة وصف من البلاطات الخزفية المتزايدة الارتفاع، موضوعة على سطح عاجي دافئ بما يشبه مخطط أعمدة.
رسم توضيحي أُعدّ خصيصًا لهذا الدليل.

ينشر منشور إطلاق GPT-6 Astra من OpenAI عشرات النتائج لاختبارات تشمل استخدام الحاسوب والعمل المهني والبرمجة والعلوم والأمن السيبراني والمواءمة والسياق الطويل. أعدّت OpenAI معظمها، بينما يأتي عدد قليل من مؤشر مستقل. ولا يقيس أي منها تقريبًا ما يهم المصمم أكثر من غيره: هل الصورة النهائية جيدة؟

يقرأ هذا المقال الجدول من منظور فريق إبداعي، بالاستناد إلى منشور الإطلاق ومنهجية Artificial Analysis كما جرت مراجعتهما في 7 سبتمبر 2026. ويشرح المهمة التي يطلبها كل تقييم ذي صلة من النموذج، والنتائج التي ترجّح Astra وتلك التي ترجّح Claude، وكيفية الاستفادة من الأرقام دون اعتبارها حكمًا على جودة عملك.

كيف تقرأ الجدول قبل النظر إلى أي رقم

يذكر منشور الإطلاق أن درجات التقييم تمثل أعلى نتيجة عند أي مستوى جهد. لذلك قد تكون نتيجة 72.6% صادرة عن أغلى إعداد، لا عن الإعداد الذي ستستخدمه لموجز يومي. والحواشي مهمة أيضًا: تعكس نتائج Claude في BenchCAD ثلاثة تعديلات موضحة في بطاقة نظام Anthropic، ويأتي صفّان لنتائج Claude من Mythos، وهو إصدار Fable ذو ضوابط حماية أقل.

تحمل عدة صفوف وصف «داخلي»، منها Design Tasks وData Science Tasks وDatabase Migration Tasks. محتوياتها غير منشورة، لذلك لا يمكن إعادة إنتاجها. تعامل معها باعتبارها وصف OpenAI لأولوياتها، لا دليلًا مستقلًا. وكل النتائج أدناه منقولة عن المزوّد ما لم يُذكر خلاف ذلك.

استخدام الحاسوب: تشغيل البرامج التي تملكها بالفعل

يطلب OSWorld 2.0 من الوكيل إكمال مهام داخل برامج حقيقية لسطح المكتب. تعلن OpenAI نتيجة 72.6% ل Astra، و65.7% ل GPT-5.6 Sol، و70.2% ل Claude Opus 5، وتضيف أن Astra أنهى المهمة في محاكاة زمن الاستجابة خلال نحو 40 دقيقة، مقابل نحو 75 دقيقة ل Sol. أما ScreenSpot-Pro، الذي يختبر تحديد مواقع عناصر الواجهة في التطبيقات المهنية دون أدوات، فتبلغ نتيجته المعلنة 92.7% ل Astra و76.9% ل Sol.

يغطي AgentsLast Exam مهام مهنية داخل برامج فعلية، منها إنتاج الوسائط، وتبلغ نتيجته المعلنة 59.3% ل Astra و55.5% ل Opus 5 و53.6% ل Sol. بالنسبة للمصمم، تصف هذه الصفوف القدرة على تشغيل محرر أو متصفح أو أداة ثلاثية الأبعاد عبر واجهتها. لكنها لا تصف الذائقة الفنية لما يُنتج داخلها.

نتائج العمل المهني ذات الصلة بالإبداع

يختبر BenchCAD قدرة النموذج على إعادة بناء أجسام ثلاثية الأبعاد من صور مصيّرة من زوايا متعددة، عبر كتابة شفرة CAD. تبلغ النتيجة المعلنة ل Astra مع الأدوات 95.9%، مقابل 83.3% ل Sol و84.3% ل Fable 5.1 وفق الشروط المبينة في الحاشية. ويقيس OpenScore String Quartets قراءة التدوين الموسيقي من الصور؛ حيث يحقق Astra قيمة 0.84 على مقياس 1 ناقص OMR-NED مقابل 0.19 ل Sol، وهي قفزة كبيرة في قراءة المحتوى المرئي المنظّم.

يعرض صف Design Tasks الداخلي نتيجة 50.0% ل Astra و47.4% ل Sol و35.8% ل Claude Fable 5، دون رقم ل Fable 5.1. ويعرض AutomationBench، الذي تصنّفه OpenAI ضمن العمل المهني، نتيجة 41.4% ل Astra و31.4% ل Fable 5.1. هذه أقرب النتائج المنشورة إلى عمل التصميم، لكن صف التصميم نفسه هو أيضًا الصف الذي لا يمكنك فحصه.

نتائج من منشور الإطلاق تفيد المصممين، منقولة عن المزوّد بتاريخ 7 سبتمبر 2026
التقييمGPT-6 AstraGPT-5.6 Solأفضل نتيجة Claude معروضة
OSWorld 2.072.6%65.7%70.2% (Opus 5)
ScreenSpot-Pro دون أدوات92.7%76.9%87.3% (Fable 5, Mythos)
AgentsLast Exam59.3%53.6%55.5% (Opus 5)
BenchCAD95.9%83.3%84.3% (Fable 5.1، مع تعديلات)
مهام التصميم الداخلية50.0%47.4%35.8% (Fable 5)
MRCR v2، من 512 ألفًا إلى مليون رمز96.3%73.8%غير معروض
أعمدة مزدوجة تعرض أربع نتائج معلنة من المزوّد ل Astra وGPT-5.6 Sol: ‏OSWorld 2.0 بقيمتي 72.6 و65.7، ومهام التصميم الداخلية بقيمتي 50.0 و47.4، وBenchCAD بقيمتي 95.9 و83.3، وMRCR من 512 ألفًا إلى مليون رمز بقيمتي 96.3 و73.8.
رُسمت الأعمدة وفق القيم المعلنة. كل رقم منشور من المزوّد ويمثل أعلى نتيجة عبر مستويات الجهد.

المؤشر المستقل يقدم صورة مختلفة

يظهر Artificial Analysis Intelligence Index v4.1.1 في جدول OpenAI نفسه: 61.2 ل Astra، و60.9 ل Sol، و65.7 ل Claude Fable 5.1، و63.1 ل Claude Opus 5، و58.7 ل Gemini 3.8 Flash. ويصف مقال Artificial Analysis المنشور في 3 سبتمبر Astra بأنه يعادل Sol في الذكاء مع استخدام رموز إخراج أقل بنحو 10%، وبسعر أعلى بمقدار 2.5 مرة.

المؤشر متوسط موزون لعشرة تقييمات تغطي الوكلاء والبرمجة والاستدلال العلمي والفئات العامة، مع وزن 30% لكل من الوكلاء والعمل العام. ويشمل إصداره الحالي AA-Briefcase وGDPval-AA v2 وTerminal-Bench وSciCode وHumanitys Last Exam وغيرها. لا يمثل أي منها تقييمًا بصريًا أو للهوية التجارية، لذا فإن التقدم في المؤشر يعكس اتساع قدرات الاستدلال، لا جودة التصميم.

السياق الطويل: قراءة دليل الهوية التجارية كاملًا

يطلب OpenAI MRCR v2 من النموذج العثور على ثماني معلومات مستهدفة وسط وثيقة طويلة. تبلغ نتيجة Astra المعلنة 100.0% في نطاق 256 ألفًا إلى 512 ألف رمز، و96.3% في نطاق 512 ألفًا إلى مليون، مقابل 91.5% و73.8% ل Sol. وتعني هذه النتائج عمليًا للفريق الإبداعي أن حزمة مراجع كبيرة، مثل دليل الهوية التجارية مع الحملات السابقة، يُرجّح استخدامها بدقة أكبر.

جودة الاسترجاع نصف الصورة فقط. فعندما تتجاوز المدخلات 272,000 رمز، يُفوتر طلب Astra وفق شريحة السياق الطويل التي تضاعف سعر الإدخال. تجعل نتيجة MRCR المرتفعة الطلب ذي المليون رمز ممكنًا؛ وتحدد صفحة الأسعار ما إذا كان مناسبًا اقتصاديًا لمهمة روتينية.

نتائج المواءمة المهمة عند تفويض المهام

تنشر OpenAI اختبارًا داخليًا لسلامة استخدام الحاسوب تكون فيه النتيجة الأقل أفضل: 2.4% ل Astra، و22.0% ل Sol، و9.5% ل Fable 5.1. وتنشر أيضًا اختبارًا داخليًا للهلوسة بنتيجة 4.2% ل Astra مقابل 12.2% ل Sol، وتقول إن احتمال تقديم Astra وصفًا غير صحيح لقدراته أقل بثلاث مرات من Sol.

إذا كنت تنوي السماح لنموذج بتشغيل برامج تصميم أو متصفح نيابة عنك، فتصف هذه الصفوف خطر الإجراءات غير المقصودة. وهي اختبارات داخلية معلنة من المزوّد، لذا تسوّغ تجربة حذرة مع تفعيل الموافقات، ولا تسوّغ استخدامًا دون إشراف على حساب عميل.

ما الذي لا تغطيه الاختبارات

لا توجد نتيجة منشورة لتوليد الصور، لأن Astra لا ينتج الصور مباشرة؛ فأداة التصيير هي GPT Image 2، ويجري تقييمها منفصلة. ولا يوجد تقييم للطباعة أو وضوح القراءة أو الألوان أو اتساق الهوية التجارية. كما لا يوجد قياس لمقدار التحرير البشري المطلوب بعد المسودة الأولى للنموذج.

الادعاءات المتعلقة بالتكلفة في المنشور تقديرات وفق شروط OpenAI، مثل نتيجة Terminal-Bench Science بتكلفة API تقديرية أقل بنحو 31% من Fable 5.1. أما الاقتباسات حول كفاءة الرموز، ومنها تقرير عميل عن استخدام رموز أقل بما يصل إلى 20% في مسارات عمل إبداعية، فتصف أنظمة عمل الآخرين. سجلاتك الخاصة هي معيار التكلفة الوحيد الذي ينطبق على منتجك.

حوّل الجدول إلى خطة اختبار

استخدم النتائج لتحديد ما ستجرّبه، لا ما ستشتريه. تشير نتائج استخدام الحاسوب إلى تجربة مهمة تحرير متكررة داخل برنامجك الفعلي. ويقترح BenchCAD وعروض Blender تجربة مشهد ثلاثي الأبعاد يُنشأ بالشفرة. وتشير نتائج MRCR إلى اختبار ما إذا كان دليل الهوية كاملًا يحسّن الالتزام بقواعد النصوص. ينبغي كتابة شرط نجاح كل اختبار قبل تشغيله.

شغّل المهام نفسها على النموذج الذي تستخدمه حاليًا. ثبّت مستوى الجهد والمراجع وأداة التصيير، وسجّل الوقت والتكلفة والتصحيحات. وعندما يعرض صف التصميم الداخلي 50.0%، فالاستجابة المفيدة هي قياس معدل اعتمادك أنت لعشرة موجزات حقيقية، لتحصل على رقم تستطيع الدفاع عنه.

قائمة قراءة مختصرة لفهم الأرقام

اقرأ منشور الإطلاق للاطلاع على الجدول كاملًا وحواشي الجهد والتعديلات وMythos. واقرأ منهجية Artificial Analysis لتعرف التقييمات التي يتألف منها المؤشر وأوزانها. واقرأ صفحة النموذج لمعرفة المواصفات وراء نتائج السياق الطويل. ثم ضع نتائجك المؤرخة إلى جانبها واقرأها معًا.

يبقى قرار العمل على الصور عمليًا. يستطيع Astra التخطيط والتوجيه؛ ويتولى GPT Image 2 التصيير؛ ويعتمد المراجع النتيجة. في Ciyo يمكنك اختبار الخطوتين الأخيرتين مباشرة، مع عرض سعر كل عملية توليد قبل تشغيلها، ومقارنة المخرجات الناتجة عن أي أداة تخطيط تختارها.

تابع القراءة

أسئلة حول اختبارات أداء Astra

هل GPT-6 Astra أفضل نموذج في جميع الاختبارات؟

لا. في جدول OpenAI نفسه، يتقدم Claude Fable 5.1 في Humanitys Last Exam مع الأدوات وفي Artificial Analysis Intelligence Index، ويتقدم Claude Opus 5 في Coding Agent Index. ويتصدر Astra نتائج استخدام الحاسوب وCAD والعلوم والسياق الطويل المعروضة.

هل يقيس أي من هذه الاختبارات جودة الصور؟

لا. يعيد Astra نصًا ويستدعي أداة صور لإنتاج الصور. أما GPT Image 2، الذي يتولى التصيير، فهو نموذج منفصل، ولا يقيّم أي صف منشور الطباعة أو التخطيط أو اتساق الهوية التجارية.

ما أثر «أعلى نتيجة عند أي مستوى جهد» على تكلفتي؟

قد تأتي النتائج من أعلى إعداد للاستدلال، حيث تُفوتر رموز الاستدلال المخفية كإخراج. وقد يحقق إعدادك اليومي نتيجة أقل بتكلفة أقل، لذا اختبر عند مستوى الجهد الذي ستستخدمه فعلًا.

قِس الخطوة التي تغفل عنها الاختبارات

ولّد صورًا للموجز نفسه باستخدام GPT Image 2 في Ciyo، واحتفظ بالمخرجات التي تصلح للنشر، وسجّل معدل اعتمادك الخاص إلى جانب جدول المزوّد.