نماذج · System One
تحكيم أربع نسخ، والفجوة التي يملؤها نموذج القرار

توليد الخيارات هو النصف السهل. أما الاختيار بينها فهو النصف الذي يبتلع بعد ظهيرة كاملة، وهو النصف الذي يتركه معظم الأدوات الإبداعية لك.
لذلك شغّلنا جولة المراجعة كما ينبغي: أربع منشورات ترويجية مربعة لنادٍ خيالي على الميناء، وأربعة معايير مكتوبة، ونموذج طُلب منه تقييم كل منشور على كل معيار. كانت النتيجة مفيدة، وكشفت أيضاً بالضبط نقطة الضعف التي صُمّم نموذج قرار مُنمّط مثل Jev لإزالتها. لا تستطيع Ciyo تشغيل Jev — فهو لا ينتج صورة ولا فيديو، ولا يرد في أي من سجليّ نماذجنا — لذا يوضح هذا المقال ما الذي يعمل اليوم ويعلم الحدود حيث يذهب شيء آخر.
أربع نسخ، عرض واحد
كانت المهمة ترويجاً لمشروب في عطلة نهاية الأسبوع لـ Pier Six Coffee، وهو مقهى مخترع على الميناء: مشروب Salted Maple Cold Brew بسعر 4.50، في السبت والأحد فقط، وموجّه لمن يتمشون على الميناء. شغّلناه في Ciyo في 21 سبتمبر 2026. عاد منشور واحد من المهمة الأصلية؛ ووُلّد ثلاثة منشورات أخرى كبدائل متعمدة — لقطة قريبة للكأس، وكوبٌ يُمسك عند درابزين الميناء، ولقطة مسطّحة على المنضدة.
أربعة مرشحين هو العدد الواقعي. يكفي أنك لا تستطيع حفظها كلها في رأسك، وقليل بما يكفي لكي ينظر الشخص فعلاً إلى كل واحد منها.

اكتب المعايير قبل أن تنظر
الانضباط الذي يجعل جولة مراجعة تستحق التشغيل هو تدوين ما تحكم عليه قبل رؤية المرشحين. وإلا فإنك تبرّر المنشور الذي أعجبك مسبقاً.
أربعة معايير، كل منها سؤال له إجابة: هل يلفت المشروب الانتباه أولاً؛ هل السعر مقروء بحجم الصورة المصغّرة؛ هل مساحة العنوان المحجوزة واضحة فعلاً؛ هل يبدو كمشهد ميناء في عطلة نهاية الأسبوع. كل واحد منها قابل للتحقق من قبل شخص لم يرَ العلامة قط.
اقرأ المنشورات الـ4 على اللوحة. ضع لكل منها درجة من 1 إلى 5 على 4 معايير منفصلة، متسائلاً عن كل واحد على حدة: (1) هل المشروب هو أول ما تقع عليه العين، (2) هل سعر 4.50 مقروء بحجم الصورة المصغّرة، (3) هل مساحة العنوان العلوي واضحة فعلاً، (4) هل يبدو كمشهد ميناء في عطلة نهاية الأسبوع. أعطني جدولاً فيه صف لكل منشور وعمود لكل معيار، ثم سمّ المنشور الذي ستنشره والسبب الوحيد لذلك.ما الذي عاد
نجح الأمر. قرأ النموذج الجميع الأربعة بحجم الصورة المصغّرة، وأنتج جدولاً مكوّناً من أربعة في أربعة مع تبرير قصير في كل خلية، وسمّى فائزاً: الكوب الممسوك عند درابزين الميناء، «لأنه يعكس بشكل مباشر أكثر مشي الجمهور في ميناء عطلة نهاية الأسبوع». تلك إجابة قابلة للدفاع، توصّلنا إليها مقابل معايير دوّناها أولاً.
كما التقطت الإخفاق الحقيقي الوحيد. سجّلت اللقطة المسطّحة على المنضدة 1 على «يُقرأ كمشهد ميناء في عطلة نهاية الأسبوع»، مع ملاحظة أنه لا توجد إشارات ميناء مرئية وأن عطلة نهاية الأسبوع نُقلت عبر النص فقط. هذا تماماً نوع الشيء الذي يفوته الشخص في الرابعة عصراً على النسخة الرابعة.

الرقم الذي يفضح نقطة الضعف
ست عشرة خلية. عاد خمسة عشر منها بدرجة 4 أو 5. كانت الدرجة المميّزة الوحيدة في الجدول كله هي ذلك 1.
إذن الجدول كاشف أعطال جيد ورتّاب ضعيف. سيخبرك بثبات أي نسخة معطوبة. ولن يخبرك بثبات أي النسخ الناجية الثلاث أفضل، لأنه على مقياس من واحد إلى خمسة لا يستخدم الوسط.
ليست علة في هذا النموذج أو هذه التعليمة. إنها ما يحدث عندما يجب التعبير عن حكم في جملة تحتوي على رقم.
| السؤال | أُجيب عنه جيداً | السبب |
|---|---|---|
| هل أي نسخة معطوبة؟ | نعم | سجّلت اللقطة المسطّحة 1 على مشهد الميناء، مع سبب محدّد |
| أيّ النسخ الجيدة أفضل؟ | لا | خمسة عشر من ست عشرة خلية كانت 4 أو 5؛ والمقياس لم يفصل بينها |
| هل سيسجّل نفس الدرجة غداً؟ | غير معروف | شغّلناه مرة واحدة؛ والقابلية للتكرار هي تماماً ما يكون مُسجّل النثر أضعف فيه. |
| هل يجب أن ينظر إنسان بعد؟ | نعم | لا شيء هنا يقرّر نبرة علامة تجارية، والفائز اختير لسبب واحد |
أين يتموضع نموذج System One
هذه هي التفصيل. نموذج قرار مُنمّط لا يكتب جملة تحتوي على درجة؛ بل يُعيد قيمة من نوع أعلنته أنت، مع احتمالات ورقم ثقة، ويعيد نفس القيمة عند السؤال مجدداً.
بالنسبة لهذه المهمة تحديداً، سيعني ذلك أربعة أسئلة Score مع سلّم تقييم صريح — لا «1 إلى 5» بل أربعة مستويات مسمّاة بتعريفات مكتوبة — تُقيَّم مقابل كل منشور، بالإضافة إلى Choice للمكالمة الإجمالية مع خيار `needs_a_human` صريح. ستعيش قاعدة الدمج في كودك أنت، حيث يمكنك ترجيح القابلية للقراءة فوق الأجواء لوضع مدفوع والعكس لمنشور عضوي.
ما ستكسبه ليس ذوقاً أفضل. إنه درجة تعني الشيء نفسه في كل تشغيل، وقيمة ثقة تقرّر متى يجب أن ينظر إنسان، وقاعدة يمكنك قراءتها وتغييرها دون إعادة كتابة تعليمة.
ما ستخسره هي الأسباب. الخلية التي أخبرتنا أن اللقطة المسطّحة لا تحمل إشارات ميناء هي نثر، ونموذج قرار لا ينتج نثراً. في الممارسة، التصميم المثير للاهتمام هو كلاهما: درجة مُنمّطة للترتيب وللتوجيه، ونموذج لغة للجملة التي تشرحه.
ما الذي لا يستطيع Jev فعله هنا، بوضوح
لا يستطيع النظر إلى المنشورات. تنص وثائق TypeSafe نفسها على أن state يجب أن يكون نصاً، أو كائن JSON، أو مصفوفة من قيم نصية، وأن الصور والصوت والفيديو غير مدعومة بعد. وجولة مراجعة بصرية خارج ما يقبله النموذج اليوم.
كما أنه لا يستطيع صنع النسخ. لا يولّد صورة ولا فيديو، ولهذا لا يرد في أي من سجليّ نماذج Ciyo، ولفتة ذلك لا تستطيع Ciyo تقديمه.
إذن النسخة الصادقة من فكرة هذا المقال هي نصّية الشكل: نموذج قرار يمكنه أن يحكم المهمة، والتعليق، والنص البديل، والبيانات الوصفية للحملة، والوصف المهيكل لعرض — أي الأجزاء من العمل الإبداعي التي هي أصلاً كلمات. الصورة ما زالت تحتاج عينين، واليوم هاتان العينان لك أو لنموذج رؤية.
شغّل جولة المراجعة على أي حال. تدوين المعايير قبل أن تنظر هو معظم القيمة، وهي تعمل مع أي نموذج لديك.
أسئلة جولة المراجعة
هل يمكن لـ Jev تقييم نسخ إعلانيّاتي؟
ليست الصور. حالته الموثّقة نصّية فقط — نص، أو كائن JSON، أو مصفوفة من قيم نصية — لذا فالصور خارج ما يقبله اليوم. يمكنه تقييم المهمة أو التعليق أو وصف مهيكل.
لماذا عادت تقريباً كل الدرجات 4 أو 5؟
لأن نموذج نثر يعبّر عن حكم كرقم مكتوب يضغط المقياس نحو الأعلى. والسبب المكتوب في كل خلية حمل معلومات أكثر من الأرقام.
هل جولة المراجعة تستحق التشغيل على أي حال؟
نعم. التقطت إخفاقاً حقيقياً في نفس بعد الظهيرة الذي وُجدت فيه، وتدوين المعايير قبل النظر هو معظم الفائدة بغض النظر عن النموذج الذي يقيّمها.
هل تشغّل Ciyo نموذج Jev؟
لا. لا يولّد صورة ولا فيديو، ولا يرد في أي من سجليّ نماذج Ciyo. التقييم في هذا المقال قام به GPT-6 Astra، الذي تستطيع Ciyo تشغيله.
نفّذ جولة المراجعة الخاصة بك
ولّد أربع نسخ، اكتب أربعة معايير قبل أن تنظر إليها، واجعل الوكيل يقيّم كل نسخة على كل واحد.