نماذج · System One
هل يمكنك التوجيه بناءً على درجة ثقة Jev؟

نموذج قرار يُرجع إجابة مفيد. نموذج قرار يُرجع إجابة زائدًا رقمًا موثوقًا يصف مدى تأكده يمكن توصيله بنظام يعرف متى يتوقف ويسأل شخصًا.
تلك هي كل وعود قيمة ثقة معايرة، وهي أيضًا الادعاء الأكثر جدارة بالفحص، لأن رقم ثقة لا يتبع الواقع أسوأ من عدم وجود رقم على الإطلاق: إنه يخبر شفرتك بالمضي. نشر تقييمان مستقلان بياناتهما في أسبوع 17 سبتمبر 2026، وبينهما يجيبان عن السؤال أفضل مما تفعل أي صفحة خاصة بجهة مورّدة. Ciyo لا يُشغّل Jev؛ هذه قراءة في أدلة منشورة.
الثقة ليست هي الاحتمال
تعُود إجابة Choice برقمين مختلفين، والخلط بينهما هو الخطأ الأول. الاحتمالات تصف التوزيع عبر خياراتك المعلنة: كيف انتشر اعتقاد النموذج. قيمة الثقة هي مقدار منفصل يصف مدى تأكد النموذج من الإجابة برمتها.
تؤطّر وثائق TypeSafe نفسها الأمر كمحور ثانٍ: الإجابة تخبرك بماذا، والثقة تخبرك بما إذا كنت تتصرف. هذا التأطير هو سبب استحقاقه مقالًا كاملًا. يمكنك بناء نظام يكون فيه الاختيار للإجابة والثقة لما إذا يرى إنسان ذلك أولًا.
النمط الموثّق يربط العتبة بحجم الضرر عند الخطأ
تنشر TypeSafe نمط توجيه بالثقة، والشيء المفيد فيه أنه لا يعطي رقمًا واحدًا. إنه يعطي سلّمًا مربوطًا بمدى سوء الخطأ.
تحت 0.6، سلّم الحالة إلى شخص. فوق 0.6، تصرف — لكن فقط إن كان الفعل رخيصًا. لفعل باهظ أو لا رجعة فيه، اطلب من المستخدم التأكيد بين 0.6 و0.85 وتصرف تلقائيًا فقط فوق 0.85. في مثالهم المعمول، يُقفل عرض رصيد الحساب عند 0.6، بينما لا يُقفل الموافقة على تحويل حتى 0.85.
هذا افتراضي الأفضل من أي عتبة عامة واحدة، لأنه يجعلك تكتب ما يكلفه الفعل. معظم الفرق تكتشف، وهي تفعل ذلك، أنها كانت تشغّل عدة أفعال مختلفة جدًا من فرع واحد.

ماذا قاسته تجربتان مستقلتان
الأولى صغيرة وموجّهة. في 17 سبتمبر 2026 صنّف معيار قابل للتكرار 60 مكالمة أداة وكيل موسومة يدويًا إلى أربع فئات مخاطر، مقسومة بين حالات واضحة وغامضة وخصومية. بلغت الدقة الكلية 91.7 بالمئة — 100 بالمئة على الحالات الواضحة، و71.4 بالمئة على الغامضة منها. والنتيجة التي تهم هنا: كل إجابة خاطئة وصلت بحذر. تراوحت الإجابات الفائتة في الثقة بين 0.130 و0.785، ولم يُرجع النموذج ثقة قصوى وهو مخطئ قط، وكان نطاق 0.9-1.0 دقيقًا بنسبة 98 بالمئة.
والثانية أكبر ومُسجّلة مسبقًا. في 20 سبتمبر 2026 نشر تقييم 5,721 استدعاء عبر 21 تجربة، مع 50 تنبؤًا مختومًا زمنيًا قبل جمع أي بيانات. من تلك التنبؤات، تأكد 26 منها وتبيّن زيف 21، و18 منها لأن المؤلفين كانوا يتوقعون فشلًا حيث لم يظهر أيٌّ. في المعايرة وجدت الدقة مسطّحة جوهريًا بين 0.50 و0.95، ثم تصل إلى 100 بالمئة عند عتبة 0.99 لا تزال تغطي 60.2 بالمئة من المرور.
مقروءة معًا، تقول شيئًا أدق من «الثقة جيدة». كانت الثقة العالية موثوقة في كلتيهما. وكان منتصف النطاق يحمل معلومات قليلة جدًا في الأكبر منهما.

ماذا يعني ذلك لعتبتك
إن كانت الدقة مسطّحة من 0.5 إلى 0.95، فعتبة 0.7 وعتبة 0.9 تشتريانك تقريبًا الشيء نفسه في تلك المهمة، والرفوض الإضافية عند 0.9 هي في معظمها وقت بشري مبدّد.
النطاق المثير هو القمة. بوابة 0.99 التي ما تزال تعالج تلقائيًا 60 بالمئة من المرور بدقة كاملة هي نقطة تشغيل مفيدة فعلًا: ثلاثة أخماس العمل تعمل دون مساس ويصل الباقي إلى شخص. ذلك تصميم نظام مختلف عن «وجّه أدنى 5 بالمئة إلى إنسان».
لكن هذه مهمة واحدة في يوم واحد، وليست مهمتك. الرقم الذي تتصرف بناءً عليه هو الذي تقيسه على مجموعتك الموسومة الخاصة.
| ما وُجد | ما يؤيده | ما لا يؤيده |
|---|---|---|
| كانت كل إجابة خاطئة محذورة، n = 60 | معاملة إجابة بثقة قصوى كآمنة في تلك المهمة | ضمانة أنها لا تفشل بثقة على مهمتك |
| الدقة مسطّحة من 0.50 إلى 0.95 | الشك في أن عتبة متوسطة النطاق تشتري القليل | ادعاء أن الثقة عديمة الفائدة دون 0.99 |
| 100 بالمئة عند 0.99، تغطي 60.2 بالمئة | تصميم سياسة تصعيد بوابة عالية وتغطية عالية | نفس التغطية على مهمة أو توزيع مختلف |
قياس منحنىك الخاص، في عصر واحد
أنت تحتاج مجموعة موسومة، وإن لم تكن لديك فهذه اللحظة التي تكتشف فيها أنك كنت تحتاجها على أي حال. مئتا صفٍ قد حكمت عليها كافية لتكون مثيرة.
أرسل كل صف، احتفظ بالإجابة وبالثقة، ثم صنّف حسب الثقة واحسب الدقة لكل صنف. ذلك الجدول هو منحنى معايرتك. اختر أدنى عتبة تكون دقتها كافية لتكلفة ذلك الفعل، ووجّه كل ما دونها إلى شخص.
ثم أعد تشغيله حين تغيّر صياغة السؤال، لأنك غيّرت مهمة النموذج، وكان المنحنى الذي قسته يخص القديمة.
نُشر في 2026-09-21، مقتبسًا منشورًا لشركة أنظمة التنبؤ Yarrow. تعريف الناشر للمعايرة — عندما يقول النموذج 70 بالمئة، يجب أن يحدث الحدث 70 بالمئة من الوقت — هو التعريف القياسي وهو سبب استحقاق منحنى معايرة القياس. لاحظ السياق التجاري: الحساب المقتبس يبيع منتج توقعات ويرسم موازاة مع منتجه.
الفشل الذي يدعو إليه هذا التصميم
قاضٍ رخيص قابل للتكرار يغيّر السلوك. حين يكلّف قرار كسرًا من السنت، تتوقف الفرق عن أخذ عيّنات وتبدأ بتقييم كل شيء، وهذا هو مغزى الأمر.
ويعني أيضًا أن قاضيًا مخطئًا في اتجاه ثابت صار مخطئًا في كل مكان، بصمت، بثقة كاملة، في كل صف. تقلّب منخفض يجعل ذلك أسوأ قبل أن يجعله أفضل، لأن خطأً قابلًا للتكرار يُكرّر تمامًا.
التخفيف غير متألق: احتفظ بمجموعة عرّاف موسومة بشريًا، وأعد قياس التوافق كلما تغيّر سؤال، واقرأ عيّنة مما أقرّه القاضي لا فقط ما رفضه.
أسئلة الثقة
هل الثقة هي نفس الاحتمال الأعلى؟
لا. الاحتمالات تصف الانتشار عبر خياراتك المعلنة. الثقة قيمة منفصلة عن مدى تأكد النموذج برمته، وهي التي يستخدمها نمط التوجيه الموثّق.
ما العتبة التي ينبغي أن أستخدم؟
يربط النمط المنشور العتبة بتكلفة الفعل: دون 0.6 إلى شخص، و0.6 للأفعال الرخيصة، و0.6 إلى 0.85 مع تأكيد المستخدم للأفعال الباهظة، وفوق 0.85 تلقائيًا. ثم قِس منحنىك الخاص.
هل وجد أحدهُا مخطئًا بثقة؟
لا في معيار الحالات الـ60، حيث كانت كل إجابة فائتة محذورة ولم يجب النموذج خطأً بثقة قصوى. أبلغ أحد الممارسين عن احتمالات خاطئة بثقة على حالات غير قابلة للمعرفة، دون نشر بيانات.
هل تستخدم Ciyo توجيه الثقة؟
ليس مع Jev، الذي لا يُشغّله Ciyo. النمط نفسه — حكم مكتوب النوع زائد عتبة تقرر ما إذا يرى إنسان — ينطبق على أي مقيّم، بما في ذلك نموذج لغة يتصرف كمراجع.
واصل القراءة
يكتب Ciyo عن النماذج وراء الأدوات الإبداعية وأدوات الوكلاء، ويختبر التي يمكنه تشغيلها.