Empezar

Modelos · System One

Las opciones que declaras son todo el modelo

Un marco de rejilla de carbón que sostiene baldosas de cerámica marfil en cada hueco menos uno, con una baldosa ámbar tendida fuera del marco
Obra de arte editorial abstracta original inspirada en un hueco faltante.

Con un modelo de lenguaje, una instrucción mala produce una frase mala y puedes verlo. Con un modelo de decisión tipado, una pregunta mala produce una respuesta perfectamente bien formada del tipo exactamente correcto, y no puedes ver nada malo en absoluto.

Esa es la trampa que vale la pena entender antes de conectar uno a nada. Dos piezas de evidencia de la semana del 17 de septiembre de 2026 — una una evaluación preregistrada, otra una ejecución de un practicante — apuntan a la misma conclusión desde direcciones distintas: la precisión que obtienes es en gran parte una propiedad de cómo escribiste las preguntas. Ciyo no ejecuta Jev; no produce imagen ni vídeo y no está en ninguno de nuestros registros de modelos.

Una pregunta, o cinco

La evidencia más directa publicada esta semana vino de un practicante ejecutando triaje de phishing. Formulada como una sola pregunta, la tarea obtuvo 62.6 por ciento. Dividida en cinco preguntas separadas, evaluada contra el mismo state y combinada en código, obtuvo 95 por ciento.

Esa es la ejecución de una persona sobre sus propias etiquetas sin un conjunto de datos publicado, así que es una razón para probar la división, no un número para citar. Pero coincide con lo que la propia documentación del proveedor recomienda — descomponer en preguntas atómicas de propósito único en lugar de pedir un juicio multifactor en una sola — y coincide con la forma de la API, donde cada pregunta en una llamada se evalúa en paralelo contra el mismo state.

La economía hace que la recomendación sea fácil de seguir. El costo que domina una llamada es enviar el state, no responder las preguntas. Preguntar cinco está casi gratis una vez que el state está en la línea.

Dos barras que comparan la precisión del 62.6 por ciento al preguntar como una sola pregunta y 95 por ciento dividido en cinco
Reportado por @rajeshberi en X, 21 de septiembre de 2026. Ilustrativo de una sola ejecución de un practicante, no un benchmark. Diagrama de Ciyo.

Cómo dividir una pregunta que resiste la división

«¿Es este correo un intento de phishing» es una conclusión, no una pregunta. La división es preguntar por la evidencia que la haría verdadera, una pieza a la vez, y dejar que tu propio código haga la conclusión.

¿Coincide el dominio del remitente con la organización que dice ser? ¿Pide el mensaje una credencial o un pago? ¿Hay presión de tiempo en el redactado? ¿Coinciden los textos de enlaces visibles con sus destinos? ¿Es genérica la bienvenida donde este remitente normalmente usa un nombre?

Cinco preguntas estrechas, cinco respuestas con sus propios valores de confianza, y una regla en tu código que puedes leer, probar y cambiar sin tocar una instrucción. Esa última parte es el premio real: la lógica de combinación se vuelve software ordinario.

La forma de un conjunto de preguntas descompuesto
questions: {
  "sender_mismatch": { "type": "noul", "instructions": "El dominio del remitente no coincide con la organización de la que el mensaje afirma provenir." },
  "asks_for_secret": { "type": "noul", "instructions": "El mensaje pide al lector una contraseña, un código o un pago." },
  "time_pressure":   { "type": "noul", "instructions": "El mensaje presiona al lector a actuar rápidamente." },
  "link_mismatch":   { "type": "noul", "instructions": "Un texto de enlace visible difiere de adonde apunta realmente el enlace." },
  "risk":            { "type": "score", "instructions": "¿Qué tan arriesgado es entregar este mensaje a una bandeja de entrada?",
                        "criteria": ["inofensivo", "sospechoso", "probablemente phishing", "claramente malicioso"] }
}

Un nombre de opción es una etiqueta; los criterios son la definición

Un Choice toma un mapa `criteria` de nombres de opciones a descripciones, y un Score toma un arreglo ordenado de descripciones de niveles. Esas cadenas no son documentación para tus colegas. Son la única definición que tiene el modelo.

«facturación» le dice casi nada. «El remitente pregunta por una factura, un cargo que no reconoce, un reembolso o cambiar su método de pago» le dice qué buscar. La segunda versión es también la que puedes discutir con un colega antes de automatizar nada, que es el punto donde los desacuerdos son baratos.

Escribe los criterios como escribirías instrucciones para una persona nueva en su primer turno: qué pertenece aquí, qué se parece pero pertenece a otro lado, y qué hacer cuando no es ninguno.

La respuesta que no puede darte

Ahora el hallazgo más agudo, y el que cambia un diseño. En la evaluación preregistrada publicada el 20 de septiembre de 2026, los autores probaron si el modelo señalaría que un state cayó fuera de las opciones declaradas. En 30 casos fuera de alcance donde no existía opción de escape, no señaló ninguno.

Eso no es un defecto. Es el sistema de tipos funcionando exactamente como se anuncia: declaraste las respuestas posibles, y volvió un valor del tipo declarado. Pero significa que una entrada fuera de alcance no falla ruidosamente. Tiene éxito en silencio, con la opción más cercana y un número de confianza adjunto.

La solución es una línea de diseño de preguntas. Declara tú mismo la opción de escape — `none_of_these`, `needs_a_human`, `not_applicable` — y escribe criterios para ella con tanto cuidado como para las opciones reales. Luego enrútala en código.

Dos tarjetas que contrastan lo que pasa sin opción de escape y qué declarar en su lugar
El hallazgo 0-of-30 es de la evaluación preregistrada priorbench/jev del 20 de septiembre de 2026. Diagrama de Ciyo.

Lo que la misma evaluación encontró que hace bien

Vale la pena reportar la otra mitad, porque el folclore sobre estos modelos a menudo está equivocado en la dirección tranquilizadora y equivocado también en la dirección pesimista.

La misma ejecución encontró que la comparación de números y el orden de fechas se mantenían en 99.6 por ciento a través de 13 diseños distintos de preguntas, y la negación se manejó correctamente en 100 por ciento de los casos probados. Una guía de practicante publicada tres días antes había advertido que las negaciones pueden fallar y que el modelo es pobre en aritmética y fechas. La ejecución mayor, preregistrada, no reprodujo eso.

Lo cual es un recordatorio útil sobre todo este tema en septiembre de 2026: mucho consejo confiado circula sobre un modelo que ha sido público por menos de una semana. Prefiere la evidencia con un método y un repositorio adjuntos.

Dos relatos de septiembre de 2026 de los mismos puntos débiles
AfirmaciónFuenteLo que encontró la ejecución preregistrada
Pobre en cálculos aritméticos y de fechasUna guía de practicante, 2026-09-17La comparación de números y el orden de fechas se mantuvieron en 99.6 por ciento a través de 13 diseños
Las negaciones pueden fallarLa misma guíaLa negación se manejó correctamente en 100 por ciento de los casos probados
Putrefacción del contexto: la precisión cae con state irrelevanteLa misma guíaNo contradicho aquí; vale la pena probarlo en tu propio state
Lee las instrucciones literalmenteLa misma guíaConsistente con el hallazgo fuera de alcance: responde la pregunta que escribiste

Una lista de verificación antes de que una pregunta vaya a producción

¿Es atómica? Si la frase contiene «y» o «a menos que», probablemente son dos preguntas.

¿Son exhaustivas las opciones, incluyendo una de escape? Si una entrada plausible no tiene dónde aterrizar, aterrizará en un lugar equivocado.

¿Tiene criterios cada opción? Un nombre de opción es una etiqueta; los criterios son la definición, y el modelo solo tiene lo que escribiste.

¿Está ordenada la rúbrica? Un Score espera de dos a diez niveles que signifiquen algo en secuencia, y la puntuación devuelta puede caer entre ellos.

¿La has medido contra tus propias etiquetas? Cada número en este artículo vino de la tarea de otro.

Preguntas de diseño de preguntas

¿Por qué es mejor dividir una pregunta?

Cada pregunta se evalúa en aislamiento contra el mismo state, así que una pregunta estrecha es una tarea estrecha. La lógica de combinación vive entonces en tu código, donde es comprobable. Una ejecución de practicante pasó de 62.6 a 95 por ciento en sus propias etiquetas tras dividir.

¿Preguntar más cuesta más?

Muy poco. El costo dominante es el state que envías; las preguntas se evalúan en paralelo contra él.

¿Qué pasa con una entrada que no encaja en ninguna de mis opciones?

Obtiene la opción más cercana de todos modos. Una evaluación preregistrada encontró que 0 de 30 casos fuera de alcance señalados cuando no se declaró opción de escape. Declara una.

¿Es malo en fechas y negación?

Una guía de practicante lo dijo el 17 de septiembre de 2026. Una ejecución preregistrada mayor tres días después midió 99.6 por ciento en orden de números y fechas y 100 por ciento en negación. Pruébalo en tus propios datos en lugar de confiar en cualquiera.

Sigue leyendo

Ciyo escribe sobre los modelos detrás de las herramientas creativas y de agentes, y prueba los que puede ejecutar.