Ciyo · GPT-6

Los benchmarks de GPT-6 Astra explicados para diseñadores

Una regla de latón, pesas graduadas de vidrio ámbar y una fila de azulejos de cerámica de altura creciente descansan sobre una superficie marfil cálida como un gráfico de barras.
Ilustración editorial creada para esta guía.

La publicación de lanzamiento de GPT-6 Astra de OpenAI presenta varias decenas de puntuaciones de benchmarks sobre uso de ordenador, trabajo profesional, programación, ciencia, ciberseguridad, alineamiento y contexto largo. La mayoría las produjo OpenAI. Unas pocas proceden de un índice independiente. Casi ninguna mide lo que más le importa a un diseñador: si la imagen final es buena.

Este artículo lee esa tabla como lo haría un equipo creativo, a partir de la publicación de lanzamiento y la metodología de Artificial Analysis consultadas el 7 de septiembre de 2026. Explica qué pide cada evaluación relevante al modelo, qué filas favorecen a Astra y cuáles a Claude, y cómo usar los números sin confundirlos con un veredicto sobre tu trabajo.

Cómo leer la tabla antes de leer cualquier número

La publicación de lanzamiento indica que las puntuaciones de evaluación son el máximo con cualquier esfuerzo. Un 72,6% puede proceder, por tanto, del ajuste más caro, no del que usarías para un encargo diario. Las notas al pie también importan: las puntuaciones de Claude en BenchCAD reflejan tres modificaciones descritas en la tarjeta de sistema de Anthropic, y dos filas de Claude proceden de Mythos, la versión de Fable con menos salvaguardas.

Varias filas están marcadas como internas, incluidas Design Tasks, Data Science Tasks y Database Migration Tasks. Su contenido no es público, así que no pueden reproducirse. Trátalas como la descripción que OpenAI hace de sus propias prioridades, no como evidencia independiente. Todo lo que sigue es información del proveedor salvo que se indique lo contrario.

Uso de ordenador: manejar el software que ya tienes

OSWorld 2.0 pide a un agente completar tareas dentro de software de escritorio real. OpenAI informa de 72,6% para Astra, 65,7% para GPT-5.6 Sol y 70,2% para Claude Opus 5, y añade que en simulaciones de latencia Astra terminó en unos 40 minutos por tarea frente a unos 75 minutos de Sol. ScreenSpot-Pro, que evalúa localizar elementos de interfaz en aplicaciones profesionales sin herramientas, se reporta en 92,7% para Astra y 76,9% para Sol.

Agents’ Last Exam abarca tareas profesionales en software real, incluida la producción de medios, y se reporta en 59,3% para Astra, 55,5% para Opus 5 y 53,6% para Sol. Para un diseñador, estas filas describen la capacidad de manejar un editor, un navegador o una herramienta 3D a través de su interfaz. No describen el gusto de lo que se crea allí.

Filas profesionales con un ángulo creativo

BenchCAD evalúa si un modelo puede reconstruir objetos 3D a partir de renders multivista escribiendo código CAD. Astra se reporta en 95,9% con herramientas, frente a 83,3% de Sol y 84,3% de Fable 5.1 en las condiciones indicadas en la nota al pie. OpenScore String Quartets mide la lectura de notación musical a partir de imágenes; Astra obtiene 0,84 en la métrica 1 menos OMR-NED frente a 0,19 de Sol, un gran salto en lectura visual estructurada.

La fila interna de Design Tasks muestra 50,0% para Astra, 47,4% para Sol y 35,8% para Claude Fable 5, sin cifra de Fable 5.1. AutomationBench, que OpenAI agrupa dentro del trabajo profesional, muestra 41,4% para Astra y 31,4% para Fable 5.1. Son las filas publicadas más cercanas al trabajo de diseño, y la fila de diseño es también la que no puedes inspeccionar.

Filas de la publicación de lanzamiento útiles para un diseñador, datos del proveedor, 7 de septiembre de 2026
EvaluaciónGPT-6 AstraGPT-5.6 SolMejor Claude mostrado
OSWorld 2.072,6%65,7%70,2% (Opus 5)
ScreenSpot-Pro, sin herramientas92,7%76,9%87,3% (Fable 5, Mythos)
Agents’ Last Exam59,3%53,6%55,5% (Opus 5)
BenchCAD95,9%83,3%84,3% (Fable 5.1, modificado)
Design Tasks interno50,0%47,4%35,8% (Fable 5)
MRCR v2, de 512K a 1M96,3%73,8%No se muestra
Barras emparejadas muestran cuatro filas del proveedor para Astra y GPT-5.6 Sol: OSWorld 2.0 con 72,6 frente a 65,7, Design Tasks interno con 50,0 frente a 47,4, BenchCAD con 95,9 frente a 83,3 y MRCR de 512K a 1M con 96,3 frente a 73,8.
Las barras se dibujan según los valores publicados. Cada cifra procede del proveedor y corresponde a la puntuación máxima entre niveles de esfuerzo.

El índice independiente cuenta otra historia

El Artificial Analysis Intelligence Index v4.1.1 aparece en la propia tabla de OpenAI: 61,2 para Astra, 60,9 para Sol, 65,7 para Claude Fable 5.1, 63,1 para Claude Opus 5 y 58,7 para Gemini 3.8 Flash. El artículo de Artificial Analysis del 3 de septiembre describe a Astra como equivalente a Sol en inteligencia, usando alrededor de un 10% menos de tokens de salida, a un precio 2,5 veces mayor.

El índice es una media ponderada de diez evaluaciones repartidas entre agentes, programación, razonamiento científico y categorías generales, con agentes y trabajo general ponderados al 30% cada uno. Su versión actual enumera AA-Briefcase, GDPval-AA v2, Terminal-Bench, SciCode, Humanity’s Last Exam y otras. Ninguna es una evaluación visual ni de marca, así que liderar este índice es liderar en amplitud de razonamiento, no en diseño.

Contexto largo: leer el manual de marca completo

OpenAI MRCR v2 pide a un modelo encontrar ocho agujas en un documento largo. Astra se reporta en 100,0% entre 256K y 512K tokens y 96,3% entre 512K y 1M, frente a 91,5% y 73,8% de Sol. Para un equipo creativo, la lectura práctica es que un paquete de referencias grande, como un manual de marca más campañas anteriores, tiene más probabilidades de usarse con precisión.

La calidad de recuperación es solo la mitad de la historia. Por encima de 272.000 tokens de entrada, una petición de Astra se factura en la banda de contexto largo, que duplica la tarifa de entrada. Una puntuación alta en MRCR hace viable una petición de un millón de tokens; la página de precios decide si es sensata para un trabajo rutinario.

Filas de alineamiento que importan cuando delegas

OpenAI informa de un benchmark interno de seguridad en uso de ordenador donde menos es mejor: 2,4% para Astra, 22,0% para Sol y 9,5% para Fable 5.1. También informa de un benchmark interno de alucinaciones con 4,2% para Astra frente a 12,2% para Sol, y afirma que Astra tiene tres veces menos probabilidades que Sol de tergiversar sus propias capacidades.

Si planeas dejar que un modelo maneje software de diseño o un navegador en tu nombre, estas filas describen el riesgo de acciones no deseadas. Son internas y del proveedor, así que justifican una prueba cuidadosa con las aprobaciones activadas, no un uso sin supervisión en la cuenta de un cliente.

Lo que los benchmarks no cubren

No hay ninguna puntuación publicada de generación de imágenes, porque Astra no produce imágenes directamente; el renderizador es GPT Image 2 y se evalúa por separado. No hay evaluación de tipografía, legibilidad, color ni coherencia de marca. No hay medida de cuánta edición necesita una persona después del primer borrador del modelo.

Las afirmaciones de coste de la publicación son estimaciones en las condiciones de OpenAI, como un resultado de Terminal-Bench Science con aproximadamente un 31% menos de coste estimado de API que Fable 5.1. Las citas de eficiencia de tokens, incluido el informe de un cliente de hasta un 20% menos de tokens en flujos creativos, describen los pipelines de otras personas. Tus propios registros son el único benchmark de coste que se aplica a tu producto.

Convierte la tabla en un plan de pruebas

Usa las filas para decidir qué probar, no qué comprar. Los resultados de uso de ordenador sugieren probar una tarea de edición repetitiva en tu software real. BenchCAD y las demos de Blender sugieren probar una escena 3D por script. MRCR sugiere probar si un manual de marca completo mejora el cumplimiento de las reglas de texto. Cada prueba debe tener una condición de aprobación escrita antes de ejecutarla.

Ejecuta las mismas tareas en el modelo que usas hoy. Mantén fijos el nivel de esfuerzo, las referencias y el renderizador, y registra tiempo, coste y correcciones. Cuando la fila interna de diseño dice 50,0%, la respuesta útil es medir tu propia tasa de aprobación en diez encargos reales, que será un número que puedas defender.

Una breve lista de lectura para los números

Lee la publicación de lanzamiento para ver la tabla completa y las notas al pie sobre esfuerzo, modificaciones y Mythos. Lee la metodología de Artificial Analysis para ver qué evaluaciones componen el índice y cómo se ponderan. Lee la ficha del modelo para conocer las especificaciones detrás de las filas de contexto largo. Después lee tus propios resultados, con fecha, junto a ellos.

Para el trabajo con imágenes, la decisión sigue siendo práctica. Astra puede planificar y dirigir; GPT Image 2 renderiza; un revisor aprueba. En Ciyo puedes probar directamente los dos últimos pasos, con el precio de cada generación visible antes de ejecutarla, y comparar resultados de cualquier planificador que elijas.

Sigue leyendo

Preguntas sobre los benchmarks de Astra

¿GPT-6 Astra es el mejor modelo en todos los benchmarks?

No. En la propia tabla de OpenAI, Claude Fable 5.1 lidera en Humanity’s Last Exam con herramientas y en el Artificial Analysis Intelligence Index, y Claude Opus 5 lidera en el Coding Agent Index. Astra lidera en las filas mostradas de uso de ordenador, CAD, ciencia y contexto largo.

¿Alguno de estos benchmarks mide la calidad de imagen?

No. Astra devuelve texto y llama a una herramienta de imagen para las imágenes. El renderizador, GPT Image 2, es un modelo independiente, y ninguna fila publicada puntúa tipografía, composición ni coherencia de marca.

¿Qué significa «máximo con cualquier esfuerzo» para mis costes?

Las puntuaciones pueden proceder del ajuste de razonamiento más alto, donde los tokens de razonamiento ocultos se facturan como salida. Tu ajuste diario puede puntuar menos y costar menos, así que prueba con el esfuerzo que realmente vas a usar.

Mide el paso que los benchmarks omiten

Genera el mismo encargo con GPT Image 2 en Ciyo, conserva los resultados que publicarías y registra tu propia tasa de aprobación junto a la tabla del proveedor.