Ciyo · GPT-6

La ventana de contexto de GPT-6 Astra: 1M de tokens en la práctica

Una larga tira de papel plegada en acordeón se enrolla dentro de un recipiente de vidrio ámbar, con un hilo de cobre que marca un punto a lo largo de su longitud.
Ilustración editorial creada para esta guía.

La ficha de GPT-6 Astra indica tres cifras que a menudo se confunden en una sola: una ventana de contexto de 1.050.000 tokens, un máximo de 922.000 tokens de entrada y un máximo de 128.000 tokens de salida. Una cuarta cifra vive en la página de precios: por encima de 272.000 tokens de entrada, una petición se factura en la banda de contexto largo.

Esta guía explica cómo se relacionan esas cifras, qué puede incluir realmente un equipo creativo en una petición y cómo mantener la factura predecible. Refleja la ficha del modelo, la página de precios, la guía de razonamiento y la documentación sobre tokens de OpenAI del 7 de septiembre de 2026, además de los resultados de contexto largo de la publicación de lanzamiento, que son datos del proveedor.

Las tres cifras y cómo se relacionan

La ventana de contexto es el espacio total que puede ocupar una petición: tu entrada, la salida visible del modelo y sus tokens de razonamiento ocultos. El máximo de entrada de 922.000 tokens limita lo que envías. El máximo de salida de 128.000 tokens limita lo que vuelve. Como los tokens de razonamiento ocupan contexto y se facturan como salida, una respuesta con mucho razonamiento deja menos espacio del que sugiere su longitud visible.

La guía de tokens de OpenAI ofrece estimaciones aproximadas para el inglés: un token equivale a unos cuatro caracteres, o a unas tres cuartas partes de una palabra, de modo que 100 tokens son aproximadamente 75 palabras. Otros idiomas se tokenizan de forma distinta. Con esa estimación, el máximo de entrada admite del orden de 690.000 palabras en inglés, más que una estantería de manuales de marca, presentaciones de campaña y textos anteriores juntos.

Las imágenes también cuentan

Una imagen de referencia no es contexto gratuito. La guía de visión de OpenAI describe un recuento basado en parches para los modelos actuales: la imagen se divide en parches de 32 píxeles, se limita por un presupuesto según el nivel de detalle y se multiplica por un factor del modelo. Sus ejemplos sitúan una imagen de 1024 por 1024 en unos 1.229 tokens y una de 2048 por 2048 en unos 3. Esos ejemplos están documentados para gpt-5.4; la guía aún no indica un multiplicador para gpt-6-astra, así que trátalos como estimaciones.000 tokens para un modelo GPT-5 con detalle alto.

Cincuenta fotografías de producto al tamaño mayor añaden del orden de 150.000 tokens antes de cualquier texto. Eso queda muy dentro de la ventana y todavía por debajo del umbral de precio, pero no es despreciable cuando el manual de marca va en la misma petición. Reduce las referencias al tamaño que necesita la tarea y envía las más nítidas en lugar de todas.

El umbral de 272.000 tokens

Con tarifas estándar, Astra cuesta 10 dólares por millón de tokens de entrada, 1 por entrada en caché y 50 por salida. Cuando la entrada de una petición supera 272.000 tokens, la petición completa se factura a 20 dólares de entrada, 2 de entrada en caché, 25 de escrituras de caché y 75 de salida. La banda se aplica a toda la petición, no solo a los tokens por encima de la línea.

Una petición con 270.000 tokens de entrada y 2.000 de salida cuesta 2,80 dólares. La misma petición con 275.000 tokens de entrada cuesta 5,65, porque la línea de entrada pasa a 5,50 dólares y la de salida a 0,15. Cinco mil tokens adicionales duplican el precio. Anthropic, en comparación, cobra el contexto completo de 1M de Claude Fable 5.1 a tarifa estándar, algo que conviene saber si usas ambos.

Dos peticiones a cada lado del umbral, tarifas estándar, sin caché
PeticiónCoste de entradaCoste de salidaTotal
270.000 de entrada + 2.000 de salida$2,70$0,10$2,80
275.000 de entrada + 2.000 de salida$5,50$0,15$5,65
Cuatro barras horizontales a escala: la ventana de contexto de 1.050.000 tokens, el máximo de entrada de 922.000 tokens, el umbral de precio de 272.000 tokens y el máximo de salida de 128.000 tokens.
Límites documentados de Astra el 7 de septiembre de 2026. El umbral marca dónde toda la petición pasa al precio de contexto largo.

¿El modelo usa realmente un millón de tokens?

La publicación de lanzamiento de OpenAI informa de MRCR v2 con ocho agujas: 100,0% para Astra entre 256K y 512K tokens y 96,3% entre 512K y 1M, frente a 91,5% y 73,8% de GPT-5.6 Sol. Son resultados de recuperación del proveedor, y sugieren que la segunda mitad de la ventana es mucho más utilizable de lo que era en el modelo anterior.

Recuperar no es juzgar. Un modelo que encuentra una regla en la página 400 de un manual de marca todavía tiene que aplicarla correctamente a un titular. Pruébalo con tu propio material: coloca una prohibición concreta en el fondo del paquete, pide un texto que la infrinja y comprueba si el modelo se da cuenta. Es un experimento de cinco minutos con una condición de aprobación clara.

Guarda el paquete en caché y varía la tarea

La caché de prompts convierte un prefijo repetido en entrada a 1 dólar por millón en lugar de 10. Coloca primero el material estable, siempre en el mismo orden: reglas de marca, datos de producto, ejemplos de tono. Añade después la tarea que cambia. Astra usa un ajuste prompt_cache_options.ttl, y la guía de OpenAI muestra un valor 30m para una ventana de caché de media hora.

Un paquete de 200.000 tokens cuesta 2,00 dólares leído sin caché y 0,20 desde la caché. Las escrituras de caché se facturan a 12,50 dólares por millón, así que reescribir el prefijo en cada petición desperdicia la ventaja. Si necesitas cambiar el esfuerzo de razonamiento entre peticiones, usa un elemento configuration_update en lugar de editar el prompt, lo que según la guía conserva el prefijo en caché.

Cuándo quedarse por debajo de la línea

La mayoría de las peticiones creativas no necesitan toda la ventana. El encargo de una campaña, una sección de marca y veinte referencias caben holgadamente por debajo de 100.000 tokens. Mantén el trabajo rutinario en la banda estándar y reserva las peticiones de contexto largo para tareas que necesiten de verdad el paquete completo, como una auditoría de cada afirmación en un año de campañas.

Para bibliotecas que cambian con frecuencia, la herramienta file_search es una alternativa a cargarlo todo: OpenAI la cobra a 2,50 dólares por cada mil llamadas y 0,10 por gigabyte y día de almacenamiento, con el primer gigabyte gratis. Recupera los pasajes relevantes en lugar de enviar todo el archivo en cada petición, lo que mantiene la mayoría de las llamadas en la banda más barata.

La salida tiene su propio límite

El límite de salida de 128.000 tokens incluye el razonamiento oculto, y el objeto usage reporta el razonamiento por separado en output_tokens_details.reasoning_tokens. Una petición que pide cincuenta descripciones de producto localizadas de una vez puede gastar buena parte de su presupuesto razonando y quedarse sin espacio para las últimas descripciones. Pide menos elementos por petición, o usa Batch para salida masiva a mitad de precio.

Establece max_output_tokens de forma deliberada. La documentación de tokens recuerda a los desarrolladores que los modelos de razonamiento necesitan espacio para razonar además de para la respuesta visible, así que un límite ajustado puede truncar la respuesta en lugar del razonamiento. Deja margen, inspecciona usage y ajusta a partir de los datos.

Contexto largo dentro de ChatGPT y Codex

Las cifras anteriores son de la API. Dentro de ChatGPT, el producto gestiona el contexto por ti y la ventana efectiva del modelo puede variar según el producto. La publicación de lanzamiento describe una nueva función de Codex para Astra que conserva notas entre ventanas de contexto y deja las ventanas anteriores consultables, de modo que una sesión de diseño larga no pierde las razones de decisiones anteriores; es experimental en el lanzamiento y se activa en el archivo de configuración de Codex.

El uso de Work y Codex se mide en créditos del plan y no en tokens de API, y sus cuotas son independientes de Chat. Si pasas un paquete de referencias grande por esas superficies, vigila la cuota del plan en lugar del precio por token, y consulta la página de límites actual en vez de suponer el comportamiento de la API.

Una configuración práctica para un equipo creativo

Reúne un único paquete de referencias estable: reglas de marca, afirmaciones aprobadas, muestras de tono y un glosario breve. Mantenlo por debajo de 200.000 tokens para que las lecturas en caché sean baratas y cada petición se quede en la banda estándar con espacio para referencias. Versiónalo y registra qué versión usó cada entregable.

Después deja que el renderizador haga su trabajo. Tanto si Astra planifica a partir de un millón de tokens como de un paquete ajustado, la imagen sigue viniendo de un modelo de imagen con sus propios ajustes. En Ciyo puedes generar con GPT Image 2 a partir de ese plan, conservar los resultados aprobados y pagar por generación sin una cuota de plan que vigilar.

Sigue leyendo

Preguntas sobre la ventana de contexto de Astra

¿La ventana de contexto es de 1 millón o de 1,05 millones de tokens?

La ficha indica 1.050.000 tokens de contexto, con un máximo de 922.000 tokens de entrada y un máximo de 128.000 tokens de salida. El marketing suele redondearlo a 1M.

¿Cuándo empieza el precio de contexto largo?

Cuando la entrada de una petición supera 272.000 tokens. Toda la petición se factura entonces a 20 dólares de entrada, 2 de entrada en caché y 75 de salida por millón de tokens en lugar de 10, 1 y 50.

¿Los tokens de razonamiento consumen la ventana de contexto?

Sí. La documentación de OpenAI indica que los tokens de razonamiento ocupan contexto y se facturan como salida. Deja margen bajo el límite de salida e inspecciona output_tokens_details.reasoning_tokens después de cada petición.

Planifica desde el paquete, renderiza en el lienzo

Lleva a Ciyo el encargo que Astra produjo a partir de tu manual de marca, genera con GPT Image 2 y paga por resultado en lugar de por token.