Ciyo · GPT-6
Guía de la API de GPT-6 Astra para aplicaciones creativas

El identificador de modelo documentado para GPT-6 Astra en la API es gpt-6-astra. La guía de modelos de OpenAI recomienda construir con él a través de Responses API, y la ficha enumera compatibilidad con Responses, Chat Completions y Batch. Para un producto que convierte encargos en imágenes, composiciones o textos, lo interesante es el control del razonamiento, la herramienta de imagen integrada y las bandas de precio.
Esta guía refleja la documentación para desarrolladores de OpenAI del 7 de septiembre de 2026. Está escrita para quienes construyen herramientas creativas, así que dedica más espacio a la herramienta de generación de imágenes y al coste por recurso que a la arquitectura general de agentes. Vuelve a consultar las páginas enlazadas antes de publicar; los parámetros y los precios son instantáneas con fecha.
Comprueba el acceso antes de escribir código
El acceso a la API es independiente de una suscripción a ChatGPT. Un plan Plus o Pro no crea saldo de API, y una clave de API no desbloquea GPT-6 Pro en Chat. Confirma que gpt-6-astra aparece en la organización y el proyecto que pagarán las peticiones, y haz una petición de texto pequeña antes de añadir archivos, herramientas o un contexto grande.
Los límites de velocidad escalan con el nivel de uso. La ficha indica 500 peticiones y 500.000 tokens por minuto en el Tier 1, y sube hasta 15.000 peticiones y 40.000.000 de tokens por minuto en el Tier 5. Un trabajo por lotes que genera variantes para todo un catálogo debe dimensionarse según esas cifras, o trasladarse al endpoint de Batch cuando la latencia no importe.
La primera petición
Establece model en gpt-6-astra en una petición de Responses API y pasa tu prompt como input. La guía recomienda Responses API porque Chat Completions no admite la llamada a herramientas con este modelo. El razonamiento se ajusta con reasoning.effort en Responses, o con reasoning_effort en Chat Completions si debes seguir allí.
Astra admite los niveles de esfuerzo low, medium, high, xhigh y max. No admite none ni minimal, así que una configuración copiada de una petición de GPT-5.6 que usaba cualquiera de los dos debe empezar en low y compararse. Elimina temperature, top_p, top_logprobs y logprobs; la guía de modelos los enumera como parámetros que hay que quitar al migrar a Astra.
| Campo | Valor | Motivo |
|---|---|---|
| model | gpt-6-astra | La única instantánea documentada |
| input | Tu encargo como texto, opcionalmente con imágenes | Se admite entrada de texto e imagen |
| reasoning.effort | low, medium, high, xhigh o max | none y minimal no se admiten |
| tools | [{ type: "image_generation" }] cuando haga falta | Añade el renderizador al turno |
| temperature, top_p, logprobs | Omitir | Enumerados como parámetros que eliminar |
Elige un nivel de esfuerzo por tarea creativa
La guía de razonamiento de OpenAI asocia el esfuerzo low a redacción de borradores y trabajo orientado a la ejecución, medium a investigación y trabajo con hojas de cálculo y presentaciones, high a razonamiento difícil y planificación profunda, y xhigh o max a ejecuciones largas donde la calidad importa más que la latencia. Para una aplicación creativa la correspondencia es clara: low para texto alternativo y variantes de pie de foto, medium para el encargo de una campaña, high para un plan de varios recursos con restricciones en conflicto.
El esfuerzo es también un control de coste. Los tokens de razonamiento no aparecen en la respuesta, pero se facturan como tokens de salida a 50 dólares por millón y ocupan espacio en la ventana de contexto. El objeto usage los reporta en output_tokens_details.reasoning_tokens. Registra ese campo en cada petición; explica por qué dos peticiones con respuestas visibles parecidas pueden costar cantidades muy distintas.
Llama a la herramienta de generación de imágenes
Añade tools: [{ type: "image_generation" }] a la petición y describe la imagen en el input. Astra planifica la imagen y llama a la herramienta; la respuesta contiene un elemento de salida de tipo image_generation_call cuyo campo result guarda la imagen codificada en base64. La herramienta acepta size, quality (low, medium o high), format, compression, background, un action de auto, generate o edit, y partial_images de 1 a 3 para previsualizaciones en streaming.
Los píxeles los renderiza GPT Image 2, no Astra, y se facturan con las tarifas del modelo de imagen: 30 dólares por millón de tokens de salida de imagen, 8 por millón de tokens de entrada de imagen y 5 por millón de tokens de entrada de texto con precio estándar. Para una edición posterior, pasa previous_response_id o incluye el image_generation_call anterior en el input para que el renderizador conserve el original como referencia.
Herramientas asíncronas y correcciones a mitad de turno
Astra introduce llamadas a funciones asíncronas. Marca una función con async: true y el modelo sigue trabajando mientras tu código ejecuta la herramienta; después devuelve el resultado con el call_id original cuando esté listo. Para una aplicación creativa esto encaja con pasos lentos, como renderizar una previsualización de vídeo o recuperar una biblioteca de recursos grande.
La corrección a mitad de turno permite enviar una actualización por WebSocket mientras se ejecuta una tarea; Responses API conserva el trabajo completado y aplica la corrección. Un elemento de entrada configuration_update cambia el esfuerzo de razonamiento en mitad de la conversación sin reescribir el prompt, de modo que el prefijo en caché sobrevive. Ambas funciones están documentadas como novedades de Astra y requieren que tu aplicación las implemente.
Conoce las cuatro bandas de precio
El procesamiento estándar cuesta 10 dólares por millón de tokens de entrada, 1 por entrada en caché, 12,50 por escrituras de caché y 50 por salida. Una petición cuya entrada supera 272.000 tokens se factura en la banda de contexto largo: 20 dólares de entrada, 2 de entrada en caché, 25 de escrituras de caché y 75 de salida. El modo Fast, que OpenAI describe como hasta el doble de velocidad, duplica las tarifas estándar a 20 dólares de entrada y 100 de salida.
El endpoint de Batch reduce a la mitad los precios estándar: 5 dólares de entrada, 0,50 de entrada en caché, 6,25 de escrituras de caché y 25 de salida para peticiones de contexto corto. La generación nocturna de variantes de texto, texto alternativo para una biblioteca de imágenes o encargos para la revisión de mañana son candidatos naturales para Batch. El modo Fast no está disponible con residencia de datos en la UE, donde la guía indica usar Standard.
| Banda | Entrada | Entrada en caché | Salida |
|---|---|---|---|
| Estándar, hasta 272K de entrada | $10 | $1 | $50 |
| Contexto largo, más de 272K de entrada | $20 | $2 | $75 |
| Modo Fast | $20 | $2 | $100 |
| Batch | $5 | $0,50 | $25 |
Guarda en caché las partes que se repiten
La mayoría de las peticiones creativas reutilizan una sección de marca: tono, afirmaciones prohibidas, reglas de color y datos de producto. Coloca ese bloque al principio del input para que el prefijo en caché coincida entre peticiones. Astra sustituye el antiguo parámetro prompt_cache_retention por prompt_cache_options.ttl, y la guía usa un valor 30m para una ventana de caché de media hora.
Un token en caché cuesta 1 dólar en lugar de 10, así que una sección de marca de 15.000 tokens cuesta 0,015 dólares por reutilización en lugar de 0,15. Las escrituras de caché se facturan a 12,50 dólares por millón, y por eso el bloque debe ser texto estable y no un prompt que cambia en cada petición. Reporta los tokens en caché por separado en tu propia analítica; son la forma más barata de aumentar la coherencia.
Coste por recurso aprobado
Una petición de encargo con 20.000 tokens de entrada sin caché y 4.000 tokens de salida cuesta 0,40 dólares con tarifas estándar. Añade 10.000 tokens de razonamiento y la línea de salida sube 0,50 dólares. Añade una imagen de alta calidad y los tokens propios del renderizador se facturan además. El coste por recurso aprobado, no el coste por llamada, es la cifra que indica si un flujo de trabajo es viable.
Registra cuatro líneas por recurso: entrada de Astra, salida de Astra incluido el razonamiento, tokens de imagen y número de intentos antes de la aprobación. Un nivel de esfuerzo más barato que necesita tres intentos puede costar más que un nivel superior que necesita uno. Es la misma contabilidad que Ciyo aplica a sus propios créditos, donde cada generación muestra su precio antes de ejecutarla.
Lo que la API no te da
No hay salida de imagen directa desde Astra; cada imagen llega a través de la herramienta de imagen o de otro renderizador. No hay esfuerzo none, no hay control de temperature y no hay un respaldo automático si envías un parámetro no admitido. GPT-6 Pro, la opción de ChatGPT, no es un modelo de API independiente; la API enumera una única instantánea gpt-6-astra.
Las comprobaciones de seguridad también pueden detener una tarea. La publicación de lanzamiento de OpenAI señala que, en la API, una tarea pausada se detiene en lugar de pedirte que la revises, así que una aplicación en producción debe gestionar con cuidado una respuesta interrumpida. Mantén visible para los usuarios la ruta de fallo y conserva un registro de la petición que lo produjo.
Sigue leyendo
Preguntas sobre la API de Astra
¿Un plan ChatGPT Plus incluye acceso a la API de Astra?
No. Los planes de ChatGPT y la facturación de la API son independientes. Plus incluye Astra en ChatGPT Work y Codex a medida que se despliega; el uso de gpt-6-astra en la API se factura por token a tu organización.
¿Puedo usar Chat Completions en lugar de Responses?
La ficha enumera compatibilidad con Chat Completions, pero la guía de OpenAI indica que Chat Completions no admite la llamada a herramientas con Astra y recomienda Responses API. La herramienta de generación de imágenes y las funciones asíncronas son funciones de Responses.
¿Los tokens de razonamiento son gratuitos?
No. Los tokens de razonamiento se facturan como tokens de salida a la tarifa de salida de la banda en la que estés, y ocupan contexto. El objeto usage los reporta en output_tokens_details.reasoning_tokens.
Prototipa el paso de renderizado sin clave de API
Genera con GPT Image 2 en el lienzo de Ciyo, conserva los resultados que apruebes y usa el mismo encargo cuando conectes la API de Astra a tu propio producto.