Ciyo · GPT-6

GPT-6 Astra 的上下文窗口:百万 token 的实际用法

一条长长的风琴折纸带盘绕进一个琥珀色玻璃容器,一根铜线标记着纸带上的某一点。
为本文创作的概念配图。

GPT-6 Astra 的模型页面列出三个常被混为一谈的数字:1,050,000 token 的上下文窗口、922,000 token 的最大输入,以及 128,000 token 的最大输出。第四个数字在价格页面上:输入超过 272,000 token 后,请求按长上下文档计费。

本指南解释这些数字之间的关系、创作团队实际能放进一次请求的内容,以及如何让账单可预测。它依据 2026 年 9 月 7 日的 OpenAI 模型页面、价格页面、推理指南和 token 文档,外加发布文章中厂商报告的长上下文结果。

三个数字及其关系

上下文窗口是一次请求能占用的总空间:你的输入、模型的可见输出,以及它隐藏的推理 token。922,000 token 的输入上限限制你能发送的内容。128,000 token 的输出上限限制返回的内容。因为推理 token 占用上下文并按输出计费,一个经过大量推理的答案留下的空间比它的可见长度暗示的更少。

OpenAI 的 token 指南给出粗略的英文估算:一个 token 约为四个字符,或约四分之三个单词,所以 100 个 token 大约是 75 个单词。其他语言的分词方式不同。按这个估算,输入上限可容纳约 690,000 个英文单词,比一整架品牌指南、宣传方案和过往文案加起来还多。

图片也要计数

参考图不是免费的上下文。OpenAI 的视觉指南描述了当前模型基于图块的计数方式:图片被切成 32 像素的图块,受每档细节预算限制,再乘以模型系数。其示例中,GPT-5 模型在高细节下,一张 1024 × 1024 的图片约 1,229 个 token,一张 2048 × 2048 的图片约 3,000 个 token。这些示例针对 gpt-5.4;指南尚未列出 gpt-6-astra 的系数,因此请把它们当作估算。

五十张较大尺寸的产品照片在任何文本之前就增加约 150,000 个 token。这远在窗口之内,也仍低于价格门槛,但一旦品牌手册放进同一次请求,它就不可忽略。把参考图缩到任务需要的尺寸,发送最清晰的那些,而不是全部。

272,000 token 的门槛

按标准价,Astra 每百万输入 token 10 美元,缓存输入 1 美元,输出 50 美元。当一次请求的输入超过 272,000 token,整次请求按输入 20 美元、缓存 2 美元、缓存写入 25 美元、输出 75 美元计费。这个档位适用于整次请求,而不只是超出部分的 token。

一次 270,000 输入 token 加 2,000 输出 token 的请求为 2.80 美元。同样的请求输入变成 275,000 token 则为 5.65 美元,因为输入一行变成 5.50 美元,输出一行变成 0.15 美元。多出的五千个 token 让价格翻倍。相比之下,Anthropic 对 Claude Fable 5.1 的完整 1M 上下文按标准价计费,如果两个模型你都在用,这一点值得知道。

门槛两侧的两次请求,标准价,无缓存
请求输入费用输出费用合计
270,000 输入 + 2,000 输出$2.70$0.10$2.80
275,000 输入 + 2,000 输出$5.50$0.15$5.65
四根按比例绘制的横向柱子:1,050,000 token 的上下文窗口、922,000 token 的输入上限、272,000 token 的价格门槛和 128,000 token 的输出上限。
2026 年 9 月 7 日的 Astra 官方限制。门槛标记整次请求转入长上下文价格的位置。

模型真的能用上一百万 token 吗?

OpenAI 的发布文章报告了八根“针”的 MRCR v2 成绩:Astra 在 256K 至 512K token 区间为 100.0%,512K 至 1M 区间为 96.3%,GPT-5.6 Sol 对应为 91.5% 和 73.8%。这些是厂商报告的检索结果,表明窗口的后半段比上一代模型可用得多。

检索不等于判断。能在品牌手册第 400 页找到一条规则的模型,仍然要把它正确应用到一个标题上。用你自己的材料测试:把一条具体的禁令放在资料包深处,要求写一段会违反它的文案,看模型是否察觉。这是一个五分钟的实验,通过条件清楚。

缓存资料包,变换任务

提示缓存把重复的前缀从每百万 10 美元的输入变成 1 美元。把稳定的材料放在最前面,每次顺序相同:品牌规则、产品事实、语气示例。然后追加会变化的任务。Astra 使用 prompt_cache_options.ttl 设置,OpenAI 的指南用 30m 表示半小时的缓存窗口。

一个 200,000 token 的资料包,未缓存读取要 2.00 美元,从缓存读取要 0.20 美元。缓存写入按每百万 12.50 美元计费,所以每次请求都重写前缀会浪费这项收益。如果需要在请求之间改变推理程度,使用 configuration_update 项而不是编辑提示词,指南说明这样能保留缓存前缀。

什么时候留在门槛以下

大多数创作请求不需要整个窗口。一份宣传需求、一段品牌资料和二十张参考图远远不到 100,000 token。把日常工作留在标准档,把长上下文请求留给确实需要完整资料包的任务,例如审核一整年宣传项目里的每一条声明。

对于经常变化的资料库,file_search 工具是加载全部内容之外的选择:OpenAI 的定价是每千次调用 2.50 美元,存储每 GB 每天 0.10 美元,首个 GB 免费。它检索相关段落,而不是每次请求都发送整个档案,这让大多数调用留在较便宜的档位。

输出也有自己的上限

128,000 token 的输出限制包含隐藏推理,用量对象在 output_tokens_details.reasoning_tokens 下单独报告推理。一次要求一口气写出五十条本地化产品描述的请求,可能把大部分预算花在推理上,最后几条描述就没有空间了。每次请求少要几条,或者用 Batch 以半价批量输出。

有意识地设置 max_output_tokens。token 文档提醒开发者,推理模型既需要推理空间,也需要可见答案的空间,所以过紧的上限截断的是回答而不是思考。留出余量,检查用量,根据数据调整。

ChatGPT 和 Codex 中的长上下文

上面的数字是 API 数字。在 ChatGPT 内部,产品替你管理上下文,模型的有效窗口可能因产品而异。发布文章介绍了 Codex 为 Astra 新增的一项功能,它跨上下文窗口保留笔记,并让之前的窗口可以搜索,所以一次长时间的设计会话不会丢失早先决定背后的理由;该功能发布时为实验性质,在 Codex 配置文件中启用。

Work 和 Codex 的用量按套餐积分计量,而不是 API token,它们的额度与 Chat 相互独立。如果你在这些入口推送大型参考资料包,关注的应是套餐额度而不是每 token 价格,并查看当前的限制页面,而不是假设它与 API 行为一致。

创作团队的实用配置

整理一份单一、稳定的参考资料包:品牌规则、已批准的声明、语气样本和一份简短术语表。把它控制在 200,000 token 以下,这样缓存读取便宜,每次请求都留在标准档,还有放参考图的余地。给它标版本,并记录每个交付物用的是哪个版本。

然后让图片模型做它自己的工作。无论 Astra 从一百万 token 还是从一份精简资料包做规划,图片仍然来自有自己参数的图片模型。在 Ciyo 上你可以根据那份方案用 GPT Image 2 生成,保留通过审核的结果,按次付费,不用盯着套餐额度。

继续阅读

关于 Astra 上下文窗口的常见问题

上下文窗口是 100 万还是 105 万 token?

模型页面列出 1,050,000 token 上下文,最大输入 922,000 token,最大输出 128,000 token。宣传材料常把它约成 1M。

长上下文价格从什么时候开始?

当一次请求的输入超过 272,000 token 时。整次请求随即按每百万 token 20 美元输入、2 美元缓存输入、75 美元输出计费,而不是 10、1 和 50 美元。

推理 token 会占用上下文窗口吗?

会。OpenAI 的文档说明推理 token 占用上下文并按输出计费。在输出限制下留出余量,每次请求后检查 output_tokens_details.reasoning_tokens。

从资料包做规划,在画布上渲染

把 Astra 根据你的品牌手册写出的需求带到 Ciyo,用 GPT Image 2 生成,按输出付费而不是按 token 付费。