Ciyo · GPT-6
GPT-6 Astra 的上下文視窗:實務中的 1M token

GPT-6 Astra 的模型頁面列出三個常被混為一談的數字:1,050,000 token 的上下文視窗、922,000 token 的最大輸入,以及 128,000 token 的最大輸出。第四個數字在價格頁面上:輸入超過 272,000 token 的請求按長上下文級距計費。
本指南解釋這些數字之間的關係、創作團隊實際能在一次請求裡放進什麼,以及怎樣讓帳單可以預測。它反映 2026 年 9 月 7 日 OpenAI 的模型頁面、價格頁面、推理指南和 token 文件,加上發布文章中的長上下文結果,這些結果由廠商自行回報。
三個數字以及它們的關係
上下文視窗是一次請求可占用的總空間:你的輸入、模型的可見輸出,以及它隱藏的推理 token。922,000 token 的輸入上限限制你能傳送的內容。128,000 token 的輸出上限限制回傳的內容。因為推理 token 占用上下文並按輸出計費,一個大量推理的答案留下的空間,比它的可見長度所暗示的更少。
OpenAI 的 token 指南給出粗略的英文估算:一個 token 約四個字元,或約四分之三個單字,所以 100 個 token 大約是 75 個單字。其他語言的 token 切分方式不同。按這個估算,輸入上限能容納約 690,000 個英文單字,比一整排品牌指南、宣傳簡報和過往文案加起來還多。
圖片也要計算
參考圖不是免費的上下文。OpenAI 的視覺指南描述目前模型以區塊為基礎的計算方式:圖片被切成 32 畫素的區塊,受每種細節程度的預算限制,再乘以模型係數。其範例把 1024 × 1024 的圖片估為約 1,229 token,2048 × 2048 的圖片估為約 3,000 token,以 GPT-5 模型在 high 細節下計算。這些範例針對 gpt-5.4;指南尚未列出 gpt-6-astra 的係數,因此請把它們當作估算。
五十張較大尺寸的產品照片,在任何文字之前就增加約 150,000 token。這遠在視窗之內,也仍低於價格門檻,但一旦品牌手冊也在同一次請求裡,就不能忽略。把參考圖縮小到任務需要的尺寸,並傳送最清晰的幾張,而不是全部。
272,000 token 的門檻
按標準費率,Astra 每百萬輸入 token 10 美元、快取輸入 1 美元、輸出 50 美元。當一次請求的輸入超過 272,000 token,整次請求改按輸入 20 美元、快取 2 美元、快取寫入 25 美元、輸出 75 美元計費。這個級距適用於整次請求,而不只是超過門檻的那些 token。
一次 270,000 輸入 token 加 2,000 輸出 token 的請求花費 2.80 美元。同樣的請求改為 275,000 輸入 token 則花費 5.65 美元,因為輸入這一項變成 5.50 美元,輸出這一項變成 0.15 美元。多出五千個 token,價格就翻倍。相較之下,Anthropic 對 Claude Fable 5.1 的完整 1M 上下文採用標準價格,如果你兩個都在用,這一點值得知道。
| 請求 | 輸入費用 | 輸出費用 | 合計 |
|---|---|---|---|
| 270,000 輸入 + 2,000 輸出 | $2.70 | $0.10 | $2.80 |
| 275,000 輸入 + 2,000 輸出 | $5.50 | $0.15 | $5.65 |
模型真的會用到一百萬 token 嗎?
OpenAI 的發布文章回報八根針的 MRCR v2:Astra 在 256K 至 512K token 之間為 100.0%,在 512K 至 1M 之間為 96.3%,GPT-5.6 Sol 則分別為 91.5% 與 73.8%。這些是廠商自行回報的檢索結果,顯示視窗的後半段比前一代模型可用得多。
檢索不等於判斷。能在品牌手冊第 400 頁找到一條規則的模型,仍然必須把它正確套用到一個標題上。用你自己的材料測試:把一條具體的禁令放在資料包深處,要求寫出會違反它的文案,然後檢查模型是否注意到。這是一個五分鐘的實驗,而且通過條件很清楚。
快取資料包,變更任務
提示快取把重複的前綴從每百萬 10 美元的輸入變成 1 美元。把穩定的材料放在最前面,每次都用相同的順序:品牌規則、產品事實、語氣範例。然後再附加會變動的任務。Astra 使用 prompt_cache_options.ttl 設定,OpenAI 的指南示範以 30m 值表示半小時的快取視窗。
一份 200,000 token 的資料包,未快取讀取花費 2.00 美元,從快取讀取為 0.20 美元。快取寫入按每百萬 12.50 美元計費,所以每次請求都重寫前綴會浪費這項好處。如果需要在請求之間更改推理程度,使用 configuration_update 項目而不是編輯提示詞,指南說明這樣能保留快取的前綴。
什麼時候該留在門檻之下
大多數創作請求不需要整個視窗。一份宣傳需求、一段品牌內容和二十張參考圖,遠不到 100,000 token 就放得下。把日常工作留在標準級距,長上下文請求則保留給真正需要完整資料包的任務,例如稽核一年宣傳活動中的每一條宣稱。
對於經常變動的文件庫,file_search 工具是載入全部內容之外的另一個選擇:OpenAI 的定價為每千次呼叫 2.50 美元,儲存每 GB 每天 0.10 美元,第一個 GB 免費。它檢索相關段落,而不是每次請求都傳送整個檔案庫,這讓大多數呼叫留在較便宜的級距。
輸出有自己的上限
128,000 token 的輸出限制包含隱藏的推理,usage 物件會在 output_tokens_details.reasoning_tokens 之下分開回報推理。一次要求五十份在地化產品描述的請求,可能把大部分預算花在推理上,然後在最後幾份描述時用完空間。每次請求少要一些項目,或者用 Batch 以半價處理大量輸出。
有意識地設定 max_output_tokens。token 文件提醒開發者,推理模型除了可見答案之外還需要推理的空間,所以過緊的上限可能截斷回覆而不是思考。留出餘裕、檢查 usage,並根據資料調整。
ChatGPT 與 Codex 中的長上下文
上面的數字都是 API 數字。在 ChatGPT 裡,產品會替你管理上下文,模型的有效視窗可能因產品而異。發布文章描述了 Astra 在 Codex 的一項新功能,能跨上下文視窗保留筆記,並讓先前的視窗可供搜尋,所以一段很長的設計工作階段不會遺失先前決定的理由;它在發布時屬於實驗性功能,需在 Codex 設定檔中啟用。
Work 和 Codex 的用量以方案積分計量,而不是 API token,其額度與 Chat 分開。如果你透過這些入口推送大型參考資料包,要留意的是方案額度而不是每 token 價格,並查閱目前的限制頁面,而不是假設它與 API 行為相同。
創作團隊的實用設定
整理一份單一且穩定的參考資料包:品牌規則、已核准的宣稱、語氣範例和一份簡短詞彙表。把它控制在 200,000 token 以下,讓快取讀取便宜,每次請求都留在標準級距,並保有放參考圖的空間。為它建立版本,並記錄每份交付物使用了哪個版本。
然後讓渲染器做它自己的工作。無論 Astra 是從一百萬 token 還是從一份精簡資料包做規劃,圖片仍然來自一個有自己設定的圖片模型。在 Ciyo 上,你可以根據那份計畫用 GPT Image 2 生成,保留通過的輸出,並按每次生成付費,不需要盯著方案額度。
繼續閱讀
關於 Astra 上下文視窗的常見問題
上下文視窗是 1M 還是 1.05M token?
模型頁面列出 1,050,000 token 的上下文,最大輸入 922,000 token,最大輸出 128,000 token。行銷材料常把它四捨五入為 1M。
長上下文價格從什麼時候開始?
當一次請求的輸入超過 272,000 token 時。整次請求改按每百萬 token 輸入 20 美元、快取輸入 2 美元、輸出 75 美元計費,而不是 10、1 和 50 美元。
推理 token 會占用上下文視窗嗎?
會。OpenAI 的文件說明推理 token 占用上下文並按輸出計費。在輸出限制之下留出餘裕,並在每次請求後檢查 output_tokens_details.reasoning_tokens。
從資料包規劃,在畫布上渲染
把 Astra 根據你的品牌手冊產出的需求帶到 Ciyo,用 GPT Image 2 生成,並按每次輸出付費,而不是按 token 付費。