OpenAI 7 月 30 日更新 API Changelog,宣布 GPT-5.6 Luna 的成本降低 80%,GPT-5.6 Terra 降低 20%,同時把 Priority Processing 改名為 Fast mode。官方 Fast mode 文件表示,GPT-5.6 Sol 在這個服務層級的處理速度最高可達標準處理的 2.5 倍,代價是以較高的 API 價格換取較低且更一致的延遲。

這次變更同時改變模型階層與服務層級的採購選項:Luna、Terra 適合大量或成本敏感的工作負載,Sol 可以用 Fast mode 處理對延遲敏感的請求。2.5 倍是官方最高值;每次請求的速度仍受模型、流量與請求型態影響,文件沒有把它寫成固定延遲保證。
GPT-5.6 Luna 與 Terra 先從成本端調整
OpenAI Changelog 把這次降價列為 GPT-5.6 模型家族的更新。API pricing 頁面目前列出的標準短 context 價格為:GPT-5.6 Sol 每百萬 input tokens 5 美元、output tokens 30 美元;Terra 為 2 美元與 12 美元;Luna 為 0.20 美元與 1.20 美元。長 context 另有較高費率,不能只用短 context 價格估算所有請求。
OpenAI 也在定價頁把快取輸入、cache writes、Batch、Flex 與 Fast mode 分開列出。符合資料駐留條件的區域處理端點,對 2026 年 3 月 5 日後發布且支援資料駐留的模型會加收 10%;若透過 Amazon Bedrock 使用 OpenAI 模型,計費由 AWS 處理,價格也可能與直接使用 OpenAI API 不同。
Fast mode 取代 Priority Processing 並保留既有參數
Fast mode 文件寫明,Priority Processing 在 2026 年 7 月 30 日改名為 Fast mode。開發者可以在 Responses API 或 Chat Completions API 的請求中使用 `service_tier: “fast”`;既有的 `service_tier: “priority”` 仍會對支援的模型提供相同處理方式,讓舊有請求不必立刻修改。
目前文件給出的 GPT-5.6 Sol 指標是最高 2.5 倍於 Standard processing,並將 Fast mode 定位在需要低延遲的高價值、面向使用者的應用。這種服務層級適合把延遲與成本一起納入路由規則,不能只看模型本身的每 token 價格。

Fast mode 仍受共用速率限制與流量爬坡規則約束
OpenAI 文件表示,Fast mode 與 Standard processing 共用同一模型的 rate limit,Fast mode 的用量也會照同一套速率限制計算。若流量增加過快,部分 Fast mode 請求可能被降回標準速度,並按照標準費率計費;回應中的 `service_tier` 會顯示實際採用的處理層級。
文件舉出的 ramp rate 條件包括每分鐘至少 1,000,000 tokens,並在 15 分鐘內把 TPM 提高超過 50%;這是公開的避免觸發條件說明,各帳戶的實際配額仍可能不同。應用程式若依賴 Fast mode,需要同時記錄回應層級、速率限制與實際成本。
OpenAI 尚未把 2.5 倍速度寫成固定 SLA
目前公開文件能確認 GPT-5.6 Luna 與 Terra 的降價幅度、Fast mode 的名稱與 `service_tier` 設定,以及 GPT-5.6 Sol 最高 2.5 倍於標準處理的官方標示;文件沒有把這個最高值承諾為所有請求的固定延遲 SLA。實際導入仍需依短/長 context、區域處理、流量爬坡與回應中的服務層級核算成本。
消息來源:OpenAI API Changelog:GPT-5.6 價格與 Fast mode、OpenAI API Pricing、OpenAI:Fast mode。