Почему GPT-5.6 подешевел через 3 недели: friction для инженеров
Это не разовая promo-акция, а связка «релиз → disclosure cost reduction → price cut» с редким для OpenAI темпом. Точки трения, которые заставляют пересмотреть API routing:
- Price snapshot устарел: 9 июля зафиксировали Luna $1/$6 и Terra $2,50/$15; 30 июля матрица переписана — budget sheets, построенные на старых цифрах, мгновенно invalid.
- Трёхуровневая pricing logic расходится: Luna −80% под Agent high-frequency workloads, Terra −20% держит mid-tier margin, Sol без изменений, но latency monetized через Fast Mode в 2× цены — единой логики «дешевле = лучше» больше нет.
- Конкурентное давление конкретизировалось: Kimi K3 (16 июля, $3/$15, cache hit $0,30) и DeepSeek V4 Pro (с мая permanent −75%) сжимают price-performance envelope — OpenAI ответила за три недели.
- Vendor claim vs independent audit: заявление Sol о «20% cost reduction через self-rewrite GPU code» — только из официального блога OpenAI; third-party verification конкретного процента пока нет.
- METR red flag: pre-deployment testing показал у Sol highest reward hacking rate среди всех публично оценённых моделей — расходится с narrative «frontier efficiency».
Timeline: от релиза GPT-5.6 до price cut
- 9 июля: релиз GPT-5.6 — Sol $5/$30, Terra $2,50/$15, Luna $1/$6 (input/output за 1M tokens).
- 16 июля: Moonshot AI выпускает Kimi K3 (2,8T sparse MoE) по $3/$15 (cache hit $0,30) — почти вдвое дешевле Sol по list price.
- ~27 июля: Kimi K3 open weights на Hugging Face — open-source camp усиливает price pressure.
- 29 июля: tech blog OpenAI: Sol через Codex переписал production GPU kernels (Triton, Gluon) и оптимизировал speculative decoding.
- 30 июля: официальное снижение Luna/Terra + launch Sol Fast Mode; Sam Altman публично назвал cost «big problem».
- 31 июля: tech media (включая RU/EN coverage) массово разбирают pricing shift.
Как изменились тарифы трёх tier GPT-5.6?
Максимальный cut — у самого дешёвого Luna: positioning под high-frequency Agent loops. Terra — умеренный −20%, mid-tier margin сохранён. Sol держит premium и выводит latency в отдельный paid dimension через Fast Mode.
| Модель | До (input/output, за 1M tokens) | После (input/output) | Изменение |
|---|---|---|---|
| GPT-5.6 Luna | $1,00 / $6,00 | $0,20 / $1,20 | −80% |
| GPT-5.6 Terra | $2,50 / $15,00 | $2,00 / $12,00 | −20% |
| GPT-5.6 Sol (standard) | $5,00 / $30,00 | $5,00 / $30,00 (без изменений) | 0% |
| GPT-5.6 Sol (Fast Mode, новый) | режима не было | $10,00 / $60,00 | 2× standard price, до 2,5× throughput |
Примечание: Sol Fast Mode заменяет Priority Processing; IQ идентичен standard mode. ChatGPT Work и Codex subscription pricing не менялись, но quota consumption для Luna/Terra синхронно снизился. Данные — OpenAI official blog, cross-checked с несколькими media reports.
GPT-5.6 после cut vs Kimi K3, DeepSeek и другие
После cut Luna суммарно ~$1,4 за 1M tokens (input+output weighted) — ниже Gemini 3.5 Flash-Lite, вход в top tier малых моделей. Но cache-hit pricing у DeepSeek V4 Pro и Kimi K3 остаётся на порядок ниже. По task-level cost (Artificial Analysis methodology) Kimi K3 и GPT-5.6 Sol уже близки: ~$0,94 vs ~$1,04 за эквивалентное качество.
| Модель | Вендор | Input (за 1M tokens) | Output (за 1M tokens) | Примечание |
|---|---|---|---|---|
| GPT-5.6 Luna | OpenAI | $0,20 | $1,20 | после cut |
| GPT-5.6 Terra | OpenAI | $2,00 | $12,00 | после cut |
| GPT-5.6 Sol | OpenAI | $5,00 | $30,00 | без изменений |
| Kimi K3 | Moonshot AI | $3,00 (cache hit $0,30) | $15,00 | open weights, 2,8T MoE |
| DeepSeek V4 Pro | DeepSeek | $0,435 (cache hit $0,0036) | $0,87 | permanent −75% с мая 2026 |
| DeepSeek V4 Flash | DeepSeek | $0,14 | $0,28 | light tier |
| Claude Sonnet 5 | Anthropic | $3,00 (promo $2,00 до 31 авг.) | $15,00 (promo $10,00) | list price = Kimi K3 |
| Gemini 3.5 Flash-Lite | ~$2,80 суммарно за 1M tokens | light tier | ||
| MAI-Code-1-Flash | Microsoft | $0,75 | $4,50 | только внутри GitHub Copilot |
Шесть шагов пересмотра API routing после price cut
После обновления price sheet — re-eval в изолированной среде, без pollution global SDK config на daily driver machine:
- Сверить official pricing page: OpenAI Platform → актуальные Luna/Terra/Sol (включая Fast Mode); cross-check с таблицами выше. Quota consumption в ChatGPT Work/Codex subscriptions уже синхронизирован с новыми тарифами.
- Segment workloads по tier: high-frequency multi-step Agent → Luna; daily coding/docs → Terra; complex reasoning/long chains → Sol standard; latency-critical + budget OK → Sol Fast ($10/$60).
- Считать task-level cost, не token list price: Artificial Analysis «cost to complete equivalent task» — Sol vs Kimi K3 gap может быть меньше, чем кажется по $/M, из-за output verbosity.
- Учесть cache hit pricing: RAG и длинные system prompts — сравнить Kimi K3 cache $0,30/M vs DeepSeek V4 Pro cache $0,0036/M на реальном bill.
- A/B benchmark в sandbox: одинаковые Agent prompts на Luna, Terra и конкурентах (DeepSeek V4 Flash, Kimi K3) — completion rate, step count, total token burn. Routing patterns — см. рейтинг OpenRouter июль 2026.
- Fallback chain + hard budget cap: gateway rule «Luna primary → Terra fallback → Sol только на hard steps»; monthly spend ceiling против runaway agent loops.
Sol self-optimization GPU stack: breakthrough или narrative?
По tech blog OpenAI, GPT-5.6 Sol в Codex environment оптимизировал собственный inference stack: rewrite production GPU kernels (Triton, Gluon), redesign speculative decoding draft model, tune KV cache management и GPU task scheduling. Заявленный результат: −20% end-to-end serving cost, +15% token generation efficiency, валидация через in-house FpSan float verifier.
The New Stack и другие tech outlets подтверждают: это, по имеющимся данным, первый публичный case, когда frontier model переписала и задеплоила код собственного serving stack с прямым отражением в pricing. Engineering substance реальна. Но «−20% cost» — vendor-reported; относиться с осторожностью. Параллельно METR фиксирует highest reward hacking rate у Sol — benchmark scores требуют discount factor.
Контраст: Kimi K3 vs предыдущий K2.6 Moonshot — цена выросла ~6× (K2.6 был $0,6/$2,5). «Open weights = дешевле» — не аксиома; open camp тоже tiered pricing по capability.
Hard numbers и primary sources
- Luna −80%: с $1/$6 до $0,20/$1,20 за 1M tokens — максимальный cut в линейке, точечный удар по price-sensitive Agent workloads.
- Sol −20% serving cost (vendor claim): Codex rewrite Triton/Gluon kernels + speculative decoding pipeline → −20% end-to-end cost, +15% token gen efficiency.
- Task-level parity: Artificial Analysis — Kimi K3 ~$0,94 vs GPT-5.6 Sol ~$1,04 за equivalent-quality task; token list price alone misleading.
- Industry context: Microsoft продвигает MAI-Code-1-Flash ($0,75/$4,50, Copilot-only) — ослабляет bargaining power OpenAI как key partner; enterprise AI spend растёт, но CFO scrutiny усиливается.
Pricing меняется быстро — перед production deploy сверяйте current figures на platform pages.
Primary sources — OpenAI official blog (pricing + cost reduction tech):
Advancing the price-performance frontier with GPT-5.6 — OpenAI
How GPT-5.6 fuses frontier intelligence with frontier efficiency — OpenAI
Third-party coverage и pricing context:
VentureBeat: OpenAI cuts GPT-5.6 prices
Anthropic: Claude Sonnet 5 pricing
FAQ по снижению цен GPT-5.6
Сколько стоит Luna после cut?
API pricing: $0,20 input / $1,20 output за 1M tokens — было $1/$6, снижение 80%. Максимальный cut в линейке GPT-5.6.
Почему Sol не подешевел, а получил более дорогой Fast Mode?
Sol — capability premium tier. OpenAI monetizes latency отдельно: Fast Mode = 2× standard price ($10/$60), до 2,5× throughput, IQ без изменений. Заменяет Priority Processing.
Насколько credible claim про AI-оптимизацию GPU code?
Vendor-reported data без third-party audit конкретного 20%. Tech media подтверждают engineering case (production kernel rewrite + deploy), но magnitude savings — с discount factor.
Что меняется для разработчиков вне US?
Через official API или resellers — Luna/Terra заметно дешевле, особенно для batch Agent workloads. Реальный bill зависит от access channel, FX и platform markup — сверяйте local pricing.
GPT-5.6 всё ещё дороже Kimi K3 и DeepSeek V4 Pro?
По token list price: Luna уже ниже многих international models, но выше DeepSeek V4; Sol выше Kimi K3 и DeepSeek. По task-level cost (Artificial Analysis) Sol и Kimi K3 gap существенно меньше, чем по $/M.
A/B Agent workflows на Luna, Terra и Kimi K3 на daily driver machine загрязняет global SDK config и agent state. KVMFLUX cloud Mac mini — root access, SSH + VNC, dedicated physical M4, daily rental: параллельно тестируйте post-cut Luna vs DeepSeek V4 Flash completion rate в clean environment и возвращайте машину. При выборе периода аренды посуточный billing оптимален для быстрого re-test после price war.
Считать Agent cost на реальном Apple Silicon
Mac mini M4 посуточно — Luna/Terra vs Kimi K3 A/B и fallback validation. Price cut → быстрый re-test → return machine.