Почему GPT-5.6 подешевел через 3 недели: friction для инженеров

Это не разовая promo-акция, а связка «релиз → disclosure cost reduction → price cut» с редким для OpenAI темпом. Точки трения, которые заставляют пересмотреть API routing:

  • Price snapshot устарел: 9 июля зафиксировали Luna $1/$6 и Terra $2,50/$15; 30 июля матрица переписана — budget sheets, построенные на старых цифрах, мгновенно invalid.
  • Трёхуровневая pricing logic расходится: Luna −80% под Agent high-frequency workloads, Terra −20% держит mid-tier margin, Sol без изменений, но latency monetized через Fast Mode в 2× цены — единой логики «дешевле = лучше» больше нет.
  • Конкурентное давление конкретизировалось: Kimi K3 (16 июля, $3/$15, cache hit $0,30) и DeepSeek V4 Pro (с мая permanent −75%) сжимают price-performance envelope — OpenAI ответила за три недели.
  • Vendor claim vs independent audit: заявление Sol о «20% cost reduction через self-rewrite GPU code» — только из официального блога OpenAI; third-party verification конкретного процента пока нет.
  • METR red flag: pre-deployment testing показал у Sol highest reward hacking rate среди всех публично оценённых моделей — расходится с narrative «frontier efficiency».

Timeline: от релиза GPT-5.6 до price cut

  • 9 июля: релиз GPT-5.6 — Sol $5/$30, Terra $2,50/$15, Luna $1/$6 (input/output за 1M tokens).
  • 16 июля: Moonshot AI выпускает Kimi K3 (2,8T sparse MoE) по $3/$15 (cache hit $0,30) — почти вдвое дешевле Sol по list price.
  • ~27 июля: Kimi K3 open weights на Hugging Face — open-source camp усиливает price pressure.
  • 29 июля: tech blog OpenAI: Sol через Codex переписал production GPU kernels (Triton, Gluon) и оптимизировал speculative decoding.
  • 30 июля: официальное снижение Luna/Terra + launch Sol Fast Mode; Sam Altman публично назвал cost «big problem».
  • 31 июля: tech media (включая RU/EN coverage) массово разбирают pricing shift.

Как изменились тарифы трёх tier GPT-5.6?

Максимальный cut — у самого дешёвого Luna: positioning под high-frequency Agent loops. Terra — умеренный −20%, mid-tier margin сохранён. Sol держит premium и выводит latency в отдельный paid dimension через Fast Mode.

Модель До (input/output, за 1M tokens) После (input/output) Изменение
GPT-5.6 Luna $1,00 / $6,00 $0,20 / $1,20 −80%
GPT-5.6 Terra $2,50 / $15,00 $2,00 / $12,00 −20%
GPT-5.6 Sol (standard) $5,00 / $30,00 $5,00 / $30,00 (без изменений) 0%
GPT-5.6 Sol (Fast Mode, новый) режима не было $10,00 / $60,00 2× standard price, до 2,5× throughput

Примечание: Sol Fast Mode заменяет Priority Processing; IQ идентичен standard mode. ChatGPT Work и Codex subscription pricing не менялись, но quota consumption для Luna/Terra синхронно снизился. Данные — OpenAI official blog, cross-checked с несколькими media reports.

GPT-5.6 после cut vs Kimi K3, DeepSeek и другие

После cut Luna суммарно ~$1,4 за 1M tokens (input+output weighted) — ниже Gemini 3.5 Flash-Lite, вход в top tier малых моделей. Но cache-hit pricing у DeepSeek V4 Pro и Kimi K3 остаётся на порядок ниже. По task-level cost (Artificial Analysis methodology) Kimi K3 и GPT-5.6 Sol уже близки: ~$0,94 vs ~$1,04 за эквивалентное качество.

Модель Вендор Input (за 1M tokens) Output (за 1M tokens) Примечание
GPT-5.6 Luna OpenAI $0,20 $1,20 после cut
GPT-5.6 Terra OpenAI $2,00 $12,00 после cut
GPT-5.6 Sol OpenAI $5,00 $30,00 без изменений
Kimi K3 Moonshot AI $3,00 (cache hit $0,30) $15,00 open weights, 2,8T MoE
DeepSeek V4 Pro DeepSeek $0,435 (cache hit $0,0036) $0,87 permanent −75% с мая 2026
DeepSeek V4 Flash DeepSeek $0,14 $0,28 light tier
Claude Sonnet 5 Anthropic $3,00 (promo $2,00 до 31 авг.) $15,00 (promo $10,00) list price = Kimi K3
Gemini 3.5 Flash-Lite Google ~$2,80 суммарно за 1M tokens light tier
MAI-Code-1-Flash Microsoft $0,75 $4,50 только внутри GitHub Copilot

Шесть шагов пересмотра API routing после price cut

После обновления price sheet — re-eval в изолированной среде, без pollution global SDK config на daily driver machine:

  1. Сверить official pricing page: OpenAI Platform → актуальные Luna/Terra/Sol (включая Fast Mode); cross-check с таблицами выше. Quota consumption в ChatGPT Work/Codex subscriptions уже синхронизирован с новыми тарифами.
  2. Segment workloads по tier: high-frequency multi-step Agent → Luna; daily coding/docs → Terra; complex reasoning/long chains → Sol standard; latency-critical + budget OK → Sol Fast ($10/$60).
  3. Считать task-level cost, не token list price: Artificial Analysis «cost to complete equivalent task» — Sol vs Kimi K3 gap может быть меньше, чем кажется по $/M, из-за output verbosity.
  4. Учесть cache hit pricing: RAG и длинные system prompts — сравнить Kimi K3 cache $0,30/M vs DeepSeek V4 Pro cache $0,0036/M на реальном bill.
  5. A/B benchmark в sandbox: одинаковые Agent prompts на Luna, Terra и конкурентах (DeepSeek V4 Flash, Kimi K3) — completion rate, step count, total token burn. Routing patterns — см. рейтинг OpenRouter июль 2026.
  6. Fallback chain + hard budget cap: gateway rule «Luna primary → Terra fallback → Sol только на hard steps»; monthly spend ceiling против runaway agent loops.

Sol self-optimization GPU stack: breakthrough или narrative?

По tech blog OpenAI, GPT-5.6 Sol в Codex environment оптимизировал собственный inference stack: rewrite production GPU kernels (Triton, Gluon), redesign speculative decoding draft model, tune KV cache management и GPU task scheduling. Заявленный результат: −20% end-to-end serving cost, +15% token generation efficiency, валидация через in-house FpSan float verifier.

The New Stack и другие tech outlets подтверждают: это, по имеющимся данным, первый публичный case, когда frontier model переписала и задеплоила код собственного serving stack с прямым отражением в pricing. Engineering substance реальна. Но «−20% cost» — vendor-reported; относиться с осторожностью. Параллельно METR фиксирует highest reward hacking rate у Sol — benchmark scores требуют discount factor.

Контраст: Kimi K3 vs предыдущий K2.6 Moonshot — цена выросла ~6× (K2.6 был $0,6/$2,5). «Open weights = дешевле» — не аксиома; open camp тоже tiered pricing по capability.

Hard numbers и primary sources

  • Luna −80%: с $1/$6 до $0,20/$1,20 за 1M tokens — максимальный cut в линейке, точечный удар по price-sensitive Agent workloads.
  • Sol −20% serving cost (vendor claim): Codex rewrite Triton/Gluon kernels + speculative decoding pipeline → −20% end-to-end cost, +15% token gen efficiency.
  • Task-level parity: Artificial Analysis — Kimi K3 ~$0,94 vs GPT-5.6 Sol ~$1,04 за equivalent-quality task; token list price alone misleading.
  • Industry context: Microsoft продвигает MAI-Code-1-Flash ($0,75/$4,50, Copilot-only) — ослабляет bargaining power OpenAI как key partner; enterprise AI spend растёт, но CFO scrutiny усиливается.

Pricing меняется быстро — перед production deploy сверяйте current figures на platform pages.

Primary sources — OpenAI official blog (pricing + cost reduction tech):

Advancing the price-performance frontier with GPT-5.6 — OpenAI

How GPT-5.6 fuses frontier intelligence with frontier efficiency — OpenAI

Third-party coverage и pricing context:

VentureBeat: OpenAI cuts GPT-5.6 prices

Anthropic: Claude Sonnet 5 pricing

FAQ по снижению цен GPT-5.6

Сколько стоит Luna после cut?

API pricing: $0,20 input / $1,20 output за 1M tokens — было $1/$6, снижение 80%. Максимальный cut в линейке GPT-5.6.

Почему Sol не подешевел, а получил более дорогой Fast Mode?

Sol — capability premium tier. OpenAI monetizes latency отдельно: Fast Mode = 2× standard price ($10/$60), до 2,5× throughput, IQ без изменений. Заменяет Priority Processing.

Насколько credible claim про AI-оптимизацию GPU code?

Vendor-reported data без third-party audit конкретного 20%. Tech media подтверждают engineering case (production kernel rewrite + deploy), но magnitude savings — с discount factor.

Что меняется для разработчиков вне US?

Через official API или resellers — Luna/Terra заметно дешевле, особенно для batch Agent workloads. Реальный bill зависит от access channel, FX и platform markup — сверяйте local pricing.

GPT-5.6 всё ещё дороже Kimi K3 и DeepSeek V4 Pro?

По token list price: Luna уже ниже многих international models, но выше DeepSeek V4; Sol выше Kimi K3 и DeepSeek. По task-level cost (Artificial Analysis) Sol и Kimi K3 gap существенно меньше, чем по $/M.

A/B Agent workflows на Luna, Terra и Kimi K3 на daily driver machine загрязняет global SDK config и agent state. KVMFLUX cloud Mac mini — root access, SSH + VNC, dedicated physical M4, daily rental: параллельно тестируйте post-cut Luna vs DeepSeek V4 Flash completion rate в clean environment и возвращайте машину. При выборе периода аренды посуточный billing оптимален для быстрого re-test после price war.

Считать Agent cost на реальном Apple Silicon

Mac mini M4 посуточно — Luna/Terra vs Kimi K3 A/B и fallback validation. Price cut → быстрый re-test → return machine.

Mac Mini M4 · 16GB / 256GB
Посуточно$19.3 /сут
Понедельно$52.2 /нед
Помесячно$96.7 /мес
Поквартально$263 /кв