Почему headline 1100% не совпадает с большинством счетов

Точки трения для закупки и инженерии конкретны:

  • Издания цитировали разные строки тарифа. «11x», «свыше 1100%» и «350%» по отдельности верны. Они относятся к peak cache-hit input, output и cache-miss input — не к смешанной ставке.
  • Пиковые часы теперь в цене. Peak — 9–12 и 14–18 по пекинскому времени. Формулировка про «более гибкое планирование нагрузки» описывает ёмкость, не маркетинг.
  • Official больше не всегда самый дешёвый канал. В пик собственный API DeepSeek выше ряда реселлеров (GMI Cloud, Novita и другие по-прежнему ставят V4 Pro ниже нового official peak).
  • Открытые веса по умолчанию не Apache 2.0. Qwen3.8-Max скачивается, но custom license удерживает рычаг над крупным MaaS и assistant-бизнесом.

Ранее разобраны GA-скоры DeepSeek V4 Flash и старый flat-тариф и окно релиза Qwen3.8-Max. Этот текст — про синхронный сдвиг трёх лабораторий в середине августа, не ещё один recap одной модели.

Что произошло за две недели: таймлайн

С середины июля до 00:00 пекинского времени 17 августа:

Дата Событие
16 июля 2026 Moonshot AI открывает веса Kimi K3 (2.8T параметров); реакция US security
2–3 августа 2026 Alibaba анонсирует, затем запускает Qwen3.8-Max как hosted API
10 августа 2026 Meta выпускает Muse Glimmer (30B, Apache 2.0) и tease открытых весов флагмана Muse Spark 1.2
12 августа 2026 Alibaba публикует Qwen3.8-2.4T-A95B на Hugging Face / ModelScope; xAI выпускает Grok 4.6
13 августа 2026 DeepSeek-V4-Pro выходит в GA и объявляет повышение цен с 17 августа; Google выпускает Gemini 3.7 Flash со скидкой
14 августа 2026 Zhipu выпускает GLM-5.3, тот же 743B-base, что у GLM-5.2
17 августа 2026, 00:00 Пекин Новый прайсинг DeepSeek вступает в силу

Шире: 30 июля OpenAI снизила GPT-5.6 Luna на 80%, 6–7 августа сделала Luna free default с безлимитным текстовым чатом. Китайские лаборатории поднимали цены и открывали флагманские веса, американские — резали цены и уходили в free на consumer-слое. Одна игра, две стороны. Снижение Luna разобрано в заметке по прайсингу GPT-5.6.

Тарифные сетки и спецификации: остаётся ли DeepSeek самым дешёвым frontier API

Ставки DeepSeek ниже — RMB за 1M токенов, с 17 августа 00:00 по Пекину. Peak: 9–12 и 14–18 пекинского времени.

Строка тарифа Было Новый off-peak Новый peak Рост в peak
V4-Flash cache hit (input) ¥0.02 ¥0.05 ¥0.10 ~400%
V4-Flash cache miss (input) ¥1.0 ¥1.5 ¥3.0 200%
V4-Flash output ¥2.0 ¥4.5 ¥9.0 350%
V4-Pro cache hit (input) ¥0.025 ¥0.15 ¥0.30 ~1100%
V4-Pro cache miss (input) ¥3.0 ¥4.5 ¥9.0 200%
V4-Pro output ¥6.0 ¥13.5 ¥27.0 350%

Цифра 1100% относится к peak cache-hit input — строке, которая стартовала ближе всего к нулю. Output, который доминирует в большинстве реальных счетов, вырос на 350%. Независимая модель тяжёлой нагрузки (около 84M токенов/мес, в основном off-peak, примерно половина cache hit) даёт рост счёта ближе к 1.8x.

Qwen3.8-2.4T-A95B (открытые веса Qwen3.8-Max):

Спека Значение
Параметры 2.4T всего, 95B active на токен (MoE, 512 experts, 10 routed + 1 shared)
Контекст 262144 токенов native (open checkpoint), расширяется до ~1.01M; hosted Max по умолчанию 1M
Каденция релиза Preview 2 августа → API 3 августа → открытые веса 12 августа
API-прайсинг (international) $2/M input, $6/M output
Лицензия Не Apache 2.0 — custom Qwen3.8-Max License
Значение Первые Max-веса Alibaba; Qwen3.5/3.6/3.7 Max оставались API-only

GLM-5.3 vs GLM-5.2: тот же base, только пост-обучение. Ниже — собственные цифры Zhipu; независимого third-party re-run пока нет.

Бенчмарк GLM-5.2 GLM-5.3 Изменение
Terminal-Bench 3.0 4.6% 28.3% +23.7
DeepSWE v1.1 46.2% 66.9% +20.7
Agents' Last Exam (CLI) 23.8% 28.5% +4.7
CyberGym 77.2% 84.5% +7.3
AutomationBench 26.2% 48.2% +22.0

На Terminal-Bench 3.0 GLM-5.3 отстаёт от GPT-5.6 Sol (34.6%) и Claude Fable 5 (33.7%). Это верхний ряд open-weight результатов, не абсолютный frontier win.

Прямое сравнение (за 1M токенов; RMB/USD ≈ ¥7.15/$1, оценка):

Модель Input Output Открытые веса
DeepSeek V4-Pro (peak) ¥9.0 (~$1.26) ¥27.0 (~$3.78) Нет
DeepSeek V4-Pro (off-peak) ¥4.5 (~$0.63) ¥13.5 (~$1.89) Нет
Qwen3.8-Max (international API) $2 $6 Да (custom license)
OpenAI GPT-5.6 Luna $0.20 $1.20 Нет
Claude Opus 5 (implied, ratio Alibaba) ~$5 ~$25 Нет

Кратко: нет. Off-peak V4-Pro всё ещё заметно ниже Claude Opus 5, но это уже не безусловно самый дешёвый вариант. International Qwen3.8-Max и OpenAI Luna оба подрезают DeepSeek off-peak хотя бы по одной оси. Равенство «китайская модель = самая дешёвая» держалось большую часть 2025 и начала 2026. Как допущение оно больше не работает.

Три ставки: capacity-прайсинг, лицензированные веса, масштаб пост-обучения

DeepSeek: от flat-rate к time-of-day прайсингу. Простое прочтение — давление на маржу. Структура ближе к явной нехватке compute. Постоянно низкая единая ставка работала как acquisition, пока предложение GPU успевало. Когда usage рос экспоненциально, а ёмкость нет, что-то должно было стать явным. «Более гибкое планирование нагрузки» означает: peak-compute дефицитен.

Alibaba: открытые веса покупают охват; custom license держит потолок выручки. Полный checkpoint 2.4T скачивается свободно. Лицензия — не permissive Apache 2.0 младших Qwen. Любой MaaS или AI Work Assistant с выручкой свыше 50M USD за 12 месяцев обязан согласовать отдельную коммерческую лицензию. Продукт с 100M+ MAU или 20M+ USD месячной выручки должен явно показывать имя модели. Это другая ставка, чем Muse Glimmer у Meta под неограниченным Apache 2.0.

Слух, который не подтверждается: лицензия Alibaba якобы запрещает загрузку из США, ЕС, Великобритании и Южной Кореи. Ложно. В опубликованном тексте нет географической или территориальной оговорки.

GLM-5.3: тот же base, большая ставка на пост-обучение. Тот же 743B-base, что у GLM-5.2, без retraining, и примерно 6× на Terminal-Bench 3.0 (4.6% → 28.3%) за счёт масштаба reinforcement-learning сред. Когда scaling laws pretraining дают убывающую отдачу, RL на этапе пост-обучения становится отдельным рычагом с более низким порогом затрат, чем новый foundation. Mid-tier лаборатории всё ещё могут сокращать разрыв на agent- и coding-бенчах.

Шесть шагов сверки headline, счёта и лицензии

Тарифы, тексты лицензий и скоры меняются. Перед пересчётом продукта сверять официальные страницы.

  1. Официальная тарифная сетка фиксируется по строкам cache hit, cache miss и output. Headline-проценты не подставляются в бюджет. Записываются только те строки, которые реально бьёт трафик.
  2. Локальные часы сопоставляются с пиковыми окнами Asia/Shanghai. Peak — 09:00–12:00 и 14:00–18:00. Ночь в одном регионе может быть полуднем в другом.
  3. Cache-hit rate оценивается по логам последней недели. Длинные фиксированные system prompt поглощают рост cache-hit. Низкий hit rate означает, что счёт несут +350% output и +200% miss-input.
  4. Читается файл лицензии Qwen, а не тред анонса. Личное и внутреннее использование в основном не затронуто. MaaS или AI Work Assistant свыше 50M USD за 12 месяцев требует отдельной коммерческой лицензии.
  5. Скоры GLM-5.3 фиксируются как vendor-reported до third-party re-run. Terminal-Bench 3.0 по-прежнему ниже GPT-5.6 Sol и Claude Fable 5.
  6. Для side-by-side загрузки весов используется стираемая машина. Checkpoint 2.4T не является задачей ноутбука. Для квантованных меньших моделей или agent-workflow на Apple Silicon выделенная машина с root чище общего ноутбука.
local shell · проверка пика по Пекину
TZ=Asia/Shanghai date '+%H:%M %Z'
python3 -c "from datetime import datetime; from zoneinfo import ZoneInfo
h=datetime.now(ZoneInfo('Asia/Shanghai')).hour
print('peak' if (9<=h<12 or 14<=h<18) else 'off-peak')"

Лист реселлера может временно быть ниже official peak. Идентичность поставщика, квота и риск отключения стоят в одной строке с ценником.

Что не подтверждено независимо, и где сверять

  • Headline 1100% технически верен и без строки тарифа вводит в заблуждение. Это peak cache-hit input. Output — статья большинства реальных счетов — вырос на 350%.
  • Утверждения, что Qwen3.8-Max крутится на внутренних чипах Zhenwu M890 (и supernode «Pangu AL128»), пересказанные рядом китайских финансовых изданий, не подтверждены техническими документами Alibaba или сторонними бенчмарками. Vendor-adjacent, unverified.
  • Сообщение о «серьёзной уязвимости» в Cursor, найденной GLM-5.3, идёт из VentureBeat и собственного disclosure Zhipu. Технические детали не опубликованы. Vendor-sourced, без независимого аудита.
  • Сообщения, что Министерство коммерции КНР (MOFCOM) готовит ответные export controls по ИИ/полупроводникам, спекулятивны, это не официальное объявление. Только фон.

Китайские финансовые медиа называют последний месяц «три обновления моделей в неделю». Американские лаборатории на consumer-слое сыграли наоборот. Есть и геополитическое прочтение: Kimi K3 уже вызвал внимание US security; выбор Alibaba этого окна для флагмана 2.4T читают как закрепление международного охвата до возможного ужесточения регулирования. Это обоснованная интерпретация, не подтверждённый факт.

Официальные источники (сверять live-страницу; цифры могут измениться):

DeepSeek API Docs — Models & Pricing

Hugging Face — Qwen/Qwen3.8-2.4T-A95B

Z.ai — GLM-5.3: Frontier Coding with Emergent Cyber Capabilities

Сторонние материалы:

CIO — DeepSeek raises some V4 prices by more than 10x

NVIDIA Technical Blog — Serve Qwen3.8-2.4T-A95B

Z.ai Docs — GLM-5.3

Частые вопросы

Означает ли новый прайсинг DeepSeek рост любого счёта на 1100%?

Нет. 1100% относится к peak cache-hit input. Output вырос на 350%, cache-miss input — на 200%. Модель тяжёлой нагрузки (около 84M токенов/мес, в основном off-peak, примерно половина cache hit) даёт множитель ближе к 1.8x, а не к 11x. Трафик в окна 9–12 и 14–18 по Пекину при низком cache hit приближается к headline-ставкам.

Можно ли коммерчески использовать открытые веса Qwen3.8-Max без отдельной лицензии?

Личные проекты и внутреннее использование в основном не затронуты. Отдельная коммерческая лицензия Alibaba нужна, если бизнес — Model-as-a-Service или AI Work Assistant и выручка за любые 12 месяцев превышает 50M USD. Продукт с 100M MAU или 20M USD месячной выручки обязан показывать имя модели.

GLM-5.3 — это новый base или тот же 743B?

Тот же 743B-base, что у GLM-5.2. Повторного pretraining не было. Прирост (Terminal-Bench 3.0: 4.6% → 28.3%) получен масштабированием reinforcement learning на этапе пост-обучения. Цифры vendor-reported, независимого third-party re-run нет.

Запрещает ли лицензия Qwen3.8-Max загрузку из США, ЕС, Великобритании или Кореи?

Нет. Утверждение ложное. В опубликованном тексте нет географических ограничений. Пороги привязаны к выручке, не к локации пользователя.

Muse Glimmer означает открытие флагманских весов Meta?

Нет. Muse Glimmer — дистиллят 30B под Apache 2.0. Закрытый флагман Muse Spark 1.2 не открыт; заявлено только намерение выпустить веса. Это stated intention, не свершившийся факт.

Time-of-day API-прайсинг, загрузка 2.4T и сравнение рецептов пост-обучения упираются в одно и то же: общий ноутбук грязный, локальный диск кончается, eval-трафик не смешивается с повседневной компиляцией. Когда нужна чистая Apple Silicon-машина с root, которую можно стереть после прогона, облачный Mac mini KVMFLUX с суточной арендой обычно даёт более контролируемую среду — выделенное железо, SSH + VNC. Расчёт периодов — в сутки / неделя / месяц / квартал.

Сравнить открытые веса на выделенном Mac посуточно

Физический Mac mini M4, root и SSH, для квантованных моделей или agent-workflow — без борьбы за диск и состояние с рабочей машиной.

Mac Mini M4 · 16GB / 256GB
Сутки$19.3 /сутки
Неделя$52.2 /нед.
Месяц$96.7 /мес.
Квартал$263 /кв.