Почему headline 1100% не совпадает с большинством счетов
Точки трения для закупки и инженерии конкретны:
- Издания цитировали разные строки тарифа. «11x», «свыше 1100%» и «350%» по отдельности верны. Они относятся к peak cache-hit input, output и cache-miss input — не к смешанной ставке.
- Пиковые часы теперь в цене. Peak — 9–12 и 14–18 по пекинскому времени. Формулировка про «более гибкое планирование нагрузки» описывает ёмкость, не маркетинг.
- Official больше не всегда самый дешёвый канал. В пик собственный API DeepSeek выше ряда реселлеров (GMI Cloud, Novita и другие по-прежнему ставят V4 Pro ниже нового official peak).
- Открытые веса по умолчанию не Apache 2.0. Qwen3.8-Max скачивается, но custom license удерживает рычаг над крупным MaaS и assistant-бизнесом.
Ранее разобраны GA-скоры DeepSeek V4 Flash и старый flat-тариф и окно релиза Qwen3.8-Max. Этот текст — про синхронный сдвиг трёх лабораторий в середине августа, не ещё один recap одной модели.
Что произошло за две недели: таймлайн
С середины июля до 00:00 пекинского времени 17 августа:
| Дата | Событие |
|---|---|
| 16 июля 2026 | Moonshot AI открывает веса Kimi K3 (2.8T параметров); реакция US security |
| 2–3 августа 2026 | Alibaba анонсирует, затем запускает Qwen3.8-Max как hosted API |
| 10 августа 2026 | Meta выпускает Muse Glimmer (30B, Apache 2.0) и tease открытых весов флагмана Muse Spark 1.2 |
| 12 августа 2026 | Alibaba публикует Qwen3.8-2.4T-A95B на Hugging Face / ModelScope; xAI выпускает Grok 4.6 |
| 13 августа 2026 | DeepSeek-V4-Pro выходит в GA и объявляет повышение цен с 17 августа; Google выпускает Gemini 3.7 Flash со скидкой |
| 14 августа 2026 | Zhipu выпускает GLM-5.3, тот же 743B-base, что у GLM-5.2 |
| 17 августа 2026, 00:00 Пекин | Новый прайсинг DeepSeek вступает в силу |
Шире: 30 июля OpenAI снизила GPT-5.6 Luna на 80%, 6–7 августа сделала Luna free default с безлимитным текстовым чатом. Китайские лаборатории поднимали цены и открывали флагманские веса, американские — резали цены и уходили в free на consumer-слое. Одна игра, две стороны. Снижение Luna разобрано в заметке по прайсингу GPT-5.6.
Тарифные сетки и спецификации: остаётся ли DeepSeek самым дешёвым frontier API
Ставки DeepSeek ниже — RMB за 1M токенов, с 17 августа 00:00 по Пекину. Peak: 9–12 и 14–18 пекинского времени.
| Строка тарифа | Было | Новый off-peak | Новый peak | Рост в peak |
|---|---|---|---|---|
| V4-Flash cache hit (input) | ¥0.02 | ¥0.05 | ¥0.10 | ~400% |
| V4-Flash cache miss (input) | ¥1.0 | ¥1.5 | ¥3.0 | 200% |
| V4-Flash output | ¥2.0 | ¥4.5 | ¥9.0 | 350% |
| V4-Pro cache hit (input) | ¥0.025 | ¥0.15 | ¥0.30 | ~1100% |
| V4-Pro cache miss (input) | ¥3.0 | ¥4.5 | ¥9.0 | 200% |
| V4-Pro output | ¥6.0 | ¥13.5 | ¥27.0 | 350% |
Цифра 1100% относится к peak cache-hit input — строке, которая стартовала ближе всего к нулю. Output, который доминирует в большинстве реальных счетов, вырос на 350%. Независимая модель тяжёлой нагрузки (около 84M токенов/мес, в основном off-peak, примерно половина cache hit) даёт рост счёта ближе к 1.8x.
Qwen3.8-2.4T-A95B (открытые веса Qwen3.8-Max):
| Спека | Значение |
|---|---|
| Параметры | 2.4T всего, 95B active на токен (MoE, 512 experts, 10 routed + 1 shared) |
| Контекст | 262144 токенов native (open checkpoint), расширяется до ~1.01M; hosted Max по умолчанию 1M |
| Каденция релиза | Preview 2 августа → API 3 августа → открытые веса 12 августа |
| API-прайсинг (international) | $2/M input, $6/M output |
| Лицензия | Не Apache 2.0 — custom Qwen3.8-Max License |
| Значение | Первые Max-веса Alibaba; Qwen3.5/3.6/3.7 Max оставались API-only |
GLM-5.3 vs GLM-5.2: тот же base, только пост-обучение. Ниже — собственные цифры Zhipu; независимого third-party re-run пока нет.
| Бенчмарк | GLM-5.2 | GLM-5.3 | Изменение |
|---|---|---|---|
| Terminal-Bench 3.0 | 4.6% | 28.3% | +23.7 |
| DeepSWE v1.1 | 46.2% | 66.9% | +20.7 |
| Agents' Last Exam (CLI) | 23.8% | 28.5% | +4.7 |
| CyberGym | 77.2% | 84.5% | +7.3 |
| AutomationBench | 26.2% | 48.2% | +22.0 |
На Terminal-Bench 3.0 GLM-5.3 отстаёт от GPT-5.6 Sol (34.6%) и Claude Fable 5 (33.7%). Это верхний ряд open-weight результатов, не абсолютный frontier win.
Прямое сравнение (за 1M токенов; RMB/USD ≈ ¥7.15/$1, оценка):
| Модель | Input | Output | Открытые веса |
|---|---|---|---|
| DeepSeek V4-Pro (peak) | ¥9.0 (~$1.26) | ¥27.0 (~$3.78) | Нет |
| DeepSeek V4-Pro (off-peak) | ¥4.5 (~$0.63) | ¥13.5 (~$1.89) | Нет |
| Qwen3.8-Max (international API) | $2 | $6 | Да (custom license) |
| OpenAI GPT-5.6 Luna | $0.20 | $1.20 | Нет |
| Claude Opus 5 (implied, ratio Alibaba) | ~$5 | ~$25 | Нет |
Кратко: нет. Off-peak V4-Pro всё ещё заметно ниже Claude Opus 5, но это уже не безусловно самый дешёвый вариант. International Qwen3.8-Max и OpenAI Luna оба подрезают DeepSeek off-peak хотя бы по одной оси. Равенство «китайская модель = самая дешёвая» держалось большую часть 2025 и начала 2026. Как допущение оно больше не работает.
Три ставки: capacity-прайсинг, лицензированные веса, масштаб пост-обучения
DeepSeek: от flat-rate к time-of-day прайсингу. Простое прочтение — давление на маржу. Структура ближе к явной нехватке compute. Постоянно низкая единая ставка работала как acquisition, пока предложение GPU успевало. Когда usage рос экспоненциально, а ёмкость нет, что-то должно было стать явным. «Более гибкое планирование нагрузки» означает: peak-compute дефицитен.
Alibaba: открытые веса покупают охват; custom license держит потолок выручки. Полный checkpoint 2.4T скачивается свободно. Лицензия — не permissive Apache 2.0 младших Qwen. Любой MaaS или AI Work Assistant с выручкой свыше 50M USD за 12 месяцев обязан согласовать отдельную коммерческую лицензию. Продукт с 100M+ MAU или 20M+ USD месячной выручки должен явно показывать имя модели. Это другая ставка, чем Muse Glimmer у Meta под неограниченным Apache 2.0.
Слух, который не подтверждается: лицензия Alibaba якобы запрещает загрузку из США, ЕС, Великобритании и Южной Кореи. Ложно. В опубликованном тексте нет географической или территориальной оговорки.
GLM-5.3: тот же base, большая ставка на пост-обучение. Тот же 743B-base, что у GLM-5.2, без retraining, и примерно 6× на Terminal-Bench 3.0 (4.6% → 28.3%) за счёт масштаба reinforcement-learning сред. Когда scaling laws pretraining дают убывающую отдачу, RL на этапе пост-обучения становится отдельным рычагом с более низким порогом затрат, чем новый foundation. Mid-tier лаборатории всё ещё могут сокращать разрыв на agent- и coding-бенчах.
Шесть шагов сверки headline, счёта и лицензии
Тарифы, тексты лицензий и скоры меняются. Перед пересчётом продукта сверять официальные страницы.
- Официальная тарифная сетка фиксируется по строкам cache hit, cache miss и output. Headline-проценты не подставляются в бюджет. Записываются только те строки, которые реально бьёт трафик.
- Локальные часы сопоставляются с пиковыми окнами Asia/Shanghai. Peak — 09:00–12:00 и 14:00–18:00. Ночь в одном регионе может быть полуднем в другом.
- Cache-hit rate оценивается по логам последней недели. Длинные фиксированные system prompt поглощают рост cache-hit. Низкий hit rate означает, что счёт несут +350% output и +200% miss-input.
- Читается файл лицензии Qwen, а не тред анонса. Личное и внутреннее использование в основном не затронуто. MaaS или AI Work Assistant свыше 50M USD за 12 месяцев требует отдельной коммерческой лицензии.
- Скоры GLM-5.3 фиксируются как vendor-reported до third-party re-run. Terminal-Bench 3.0 по-прежнему ниже GPT-5.6 Sol и Claude Fable 5.
- Для side-by-side загрузки весов используется стираемая машина. Checkpoint 2.4T не является задачей ноутбука. Для квантованных меньших моделей или agent-workflow на Apple Silicon выделенная машина с root чище общего ноутбука.
TZ=Asia/Shanghai date '+%H:%M %Z'
python3 -c "from datetime import datetime; from zoneinfo import ZoneInfo
h=datetime.now(ZoneInfo('Asia/Shanghai')).hour
print('peak' if (9<=h<12 or 14<=h<18) else 'off-peak')"
Лист реселлера может временно быть ниже official peak. Идентичность поставщика, квота и риск отключения стоят в одной строке с ценником.
Что не подтверждено независимо, и где сверять
- Headline 1100% технически верен и без строки тарифа вводит в заблуждение. Это peak cache-hit input. Output — статья большинства реальных счетов — вырос на 350%.
- Утверждения, что Qwen3.8-Max крутится на внутренних чипах Zhenwu M890 (и supernode «Pangu AL128»), пересказанные рядом китайских финансовых изданий, не подтверждены техническими документами Alibaba или сторонними бенчмарками. Vendor-adjacent, unverified.
- Сообщение о «серьёзной уязвимости» в Cursor, найденной GLM-5.3, идёт из VentureBeat и собственного disclosure Zhipu. Технические детали не опубликованы. Vendor-sourced, без независимого аудита.
- Сообщения, что Министерство коммерции КНР (MOFCOM) готовит ответные export controls по ИИ/полупроводникам, спекулятивны, это не официальное объявление. Только фон.
Китайские финансовые медиа называют последний месяц «три обновления моделей в неделю». Американские лаборатории на consumer-слое сыграли наоборот. Есть и геополитическое прочтение: Kimi K3 уже вызвал внимание US security; выбор Alibaba этого окна для флагмана 2.4T читают как закрепление международного охвата до возможного ужесточения регулирования. Это обоснованная интерпретация, не подтверждённый факт.
Официальные источники (сверять live-страницу; цифры могут измениться):
DeepSeek API Docs — Models & Pricing
Hugging Face — Qwen/Qwen3.8-2.4T-A95B
Z.ai — GLM-5.3: Frontier Coding with Emergent Cyber Capabilities
Сторонние материалы:
CIO — DeepSeek raises some V4 prices by more than 10x
NVIDIA Technical Blog — Serve Qwen3.8-2.4T-A95B
Частые вопросы
Означает ли новый прайсинг DeepSeek рост любого счёта на 1100%?
Нет. 1100% относится к peak cache-hit input. Output вырос на 350%, cache-miss input — на 200%. Модель тяжёлой нагрузки (около 84M токенов/мес, в основном off-peak, примерно половина cache hit) даёт множитель ближе к 1.8x, а не к 11x. Трафик в окна 9–12 и 14–18 по Пекину при низком cache hit приближается к headline-ставкам.
Можно ли коммерчески использовать открытые веса Qwen3.8-Max без отдельной лицензии?
Личные проекты и внутреннее использование в основном не затронуты. Отдельная коммерческая лицензия Alibaba нужна, если бизнес — Model-as-a-Service или AI Work Assistant и выручка за любые 12 месяцев превышает 50M USD. Продукт с 100M MAU или 20M USD месячной выручки обязан показывать имя модели.
GLM-5.3 — это новый base или тот же 743B?
Тот же 743B-base, что у GLM-5.2. Повторного pretraining не было. Прирост (Terminal-Bench 3.0: 4.6% → 28.3%) получен масштабированием reinforcement learning на этапе пост-обучения. Цифры vendor-reported, независимого third-party re-run нет.
Запрещает ли лицензия Qwen3.8-Max загрузку из США, ЕС, Великобритании или Кореи?
Нет. Утверждение ложное. В опубликованном тексте нет географических ограничений. Пороги привязаны к выручке, не к локации пользователя.
Muse Glimmer означает открытие флагманских весов Meta?
Нет. Muse Glimmer — дистиллят 30B под Apache 2.0. Закрытый флагман Muse Spark 1.2 не открыт; заявлено только намерение выпустить веса. Это stated intention, не свершившийся факт.
Time-of-day API-прайсинг, загрузка 2.4T и сравнение рецептов пост-обучения упираются в одно и то же: общий ноутбук грязный, локальный диск кончается, eval-трафик не смешивается с повседневной компиляцией. Когда нужна чистая Apple Silicon-машина с root, которую можно стереть после прогона, облачный Mac mini KVMFLUX с суточной арендой обычно даёт более контролируемую среду — выделенное железо, SSH + VNC. Расчёт периодов — в сутки / неделя / месяц / квартал.
Сравнить открытые веса на выделенном Mac посуточно
Физический Mac mini M4, root и SSH, для квантованных моделей или agent-workflow — без борьбы за диск и состояние с рабочей машиной.