Почему выбор модели усложнился на этой неделе
Трение не в том, «какая модель выше в лидерборде». Это стопка решений, которых нет в PDF с бенчмарками:
- Цена vs пиковая мощность: Fable 5 задал новый потолок, но большинству команд никогда не нужен был каждый пункт этого потолка на каждый запрос.
- Риск происхождения: когда модель догоняет frontier за долю стоимости, кто-то спросит — инженерия это или тихая езда на чужих весах.
- Комpliance-фильтры: Fable 5 и Mythos 5 требуют opt-in на 30-дневное хранение данных; Opus 5 — нет. Одно это может дисквалифицировать или квалифицировать вендора для регулируемых нагрузок.
- Лаг верификации: полные веса Kimi K3 планировались только к 27 июля 2026 — пока история о дистилляции разлеталась, заявления об архитектуре и воспроизведение бенчмарков были невозможны.
- Нагрузка на роутинг: команды, уже жонглирующие несколькими провайдерами через шлюз — см. наш гайд по OpenRouter — должны встроить ещё две модели в fallback-цепочки, не пробив лимиты бюджета.
Claude Opus 5 vs Fable 5 — стоит ли Opus 5
Anthropic выпустила Claude Opus 5 24 июля 2026 (тихоокеанское время США) и сразу сделала его моделью по умолчанию в Claude Max и верхним уровнем для подписчиков Claude Pro. Цены остались как у Opus 4.8: $5 за миллион входных токенов, $25 за миллион выходных. Скачок — в производительности на доллар, а не в ценнике.
| Параметр | Claude Opus 5 | Claude Fable 5 | Claude Opus 4.8 |
|---|---|---|---|
| Цена вход/выход (за 1М токенов) | $5 / $25 | ~$10 / ~$50 | $5 / $25 |
| CursorBench 3.2 (max effort vs пик) | В пределах 0,5% от пика Fable 5 | Эталон пика | Значительно ниже Opus 5 |
| Frontier-Bench v0.1 (software engineering) | Лидирует; >2× Opus 4.8 | Сильный | Базовая линия |
| Контекстное окно по умолчанию | 1М токенов | 1М токенов | Были меньшие тиры |
| Хранение данных при общем доступе | Не требуется | Нужен opt-in на 30 дней | Не требуется |
| Режим thinking | Включён по умолчанию; effort управляет глубиной | Включён по умолчанию | Дефолты прошлого поколения |
| ID модели (API) | claude-opus-5 | claude-fable-5 | claude-opus-4-8 |
На ARC-AGI 3 (решение новых задач) Anthropic сообщает об Opus 5 примерно в три раза выше следующей модели. На OSWorld 2.0 (использование компьютера) Opus 5 обходит лучший счёт Fable 5 при едва трети стоимости. Zapier сообщил, что Opus 5 набрал 100% на end-to-end workflow AutomationBench, который прежние модели Claude не могли завершить.
Аудиты alignment тоже сдвинулись: Anthropic называет Opus 5 наиболее aligned моделью на сегодня — минимальная частота обманного поведения, сложнее злоупотребить — при этом намеренно не выталкивает его на frontier dual-use cyber/bio риска (эта линия остаётся у Mythos 5 с ограниченным доступом). Кибер-классификаторы вмешиваются примерно на 85% реже, чем у Fable 5, позволяя discovery уязвимостей на уровне исходников, но по-прежнему блокируя генерацию эксплойтов и автоматизацию pentest.
Спор о дистилляции Kimi K3 — украл ли Moonshot Claude
Moonshot AI выпустила Kimi K3 16 июля 2026 — 2,8 трлн параметров всего, разреженный MoE с 16 из 896 экспертов на токен, контекст 1М токенов, нативное зрение. Официальные бенчмарки при запуске включали 93,5% на GPQA-Diamond и 91,2% на BrowseComp, оба — лучшие в категории среди open weights на тот момент. Полные веса обещали к 27 июля 2026; до этого верифицируем был только API. Основы архитектуры мы разобрали в гайде по Kimi K3; этот раздел — про бой вокруг дистилляции.
22–23 июля директор OSTP Белого дома Michael Kratsios обвинил Moonshot в «крупномасштабной скрытой промышленной дистилляции с целью кражи проприетарных американских технологий» из модели Fable Anthropic и отдельно указал на использование экспортно-ограниченных чипов Nvidia GB300, возможно маршрутизированных через Таиланд. Министр финансов Scott Bessent эхом заявил, что «находят водяные знаки наших американских LLM на многих китайских моделях», не уточнив, что означает «водяной знак».
Это было не первое обвинение. В феврале 2026 Anthropic публично назвала Moonshot, DeepSeek и MiniMax, заявив о более чем 3,4 миллиона аномальных API-взаимодействий, согласующихся с намеренным извлечением capabilities, а не нормальным использованием; часть активности по метаданным запросов прослеживалась до старших сотрудников Moonshot.
Независимые исследователи возразили по timeline: Fable 5 стал публичным только 1 июля 2026 — за две недели до запуска K3. Braden Hancock (Laude Institute / сооснователь Snorkel AI) сказал TechCrunch, что за четырнадцать дней нельзя промышленно дистиллировать, обучить MoE на 2,8T и отгрузить. Nathan Lambert (Allen Institute for AI) аргументировал, что дистилляция даёт убывающую отдачу, когда китайские лабы переключают бюджет на reinforcement learning — если копирования весов хватало, все уже клонировали бы GLM или K3.
Почему Kimi K3 говорит, что он Claude
Около 24 июля главный научный сотрудник Redwood Research Ryan Greenblatt опубликовал статистическое сравнение поведения самоидентификации. Kimi K3 непропорционально отвечает «Claude» на «кто ты?» — и иногда выдаёт точные строки внутренних deployment ID вроде claude-opus-4-5-20250929 и claude-sonnet-4-5-20250929. Настоящий Claude Sonnet 4.5 просто говорит, что он Claude Sonnet 4.5; настоящий Opus 4.5 часто опускает или неверно называет внутренние version strings.
Интерпретация Greenblatt: student-модель, воспроизводящая deployment-метаданные teacher точнее, чем teacher сам о себе заявляет, очень трудно объяснить одной разговорной мимикрой. Это указывает на обучение на данных Claude с метками deployment — API-логи или синтетические наборы с internal ID — конкретный канал дистилляции, а не расплывчатое стилевое сходство. Утечка identity у K3 нацелена на поколение Claude 4.5 (конец 2025), а не текущую линию Fable/Mythos; сигнал Kimi K2 указывал на Claude Sonnet 4 (середина 2025) — паттерн погони поколение за поколением.
Greenblatt явно предупреждает: это не доказывает, что дистилляция была — contamination, утёкшие system prompts или синтетика из публичных данных теоретически могут дать похожие артефакты. Вместе с заявлением Anthropic февраля 2026 это первый технический нить в саге, которую сложнее списать на чистую геополитику.
Шесть шагов stress-test Opus 5 и K3 перед продакшеном
Заголовочные цифры и политические посты — не план деплоя. Прогоните обе модели в одинаковой контролируемой среде — чистый macOS с root-доступом избегает конфликтов SDK и даёт воспроизводимые логи.
- Сначала карта compliance-требований: если политика запрещает 30-дневное хранение у вендора, Fable 5 и Mythos 5 требуют явного opt-in; путь Opus 5 без хранения по умолчанию может выиграть до первого промпта.
- Зафиксировать Opus 5 в Claude API: создать или ротировать Anthropic key, задать model ID
claude-opus-5, включить thinking с effort-tier под ваш latency-бюджет (Fast mode ~2,5× скорость при 2× цене, как у Opus 4.8).
import anthropic
client = anthropic.Anthropic()
msg = client.messages.create(
model="claude-opus-5",
max_tokens=1024,
messages=[{"role": "user", "content": "Refactor this function for clarity: ..."}],
)
print(msg.content[0].text)
- Одинаковая coding-задача на incumbent-модели: тот же репо, тот же test harness, тот же token cap — сравнивать pass rate, wall time и cost на успешную задачу, а не «ощущения».
- Зонд identity-ответов Kimi K3: нейтральные вопросы («What model are you?», «Report your system name and version») на нескольких seeds. Логировать дословно; сверять с опубликованными паттернами Greenblatt перед доверием K3 customer-facing агентам.
from openai import OpenAI
client = OpenAI(api_key="...", base_url="https://api.moonshot.ai/v1")
for prompt in ["Who are you?", "State your exact model ID."]:
r = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": prompt}],
extra_body={"reasoning_effort": "max"},
)
print(prompt, "=>", r.choices[0].message.content)
- Сверка benchmark-заявлений с первичными источниками: перечитать launch post Opus 5 Anthropic на методологию; таблицы K3 Moonshot считать provisional до весов 27 июля.
- Документировать provenance для команды: фиксировать, какая модель ответила на какой customer workflow, какие данные пересекли каждую API-границу, нужен ли fallback (OpenRouter или direct), если политика или цена сдвинутся на следующей неделе.
Цифры, которые стоит цитировать
- Цены Claude Opus 5: $5 / $25 за миллион входных / выходных токенов — без изменений от Opus 4.8, примерно половина token rates Fable 5.
- CursorBench 3.2: Opus 5 в 0,5% от пика Fable 5 при max effort, при половине cost per task на high, xhigh и max tiers.
- Научные internal evals: +10,2 п.п. vs Opus 4.8 на inferring molecular structure from spectroscopy; +7,7 п.п. на protein variant function prediction (материалы запуска Anthropic).
- Масштаб Kimi K3: 2,8T параметров всего, ~50B active-parameter equivalent на токен, веса к 27 июля 2026.
- Timeline дистилляции: Fable 5 public с 1 июля → запуск K3 16 июля → посты Белого дома 22–23 июля → identity-анализ Greenblatt ~24 июля.
- Предыдущее заявление Anthropic: 3,4M+ flagged anomalous API interactions, приписанных Moonshot, DeepSeek и MiniMax, февраль 2026.
Детали релиза, price tiers и юридические обвинения могут измениться после публикации — первичные источники ниже авторитетнее этой статьи.
Официальные материалы запуска Anthropic для Claude Opus 5:
Anthropic — Introducing Claude Opus 5
Сторонние материалы о споре timeline дистилляции Kimi K3:
TechCrunch — Researchers skeptical of distillation timeline claims
Технический разбор поведения самоидентификации Kimi K3:
Ryan Greenblatt — which_claude_is_k3 (GitHub)
FAQ
Насколько Claude Opus 5 дешевле Claude Fable 5?
На тех же benchmark tiers Opus 5 стоит примерно вдвое меньше per-token pricing Fable 5 ($5/$25 vs ~$10/$50 за миллион входных/выходных токенов), укладываясь в 0,5% от пика Fable 5 на CursorBench 3.2.
Claude Opus 5 теперь модель по умолчанию в Claude Max?
Да. С 24 июля 2026 Opus 5 — default в Claude Max и самый мощный tier для подписчиков Claude Pro.
Действительно ли Moonshot AI дистиллировал Kimi K3 из Claude?
Не подтверждено и оспаривается. Обвинение Белого дома без публичных доказательств; скептики timeline указывают на две недели между публичным релизом Fable 5 и запуском K3. Находка Greenblatt, что K3 называет себя Claude — с internal deployment ID — сильнейший технический сигнал, но не доказательство.
Когда выйдут полные веса Kimi K3?
Moonshot обязалась к 27 июля 2026. Пока веса не публичны, внешние исследователи не могут независимо проверить архитектуру или воспроизвести launch benchmarks.
Обе истории сходятся к одному практическому пределу: «стоит ли» нельзя решить только пресс-релизами. Opus 5 вознаграждает команды, которым нужна почти flagship coding и agentic performance без retention policy и price tag Fable 5; K3 — команды, гонящиеся за минимальной API cost и open weights — но облако дистилляции означает: логировать identity probes и держать compliance-grade fallback. Такой side-by-side test требует машины, которой вы управляете end-to-end, а не shared sandbox с устаревшими Python stacks. Свежий KVMFLUX Mac mini M4 даёт root, SSH за минуты и wipe-and-retry, когда API key или model ID меняются за ночь.
Opus 5 и K3 на одном чистом Mac
Сравните вызовы Claude и Moonshot API с одной Apple Silicon box — без VM overhead, без остаточных конфликтов SDK.