Что такое Kimi K3 на самом деле

Kimi K3 — новая флагманская модель Moonshot AI: разреженная система Mixture-of-Experts, построенная на Kimi Delta Attention (KDA) — гибридном механизме линейного внимания, дополненном Attention Residuals и схемой маршрутизации под названием Stable LatentMoE. На каждый токен активируется только 16 из 896 экспертов — эта деталь важнее для планирования, чем сама цифра «2,8 триллиона параметров»: модель разреженная и маршрутизируемая, а не монолитный блок, который нужно оценивать целиком.

Параметр Kimi K3
Всего параметров2,8 трлн
Активных экспертов на токен16 из 896
Окно контекста1 048 576 токенов (вход + выход)
МодальностиТекст и изображения на входе, текст на выходе
Режим рассужденийВсегда включён; на старте поддерживается только reasoning_effort: "max"
Открытые весаОбещаны до 27 июля 2026 года — на момент релиза недоступны

За этими цифрами стоят четыре менее заметные, но важные инженерные решения — пригодятся при чтении технического отчёта: Quantile Balancing для распределения нагрузки между экспертами вместо эвристической вспомогательной функции потерь, Per-Head Muon — независимые обновления оптимизатора для каждой головы внимания при таком масштабе, а также связка Sigmoid Tanh Unit (SiTU) и Gated MLA для управления активацией и избирательностью внимания. На то, как вы вызываете API, это не влияет — но объясняет, как Moonshot вообще смогла стабильно обучить модель такого размера.

Загвоздка: «открытая» не значит «скачиваемая прямо сейчас»

Moonshot прямо называет Kimi K3 моделью с открытыми весами, но так же прямо признаёт, что на момент релиза чекпоинт не был выложен на Hugging Face. Компания обязалась опубликовать полные веса до 27 июля 2026 года, вместе с техническим отчётом и реализацией Kimi Delta Attention для vLLM. До этой даты API и готовые продукты (Kimi.com, Kimi Work, Kimi Code) остаются единственным практическим способом использовать K3.

Даже когда веса появятся вовремя, самостоятельный хостинг разреженной MoE на 2,8 трлн параметров — это не задача для ноутбука. Независимые аналитики называют рекомендуемой конфигурацией суперноду с 64+ ускорителями, весами в формате MXFP4 и активациями в MXFP8. Для большинства команд API останется единственным реалистичным путём на месяцы вперёд, а не только до 27 июля.

Место Kimi K3 на фоне остального рынка

Кросс-лабораторные сравнения бенчмарков, опубликованные в первую неделю после релиза, стоит воспринимать как предварительные — у каждой лаборатории свой инструментарий оценки, а сторонние цифры часто пересматриваются позже. Что можно проверить уже сегодня — это структурное сравнение: длина контекста, статус лицензии и цена.

Модель Окно контекста Веса Цена API (за 1М токенов)
Kimi K3 (Moonshot)1 048 576 токеновОткрытые, до 27 июля 2026$3.00 вход / $0.30 кэш / $15.00 выход
Kimi K2.6 (Moonshot, прошлое поколение)256K токеновОткрытыеНиже, тарифы заменены на K3
Закрытые топовые модели (класс Claude / GPT)Обычно 200K–256K токенов на момент релизаЗакрытые, только APIЗависит от поставщика и тарифа

Вывод: главное реальное преимущество сейчас — длина контекста и цена за токен на длинных нагрузках, а не подтверждённое превосходство по всем бенчмаркам. Один независимый трекер уже поставил K3 на первое место в своём рейтинге Frontend-Code — стоит следить, но пока не стоит цитировать это как универсальный рейтинг до появления большего числа независимых оценок.

Тестируем Kimi K3 за шесть шагов на чистой машине

Быстрее всего составить собственное мнение — вызвать API из окружения, которое полностью под вашим контролем: без конфликтов версий Python из старого проекта, без наполовину установленных SDK. Вот шесть шагов от нуля до рабочего вызова функции.

  1. Получите API-ключ: зарегистрируйтесь на платформе Kimi API и создайте ключ с доступом к модели kimi-k3.
  2. Подготовьте чистую машину: подключитесь по SSH к свежей машине с macOS (арендованный Mac mini M4 отлично подходит — root-доступ, ничего предустановленного, что могло бы конфликтовать) и создайте виртуальное окружение Python.
on the mac
python3 -m venv ~/kimi-lab && source ~/kimi-lab/bin/activate
pip install --upgrade openai
  1. Направьте OpenAI-совместимый клиент на эндпоинт Moonshot: Kimi K3 использует схему OpenAI Chat Completions, поэтому существующие SDK работают после смены base_url.
kimi_test.py
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["MOONSHOT_API_KEY"],
    base_url="https://api.moonshot.cn/v1",
)
  1. Отправьте первый запрос с максимальной глубиной рассуждений: K3 всегда рассуждает; на старте поддерживается только значение max.
kimi_test.py
resp = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Опиши механизм внимания KDA тремя тезисами."}],
    extra_body={"reasoning_effort": "max"},
)
print(resp.choices[0].message.content)
  1. Проверьте вызов инструментов: K3 поддерживает function calling и строгий вывод по JSON Schema — это важно, если вы строите агента, а не просто чат-бота.
kimi_test.py
tools = [{
    "type": "function",
    "function": {
        "name": "get_rental_quote",
        "parameters": {"type": "object", "properties": {"sku": {"type": "string"}}},
    },
}]
resp = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Скажи суточную цену для m4-16-256."}],
    tools=tools,
    extra_body={"reasoning_effort": "max"},
)
  1. Попробуйте нативные клиенты для долгой работы: если цель — автономный агент, а не разовые вызовы, установите Kimi Code (CLI в терминале, выбор модели через /model) или запустите десктопное приложение Kimi Work — у Moonshot есть нативная сборка под Apple Silicon, которая работает прямо на арендованном Mac из шагов 1–5, без прослойки трансляции Rosetta.

Поддерживать сессию Kimi Code как фоновый сервис — по сути та же задача, что и поддерживать живым CI-раннер: нужен SSH только по ключу, процесс, переживающий выход из системы, и машина, которую не жалко очистить и развернуть заново. Именно такую конфигурацию на основе launchd мы разбирали в гайде по настройке CI-раннера для Xcode — шаги по усилению SSH и регистрации сервиса напрямую применимы к долгоживущему агенту на Kimi Code, а не только к сборкам Xcode.

Цифры, на которые стоит ссылаться

  • Всего 2,8 трлн параметров, из которых на каждый токен активируется лишь 16 из 896 экспертов — именно эта разреженность держит стоимость инференса под контролем.
  • Окно контекста 1 048 576 токенов, вход и выход суммарно, с единой ценой по всему окну (без градации по длине).
  • Глобальные цены API: $3.00 за миллион входных токенов при промахе кэша, $0.30 при попадании в кэш, $15.00 за миллион выходных токенов.
  • Дата публикации полных весов: до 27 июля 2026 года, вместе с техническим отчётом и реализацией Kimi Delta Attention для vLLM.

Детали в этот ранний период после релиза меняются быстро — тарифные пороги, лимиты запросов и точная дата публикации весов ещё могут сдвинуться. Считайте ссылки ниже первоисточником, а не этот пересказ.

Moonshot AI — официальный пост о запуске Kimi K3

Kimi API Platform — документация по быстрому старту с K3

Northflank — анализ бенчмарков, цен и самостоятельного хостинга Kimi K3

IoT Digital Twin PLM — разбор архитектуры и бенчмарков Kimi K3

FAQ

Kimi K3 бесплатна?

Чат в приложении Kimi бесплатен в рамках стандартных лимитов. API тарифицируется по использованию: на старте $3.00 за миллион входных токенов при промахе кэша, $0.30 при попадании в кэш и $15.00 за миллион выходных токенов.

Можно ли уже сейчас развернуть Kimi K3 у себя?

Пока нет. Moonshot обязалась опубликовать полные веса до 27 июля 2026 года. Но даже после этого для реального запуска разреженной модели на 2,8 трлн параметров потребуется суперноды с несколькими ускорителями, а не одна рабочая станция.

Что реально изменилось по сравнению с прошлым поколением Kimi?

Главные скачки — это окно контекста (с 256K до более чем 1М токенов) и общий масштаб (2,8 трлн параметров с новой схемой маршрутизации Stable LatentMoE), плюс гибридный механизм линейного внимания Kimi Delta Attention, рассчитанный на то, чтобы декодирование при длинном контексте оставалось доступным по стоимости.

Нужен ли GPU на своей машине, чтобы протестировать API?

Нет. Для вызова размещённого API достаточно машины, способной отправлять HTTPS-запросы — арендованного Mac вполне хватит. GPU понадобится только тогда, когда вы будете самостоятельно разворачивать веса после их публикации 27 июля.

Ни один из шести шагов выше не требует ничего экзотического — SSH-сессии и виртуального окружения Python достаточно, чтобы начать. По-настоящему важно другое: машина, которую не жалко захламить тестовыми зависимостями, недописанными скриптами агента и забытым работающим процессом Kimi Code. На общем ноутбуке такой мусор накапливается быстро; на одноразовой, по-настоящему Apple Silicon машине, которую можно в любой момент сбросить и снова арендовать на сутки, этой проблемы нет. Именно поэтому для тестирования новых релизов моделей выгоднее использовать Mac в краткосрочной аренде, а не основную рабочую машину.

Протестируйте на настоящем Apple Silicon

Разверните Mac mini M4 на сутки, подключите Kimi API или запустите Kimi Code как фонового агента, а после — просто откажитесь от аренды, не оставляя лишних зависимостей на основной машине.

Mac Mini M4 · 16GB / 256GB
Сутки$19.3 /сутки
Неделя$52.2 /нед.
Месяц$96.7 /мес.
Квартал$263 /кв.