Ce qu'est vraiment Kimi K3

Kimi K3 est le nouveau modèle phare de Moonshot AI : un système Mixture-of-Experts épars construit autour de Kimi Delta Attention (KDA), un mécanisme d'attention linéaire hybride, complété par des Attention Residuals et un schéma de routage baptisé Stable LatentMoE. Seuls 16 des 896 experts s'activent par token — ce détail compte plus pour la planification que le chiffre brut de 2,8 billions de paramètres : le modèle est épars et routable, pas un bloc monolithique à évaluer d'un seul tenant.

Caractéristique Kimi K3
Paramètres totaux2,8 billions
Experts actifs par token16 sur 896
Fenêtre de contexte1 048 576 tokens (entrée + sortie)
ModalitésEntrée texte et image, sortie texte
RaisonnementToujours actif ; seul reasoning_effort: "max" au lancement
Poids ouvertsPromis avant le 27 juillet 2026 — indisponibles le jour du lancement

Derrière ces chiffres, la pile d'entraînement embarque quatre innovations plus discrètes, utiles pour la lecture du futur rapport technique : Quantile Balancing pour répartir la charge entre experts sans passer par une perte auxiliaire heuristique, Per-Head Muon pour des mises à jour d'optimiseur indépendantes par tête d'attention, et un duo Sigmoid Tanh Unit (SiTU) / Gated MLA pour le contrôle de l'activation et de la sélectivité de l'attention. Rien de tout cela ne change la façon d'appeler l'API — mais cela explique comment Moonshot a pu stabiliser l'entraînement à cette échelle.

Le hic : « ouvert » ne veut pas dire « téléchargeable dès aujourd'hui »

Moonshot présente clairement Kimi K3 comme un modèle en poids ouverts, tout en précisant tout aussi clairement que le checkpoint n'était pas sur Hugging Face au moment du lancement. L'entreprise s'est engagée à publier les poids complets d'ici le 27 juillet 2026, accompagnés d'un rapport technique et d'une implémentation de Kimi Delta Attention pour vLLM. D'ici là, l'API et les applications officielles (Kimi.com, Kimi Work, Kimi Code) restent le seul moyen concret d'utiliser K3.

Même une fois les poids publiés, auto-héberger un MoE épars de 2,8 T de paramètres n'a rien d'un projet de laptop. Les analyses indépendantes recommandent un supernode d'au moins 64 accélérateurs, avec des poids en MXFP4 et des activations en MXFP8. Pour la plupart des équipes, l'API restera la seule option réaliste pendant des mois, pas seulement jusqu'au 27 juillet.

La place de K3 face au reste du marché

Les comparatifs de benchmarks inter-laboratoires publiés dans la première semaine suivant un lancement doivent être pris comme provisoires — chaque laboratoire utilise ses propres protocoles d'évaluation, et les chiffres tiers sont souvent révisés par la suite. Ce qui est vérifiable aujourd'hui, c'est la comparaison structurelle : longueur de contexte, posture de licence et tarification.

Modèle Fenêtre de contexte Poids Tarif API (pour 1 M de tokens)
Kimi K3 (Moonshot)1 048 576 tokensOuverts, avant le 27 juillet 20263,00 $ entrée / 0,30 $ cache / 15,00 $ sortie
Kimi K2.6 (Moonshot, génération précédente)256K tokensOuvertsInférieur, tarification remplacée par K3
Modèles fermés de pointe (classe Claude / GPT)Généralement 200K–256K tokens au lancementFermés, API uniquementVariable selon l'éditeur et le palier

Verdict : l'avantage concret aujourd'hui, c'est la longueur de contexte et le coût par token sur les charges longues — pas une domination confirmée sur tous les benchmarks. Un outil de classement indépendant place déjà K3 en tête de son leaderboard Frontend-Code : à surveiller, mais pas encore à citer comme un classement universel tant que d'autres évaluations n'ont pas confirmé la tendance.

Tester Kimi K3 en six étapes sur une machine propre

Le moyen le plus rapide de se faire son propre avis est d'appeler l'API depuis un environnement entièrement sous son contrôle — sans conflit de version Python hérité d'un ancien projet, sans SDK installé à moitié. Voici les six étapes pour passer de zéro à un premier appel d'outil fonctionnel.

  1. Obtenir une clé API : s'inscrire sur la Kimi API Platform et générer une clé autorisée à appeler le modèle kimi-k3.
  2. Préparer une machine propre : se connecter en SSH à une machine macOS fraîchement provisionnée (un Mac mini M4 loué convient parfaitement — accès root, rien de préinstallé qui pourrait entrer en conflit) et créer un environnement virtuel Python.
on the mac
python3 -m venv ~/kimi-lab && source ~/kimi-lab/bin/activate
pip install --upgrade openai
  1. Pointer un client compatible OpenAI vers l'endpoint de Moonshot : Kimi K3 respecte le schéma OpenAI Chat Completions, les SDK existants fonctionnent donc avec un simple changement de base_url.
kimi_test.py
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["MOONSHOT_API_KEY"],
    base_url="https://api.moonshot.cn/v1",
)
  1. Envoyer un premier appel avec l'effort de raisonnement maximal : K3 raisonne en permanence ; au lancement, seule la valeur max est supportée.
kimi_test.py
resp = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Résume le mécanisme d'attention KDA en 3 points."}],
    extra_body={"reasoning_effort": "max"},
)
print(resp.choices[0].message.content)
  1. Tester l'appel d'outils : K3 prend en charge le function calling et une sortie JSON Schema stricte — essentiel si vous construisez un agent plutôt qu'un simple chatbot.
kimi_test.py
tools = [{
    "type": "function",
    "function": {
        "name": "get_rental_quote",
        "parameters": {"type": "object", "properties": {"sku": {"type": "string"}}},
    },
}]
resp = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Donne-moi le tarif journalier pour m4-16-256."}],
    tools=tools,
    extra_body={"reasoning_effort": "max"},
)
  1. Essayer les clients natifs longue durée : si l'objectif est un agent autonome plutôt que des appels ponctuels, installez Kimi Code (CLI de terminal, sélection du modèle via /model) ou lancez l'application de bureau Kimi Work — Moonshot fournit une version native Apple Silicon, qui tourne directement sur le Mac loué des étapes précédentes, sans couche de traduction Rosetta.

Maintenir une session Kimi Code en vie comme service d'arrière-plan pose exactement le même problème que maintenir un runner CI en vie : il faut du SSH restreint aux clés, un processus qui survit à la déconnexion, et une machine qu'on n'a pas peur de réinitialiser. Nous avons détaillé cette configuration basée sur launchd dans notre guide de runner CI Xcode — les étapes de durcissement SSH et d'enregistrement de service s'appliquent directement à un agent Kimi Code longue durée, pas seulement aux builds Xcode.

Chiffres à retenir et à citer

  • 2,8 billions de paramètres au total, avec seulement 16 des 896 experts actifs par token — ce ratio de parcimonie est ce qui contient le coût d'inférence.
  • Fenêtre de contexte de 1 048 576 tokens, entrée et sortie cumulées, avec une tarification uniforme sur toute la fenêtre (pas de paliers selon la longueur).
  • Tarification API mondiale : 3,00 $ par million de tokens d'entrée en cas de cache manqué, 0,30 $ en cas de cache trouvé, 15,00 $ par million de tokens de sortie.
  • Date de publication des poids complets : avant le 27 juillet 2026, avec un rapport technique et une implémentation vLLM de Kimi Delta Attention.

Les détails de cette fenêtre de lancement évoluent vite — paliers tarifaires, limites de débit et date exacte de publication des poids peuvent encore bouger. Considérez les liens ci-dessous comme la référence, plutôt que ce résumé.

Moonshot AI — billet officiel de lancement de Kimi K3

Kimi API Platform — documentation de démarrage rapide K3

Northflank — analyse des benchmarks, tarifs et auto-hébergement de Kimi K3

IoT Digital Twin PLM — architecture et benchmarks de Kimi K3

FAQ

Kimi K3 est-il gratuit ?

Le chat dans l'application Kimi est gratuit dans la limite des quotas standards. L'API est facturée à l'usage : au lancement, 3,00 $ par million de tokens d'entrée en cas de cache manqué, 0,30 $ en cas de cache trouvé, et 15,00 $ par million de tokens de sortie.

Peut-on auto-héberger Kimi K3 dès aujourd'hui ?

Pas encore. Moonshot s'est engagé à publier les poids complets avant le 27 juillet 2026. Même une fois disponibles, faire tourner un modèle épars de 2,8 billions de paramètres nécessite concrètement un supernode multi-accélérateurs, pas un simple poste de travail.

Qu'est-ce qui change vraiment par rapport à la génération précédente de Kimi ?

Les deux sauts les plus visibles sont la fenêtre de contexte (de 256K à plus d'1 M de tokens) et l'échelle globale (2,8 billions de paramètres avec le nouveau routage Stable LatentMoE), auxquels s'ajoute un mécanisme d'attention linéaire hybride, Kimi Delta Attention, pensé pour contenir le coût du décodage sur de longs contextes.

Faut-il un GPU sur sa propre machine pour tester l'API ?

Non. Appeler l'API hébergée ne demande qu'une machine capable d'envoyer des requêtes HTTPS — un Mac loué suffit largement. Un GPU ne devient nécessaire qu'au moment d'auto-héberger les poids après leur publication le 27 juillet.

Aucune des six étapes ci-dessus ne nécessite d'équipement exotique — une session SSH et un environnement virtuel Python suffisent pour démarrer. Ce qui compte vraiment, c'est de disposer d'une machine dont on ne craint pas qu'elle se retrouve encombrée de dépendances de test, de scripts d'agent à moitié terminés et d'un processus Kimi Code oublié en arrière-plan. Un ordinateur portable partagé accumule vite ce genre de résidus ; une machine Apple Silicon réelle, jetable, qu'on peut réinitialiser et relouer à la journée, n'a pas ce problème. C'est tout l'intérêt de tester les nouvelles sorties de modèles sur un Mac loué à court terme plutôt que sur sa machine principale.

Testez sur du vrai Apple Silicon

Lancez un Mac mini M4 à la journée, branchez l'API Kimi ou faites tourner Kimi Code comme agent en arrière-plan, puis résiliez une fois terminé — sans dépendances qui traînent sur votre machine principale.

Mac Mini M4 · 16GB / 256GB
Journalier$19.3 /jour
Hebdomadaire$52.2 /sem.
Mensuel$96.7 /mois
Trimestriel$263 /trim.