IA & Machine Learning

Kimi K3 et ses 2,8 billions de paramètres : ce que ce chiffre veut vraiment dire

Kimi K3 revendique 2,8 billions de paramètres, mais seule une fraction s'active à chaque mot. Ce que le mixture-of-experts change vraiment.

Editorial Team / /8 min de lecture
Un mur d'archives aux centaines de tiroirs identiques, presque tous fermés, dont une poignée est ouverte et éclairée, l'un d'eux en violet

Le Kimi K3 de Moonshot AI affiche 2,8 billions de paramètres, ces valeurs internes qu’un réseau de neurones ajuste pendant l’entraînement pour apprendre à prédire du texte. C’est plus que n’importe quel autre grand modèle de langage publié en open weight (le fabricant diffuse gratuitement le modèle entraîné, prêt à l’emploi) à ce jour. Mais ce total ne dit rien de ce qui tourne réellement à chaque question posée. Pour générer un mot, Kimi K3 ne mobilise qu’une fraction infime de ces paramètres, environ 1,8 %, et c’est cette fraction, pas le chiffre à mille milliards, qui détermine le coût réel de fonctionnement du modèle. Cet article se concentre sur ce que cette taille signifie techniquement ; le prix de Kimi K3 et ses deux premières semaines mouvementées sont traités séparément.

Cette astuce a un nom : le mixture-of-experts, une architecture qui n’active qu’une poignée d’experts par mot au lieu de faire tourner le modèle entier à chaque fois. Moonshot a publié le détail technique complet sur son propre blog lors de la sortie des poids complets de Kimi K3, le 27 juillet 2026. Comprendre ce mécanisme explique ce que ce chiffre de 2,8 billions achète réellement, et pourquoi le même principe tourne déjà dans d’autres grands modèles de langage que le lecteur connaît peut-être de nom.

La différence entre la taille totale et ce qui tourne réellement

Un paramètre est un nombre ajustable à l’intérieur d’un réseau de neurones, réglé pendant l’entraînement jusqu’à ce que le modèle devienne meilleur pour prédire le mot suivant. Kimi K3 en compte 2,8 billions au total, répartis dans toute son architecture. Dans un modèle dense, celui qui a porté la première vague de grands modèles de langage, chacun de ces paramètres intervient à chaque calcul. Doubler le nombre de paramètres d’un modèle dense double à peu près le calcul nécessaire pour répondre à une seule question.

Kimi K3 ne fonctionne pas ainsi. C’est un modèle mixture-of-experts (MoE), ce qui signifie que ce total ne forme pas un seul bloc qui tourne toujours en entier. Il est découpé en 896 sous-réseaux spécialisés distincts, appelés experts, et un mécanisme de routage décide, mot par mot, lesquels de ces experts interviennent. Ce chiffre total décrit le réservoir complet dans lequel Kimi K3 peut puiser, pas la quantité de calcul qu’il effectue pour générer un seul mot.

Cette nuance se perd dans les articles qui traitent le nombre total de paramètres d’un modèle comme un simple indicateur de sa taille ou de sa puissance, l’angle derrière les titres qui présentent Kimi K3 comme le plus grand modèle d’IA jamais publié. DecodeStack a déjà examiné comment ce battage médiatique a résisté face aux résultats réels de Kimi K3 aux benchmarks (les tests de référence standardisés qui mesurent les performances d’un modèle). Le nombre de paramètres est réel, mais il ne dit à lui seul rien du coût de fonctionnement du modèle, ce que la section suivante détaille.

L’astuce : seuls 16 des 896 experts s’activent pour un seul mot

Imaginez un grand hôpital qui emploie 896 médecins, presque un par spécialité médicale imaginable. Quand un patient arrive, l’hôpital n’envoie pas son dossier aux 896 médecins en leur demandant à chacun de donner son avis. Une étape de tri associe les symptômes du patient à la poignée de spécialistes réellement concernés par ce cas, 16 peut-être, et seuls ces médecins-là travaillent. Les 880 autres restent disponibles pour d’autres patients.

L’architecture mixture-of-experts de Kimi K3 suit la même logique, appliquée à chaque mot qu’il génère. Le modèle compte 896 experts, de petits sous-réseaux spécialisés qui apprennent chacun à traiter certains types de régularités du langage. Pour chaque mot, un composant de routage regarde le contexte accumulé jusque-là et choisit les experts les mieux adaptés à ce mot précis. Seuls ces 16 experts parmi les 896 effectuent réellement un calcul pour ce mot ; les autres restent inactifs jusqu’au mot suivant, où le routeur peut choisir un tout autre groupe de 16.

16 sur 896, cela représente environ 1,8 %, le chiffre de parcimonie que Moonshot avance pour Kimi K3. C’est ce qui permet à un modèle totalisant 2,8 billions de paramètres de répondre à une vitesse et un coût proches de ceux d’un modèle bien plus petit : seule une infime fraction, environ 1,8 %, fait le travail pour un mot donné, pas la totalité des 2,8 billions.

Un couloir sombre bordé de nombreuses portes fermées, dont seules quelques-unes sont ouvertes et éclairées, évoquant l'activation sélective parmi de nombreux composants

Ce routage se fait automatiquement, appris pendant l’entraînement plutôt que programmé à la main : Moonshot ne décide donc pas manuellement quels experts traitent quels sujets. Le modèle découvre lui-même sa propre répartition du travail.

Ce que cela change pour le prix et la vitesse

Faire tourner un modèle de langage coûte de l’argent et du temps à peu près en proportion de la quantité de calcul effectuée par mot, pas du nombre total de paramètres qu’il possède. Parce que le coût d’inférence (le fait de faire tourner le modèle pour produire une réponse) suit les paramètres réellement activés, pas le total de 2,8 billions, le coût de fonctionnement réel de Kimi K3 par réponse ressemble bien plus à celui d’un modèle dense de taille moyenne que ne le laisse penser son chiffre de paramètres affiché. Un modèle dense construit pour atteindre les mêmes 2,8 billions de paramètres devrait faire tourner l’intégralité de ce total à chaque mot, et serait considérablement plus lent et plus coûteux à servir.

Cet écart entre la taille totale et le coût réel de fonctionnement explique aussi pourquoi Moonshot peut proposer Kimi K3 via une API à un prix comparable à des modèles bien plus petits, et pourquoi le modèle peut tenir une conversation à une vitesse utilisable plutôt qu’au rythme qu’imposerait un modèle dense de cette taille. DecodeStack a couvert directement le volet tarifaire, y compris la guerre des prix qu’elle a déclenchée entre laboratoires d’IA chinois dans les deux semaines suivant le lancement. En résumé : c’est la parcimonie, et non une quelconque astuce commerciale, qui rend ces chiffres possibles.

Kimi K3 n’est pas le seul modèle à faire ça

Le mixture-of-experts est une technique bien établie, antérieure de plusieurs années à Kimi K3, utilisée dans de nombreux grands modèles de langage à mesure que les laboratoires cherchaient un moyen de faire grandir la capacité totale d’un modèle sans faire grimper son coût de fonctionnement dans les mêmes proportions. Mixtral, chez Mistral AI, est un exemple largement documenté d’un autre modèle publié en open weight construit sur ce même principe, activant un sous-ensemble de ses experts par token (l’unité de texte, mot ou fragment de mot, que le modèle traite à chaque étape) plutôt que de faire tourner l’intégralité de ses paramètres à chaque requête.

Ce qui change d’un modèle à l’autre, c’est le réglage précis : combien d’experts au total, combien s’activent par mot et comment le routage est entraîné. Les chiffres propres à Kimi K3, 896 experts dont 16 actifs, sont un choix de Moonshot au sein de cette conception partagée, pas une architecture différente. Plusieurs des meilleurs modèles de langage en open weight disponibles en 2026 s’appuient désormais sur une variante de cette même idée d’activation parcimonieuse, ce qui vaut la peine d’être gardé en tête avant de juger un modèle sur son seul nombre brut de paramètres.

Ce que Moonshot affirme, et ce qui est confirmé de façon indépendante

Certains faits sur l’architecture de Kimi K3 sont publics et vérifiables parce que Moonshot les a documentés lui-même : les 2,8 billions de paramètres au total, les 896 experts dont 16 actifs par mot et une fenêtre de contexte native d’un million de tokens (la quantité de texte que le modèle peut prendre en compte en une fois). Ces chiffres proviennent du propre article de blog technique de Moonshot et décrivent le modèle tel qu’il est construit, pas une affirmation qui exigerait une confirmation extérieure.

Un chiffre de ce même article est d’une autre nature. Moonshot écrit que ses changements d’architecture apportent « une amélioration approximative de 2,5x de l’efficacité globale de mise à l’échelle par rapport à Kimi K2 », son modèle précédent. Il s’agit là d’une affirmation propre à Moonshot, formulée dans sa propre annonce, pas d’un chiffre produit par un laboratoire extérieur menant son propre benchmark. Le chiffre de 2,5x avancé par Moonshot reste le chiffre de l’entreprise elle-même, pas une mesure indépendante, et à l’heure où ces lignes sont écrites, aucun tiers n’a publié de test confirmant ou contestant ce ratio précis. Cela ne rend pas l’affirmation fausse. Cela signifie simplement que ce chiffre appartient à la catégorie des choses qu’un fournisseur dit de son propre produit, à noter comme tel tant que personne en dehors de Moonshot ne l’a vérifié.

Carte de décision : comparer les paramètres actifs par token plutôt que le total, vérifier le taux d'activation 16 sur 896 avant d'attendre un coût proportionnel à 2,8 billions, présenter la revendication Moonshot de 2,5x comme un chiffre éditeur, et reconnaître le même mécanisme dans Mixtral ou d'autres modèles MoE

La mesure qui compte vraiment

Les 2,8 billions de paramètres de Kimi K3 sont bien réels, et Moonshot a documenté précisément comment le modèle est construit pour atteindre ce total. Mais c’est la fraction qui s’active réellement par mot, pas sa taille totale, qui détermine le coût réel de son fonctionnement, et Kimi K3 n’active qu’environ 1,8 % de lui-même pour un seul mot. C’est le chiffre à retenir, la prochaine fois que la taille affichée d’un modèle de langage sera présentée comme si elle racontait toute l’histoire.

Questions fréquentes

Qu’est-ce que Kimi K3 ?

Kimi K3 est le grand modèle de langage de Moonshot AI, publié avec ses poids complets en open weight le 27 juillet 2026. Il s’agit d’un modèle mixture-of-experts avec 2,8 billions de paramètres au total, dont seule une fraction infime est active pour chaque réponse.

Combien d’experts Kimi K3 active-t-il par mot ?

Kimi K3 active 16 de ses 896 experts au total pour chaque mot qu’il génère, soit environ 1,8 % du modèle complet. Un routeur choisit un groupe différent de 16 experts pour chaque mot en fonction du contexte, si bien que les experts effectivement utilisés peuvent changer d’un mot à l’autre au sein d’une même phrase.

Kimi K3 est-il le plus grand modèle d’IA ?

Kimi K3 compte plus de paramètres au total que la plupart des grands modèles de langage publiés publiquement, d’où vient l’étiquette de « plus grand modèle ». Mais comme il n’active qu’une infime tranche de ce total par mot, cette taille sur le papier n’en fait pas le modèle le plus lent ou le plus coûteux à faire tourner.

Quels autres modèles d’IA utilisent une architecture mixture-of-experts ?

Le mixture-of-experts précède Kimi K3 et se retrouve dans plusieurs autres grands modèles de langage bien connus. Mixtral, chez Mistral AI, en est un exemple largement documenté, activant un sous-ensemble de sous-réseaux spécialisés par mot plutôt que de faire tourner l’intégralité de ses paramètres à chaque requête, le même principe que celui de Kimi K3.

L’affirmation d’efficacité de 2,5x de Moonshot est-elle vérifiée de façon indépendante ?

L’amélioration de 2,5x de l’efficacité de mise à l’échelle par rapport à Kimi K2, avancée par Moonshot, n’a pas été vérifiée de façon indépendante. Ce chiffre provient du propre article de blog technique de l’entreprise, pas du benchmark d’un laboratoire extérieur, et aucun test indépendant confirmant ou contestant ce chiffre n’a été publié à l’heure où ces lignes sont écrites.

#kimi-k3#moonshot-ai#mixture-of-experts#llm-architecture#open-weight-models