KI & Maschinelles Lernen

Kimi K3: Was die 2,8 Billionen Parameter wirklich bedeuten

Kimi K3 hat 2,8 Billionen Parameter – aktiv ist pro Wort nur ein Bruchteil davon. Wie Mixture-of-Experts das Riesenmodell bezahlbar hält.

Editorial Team / /8 Min. Lesezeit
Eine Archivwand mit Hunderten identischer kleiner Schubladen, fast alle geschlossen, eine Handvoll geöffnet und beleuchtet, eine davon violett

Kimi K3, das neue Sprachmodell von Moonshot AI, trägt 2,8 Billionen Parameter in sich – die internen Stellschrauben, die ein neuronales Netz beim Training justiert, damit es Text vorhersagen kann. Kein anderes offen veröffentlichtes Sprachmodell bringt bislang mehr davon mit. Was diese Zahl nicht verrät: wie viel von diesem Modell tatsächlich mitrechnet, wenn es eine Antwort liefert. Kimi K3 rührt bei jedem einzelnen Wort nur einen winzigen Ausschnitt an, ungefähr 1,8 Prozent seiner Parameter – und genau dieser Anteil, nicht die Billionen-Schlagzeile, entscheidet darüber, was der Betrieb des Modells kostet. Dieser Beitrag konzentriert sich darauf, was diese Größe technisch bedeutet; Kimi K3s Preis und seine turbulenten ersten zwei Wochen werden separat behandelt.

Der Trick trägt einen Namen: Mixture-of-Experts, kurz MoE – eine Architektur, die pro Wort nur eine Handvoll spezialisierter Teilnetze aktiviert, statt bei jeder Anfrage das komplette Modell laufen zu lassen. Moonshot hat die vollständige technische Erklärung im eigenen Blog veröffentlicht, als das Unternehmen am 27. Juli 2026 die kompletten Gewichte von Kimi K3 freigab. Wer diesen Mechanismus versteht, weiß auch, wofür die 2,8 Billionen tatsächlich gut sind – und warum derselbe Trick längst in anderen bekannten Sprachmodellen steckt.

Der Unterschied zwischen Gesamtgröße und tatsächlichem Rechenaufwand

Ein Parameter ist eine einzelne einstellbare Zahl in einem neuronalen Netz, die während des Trainings so lange angepasst wird, bis das Modell das nächste Wort besser vorhersagt. Kimi K3 trägt insgesamt 2,8 Billionen davon, verteilt über seine gesamte Architektur. Bei einem Dense-Modell, wie es die erste Welle großer Sprachmodelle antrieb, rechnet bei jeder Berechnung wirklich jeder dieser Parameter mit. Verdoppelt man die Parameterzahl eines Dense-Modells, verdoppelt sich ungefähr auch der Rechenaufwand für eine einzige Antwort.

So funktioniert Kimi K3 nicht. Es ist ein Mixture-of-Experts-Modell, das heißt: Diese Gesamtzahl ist kein Block, der immer geschlossen mitläuft. Sie ist aufgeteilt in 896 einzelne Spezialisten-Teilnetze, genannt Experten, und ein Router entscheidet Wort für Wort, welche davon zum Einsatz kommen. Die Schlagzeilenzahl beschreibt den gesamten Pool, aus dem Kimi K3 schöpfen kann – nicht die Rechenmenge, die für ein einziges Wort tatsächlich anfällt.

Diese Unterscheidung geht in Berichten unter, die die Parameterzahl eines Modells kurzerhand mit seiner Größe oder Fähigkeit gleichsetzen – genau der Rahmen hinter Schlagzeilen, die Kimi K3 zum bislang größten veröffentlichten KI-Modell erklären. DecodeStack hat bereits untersucht, wie dieser Hype den tatsächlichen Benchmark-Ergebnissen von Kimi K3 standhält. Die Parameterzahl ist real, sagt für sich genommen aber nichts darüber, was der Betrieb des Modells kostet – und genau das klärt der nächste Abschnitt.

Der Trick: Nur 16 von 896 Experten arbeiten pro Wort mit

Stell dir ein großes Krankenhaus vor, das 896 Ärztinnen und Ärzte beschäftigt, für so gut wie jedes erdenkliche Fachgebiet eine oder einen. Kommt ein Patient herein, schickt das Krankenhaus dessen Akte nicht an alle 896 gleichzeitig. Eine Triage gleicht die Symptome mit der Handvoll wirklich passender Fachleute ab, vielleicht 16 von ihnen, und nur die kümmern sich um den Fall. Die übrigen 880 bleiben frei für andere Patienten.

Die Mixture-of-Experts-Architektur von Kimi K3 folgt derselben Logik, angewendet auf jedes einzelne Wort, das sie erzeugt. Das Modell hält 896 Experten vor, kleine spezialisierte Teilnetze, die jeweils lernen, bestimmte Muster in Sprache zu erkennen. Für jedes Wort blickt ein Router auf den bisherigen Kontext und wählt die dafür am besten geeigneten Experten aus. Nur diese 16 der 896 Experten rechnen für dieses eine Wort tatsächlich mit; der Rest bleibt bis zum nächsten Wort untätig, wenn der Router erneut eine ganz andere Kombination aus 16 zusammenstellen kann.

16 von 896 ergibt rund 1,8 Prozent – die Zahl, die Moonshot für Kimi K3 nennt. Sie erklärt, warum ein Modell mit 2,8 Billionen Parametern in etwa so schnell und günstig antworten kann wie ein viel kleineres Modell: Nur ein winziger Ausschnitt, rund 1,8 Prozent, erledigt bei jedem Wort die eigentliche Arbeit, nicht die kompletten 2,8 Billionen.

Ein dunkler Flur mit vielen geschlossenen Türen, von denen nur wenige offen und beleuchtet sind – ein Sinnbild für selektive Aktivierung unter vielen Komponenten

Das Routing läuft automatisch, während des Trainings erlernt statt von Hand programmiert – Moonshot legt also nicht manuell fest, welcher Experte für welches Thema zuständig ist. Das Modell findet seine eigene Arbeitsteilung selbst.

Warum das über Preis und Tempo entscheidet

Der Betrieb eines Sprachmodells kostet Geld und Zeit ungefähr im Verhältnis dazu, wie viel es pro Wort tatsächlich rechnet – nicht dazu, wie viele Parameter es insgesamt besitzt. Weil sich die Betriebskosten nach den tatsächlich aktivierten Parametern richten, nicht nach den vollen 2,8 Billionen, liegen die realen Kosten pro Antwort bei Kimi K3 viel näher an einem mittelgroßen Dense-Modell, als es die Schlagzeilenzahl vermuten lässt. Ein Dense-Modell mit denselben 2,8 Billionen Parametern müsste bei jedem Wort alle davon durchrechnen – und wäre dabei drastisch langsamer und teurer im Betrieb.

Genau diese Lücke zwischen Gesamtgröße und Betriebskosten erlaubt es Moonshot, Kimi K3 über eine API zu einem Preis anzubieten, der mit deutlich kleineren Modellen mithalten kann, und ein Gespräch in einem brauchbaren Tempo zu führen statt im Schneckentempo, das ein Dense-Modell dieser Größenordnung bräuchte. DecodeStack hat die Preisseite direkt behandelt, einschließlich des Preiskriegs, den Kimi K3 in den zwei Wochen nach dem Start unter chinesischen KI-Laboren auslöste. Kurz gesagt: Diese Zahlen sind vor allem der geringen Rechenlast pro Wort zu verdanken, nicht einem Preistrick.

Kimi K3 ist nicht das einzige Modell mit diesem Trick

Mixture-of-Experts ist eine etablierte Technik, die Kimi K3 um mehrere Jahre vorausgeht, verbreitet in zahlreichen Sprachmodellen, seit Labore nach einem Weg suchten, die Gesamtkapazität eines Modells wachsen zu lassen, ohne dass die Betriebskosten im gleichen Maß mitwachsen. Mixtral von Mistral AI ist ein bekanntes Beispiel für ein weiteres offen veröffentlichtes Modell nach demselben Prinzip: Es aktiviert pro Token nur einen Teil seiner Experten, statt bei jeder Anfrage die volle Parameterzahl abzurufen.

Was sich von Modell zu Modell unterscheidet, ist die genaue Abstimmung: wie viele Experten es insgesamt gibt, wie viele pro Wort aktiv werden und wie das Routing trainiert wird. Die konkreten Zahlen von Kimi K3, 896 Experten mit 16 aktiven, sind Moonshots eigene Wahl innerhalb dieses gemeinsamen Grundprinzips, keine völlig andere Architektur. Mehrere der stärksten frei verfügbaren Sprachmodelle im Jahr 2026 setzen inzwischen auf eine Version derselben Idee der selektiven Aktivierung – ein guter Grund, ein Modell nie allein anhand seiner rohen Parameterzahl zu beurteilen.

Was Moonshot behauptet – und was unabhängig bestätigt ist

Einige Fakten zur Architektur von Kimi K3 sind öffentlich und überprüfbar, weil Moonshot sie selbst dokumentiert hat: die 2,8 Billionen Parameter insgesamt, die 896 Experten mit 16 aktiven pro Wort und ein natives Kontextfenster von 1 Million Token, also die Textmenge, die das Modell gleichzeitig berücksichtigen kann. Diese Zahlen stammen aus Moonshots eigenem Architektur-Blogpost und beschreiben das Modell so, wie es gebaut ist – keine Behauptung, die einer externen Bestätigung bedürfte.

Eine Zahl in demselben Blogpost gehört in eine andere Kategorie. Moonshot schreibt, die architektonischen Änderungen brächten „eine ungefähr 2,5-fache Verbesserung der gesamten Skalierungseffizienz gegenüber Kimi K2”, dem Vorgängermodell. Das ist Moonshots eigene Behauptung, formuliert in der eigenen Ankündigung, keine Zahl, die ein unabhängiges Labor mit einem eigenen Benchmark ermittelt hätte. Moonshots 2,5-fache Effizienzbehauptung ist die eigene Zahl des Unternehmens, kein unabhängig gemessener Benchmark, und bis zum Redaktionsschluss dieses Artikels hat kein Dritter einen Test veröffentlicht, der dieses konkrete Verhältnis bestätigt oder widerlegt. Das macht die Behauptung nicht falsch. Es bedeutet nur, dass die Zahl in die Kategorie der Dinge gehört, die ein Hersteller über sein eigenes Produkt sagt – bemerkenswert als genau das, bis jemand außerhalb von Moonshot nachprüft.

Entscheidungskarte: aktive Parameter pro Token statt Gesamtzahl vergleichen, vor Kostenannahmen die Aktivierungsrate 16 von 896 prüfen, Moonshots 2,5x-Effizienzbehauptung als Herstellerangabe kennzeichnen, und denselben Mechanismus bei Mixtral oder anderen MoE-Modellen wiedererkennen

Das Maß, das wirklich zählt

Die 2,8 Billionen Parameter von Kimi K3 sind real, und Moonshot hat genau dokumentiert, wie das Modell gebaut ist, um diese Zahl zu erreichen. Aber der winzige Ausschnitt, der pro Wort tatsächlich mitrechnet, nicht die Gesamtgröße, entscheidet über die realen Betriebskosten – und Kimi K3 aktiviert für ein einzelnes Wort nur rund 1,8 Prozent seiner selbst. Das ist die Zahl, die es sich zu merken lohnt, wenn das nächste Mal die Schlagzeilengröße eines Sprachmodells so präsentiert wird, als wäre sie die ganze Geschichte.

Häufig gestellte Fragen

Was ist Kimi K3?

Kimi K3 ist das große Sprachmodell von Moonshot AI, seit dem 27. Juli 2026 als Open Weight veröffentlicht: Moonshot stellt die fertigen Modell-Gewichte frei zum Download bereit. Es ist als Mixture-of-Experts-Modell gebaut, mit 2,8 Billionen Parametern insgesamt, wovon für jede Antwort nur ein kleiner Bruchteil aktiv ist.

Wie viele Experten aktiviert Kimi K3 pro Wort?

Kimi K3 aktiviert 16 seiner insgesamt 896 Experten für jedes erzeugte Wort, rund 1,8 Prozent des gesamten Modells. Ein Router wählt je nach Kontext für jedes Wort eine andere Kombination aus 16 aus, sodass sich die genutzten Experten innerhalb desselben Satzes von Wort zu Wort ändern können.

Ist Kimi K3 das größte KI-Modell?

Kimi K3 trägt insgesamt mehr Parameter in sich als die meisten öffentlich veröffentlichten großen Sprachmodelle – daher die Einordnung als „größtes” Modell. Weil aber pro Wort nur ein kleiner Ausschnitt dieser Gesamtzahl mitrechnet, macht diese Größe auf dem Papier es nicht zum langsamsten oder teuersten Modell im Betrieb.

Welche anderen KI-Modelle setzen auf eine Mixture-of-Experts-Architektur?

Mixture-of-Experts geht Kimi K3 voraus und steckt in mehreren bekannten großen Sprachmodellen. Mixtral von Mistral AI ist ein bekanntes Beispiel: Es aktiviert pro Wort nur einen Teil seiner spezialisierten Teilnetze, statt bei jeder Anfrage die volle Parameterzahl abzurufen – dasselbe Prinzip wie bei Kimi K3.

Ist Moonshots 2,5-fache Effizienzbehauptung unabhängig bestätigt?

Moonshots behauptete 2,5-fache Verbesserung der Skalierungseffizienz gegenüber Kimi K2 ist nicht unabhängig überprüft. Die Zahl stammt aus dem eigenen Architektur-Blogpost des Unternehmens, nicht aus dem Benchmark eines externen Labors, und bis zum Redaktionsschluss dieses Artikels wurde kein unabhängiger Test veröffentlicht, der sie bestätigt oder infrage stellt.

#kimi-k3#moonshot-ai#mixture-of-experts#llm-architecture#open-weight-models