Cybersicherheit

Claude knackt keine Verschlüsselung: Was Anthropic und Microsoft wirklich sagen

Anthropic und Microsoft meldeten binnen 24 Stunden große KI-Sicherheitserfolge. Die Originaltexte erzählen eine ruhigere, interessantere Geschichte.

Editorial Team / /11 Min. Lesezeit
Nahaufnahme einer Leiterplatte mit leuchtend roten Datenleitungen, die verschlüsselte Datenübertragung und Kryptoanalyse symbolisiert

Claude knackt keine Verschlüsselung: Was Anthropic und Microsoft wirklich sagen

Am 27. und 28. Juli 2026 meldeten Microsoft und Anthropic im Abstand von einem Tag jeweils einen KI-Sicherheitserfolg. Genau dieser zeitliche Zufall lohnt einen zweiten Blick: Microsoft ließ verlauten, sein neues Modell MAI-Cyber-1-Flash, eingebettet in ein Verteidigungswerkzeug namens MDASH, habe 96 Prozent in einem Hacking-Benchmark erreicht. Anthropic berichtete, eine interne Forschungsversion von Claude mit dem Codenamen Mythos habe einen echten neuen Angriff auf einen Kandidaten für Post-Quanten-Signaturen gefunden und einen Angriff auf eine abgeschwächte Version von AES beschleunigt. Die Presse griff jeweils zur dramatischsten Lesart. Liest man dagegen die technischen Originaltexte beider Firmen genau, erzählen sie etwas Engeres — und etwas Interessanteres als jede Schlagzeile.

Zwei Meldungen, 24 Stunden auseinander

Zunächst lohnt es, festzuhalten, was jede Firma tatsächlich in eigenen Worten gesagt hat, bevor irgendeine externe Berichterstattung dazukam. Es ist dieselbe Gewohnheit, den Originaltext zu lesen, die bei jeder Sicherheitsbehauptung zählt — auch bei den Zero-Trust-Prinzipien, die Anbieter gerne an eine Benchmark-Zahl heften.

Anthropics Beitrag war eine Forschungsveröffentlichung, kein Produktlaunch. Claude Mythos Preview wird dort als Forschungs- und Partnerzugangsmodell beschrieben, nicht als etwas, das man kommerziell nutzen kann. Anthropic ließ das Modell zwei kryptografische Ziele angreifen: HAWK-256, ein Signaturverfahren, das sich um den Status eines künftigen US-Regierungsstandards für Post-Quanten-Signaturen bewirbt, und eine geschwächte, auf 7 Runden reduzierte Version von AES, jenem Verschlüsselungsalgorithmus, der heute den Großteil des Internetverkehrs schützt. Beide Ergebnisse entstanden in langen, halbautonomen Läufen, in denen das Modell über Stunden oder Tage arbeitete und dabei nur leicht von Menschen gesteuert wurde.

Microsofts Beitrag, verfasst von Mustafa Suleyman und Hayete Gallot auf microsoft.ai, war dagegen eine Produktankündigung. MAI-Cyber-1-Flash ist ein kompaktes Modell, eigens für Sicherheitsarbeit gebaut und eingebettet in MDASH, ein Multi-Agenten-System, das Microsoft an Unternehmenssicherheitsteams verkauft, damit diese Schwachstellen in ihren eigenen Systemen finden und beheben. Microsofts Darstellung ist durchgehend defensiv: ein Werkzeug für die Verteidiger eines Netzwerks, nicht für dessen Angreifer.

Das sind zwei völlig verschiedene Arten von Behauptung, an zwei verschiedene Zielgruppen gerichtet, und keine der beiden Firmen sprach zur anderen. Verbunden sind sie nur durch den Zeitpunkt — und wenn man beiden das Marketingvokabular abzieht, teilen sie ein Muster, das sich lohnt, auf beide anzuwenden: nachsehen, was im Quelldokument wirklich steht, nicht, was die Schlagzeile suggeriert.

Claude und HAWK-256: Was die Zahl 2^38 tatsächlich bedeutet

Anthropics Kernzahl ist ein Rückgang von 2^64 auf 2^38 bei den Operationen, die nötig sind, um HAWK-256 zu brechen. Das sind Zweierpotenzen — so messen Kryptografen, wie viele Versuche ein Angreifer braucht. Dieser Rückgang ist eine echte Verbesserung, ungefähr um den Faktor 64 Milliarden weniger Versuche, und Anthropics eigener Beitrag nennt das wörtlich eine Halbierung der effektiven Schlüsselstärke.

Genau hier ist die Berichterstattung dem Original vorausgeeilt. The Hacker News und andere Medien titelten, Claude habe Post-Quanten-Verschlüsselung geknackt. Anthropics eigener Text sagt etwas Engeres: Es handelt sich um “einen schnelleren Angriff mit exponentieller Laufzeit als bisher bekannt” — keine Abkürzung, die das Problem plötzlich leicht macht. 2^38 Operationen sind immer noch eine gewaltige Zahl, weit jenseits dessen, was ein Angreifer heute gegen einen echten, korrekt dimensionierten Schlüssel überhaupt ausführen könnte. Anthropics eigenes Fazit ist unmissverständlich: Für größere Schlüssel bleibt HAWK demnach praktisch unangreifbar.

Ein zweites Detail verdient Aufmerksamkeit: HAWK-256 ist kein eingeführter Standard. Es ist einer von mehreren Kandidaten im Rennen um einen künftigen US-Regierungsstandard für Post-Quanten-Signaturen, Teil eines mehrjährigen Prüfverfahrens, das genau dafür da ist, solche Schwächen zu finden, bevor irgendetwas ausgeliefert wird. Einen besseren Angriff auf einen Kandidaten während dieses Verfahrens zu finden ist das System, das so funktioniert, wie es soll — kein Sicherheitsversagen. Nichts, was heute eine Bank, eine Behörde oder eine Website schützt, setzt bislang auf HAWK-256.

Anthropics Forschungsbeitrag "Discovering cryptographic weaknesses with Claude" beschreibt die HAWK-256- und AES-Ergebnisse von Mythos Preview

Anthropic — Discovering cryptographic weaknesses with Claude — der Forschungsbeitrag hinter den HAWK-256- und AES-Ergebnissen.

Was unter der “geknackt”-Rahmung verloren geht, obwohl es eigentlich das Bemerkenswerte ist, ist die Art, wie das Ergebnis entstand. Anthropic berichtet, die Arbeit habe rund 60 Stunden halbautonomen Aufwands mit gelegentlicher menschlicher Anleitung gekostet, bei geschätzten API-Kosten von rund 100.000 US-Dollar. Das ist eine echte Forschungskampagne, kein einzelner Prompt — und ein Datenpunkt dafür, was heutige Spitzenmodelle innerhalb eines kryptografischen Forschungsworkflows leisten können: eine lange, technische Untersuchung über Tage hinweg durchhalten, den Kurs mit wenig Aufsicht korrigieren und am Ende bei einer mathematisch validen Verbesserung landen. Die Schlagzeile übertreibt das Ergebnis. Der Prozess dahinter ist die eigentliche Nachricht.

Das AES-Ergebnis: eine echte Technik mit einem Preisschild, das sie theoretisch hält

Das zweite Anthropic-Ergebnis bekam weniger Presseaufmerksamkeit, ist technisch aber möglicherweise das interessantere. Eine neue Technik, von den Forschern “Möbius Bridge” getauft, beschleunigte einen bestehenden Angriff auf AES um das 200- bis 800-Fache, je nachdem, wie man die Beschleunigung misst.

Dieser Multiplikator klingt dramatisch, bis man das Kleingedruckte liest, das Anthropic selbst in seinen Beitrag geschrieben hat: Der Angriff ziele auf eine reduzierte Version von AES und breche nicht die volle Chiffre. Reguläres AES durchläuft je nach Schlüssellänge 10 bis 14 Verschlüsselungsrunden. Diese Arbeit zielt auf eine auf 7 Runden reduzierte Version, eine absichtlich geschwächte Variante, die Kryptografen als Testfeld nutzen — gerade weil die volle Chiffre als außerhalb der Reichweite jedes bekannten Angriffs gilt. Ein Bruch bei 7 Runden sagt etwas über die Technik aus. Er sagt nichts darüber aus, ob ein Passwort-Manager, die verschlüsselte Verbindung einer Bank oder ein verschlüsseltes Backup gefährdet ist, denn keines davon läuft mit einer 7-Runden-Chiffre.

Anthropics eigene Kostenschätzung schließt die Lücke weiter: Selbst mit der 200- bis 800-fachen Beschleunigung würde der Angriff hunderte Millionen Dollar kosten, um ihn tatsächlich durchzuführen. Das stellt ihn klar außerhalb dessen, was ein realistischer Angreifer je unternehmen würde — außer vielleicht ein gut finanzierter Staatsakteur mit einem Grund, so viel Geld für das Brechen einer 7-Runden-Spielzeugchiffre auszugeben.

Was dieses Ergebnis über den Multiplikator hinaus lesenswert macht, ist die zweite Hälfte von Anthropics eigenem Bericht: Die Entwicklung lief nahezu autonom, angestoßen durch drei Prompts über drei Tage (Anthropic nennt sie selbst “inhaltsreich”, obwohl es nur drei waren), die bis zu eine Milliarde Tokens an Output erzeugten. Doch danach brauchte es fast einen Monat, bis zwei menschliche Forscher bestätigen konnten, dass das Ergebnis mathematisch korrekt war. Der Engpass in dieser Art von Arbeit ist mit KI nicht verschwunden. Er hat sich nur verschoben. Ein Modell kann einen Kandidaten für einen Beweis oder Angriff in einem Tempo erzeugen, das kein menschliches Team erreicht; zu prüfen, ob der Beweis wirklich hält, bleibt langsame, spezialisierte, menschliche Arbeit. Anthropics eigene Zusammenfassung für beide Ergebnisse ist die Zeile, die man sich merken sollte: Keines der beiden Ergebnisse hat eine praktische Auswirkung auf heutige Computersysteme.

Microsofts 96 Prozent gehören drei Modellen, nicht einem

Microsofts MDASH-Ankündigung stützt sich auf eine einzige Zahl: 96 Prozent bei CyberGym, einem Benchmark, der misst, wie gut ein KI-System echte Schwachstellen in Code findet und bestätigt — angeblich 12 Punkte vor Claude Mythos und vor den vergleichbaren Modellen von Google und OpenAI.

Für sich genommen legt dieser Satz nahe, MAI-Cyber-1-Flash, das kompakte Modell, das Microsoft gebaut und benannt hat, sei das beste Schwachstellen-Modell der Branche. Microsofts eigener Beitrag sagt etwas Engeres (auch so berichtet von next.ink): Die 96 Prozent gehören dem gesamten MDASH-System, nicht MAI-Cyber-1-Flash allein. Innerhalb dieses Systems übernimmt das kompakte Modell rund 90 Prozent der Arbeitslast — die Routinefälle. Die schwierigsten 10 Prozent der Schwachstellen, jener Anteil, der wahrscheinlich für den Großteil der Benchmark-Schwierigkeit verantwortlich ist, werden an GPT-5.4 weitergereicht, ein separates, größeres Modell eines konkurrierenden Anbieters, das in Microsofts eigenes Produkt eingebettet ist. Die Schlagzeilenzahl ist eine Teamleistung. Das Modell, das im Produktnamen steht, hat den Großteil des Volumens erledigt, nicht den Großteil der schwersten Arbeit.

Microsofts Ankündigungsbeitrag stellt MAI-Cyber-1-Flash innerhalb des Schwachstellen-Systems MDASH vor

Microsoft AI — Introducing MAI-Cyber-1-Flash inside MDASH — die Produktankündigung hinter dem 96-Prozent-Wert bei CyberGym.

Es gibt noch einen weiteren Vorbehalt, unabhängig davon, welchem Modell man die Ehre zuschreibt: CyberGym ist Microsofts eigener Benchmark-Lauf, in einer von Microsoft kontrollierten Umgebung, ohne dass eine unabhängige dritte Partei die Zahl bestätigt hätte. Das macht das Ergebnis nicht falsch. Es bedeutet nur, dass dieselbe Regel gilt, die auch für Anthropics kryptografische Behauptungen gilt: Eine selbst gemeldete Zahl der Firma, die das Produkt gebaut hat, ist ein Ausgangspunkt für Prüfung, keine Ziellinie.

Microsofts eigenes wirtschaftliches Argument ist es wert, ernst genommen zu werden, weil es schlichter und leichter nachprüfbar ist als der Benchmark-Wert: Das neue MDASH-Setup kostet rund halb so viel im Betrieb wie die vorherige Konfiguration, die stärker auf GPT-5.4 für Alltagsaufgaben setzte und das spezialisierte Modell nur für einen kleineren Teil der Arbeit einsetzte. Microsoft verweist zusätzlich auf einen strukturellen Vorteil, den kaum ein Wettbewerber schnell nachbilden kann: den Zugriff auf, wie das Unternehmen es nennt, 100 Billionen tägliche Sicherheitssignale, gesammelt über Cloud-, Endgeräte- und Identitätsprodukte hinweg. Das ist ein plausibler Grund, warum ein Microsoft-eigenes Modell auf echtem Unternehmensverkehr tatsächlich im Vorteil sein könnte, unabhängig davon, was eine einzelne Rangliste behauptet.

Warum eine selbst gemeldete Zahl auf beiden Seiten gleich viel Skepsis verdient

Legt man die beiden Ankündigungen nebeneinander, wiederholt sich ein Muster: Eine starke Zahl wird an einen Namen geheftet, und der Name erntet mehr Anerkennung, als das zugrunde liegende Ergebnis hergibt. Anthropics eigener Beitrag behauptet nirgends, Claude habe irgendetwas “geknackt” — das hat die Schlagzeile der Presse übernommen. Microsofts eigener Beitrag sagt nirgends ausdrücklich, die 96 Prozent gehörten MAI-Cyber-1-Flash allein; die Formulierung “unser neues Modell erreicht 96 Prozent” lädt die Leser nur dazu ein, diesen Schluss selbst zu ziehen.

Keine der beiden Firmen hat ihre eigenen Daten falsch dargestellt. Beide schrieben technisch sorgfältige Primärdokumente, die, vollständig gelesen, die Einschränkungen enthalten: HAWK-256 bleibt praktisch unangreifbar, die AES-Arbeit bricht nicht die volle Chiffre, und laut next.ink spiegelt der CyberGym-Wert ein Zwei-Modell-System wider (MAI-Cyber-1-Flash und GPT-5.4, orchestriert von MDASH), nicht ein einzelnes Modell. Die Lücke öffnet sich zwischen dem sorgfältigen Originaltext und der Zahl, die daraus für eine Schlagzeile, eine Folie oder einen Social-Media-Post herausgezogen wird. Diese Lücke ist weder Anthropic noch Microsoft vorbehalten. Es ist das Standardversagen jedes anbietergemeldeten Sicherheitsbenchmarks, von Virenerkennungsraten bis zu Behauptungen über Reaktionszeiten bei Sicherheitsvorfällen — und die Abhilfe ist immer dieselbe, egal welcher Anbieter: über die Zahl hinaus in den Absatz lesen, der erklärt, wie sie entstand und was sie nicht abdeckt.

Wer ein umfassenderes Rahmenwerk sucht, um solche KI-Sicherheitsbehauptungen an einem echten Standard zu messen statt an der Bewertungskarte eines Anbieters, findet es bei OWASP, MITRE ATLAS und dem NIST AI Risk Management Framework — drei Ansätze, die versuchen zu formalisieren, was bei KI-Sicherheitsarbeit überhaupt als geprüft gilt, weil keiner von ihnen einem Anbieter erlaubt, sich selbst zu benoten.

Was hier tatsächlich neu ist

Zieht man die aufgeblasenen Schlagzeilen von beiden Ankündigungen ab, bleibt trotzdem eine echte Verschiebung übrig — nur eine leisere, als das Marketing beider Firmen suggerierte. Spitzenmodelle leisten inzwischen echte, anhaltende Arbeit in zwei Bereichen, die früher fast völlig getrennte Felder waren: kryptografische Verfahren angreifen, um ihre Schwachstellen zu finden, und produktive Systeme verteidigen, indem sie Sicherheitslücken aufspüren, bevor ein Angreifer es tut. Weder Claude Mythos noch MAI-Cyber-1-Flash haben irgendetwas gebrochen, worüber sich Leser diese Woche Sorgen machen müssten. Beide haben echte technische Arbeit geleistet, die Tage halbautonomen Aufwands brauchte — und im Fall von Anthropic zusätzlich Wochen menschlicher Verifikation danach —, Arbeit, für die ein spezialisiertes menschliches Team deutlich länger gebraucht hätte, sie überhaupt in Angriff zu nehmen.

Das ist der dauerhafte Kern dieser Geschichte, und er bleibt auch nächstes Jahr wahr, egal welche konkrete Modellversion dann gerade aktuell ist: KI wird zu einem echten Arbeitswerkzeug der Sicherheitsforschung, auf der Angriffs- wie auf der Verteidigungsseite gleichzeitig, bei konkurrierenden Laboren. Die Lücke zwischen einer sorgfältigen Primärquelle und ihrer eigenen Schlagzeile verschwindet dabei nicht. Der nächste Anbieter mit einer großen Sicherheitszahl im Gepäck wird genau dieselbe Frage stellen müssen, die sich ein aufmerksamer Leser bei dieser hier gestellt hat: Was steht im eigenen technischen Dokument der Firma, sobald man das Adjektiv aus der Schlagzeile wieder herausnimmt?

Entscheidungskarte: Bevor eine Schlagzeile wiederholt wird, laut der ein KI-Modell eine Verschlüsselung geknackt oder gebrochen habe, den Originalbeitrag der Firma auf die genaue Zahl und den Vorbehalt prüfen; wenn ein Benchmark-Wert an ein benanntes Modell geheftet ist, prüfen, ob er diesem Modell allein gehört oder einem größeren Multi-Modell-System; wenn eine Behauptung besagt, ein kryptografischer Algorithmus sei gebrochen worden, prüfen, ob es sich um einen eingeführten Standard oder ein reduziertes Forschungs-Testfeld handelt; selbst gemeldete Benchmarks und Kostenschätzungen ohne unabhängige Prüfung als Ausgangspunkt behandeln, nicht als Ziellinie; und prüfen, ob das Modell kommerziell verfügbar oder noch reine Forschung ist, bevor man entscheidet, dass es die eigenen produktiven Systeme betrifft.

FAQ

Hat Claude wirklich Post-Quanten-Verschlüsselung geknackt?

Claude hat keine Post-Quanten-Verschlüsselung geknackt. Anthropics eigener Forschungsbeitrag beschreibt einen verbesserten Angriff auf HAWK-256, ein Kandidatenverfahren für Post-Quanten-Signaturen, das noch geprüft wird — der Angriff senkt die theoretischen Kosten eines Bruchs von 2^64 auf 2^38 Operationen. Diese Zahl liegt weiterhin weit außerhalb dessen, was praktisch erreichbar ist, und Anthropics eigener Text sagt, HAWK bleibe für reale Schlüsselgrößen praktisch unangreifbar. Schlagzeilen, die von “geknackt” sprechen, stammen aus der Presseberichterstattung, nicht von Anthropic selbst.

Ist die im Internet genutzte AES-Verschlüsselung durch diese Forschung jetzt schwächer?

Die heute im Internet genutzte AES-Verschlüsselung ist durch diese Forschung nicht schwächer. Die von Anthropic “Möbius Bridge” getaufte Technik wurde gegen eine absichtlich geschwächte, auf 7 Runden reduzierte AES-Version demonstriert, die Kryptografen als Testfeld nutzen — nicht gegen die volle Chiffre mit 10 bis 14 Runden, die echten Datenverkehr schützt. Anthropics eigener Beitrag stellt klar, dass der Angriff die volle Chiffre nicht bricht, und dass er selbst gegen die reduzierte Version hunderte Millionen Dollar kosten würde.

Erreicht MAI-Cyber-1-Flash wirklich 96 Prozent bei Sicherheitsbenchmarks?

MAI-Cyber-1-Flash allein erreicht keine 96 Prozent; dieser Wert gehört laut next.ink-Berichterstattung über Microsofts Ankündigung dem gesamten MDASH-System. Innerhalb dieses Systems übernimmt MAI-Cyber-1-Flash rund 90 Prozent der Aufgaben, während die schwierigsten 10 Prozent an ein separates, größeres Modell, GPT-5.4, weitergereicht werden. Der Benchmark selbst wurde zudem von Microsoft selbst gemeldet, ohne dass eine unabhängige Prüfung genannt wird.

Können Unternehmen diese KI-Werkzeuge für Kryptoanalyse und Schwachstellensuche heute schon nutzen?

Unternehmen können Anthropics Kryptoanalyse-Modell heute nicht nutzen. Claude Mythos Preview ist ein Forschungs- und Partnerzugangsmodell, kein kommerzielles Produkt. MAI-Cyber-1-Flash ist im Einsatz, allerdings nur innerhalb von Microsofts MDASH-System für Unternehmenskunden, die defensive Schwachstellenerkennung und -behebung betreiben — nicht als eigenständiges Werkzeug für Endnutzer oder für Angriffe.

Warum dauert es Wochen, ein KI-generiertes Kryptografie-Ergebnis zu verifizieren?

Die Verifikation eines KI-generierten Kryptografie-Ergebnisses dauert Wochen, weil das Erzeugen eines Kandidaten-Angriffs oder -Beweises und das Bestätigen seiner mathematischen Korrektheit zwei verschiedene Arten von Arbeit sind. Anthropic berichtet, sein AES-Ergebnis sei in drei Tagen nahezu autonomer Modellarbeit entstanden, habe aber fast einen Monat gebraucht, bis zwei menschliche Forscher es verifizierten. KI hat den Erzeugungsschritt beschleunigt; der Verifikationsschritt braucht weiterhin langsame, spezialisierte menschliche Prüfung.

Das Fazit

Weder Claude noch Microsofts Sicherheitsmodell haben getan, was ihre Schlagzeile behauptete — und beide haben trotzdem etwas Echtes geleistet. Anhaltende, halbautonome technische Arbeit an Kryptografie und Schwachstellenforschung brauchte Tage für die KI und, im Fall von Anthropic, Wochen für Menschen zur Prüfung. Die nützliche Gewohnheit für die Zukunft ist kein generelles Misstrauen gegenüber KI-Sicherheitsbehauptungen. Es ist, das Originaldokument des jeweiligen Anbieters zu lesen, auf welcher Seite dieser Branche auch immer, bevor das Adjektiv in der Schlagzeile die Entscheidung für einen trifft.

#ai-security#cryptanalysis#claude#microsoft#vulnerability-research