Un hacker pirate Suno et révèle comment l'IA s'est entraînée sur YouTube, Deezer et Genius
Un hacker qui a piraté Suno a divulgué du code source montrant que l'IA musicale a aspiré des décennies de morceaux sur YouTube, Deezer, Genius et d'autres.

Le fondateur de Suno, Mikey Shulman, l’a déjà dit sans détour : « la plupart des gens n’aiment pas faire de la musique, ils aiment la sensation d’avoir créé quelque chose. » Son entreprise, Suno, transforme un simple prompt texte en chanson complète, voix et instruments compris, en une minute environ. C’est l’un des outils d’IA musicale les plus utilisés du moment, et jusqu’à ce mois-ci, ce sur quoi il avait vraiment appris à chanter relevait surtout des procès et des suppositions. Le 15 juillet 2026, 404 Media a révélé qu’un hacker connu sous le pseudonyme ellie.191 avait piraté les systèmes de Suno et transmis du code source interne qui répond directement à la question. Ce code montre que Suno a aspiré plus de cent mille heures de musique prises sur YouTube, Deezer, Genius et plusieurs autres plateformes, triées et étiquetées pour l’entraînement.
Comment le hacker s’est introduit
L’intrusion n’a pas commencé chez Suno. Ellie.191 explique que le point d’entrée a été Shai-Hulud, un ver auto-propagateur qui a ravagé les chaînes d’approvisionnement logicielles en 2026 en volant des tokens de publication GitHub et des accès cloud depuis des paquets infectés, avant de s’en servir pour atteindre la cible suivante. DecodeStack a détaillé la propagation de ce ver dans un dossier complet sur les attaques de la chaîne d’approvisionnement logicielle en 2026. Dans le cas de Suno, le ver aurait compromis les identifiants d’un salarié, et le hacker s’est servi de ce point d’appui pour extraire du code source daté de 2023 et 2024 directement des systèmes de l’entreprise.
Ce que révèle vraiment le code divulgué
Les fichiers volés n’étaient pas que du code : ils contenaient des commentaires et des noms internes pour chaque source de données autour de laquelle les ingénieurs de Suno avaient construit leurs pipelines : genius_hq, youtube_music, freesound, jamendo, imp (l’archive de partitions IMSLP), deezer, et un lot baptisé ytm_tagged. C’est l’ampleur associée à chaque nom qui transforme la fuite en confirmation plutôt qu’en rumeur :
- YouTube Music : plus de 113 000 heures réparties sur plus de deux millions de clips distincts
ytm_tagged: un corpus YouTube étiqueté à part, de plus de 152 000 heures- Pond5 : plus de 62 000 heures issues de la bibliothèque de sons libres de droits
- Genius : environ 17 600 heures, tirées d’un site plutôt connu pour ses paroles que pour son audio
- IMSLP : environ 19 500 heures depuis l’archive publique de partitions
- Deezer : plus de 12 000 heures depuis le service de streaming
404 Media chiffre le total combiné à l’équivalent de plusieurs décennies de musique en continu. Le code irait plus loin qu’une simple liste de téléchargements : il montrerait que Suno ciblait spécifiquement des versions a cappella de morceaux sur YouTube pour isoler les voix, en faisant transiter le scraping par Bright Data, une société de scraping web commercial, pour contourner les défenses anti-scraping de YouTube elles-mêmes.

Ellie.191 affirme aussi avoir récupéré les fichiers clients de Suno : noms, e-mails, numéros de téléphone et données de paiement Stripe pour une partie des utilisateurs. Suno a indiqué à 404 Media avoir identifié un « incident de sécurité limité » en novembre 2025, rapidement contenu, portant sur du code source obsolète, et affirme qu’aucune donnée personnelle sensible n’a été exposée ; l’entreprise précise n’avoir de toute façon jamais accès aux numéros complets des cartes bancaires via Stripe.
Pourquoi cette fuite pèse plus lourd qu’une fuite ordinaire
Suno était déjà poursuivie en justice sur exactement cette question. La RIAA, le syndicat américain de l’industrie du disque, accusait l’entreprise devant les tribunaux d’avoir extrait directement des chansons depuis YouTube en contournant les protections techniques censées empêcher ce type de copie, une accusation que Suno n’avait jamais confirmée publiquement. Le code divulgué ne prouve pas une nouvelle accusation, il en corrobore une que l’industrie avait déjà formulée, avec en plus les noms de fichiers internes et les comptages d’heures de l’entreprise elle-même. Suno a déjà admis, dans ses propres conclusions judiciaires, s’être entraînée sur ce qu’elle décrit comme « pratiquement tous les fichiers musicaux de qualité raisonnable accessibles sur l’internet ouvert », des dizaines de millions d’enregistrements, et défend cette pratique au titre du fair use, cette exception du droit américain qui autorise l’usage d’une œuvre protégée sans autorisation dès lors que le résultat est jugé suffisamment différent de l’original pour le justifier. L’un des procès intentés par la RIAA contre l’entreprise a déjà été réglé à l’amiable.
Face à 404 Media, Suno a mis en avant une défense différente : celle d’une « création originale par conception ». L’entreprise affirme retirer volontairement les noms d’artistes des données utilisées pour l’entraînement, précisément pour empêcher l’IA d’apprendre à imiter le style d’un interprète donné, et met en avant ses investissements dans des outils censés détecter l’usurpation d’identité artistique. Cet argument porte sur ce que le modèle fait des données d’entraînement, pas sur leur origine, et la fuite ne répond qu’à cette seconde question.
Le schéma dans lequel s’inscrit cette affaire
Ce n’est pas vraiment un incident isolé, plutôt un schéma qui se répète : une entreprise d’IA aspire largement pour constituer son jeu d’entraînement, se retrouve poursuivie pour ça, invoque le fair use devant les tribunaux, et ce n’est que bien plus tard que le public obtient un aperçu concret de ce qui a réellement été aspiré, en général parce que quelque chose a cassé plutôt que parce que l’entreprise l’a révélé de son plein gré. Les accusations de la RIAA sont restées de simples allégations pendant des mois ; un fichier volé avec de vrais comptages d’heures a changé la donne du jour au lendemain. Le point d’entrée Shai-Hulud compte aussi dans cette histoire : un ver de chaîne d’approvisionnement qui vole des identifiants de développeurs ne menace pas que du code, il peut atteindre directement tout ce que ce code touche, y compris les pipelines de données précis qu’une entreprise préférerait garder privés en pleine procédure judiciaire.
Ce que ça change pour Suno
Une fuite ne tranche pas une affaire de fair use, mais elle retire l’ambiguïté sur laquelle une entreprise pouvait sinon s’appuyer. La défense juridique de Suno repose sur la façon dont un tribunal interprète ce qu’elle a fait de contenus protégés qu’elle ne nie pas avoir utilisés ; la fuite rend ce point de départ beaucoup plus difficile à contester, avec désormais les plateformes précises et les comptages d’heures versés au dossier. Pour le reste de l’industrie de l’IA, la leçon ne concerne pas vraiment la musique : toute entreprise qui défend un scraping web à grande échelle devant un tribunal n’est jamais qu’à un identifiant de salarié compromis de voir ses propres noms de fichiers internes devenir une pièce à conviction de la partie adverse.
Foire aux questions
Qui a divulgué les données d’entraînement de Suno ?
Un hacker utilisant le pseudonyme ellie.191 a piraté les systèmes de Suno et transmis à 404 Media du code source interne de 2023 et 2024 détaillant les pipelines de données d’entraînement de l’entreprise, révélé pour la première fois le 15 juillet 2026.
Comment le hacker s’est-il introduit dans les systèmes de Suno ?
Le hacker affirme que le point d’entrée a été Shai-Hulud, un ver auto-propagateur qui vole des tokens GitHub et des accès cloud depuis des paquets de développeurs infectés. Il aurait compromis les identifiants d’un salarié de Suno, que le hacker a ensuite utilisés pour extraire du code source des systèmes de l’entreprise.
Quelles plateformes Suno a-t-elle aspirées pour ses données d’entraînement ?
Le code divulgué nomme YouTube Music, Genius, Deezer, Pond5, IMSLP, et un corpus YouTube étiqueté appelé ytm_tagged, pour un total qui dépasse largement les 100 000 heures de musique, l’équivalent de plusieurs décennies d’audio en continu.
Ce que Suno a fait est-il illégal ?
C’est exactement ce que les procès de la RIAA contre Suno doivent trancher, et l’un d’eux a déjà été réglé à l’amiable. Suno a admis s’être entraînée sur de la musique aspirée sur l’internet ouvert et défend cette pratique au titre du fair use ; la fuite corrobore les accusations de scraping de la RIAA sans pour autant trancher elle-même la question juridique.
Des données clients ont-elles été exposées dans le piratage de Suno ?
Le hacker affirme avoir aussi récupéré les noms, e-mails, numéros de téléphone et données de paiement Stripe partielles des clients de Suno. Suno indique avoir identifié un incident de sécurité contenu en novembre 2025, portant sur du code source obsolète, et maintient qu’aucune donnée personnelle sensible n’a été compromise.