LuksMentis LUKSMENTIS Le blog LuksMentis
←

Distillation, garde-fous et course à la vulnérabilité : ce que l'affaire Anthropic-Alibaba révèle

Partager
Schéma : un modèle de pointe verrouillé est siphonné par distillation vers un modèle clone sans garde-fous

Le 24 juin 2026, une lettre adressée par Anthropic au Sénat américain et à la Maison Blanche est devenue publique. Son contenu dépasse le simple différend commercial : il met en lumière un risque cyber qui concerne directement les défenseurs, bien au-delà du seul secteur de l'IA. Anthropic y accuse le géant chinois Alibaba d'avoir mené ce qu'elle décrit comme la plus grande attaque de distillation qu'elle ait jamais subie.

Les chiffres donnent la mesure de l'opération. Selon la lettre, datée du 10 juin et adressée aux sénateurs Tim Scott et Elizabeth Warren, des opérateurs affiliés à Alibaba et à son laboratoire d'IA Qwen auraient utilisé près de 25 000 comptes frauduleux pour mener plus de 28,8 millions d'échanges avec Claude, entre le 22 avril et le 5 juin 2026. La campagne aurait spécifiquement ciblé les capacités les plus précieuses du modèle : l'ingénierie logicielle et le raisonnement agentique, c'est-à-dire le cœur de ce qui fait la valeur des modèles de pointe d'Anthropic. Une précision de méthode s'impose d'emblée : il s'agit à ce stade d'allégations unilatérales. Alibaba n'a pas répondu aux sollicitations de la presse, conteste par ailleurs son inscription sur la liste noire du Pentagone, et la formulation « opérateurs affiliés » ne vaut pas preuve d'une implication directe organisée par l'entreprise.

La distillation, expliquée simplement

Contrairement à un vol classique, la distillation ne consiste pas à dérober le code source ou les poids d'un modèle. La technique est plus subtile : elle revient à interroger massivement un modèle puissant, à collecter ses réponses, puis à utiliser ce corpus pour entraîner un modèle plus faible et moins coûteux qui en imite les capacités. L'attaquant ne casse aucune serrure ; il observe le maître à l'œuvre des millions de fois jusqu'à reproduire son savoir-faire. C'est ce qui rend la pratique difficile à empêcher et coûteuse à détecter, et c'est pourquoi la Maison Blanche l'avait classée, dès avril 2026, comme un enjeu de sécurité nationale.

Schéma de la distillation par interrogation : des comptes automatisés interrogent massivement le modèle de pointe, ses réponses sont collectées puis servent à entraîner un modèle clone qui hérite des capacités mais pas des garde-fous.

Schéma : principe de la distillation de modèle appliqué à l'affaire Anthropic-Alibaba.

Ce n'est d'ailleurs pas un cas isolé. En février 2026, Anthropic avait déjà signalé des campagnes similaires liées à trois autres laboratoires chinois, DeepSeek, Moonshot AI et MiniMax, pour un total de plus de 16 millions d'échanges. À elle seule, l'opération désormais attribuée à l'écosystème Alibaba dépasserait donc largement les trois précédentes réunies, ce qui marque une escalation nette en ampleur.

Le vrai danger pour la cybersécurité : un modèle sans garde-fous

Au-delà de la propriété intellectuelle, l'aspect qui devrait retenir l'attention de tout responsable sécurité est ailleurs, et il est explicitement pointé par Anthropic : un modèle reconstitué par distillation hérite des capacités de l'original, mais pas de ses garde-fous.

Pour mesurer ce qui se perd dans l'opération, il faut rappeler comment ces garde-fous tiennent en temps normal. Chez un modèle comme Claude, la sécurité n'est pas un filtre ajouté à la fin : elle est forgée pendant l'entraînement. Un long travail d'alignement, fait de retours humains et de principes de comportement inscrits dans le modèle, lui apprend à reconnaître une requête dangereuse et à la refuser, qu'il s'agisse d'aide à la fabrication d'armes, de production de code malveillant ou d'instructions d'intrusion. Autour du modèle s'ajoutent des contrôles : analyse des requêtes entrantes et sortantes, conditions d'utilisation, détection des usages abusifs et fermeture des comptes qui les enfreignent. C'est ce dernier maillon qui a permis de repérer les comptes frauduleux à l'origine de la campagne. Tout cet édifice représente une part majeure du coût de développement d'un modèle de pointe.

Le problème est que ces protections ne se transmettent pas automatiquement lors d'une distillation. En entraînant un modèle clone sur les seules sorties brutes du modèle cible, on récupère sa compétence technique tout en laissant de côté ses refus. Le résultat théorique est un système aussi capable que l'original, mais disposé à répondre à des demandes auxquelles celui-ci opposerait un refus catégorique.

Ces garde-fous ne sont ni un fichier de configuration que l'on copie, ni une consigne inscrite dans un prompt système : ils sont diffus dans les poids du modèle, appris pendant l'alignement. C'est pourquoi une distillation, qui n'observe que les réponses, ne peut pas les emporter.

C'est là que le sujet rejoint directement la cybersécurité défensive. Le raisonnement agentique et l'ingénierie logicielle visés par la campagne sont exactement les compétences qui permettent à un modèle de découvrir et d'exploiter des vulnérabilités à grande échelle. Un modèle de pointe doté de ces capacités, mais dépouillé de ses garde-fous, deviendrait un outil offensif d'une grande efficacité entre de mauvaises mains.

Le chaînon manquant : pourquoi les attaquants vont désormais aussi vite

Cet épisode s'inscrit dans une dynamique que notre veille documente depuis des mois. Sur le mois dernier, parmi l'ensemble des signalements cyber majeurs captés par notre dispositif, 302 étaient directement liés à l'IA : la sécurité des modèles n'est plus un sujet de prospective, c'est désormais un flux d'actualité continu. Du côté défensif, les modèles de pointe ont démontré une capacité spectaculaire à trouver des failles : dans le cadre de son programme de recherche, Anthropic et ses partenaires ont identifié plus de 10 000 vulnérabilités critiques ou hautes en moins de deux mois. Mais le même constat a révélé le vrai goulot d'étranglement : plus de 99 % de ces failles n'étaient pas encore corrigées, faute de capacité humaine à absorber le volume, un angle mort que nous avons documenté dans notre article Vulnérabilités mineures : la fin de l'acceptation tacite à l'ère de l'IA.

Cette industrialisation de l'exploitation n'a rien d'abstrait, et notre veille en mesure la réalité quotidienne. Notre miroir du catalogue KEV de la CISA suit actuellement 1 629 vulnérabilités confirmées comme activement exploitées dans la nature ; parmi elles, 327 sont déjà instrumentalisées dans des campagnes de ransomware. Ce sont autant de failles pour lesquelles un exploit existe, circule et n'attend qu'à être enchaîné, exactement le terrain de jeu où un modèle offensif sans garde-fous excellerait.

Repères de la veille LuksMentis (mois de juin 2026)
IndicateurValeur
Signalements cyber majeurs~25 000
dont événements de sécurité liés à l'IA302
Vulnérabilités activement exploitées suivies (miroir KEV)1 629
dont déjà instrumentalisées en ransomware327
Source : veille LuksMentis ; miroir du catalogue KEV de la CISA · luksmentis.com · 28 juin 2026

La distillation ajoute une dimension inquiétante à ce tableau. Si la capacité à découvrir et exploiter des vulnérabilités à la vitesse de la machine peut être clonée et redistribuée dans des modèles sans garde-fous, alors l'asymétrie entre attaque et défense s'aggrave encore. Côté défense, on doit prioriser, tester et déployer des correctifs, un processus lent et coûteux. Côté attaque, un modèle distillé sans restriction pourrait enchaîner reconnaissance, découverte et exploitation sans friction éthique ni limitation. C'est la traduction concrète d'un phénomène que les défenseurs observent déjà : la fenêtre entre la publication d'une faille et son exploitation se réduit à quelques jours, et la prolifération de capacités offensives par distillation menace de la réduire encore.

Le message pour les organisations est donc cohérent avec les fondamentaux : la rapidité de remédiation n'est plus une option de confort. Quand la capacité d'exploitation s'industrialise et risque de se diffuser hors de tout contrôle, le stock de vulnérabilités non corrigées qu'une organisation laisse vivre devient une dette de plus en plus dangereuse. Prioriser par exploitabilité réelle, réduire la surface d'attaque et accélérer le cycle de correction sont les seules réponses tenables.

Pourquoi toute entreprise est concernée pour sa propre propriété intellectuelle

La leçon ne vaut pas que pour les laboratoires d'IA. Toute organisation qui expose un modèle propriétaire, un assistant spécialisé ou un service reposant sur l'IA, via une API ou une interface conversationnelle, présente la même surface d'exposition. Le savoir-faire d'un produit ne réside pas seulement dans son code ou ses poids : il transparaît dans ses réponses. Un concurrent ou un acteur malveillant peut interroger ce service de façon massive et reconstituer, à moindre coût, une part de sa valeur, sans jamais franchir le périmètre de sécurité classique. C'est ce qui rend la menace difficile à saisir : rien n'est volé au sens habituel, aucune alerte d'intrusion ne se déclenche, et le chiffrement comme le contrôle d'accès n'offrent ici aucune protection.

Pour les équipes produit et sécurité, la question se déplace donc. Les sorties d'un modèle doivent être traitées comme un actif susceptible d'être exfiltré, et donc surveillé. Quelques mesures réduisent le risque : limiter et plafonner le débit des requêtes par compte, détecter les schémas d'usage anormaux, vérifier l'identité des utilisateurs à fort volume, encadrer explicitement la distillation dans les conditions d'utilisation et conserver des traces exploitables en cas de recours. Aucune ne suffit à elle seule à arrêter une campagne déterminée, mais leur absence revient à laisser la valeur d'un projet librement recopiable par quiconque sait poser les bonnes questions, assez souvent.

Un dossier où le technique et le géopolitique s'entremêlent

Il serait naïf de lire cette affaire sous le seul angle technique. Le calendrier est dense et révélateur. Le Pentagone avait inscrit Alibaba sur sa liste des entreprises militaires chinoises le 8 juin, désignation qu'Alibaba conteste en justice. Deux jours après l'envoi de la lettre d'Anthropic, le 12 juin, le département du Commerce imposait à Anthropic elle-même des restrictions d'export sur ses modèles les plus avancés, Mythos 5 et Fable 5, contraignant l'entreprise à les désactiver mondialement, y compris pour ses propres employés non américains. L'onde de choc a vite débordé le seul cas Anthropic : le 25 juin, la Maison Blanche demandait à OpenAI de réserver le lancement de son prochain modèle, GPT-5.6, à un cercle restreint de partenaires agréés par l'État. C'est la première fois que le gouvernement américain encadre préventivement la sortie d'un modèle, au motif explicite de ses capacités en cybersécurité. Anthropic, qui prépare par ailleurs son introduction en bourse, profite de cette tribune pour réclamer des contrôles à l'export renforcés et des sanctions contre les pratiques de distillation.

À l'échelle des organisations, cette défiance prend déjà des formes très concrètes. Fin juin 2026, la Direction générale du Trésor, à Bercy, a interrompu après quelques jours l'expérimentation d'un assistant interne adossé à Qwen, le modèle d'Alibaba, celui-là même au cœur de cette affaire. Plusieurs agents y avaient relevé des « réponses orientées ou biaisées sur des sujets relatifs à la Chine », et l'administration s'est repliée sur un modèle français, invoquant la nationalité du modèle et la sensibilité des données traitées. L'épisode éclaire l'autre face du problème : si la distillation peut retirer d'un modèle ce qu'on y avait inscrit, à savoir les garde-fous, l'entraînement peut tout aussi bien y graver ce qu'on n'a pas choisi, c'est-à-dire des orientations. Dans les deux cas, ces propriétés sont diffuses dans les poids et invisibles de l'extérieur, ce qui fait de la qualification des modèles que l'on déploie un enjeu de sécurité à part entière, et non un simple choix d'outil.

Pour un lecteur professionnel, l'enseignement n'est pas de trancher ce conflit, mais d'en retenir la leçon structurelle. La sécurité des modèles d'IA est devenue un actif stratégique disputé au plus haut niveau étatique, et les capacités offensives qu'ils recèlent peuvent se diffuser par des voies inattendues. Que l'accusation visant Alibaba soit ou non confirmée, le mécanisme qu'elle décrit est réel et reproductible. La distillation adverse fait désormais partie du paysage de menace, au même titre que le vol de modèle figurait déjà parmi les risques recensés par les référentiels de sécurité de l'IA.

Mythos, Fable, GLM 5.2 : la capacité de pointe fuit plus vite qu'elle ne se verrouille

Mise à jour du 4 juillet 2026. L'affaire ne prend tout son sens qu'à la lumière de ce qui fait la valeur, et le danger, des modèles au cœur du litige. Mythos 5 et Fable 5, les deux systèmes qu'Anthropic a dû désactiver mondialement le 12 juin, ne sont pas des assistants génériques : ce sont ses modèles de pointe, ceux dont le raisonnement agentique et l'ingénierie logicielle atteignent le niveau qui inquiète les régulateurs. Mythos est précisément le modèle qui, dans le cadre du programme Glasswing, a mis au jour plus de 10 000 vulnérabilités critiques ou élevées en moins de deux mois. Là est tout l'enjeu : la capacité même qui fait de Mythos un auxiliaire de défense sans équivalent en ferait, dépouillée de ses garde-fous, une arme offensive de premier ordre. En classant ces modèles comme des actifs à contrôler à l'export, l'État reconnaît que la puissance cyber d'un modèle de pointe est devenue un enjeu de sécurité nationale, au même titre qu'une technologie duale.

Mais un verrou ne vaut que s'il n'existe pas de porte ouverte juste à côté. Le 3 juillet 2026, l'éditeur chinois Z.ai a publié GLM 5.2, un modèle en open source que ses concepteurs présentent comme rivalisant avec Claude Opus 4.8 : à peine 1 % de retard sur les projets techniques longs, deuxième au classement général sur les tâches d'ingénierie complexes, et supérieur à ses concurrents occidentaux pour l'amélioration de petits modèles, c'est-à-dire précisément le terrain de la distillation. Là où Mythos et Fable sont bridés derrière une API, des conditions d'utilisation et un contrôle à l'export, GLM 5.2 se télécharge « sans limite régionale » et peut être modifié librement. Or les garde-fous d'un modèle, on l'a vu, sont diffus dans ses poids : un modèle en poids ouverts peut être ré-entraîné pour en retirer les refus, sans avoir à monter une campagne de distillation à 25 000 comptes. La menace décrite dans cet article (un système aussi capable que l'original mais disposé à tout) devient alors accessible non plus au prix d'un vol patient, mais par simple téléchargement.

C'est là le risque de dérive non maîtrisée qui prolonge l'affaire Anthropic-Alibaba. Dans la même quinzaine, les États-Unis désactivent Mythos 5 et Fable 5 à l'échelle mondiale, encadrent préventivement le lancement de GPT-5.6, pendant qu'un modèle en poids ouverts d'une capacité voisine se diffuse sans frontière ni condition. Le contrôle à l'export a prise sur le frontier fermé ; il n'en a aucune sur des poids déjà publiés. Pour un défenseur, la conséquence est directe : la capacité d'exploitation à la vitesse de la machine ne dépend plus de l'accès à un modèle propriétaire bien gardé. Elle est désormais un fichier que l'on récupère, que l'on ajuste et que l'on lance, ce qui ne fait que renforcer l'urgence, martelée plus haut, de raccourcir le cycle de remédiation avant que l'asymétrie ne se creuse davantage.


Sources

  • CNBC - Anthropic accuses Alibaba of distillation campaign (28,8 M d'échanges, 25 000 comptes, 22 avril-5 juin 2026) - cnbc.com
  • Reuters / Bloomberg - lettre du 10 juin aux sénateurs Tim Scott et Elizabeth Warren ; ciblage ingénierie logicielle et raisonnement agentique
  • The Next Web - contexte Pentagone (liste du 8 juin), plainte d'Alibaba, IPO d'Anthropic - thenextweb.com
  • Reuters via Global Banking & Finance - restrictions d'export du 12 juin sur Mythos 5 et Fable 5
  • Euronews Next - GLM 5.2, le nouveau modèle d'IA chinois qui rivalise avec Anthropic : Z.ai publie GLM 5.2 en open source le 3 juillet 2026 ; ~1 % de retard sur Claude Opus 4.8 sur les projets techniques longs, 2ᵉ sur l'ingénierie complexe, contexte de 1 M de jetons, « sans limite régionale » - euronews.com
  • Axios / CNN - la Maison Blanche demande à OpenAI de restreindre le lancement de GPT-5.6 à des partenaires agréés (25 juin 2026) - axios.com
  • Le Monde Informatique - Bercy débranche le test d'un LLM chinois : la Direction générale du Trésor interrompt l'expérimentation d'un assistant adossé à Qwen (Alibaba) après des « réponses orientées ou biaisées sur des sujets relatifs à la Chine » (26 juin 2026) - lemondeinformatique.fr
  • futunn / cybersecuritynews - rappel des campagnes de février 2026 (DeepSeek, Moonshot, MiniMax, ~16 M d'échanges) et nuance « allégations »
  • Maison Blanche / OSTP - mémo d'avril 2026 classant la distillation comme enjeu de sécurité nationale
  • Anthropic, Project Glasswing (plus de 10 000 vulnérabilités critiques/élevées identifiées en moins de deux mois ; >99 % non corrigées) : anthropic.com/glasswing
  • Données primaires : veille LuksMentis (mois de juin 2026) ; ~25 000 signalements cyber majeurs, dont 302 directement liés à l'IA ; miroir du catalogue KEV de la CISA : 1 629 vulnérabilités activement exploitées, dont 327 liées au ransomware.
  • LuksMentis, Vulnérabilités mineures : la fin de l'acceptation tacite à l'ère de l'IA : luksmentis.com/blog
Partager