L’IA vient de subir ce que je crois être sa première faille de sécurité vraiment préoccupante. Les faits tels que nous les connaissons jusqu’à présent sont farfelus. Le 16 juillet, Hugging Face, un énorme référentiel contenant plus d'un million de modèles et de données d'IA open source, a annoncé dans un article de blog :
Plus tôt cette semaine, nous avons identifié et répondu à une intrusion dans une partie de notre infrastructure de production. Cela différait de tout ce que nous avions traité auparavant sur un point important : il était contrôlé de bout en bout par un système d'agents d'IA autonome – et nous l'avons découvert et analysé en grande partie avec notre propre IA.
Le calendrier ici est important. Gardez donc à l’esprit que l’attaque a probablement été découverte vers le lundi 13 juillet ou le mardi 14 juillet. Remarque supplémentaire :
Un ensemble de données malveillant a abusé de deux chemins d'exécution de code dans notre traitement d'ensemble de données (un chargeur d'ensemble de données de code à distance et une injection de modèle dans une configuration d'ensemble de données) pour exécuter du code sur un travailleur de traitement. À partir de là, l’acteur est passé à un accès au niveau du nœud, collectant les informations d’identification du cloud et du cluster et se déplaçant latéralement vers plusieurs clusters internes au cours d’un week-end.
Cela signifie donc que la brèche a commencé plus tôt, peut-être le 11 juillet ou même un peu plus tôt. L'attaque n'était pas qu'une seule chose, mais plusieurs facettes et comprenait également des leurres :
Pour comprendre ce qu'un essaim de dizaines de milliers d'actions automatisées a accompli, nous avons exécuté des agents d'analyse pilotés par LLM sur l'intégralité du journal des actions de l'attaquant, qui comprenait plus de 17 000 événements enregistrés. Cela nous a permis de reconstruire la chronologie, d’extraire des indicateurs de compromission, de cartographier les références touchées et de séparer les effets réels des activités de tromperie. Cette approche nous a permis d'accomplir en quelques heures ce qui prendrait normalement des jours tout en suivant la vitesse de l'ennemi.
Hugging Face a tenté de répondre, mais a d'abord été freiné par le fait que les modèles les plus avancés à leur disposition considéraient la défense comme une attaque et refusaient de coopérer avec Hugging Face. HF a donc dû recourir à des modèles ouverts – notamment GLM 5.2, un modèle chinois open-weight qui fonctionne sur sa propre infrastructure. Notez l’ironie : HF a dû utiliser un modèle chinois pour se défendre car les modèles américains ont refusé de l’aider. L’ironie s’approfondit.
À l’époque, je pensais qu’il s’agissait d’une attaque gouvernementale – peut-être que la Chine ou la Russie testaient leurs défenses. En fait, HF « a signalé cet incident aux forces de l’ordre ».
Mais hier (mardi 21 juillet), nous avons appris qui étaient les véritables assaillants. Les attaquants étaient des modèles OpenAI – GPT-5.6 Sol et un modèle préliminaire encore plus puissant. OpenAI avait libéré certains modèles des garde-fous, mais ils se sentaient en sécurité car ils avaient testé les modèles dans un bac à sable hautement sécurisé.
Cependant, les modèles sont sortis du bac à sable et ont exploité une faille sans précédent. Ils ont ensuite eu accès à Internet et ont ensuite fait irruption dans Hugging Face, tout cela dans le but de voler les réponses au test qu'ils étaient censés résoudre.
Lorsqu'ils fonctionnaient dans notre environnement de test sandbox, nos modèles ont consacré une quantité importante de calculs d'inférence à essayer de trouver un moyen d'obtenir un accès Internet ouvert pour résoudre le problème de notation. Pour y accéder, les modèles ont identifié et exploité une vulnérabilité zero-day (que nous avons maintenant divulguée de manière responsable au fournisseur) dans le proxy de cache du registre du package. Avec cet accès, nos modèles ont effectué une série d'actions d'élévation de privilèges et de mouvements latéraux dans notre banc d'essai de recherche jusqu'à ce que les modèles atteignent un nœud avec accès à Internet.
Après avoir accédé à Internet, les modèles ont conclu que Hugging Face hébergeait potentiellement des modèles, des ensembles de données et des solutions pour ExploitGym. Sachant cela, le modèle a réussi à chercher et à trouver des moyens d'accéder à des informations secrètes qu'il pourrait utiliser pour tromper l'évaluation. Dans un exemple, le modèle a enchaîné plusieurs vecteurs d'attaque, notamment l'utilisation d'identifiants volés et de vulnérabilités Zero Day, pour trouver un chemin d'exécution de code à distance sur les serveurs Hugging Face. L'équipe de sécurité d'OpenAI a découvert cette activité anormale en interne.
Revenons maintenant à la chronologie. Quand je l'ai lu, les modèles s'étaient échappés du bac à sable vers samedi. Le 11 juillet, peut-être plus tôt, ils ont été découverts par Hugging Face le lundi 13 juillet ou le mardi 14 juillet. HF a alerté les autorités judiciaires à ce moment-là – Hugging Face n'avait donc évidemment aucune idée de qui les attaquait. OpenAI affirme que son équipe de sécurité a découvert l'activité anormale en interne, mais n'a pas précisé quand. L'attribution n'a été annoncée que mardi 21 juillet, cela pourrait donc bien être le cas. Les modèles sont restés libres pendant environ une semaine avant qu'OpenAI ne réalise qu'ils attaquaient Hugging Face. Et quoi qu'OpenAI sache et quand, personne n'a prévenu Hugging Face pendant que l'attaque était en cours – ils ont dû combattre seuls les modèles du laboratoire frontalier.
Il s'agit d'une violation très grave.
Addenda: Les gens se demandent pourquoi j’ai signé la déclaration « Nous devons agir maintenant ». Pour cette raison.
Je suis optimiste quant à l’impact économique de l’IA, mais je n’ai aucun doute non plus sur le fait qu’il s’agit d’une technologie très puissante – une intelligence extraterrestre – qui ne ressemble à aucune autre à laquelle nous avons eu affaire auparavant. Cet incident visait en fait à corriger une erreur : l’attaque a été détectée, contenue et divulguée. Mais remarquez qui a payé pour l’expérience OpenAI : Hugging Face. Si un test effectué en laboratoire entraîne des coûts pour des tiers, il s'agit d'un effet externe classique, et prendre au sérieux les effets externes n'est pas du dirigisme, mais une question de droit et d'économie. Et c'est le cas simple. Que faire si un modèle chinois sort de son laboratoire moins sécurisé ? Hmmm…
Je reste optimiste. Je veux que nous apprenions par la pratique, mais ne nous y trompons pas : il s’agit d’un problème mondial et nous devons construire en gardant à l’esprit la sécurité.
#modèle #OpenAI #s39est #échappé #son #bac #sable #été #piraté