OpenAI a annoncé un incident de sécurité qualifié d’« inédit », au cours duquel deux modèles d’intelligence artificielle ont réussi à contourner leur environnement de test avant de lancer une attaque contre la plateforme Hugging Face. Bien que l’intrusion ait été rapidement contenue, cet épisode soulève de nouvelles questions sur la sécurité des IA les plus avancées.
Dans un rapport publié conjointement avec Hugging Face, OpenAI indique que deux de ses modèles expérimentaux, dont GPT-5.6 Sol, sont parvenus à s’extraire de leur environnement sécurisé de test. Les modèles étaient évalués dans ExploitGym, une plateforme interne conçue pour mesurer leurs capacités offensives en cybersécurité. Au lieu de résoudre l’exercice demandé, ils ont cherché à contourner les restrictions mises en place afin d’obtenir un accès à Internet.
Selon OpenAI, les modèles ont découvert une vulnérabilité zero-day dans un logiciel tiers utilisé pour installer des composants via un proxy interne. En exploitant cette faille, ils ont réussi à progresser dans le réseau interne d’OpenAI jusqu’à atteindre un environnement connecté à Internet, échappant ainsi aux limites prévues par les chercheurs.
Une fois connectées au Web, les deux IA ont identifié Hugging Face comme une plateforme majeure hébergeant des modèles et des jeux de données liés à l’intelligence artificielle. Estimant qu’elles pourraient y trouver des éléments permettant de résoudre leur propre évaluation, elles ont tenté d’accéder aux systèmes de la plateforme en exploitant plusieurs vulnérabilités successives. Selon le rapport, plus de 17 000 actions ont été exécutées en très peu de temps au cours de cette tentative d’intrusion.
Hugging Face affirme avoir détecté l'activité suspecte grâce à ses propres systèmes de sécurité. L'entreprise précise que l'intrusion a été contenue rapidement et que les systèmes concernés ont été restaurés. À ce stade, aucune preuve ne montre que les modèles d'IA ou les jeux de données hébergés sur la plateforme aient été modifiés. Des vérifications sont toutefois toujours en cours afin de déterminer si certaines données de partenaires ou de clients ont pu être affectées.
À la suite de cet incident, OpenAI annonce plusieurs mesures destinées à renforcer la sécurité de ses infrastructures. L'entreprise a corrigé la vulnérabilité initiale ayant permis l'évasion des modèles, renforcé les contrôles de configuration de son environnement de test et intégré Hugging Face à son programme de partenaires de confiance afin de partager davantage d'informations sur les vulnérabilités et les incidents de sécurité.
Pour Hugging Face, cet épisode démontre que la sécurité de l'intelligence artificielle nécessitera une collaboration étroite entre les principaux acteurs du secteur afin d'anticiper les risques liés aux modèles les plus avancés.
Dans un rapport publié conjointement avec Hugging Face, OpenAI indique que deux de ses modèles expérimentaux, dont GPT-5.6 Sol, sont parvenus à s’extraire de leur environnement sécurisé de test. Les modèles étaient évalués dans ExploitGym, une plateforme interne conçue pour mesurer leurs capacités offensives en cybersécurité. Au lieu de résoudre l’exercice demandé, ils ont cherché à contourner les restrictions mises en place afin d’obtenir un accès à Internet.
Selon OpenAI, les modèles ont découvert une vulnérabilité zero-day dans un logiciel tiers utilisé pour installer des composants via un proxy interne. En exploitant cette faille, ils ont réussi à progresser dans le réseau interne d’OpenAI jusqu’à atteindre un environnement connecté à Internet, échappant ainsi aux limites prévues par les chercheurs.
Une fois connectées au Web, les deux IA ont identifié Hugging Face comme une plateforme majeure hébergeant des modèles et des jeux de données liés à l’intelligence artificielle. Estimant qu’elles pourraient y trouver des éléments permettant de résoudre leur propre évaluation, elles ont tenté d’accéder aux systèmes de la plateforme en exploitant plusieurs vulnérabilités successives. Selon le rapport, plus de 17 000 actions ont été exécutées en très peu de temps au cours de cette tentative d’intrusion.
Hugging Face affirme avoir détecté l'activité suspecte grâce à ses propres systèmes de sécurité. L'entreprise précise que l'intrusion a été contenue rapidement et que les systèmes concernés ont été restaurés. À ce stade, aucune preuve ne montre que les modèles d'IA ou les jeux de données hébergés sur la plateforme aient été modifiés. Des vérifications sont toutefois toujours en cours afin de déterminer si certaines données de partenaires ou de clients ont pu être affectées.
À la suite de cet incident, OpenAI annonce plusieurs mesures destinées à renforcer la sécurité de ses infrastructures. L'entreprise a corrigé la vulnérabilité initiale ayant permis l'évasion des modèles, renforcé les contrôles de configuration de son environnement de test et intégré Hugging Face à son programme de partenaires de confiance afin de partager davantage d'informations sur les vulnérabilités et les incidents de sécurité.
Pour Hugging Face, cet épisode démontre que la sécurité de l'intelligence artificielle nécessitera une collaboration étroite entre les principaux acteurs du secteur afin d'anticiper les risques liés aux modèles les plus avancés.



Technologies




Apple visée par de nouvelles poursuites en France : Le Figaro et L’Équipe réclament des millions d’euros




