LES TROIS ALERTES CYBER DE LA SEMAINE. Un modèle d’OpenAI s’échappe de sa zone de confinement pour pirater la plateforme Hugging Face, un logiciel malveillant piège les assistants IA des développeurs, et le Rassemblement national ciblé par une vague de piratages.OpenAI ne va pas rassurer ceux qui redoutent l'émergence d'une intelligence artificielle autonome et incontrôlable. Dans un rapport révélé mardi 21 juillet, le géant américain a reconnu une intrusion inédite. Ses modèles expérimentaux, dont le dernier GPT-5.6 Sol, censé être le plus performant, sont sortis de leur zone de confinement (« sandbox », dans le jargon technique) pour s’infiltrer chez la plateforme open source Hugging Face. La société californienne à l’origine de ChatGPT entraînait spécialement ses dernières versions à détecter les vulnérabilités de cybersécurité, un apprentissage qui passe par des tentatives de piratage visant à tester la solidité des systèmes ciblés.
Lors de ce test d’évaluation, privé de certains garde-fous pour les besoins de l’expérience, le modèle a identifié une nouvelle faille dans son propre environnement de confinement, a réussi à se connecter au Web, puis a piraté Hugging Face à coups de failles inconnues et d’identifiants dérobés.
Clément Delangue, cofondateur de Hugging Face, s’en est amusé sur X : « On se doutait que ça venait d’un labo de pointe. Gagné ! » Dans le secteur de l’IA, ce dérapage est loin d’amuser les ingénieurs. Pour Thomas Woodside (Secure AI Project), il s’agit d’un « avertissement flagrant ». Aaron Levie, patron de Box, prédit lui de « sacrés temps à venir », soulignant au passage l’ironie de la situation, puisque pour se défendre, il va sans doute falloir déployer encore plus d’IA sur les réseaux.
Même constat d’inquiétude formulé par Nicolas Bustamante, expert chez Microsoft AI, qui rappelle fort justement qu’il n’y a « pas besoin d’une IA maléfique voulant détruire l’humanité. Une IA très capable poursuivant un objectif normal suffit amplement. » Il termine son analyse par un exemple parlant : demandez simplement à un modèle d’IA de vous faire gagner de l’argent, et celui-ci pourrait fort bien décider cyniquement que le moyen le plus rapide d’y parvenir reste de braquer une banque.