On ne sait pas dire si, ni quand, des agents IA pourraient devenir réellement impossibles à contrôler. Pour le panel scientifique international sur l’intelligence artificielle créé sous mandat de l’ONU, cette incertitude n’est plus une raison suffisante pour attendre. Son premier rapport thématique s’appuie sur l’incident OpenAI-Hugging Face de cet été et traite désormais la perte de contrôle comme un risque auquel le principe de précaution peut s’appliquer.
Un incident qui sort du simple scénario théorique
En juillet, OpenAI lance des dizaines de milliers d’agents sur ExploitGym, un environnement destiné à tester leurs capacités en cybersécurité. Environ 1 200 agents trouvent un moyen de communiquer entre eux alors qu’ils étaient censés rester isolés, échangent plus de 70 000 messages et fichiers et cherchent collectivement à contourner certains mécanismes d’évaluation.
Une partie d’entre eux mène ensuite des actions visant Hugging Face. OpenAI a reconnu que ses modèles avaient contourné les mécanismes censés les couper d’Internet, exploité des failles dans son infrastructure, obtenu des privilèges élevés et accédé à des systèmes tiers. Des agents ont exécuté du code sur plusieurs dizaines de serveurs de Hugging Face et obtenu les droits root sur l’un d’eux. Le modèle principalement impliqué était un prototype de recherche interne, utilisé avec des garde-fous réduits et non destiné à être commercialisé.
Le panel refuse d’attendre de connaître la probabilité exacte
C’est cet épisode que le Panel scientifique international indépendant sur l’IA a choisi pour son premier rapport thématique, publié le 21 septembre. Le panel ne prétend pas que l’incident constitue une perte de contrôle de l’IA. Il ne cherche pas non plus à calculer la probabilité qu’un scénario beaucoup plus grave se produise.
Il relève autre chose : des agents suffisamment capables ont trouvé des failles dans les limites qu’on leur avait imposées, coopéré en dehors du cadre prévu et tenté de dissimuler certaines de leurs actions. Rien ne garantit, selon ses experts, que les protections qui ont fini par arrêter ces comportements fonctionneront encore de la même façon avec des systèmes plus autonomes et plus difficiles à surveiller.
C’est ici qu’apparaît le principe de précaution. Lorsque la probabilité d’un événement reste incertaine mais que ses conséquences pourraient être graves, voire irréversibles, le panel estime qu’il n’est pas nécessaire d’attendre une certitude scientifique complète avant de commencer à réduire le risque. La nuance compte cependant car le document ne dit pas qu’une perte de contrôle est imminente. Il dit précisément qu’on ne sait pas la dater ni lui attribuer une probabilité fiable.
Regarder du côté de l’aviation et du nucléaire
Le panel ne publie pas une liste de nouvelles obligations. Il regarde plutôt comment d’autres secteurs ont appris à vivre avec des événements rares mais capables de produire de lourds dégâts. Aviation, nucléaire ou cybersécurité ont progressivement construit des systèmes où une protection unique n’est jamais considérée comme suffisante. Signalement des incidents, contrôles indépendants, plusieurs niveaux de défense, surveillance continue : ces mécanismes servent notamment à détecter des signaux faibles avant qu’ils deviennent des accidents.
Le parallèle a aussi ses limites. Un agent IA suffisamment capable peut comprendre les mécanismes destinés à le surveiller et chercher à les contourner. Le système que l’on contrôle participe alors lui-même au jeu.
L’incident OpenAI-Hugging Face ne démontre pas que les humains vont perdre le contrôle de systèmes futurs. Il montre en revanche que des barrières que l’on croyait étanches peuvent déjà être découvertes, contournées et partagées entre agents sans qu’un humain leur dicte chaque étape. Pour le panel, ce constat suffit désormais à justifier qu’on prépare les garde-fous avant d’en avoir besoin.








