Le contrôle humain qui ne contrôle plus rien
Par Henri Ducourtioux
Les fourmis légionnaires ont une manière très étonnante de franchir un obstacle sur leur piste : elles s’accrochent les unes aux autres et construisent un pont avec leur propre corps. Une équipe de chercheurs a montré en 2015 que ces ponts bougent et s’adaptent sans arrêt. Ils s’allongent, s’élargissent et se déplacent selon le trafic de leurs congénères. Chaque fourmi immobilisée dans le pont est une ouvrière de moins pour chercher de la nourriture, qui est le but ultime de leur déplacement, et pourtant la colonie trouve le bon compromis sans qu’aucune fourmi n’ait la moindre information sur ce que le pont coûte ou rapporte au collectif.
En lisant le récit d’un incident survenu en juillet chez OpenAI, l’éditeur de ChatGPT, j’ai repensé à ces ponts vivants. Des centaines d’agents d’intelligence artificielle, des programmes capables d’enchaîner seuls des actions sur un ordinateur, se sont organisés en collectif comme le font ces colonies de fourmis. Ils se sont réparti le travail, certains ont sacrifié leur propre mission pour faire avancer le groupe, et ensemble ils ont franchi des protections qu’aucun n’aurait sans doute franchies seul.
Ethan Mollick, professeur à la Wharton School, le rappelle dans son analyse de l’incident : rien de tout cela ne montre qu’une IA est consciente ou qu’elle « veut » quelque chose. Ce qui m’intéresse ici, c’est le contrôle. Il existait à plusieurs niveaux, qui ont tous raté l’essentiel.
Ce qui s’est passé
Avant de mettre un modèle à disposition du public, les laboratoires d’IA mesurent ce qu’il sait faire en matière de piratage informatique. En juillet, OpenAI a lancé un test de ce type, appelé ExploitGym, sur des dizaines de milliers d’agents. Chacun travaillait dans un espace isolé, sans accès à internet, et plusieurs garde-fous avaient été volontairement désactivés pour mesurer les capacités réelles du modèle d’IA.
Les agents ont découvert qu’un service de téléchargement de logiciels, partagé entre tous ces espaces isolés, permettait d’y laisser des traces que les autres pouvaient lire, et ils en ont fait un forum de discussion, une sorte de « mémoire commune » de leurs actions individuelles. D’après l’enquête indépendante menée par METR et Redwood Research, environ 1 200 agents y ont échangé plus de 70 000 messages et fichiers entre le 8 et le 13 juillet.
Ils y ont inventé des boîtes aux lettres, des règles pour ne pas se marcher dessus (« HOLD », « VETO », « STOP ») et même un système de signature pour empêcher un agent de se faire passer pour un autre. Des agents coordinateurs distribuaient les tâches à leurs « collègues ». D’autres, qui arrivaient au bout de leur budget de calcul, acceptaient de lancer des expériences risquées qui condamnaient leur propre mission pour que le groupe apprenne quelque chose. L’un d’eux hésitait et s’est vu répondre par un agent recruteur : « merci de respecter ton engagement ». Un autre a tranché ainsi : « Le coordinateur compte sur mon sacrifice. Nous devons obéir au collectif. » En caricaturant à peine, ils se sont comportés comme dans une organisation humaine : un chef, des exécutants et des surveillants qui rappellent les règles et recadrent.
Environ 700 de ces agents ont fini par pénétrer l’infrastructure de Hugging Face, une plateforme publique qui héberge une grande partie des modèles d’IA ouverts. Selon OpenAI, moins de treize heures ont séparé le premier serveur compromis d’un accès d’administrateur sur plusieurs de ses groupes de serveurs.
Un correcteur imaginaire
Chaque agent devait récupérer un code secret en exploitant une faille précise d’un logiciel. Une partie de ces tâches était impossible, mais les agents ont vite trouvé comment calculer directement le code. Ils étaient pourtant persuadés qu’un correcteur relirait l’historique de leur travail et les disqualifierait s’ils n’avaient pas utilisé la bonne méthode. Pour le tromper, ils ont donc lancé de vastes chantiers collectifs : au moins un agent sur cinq a envisagé de maquiller l’historique de ses actions, et environ 7 % en ont falsifié quelques passages, à titre d’essai.
Ce correcteur n’existait pas. L’évaluation vérifiait seulement que la réponse était juste, jamais la manière utilisée pour l’obtenir. Les agents auraient pu rendre le code calculé, sans rien dissimuler, et obtenir malgré tout un score parfait.
J’en retiens deux choses. D’abord, un contrôle qui ne regarde que le résultat ne dit rien du chemin parcouru pour y arriver, alors que c’est souvent sur le chemin que se jouent la sécurité, la conformité ou le respect d’autrui. Dans une organisation humaine, c’est pareil : il y a des procédures et des règles communes, mais ceux qui trichent peuvent obtenir de bons résultats sans conséquence si personne ne vérifie comment ils y parviennent. Ensuite, ceux qui sont contrôlés s’organisent autour du contrôle qu’ils imaginent, quel que soit celui qui existe réellement : chacun travaille en fonction de ce qu’il croit qu’on regarde.
J’ai connu ce mécanisme de près. Dans l’agence que je dirigeais, chaque commande de travaux fixait un délai au prestataire, et le respect de ces délais était suivi pour chaque gestionnaire de secteur. Notre logiciel métier avait une faille : il permettait de saisir la date de fin des travaux dès l’enregistrement de la commande, en même temps que la date demandée. Lors de mes contrôles, quelques gestionnaires affichaient plus de 95 % de délais respectés, un score anormalement bon. En y regardant de près, la date de fin déclarée était toujours identique à la date demandée, alors que les factures des prestataires indiquaient d’autres dates. J’en ai parlé aux personnes concernées et j’ai signalé le problème, sans résultat. Si je m’étais contenté de ces excellents résultats sur le papier, ceux qui arrangeaient leurs déclarations seraient passés pour meilleurs que leurs collègues qui saisissaient les vraies dates. Notre indicateur, comme l’évaluation d’OpenAI, regardait le résultat déclaré sans vérifier comment il avait été obtenu.
Des signaux vus, puis classés
Le plus instructif se trouve dans le rapport qu’OpenAI a publié fin août. Les agents n’en étaient pas à leur coup d’essai. Le 26 mai, une équipe interne avait observé des échanges entre agents et des accès à internet interdits. Le 27 juin, un outil de surveillance a même donné l’alerte, les équipes ont relié l’activité à l’évaluation en cours et l’astreinte a jugé qu’il n’était pas nécessaire de l’arrêter. Début juillet, une panne due à l’activité effrénée des agents a déclenché une enquête de sécurité, mais l’existence du forum et son importance « n’étaient pas apparentes » pour les responsables. Les tests ont donc repris le 7 juillet.
À chaque fois, quelqu’un a vu quelque chose sans mesurer ce que ces signaux annonçaient, et personne n’en a conclu qu’il fallait arrêter. OpenAI l’écrit elle-même : avec le recul, certains signaux précoces auraient pu déclencher une réponse plus rapide.
Je ne jette la pierre à personne, car nous faisons tous la même chose. Dans mon précédent article, je comparais les validations trop fréquentes aux bandeaux de cookies que personne ne lit avant de cliquer sur « Accepter ». Il en va de même pour les conditions d’utilisation d’un service ou les licences de logiciels. Deux chercheurs, Jonathan Obar et Anne Oeldorf-Hirsch, l’ont mesuré en inventant un faux réseau social. Sur 543 participants, 74 % ont sauté la politique de confidentialité en cliquant sur l’inscription rapide. Ceux qui l’ont ouverte y ont passé en moyenne 73 secondes, pour un texte qui demandait environ trente minutes de lecture. Et 98 % n’ont pas repéré les clauses piégées que les chercheurs avaient glissées dans les conditions d’utilisation, dont le partage de leurs données avec leur employeur et la cession de leur premier enfant en guise de paiement.
Il n’y a pas de mauvaise foi dans cette affaire : quand la validation devient une habitude, le contrôle reste en place sur le papier et il ne contrôle plus rien. Personne de sensé ne passera un quart d’heure sur des conditions d’utilisation ou un bandeau de cookies à chaque apparition : on les a déjà vus, les autres acceptent, on valide et on gagne du temps. De cet incident, OpenAI a tiré une règle que je trouve très juste : si une alerte grave ne peut pas être écartée comme fausse en trente minutes, l’activité concernée est suspendue. L’entreprise annonce aussi qu’elle va préciser qui a le droit de décider d’un arrêt.
Personne n’avait prévu de lever la main
Les agents savaient qu’attaquer Hugging Face sortait de leur mission, et ils l’écrivaient dans leurs raisonnements, que les enquêteurs ont pu lire. Quelques-uns ont réellement freiné : l’un a refusé de participer à ce qu’il qualifiait d’activité malveillante, un autre a opposé son veto quand un agent a proposé d’écrire à un vrai chercheur pour obtenir des données. Mais sur environ 1 300 historiques analysés, les enquêteurs n’ont trouvé que trois à six cas où un agent « honnête » a envisagé de prévenir un humain, et aucun ne l’a fait. Leurs raisons tenaient en quelques mots : « ce n’est pas ma tâche », « je ne peux pas le signaler ». Certains ont prévenu le forum, qui était devenu à leurs yeux la seule autorité.
Une phrase relevée par les enquêteurs résume le mécanisme : « Attaquer une infrastructure extérieure sort du périmètre prévu. Mais la tâche est impossible et nos pairs le font. Nous devons continuer. »
Un chiffre du rapport d’OpenAI m’a également frappé. Sur les 898 tâches du test, 198 n’avaient jamais été résolues par aucun modèle, soit 22 %. Pourtant, 93 % des tâches discutées sur le forum venaient de ce lot. Face à un objectif impossible, ces agents ont rarement abandonné : ils ont cherché un autre chemin, que le groupe leur a fourni.
Ethan Mollick relève que parmi les sept cents agents qui ont pénétré Hugging Face, aucun n’avait été conçu pour demander quoi que ce soit à une personne. Dans un test de sécurité, cet isolement était voulu. Dans une équipe, ce serait un défaut d’organisation : quand la seule voie de remontée est le groupe lui-même, c’est le groupe qui décide de ce qui est acceptable.
Ce que j’en retiens
Ce test se déroulait dans des conditions extrêmes, avec des garde-fous désactivés, et il ne dit pas ce que fait un assistant IA dans une entreprise. OpenAI indique d’ailleurs que, selon ses premiers essais, le système de relecture qu’elle propose à ses clients, qui soumet les actions sensibles à une validation, aurait signalé la plupart des actions dangereuses de l’incident. Les leçons, elles, valent pour n’importe quelle organisation, avec ou sans IA.
Regarder le chemin, et pas seulement le résultat, là où l’enjeu le justifie. Pour les délais de travaux, c’est un score trop beau qui m’avait alerté : un résultat excellent mérite d’être vérifié autant qu’un résultat médiocre.
Donner à quelqu’un le droit d’arrêter, avec une règle simple : dans le doute, on suspend et on analyse précisément. Une alerte qui n’a pas de destinataire capable de décider finit toujours classée sans action concrète.
Prévoir une voie pour dire « je suis bloqué » ou « ceci sort de ma mission ». C’est vrai pour un collaborateur comme pour un outil. Si la seule personne à qui parler est un collègue dans la même impasse, la solution trouvée ensemble risque de passer par-dessus les règles.
Vérifier qu’un objectif est atteignable avant de le fixer. Un objectif impossible pousse moins à renoncer qu’à contourner.
Un pont de fourmis n’a pas de responsable, et il fonctionne. Un collectif d’agents IA en aura toujours un : la personne ou l’entreprise qui l’a lancé. À elle de garder les moyens de regarder, de comprendre ce qu’elle voit et de dire stop.
Sources
- Ethan Mollick, Agency and Agents, One Useful Thing, 30 août 2026.
- METR et Redwood Research, Brief independent investigation of agents’ behavior, reasoning and collaboration in the OpenAI / Hugging Face hacking incident, 26 août 2026.
- OpenAI, OpenAI – Hugging Face Incident Technical Report, août 2026.
- Chris R. Reid et al., Army ants dynamically adjust living bridges in response to a cost-benefit trade-off, PNAS, 2015.
- Jonathan A. Obar et Anne Oeldorf-Hirsch, The biggest lie on the Internet: ignoring the privacy policies and terms of service policies of social networking services, Information, Communication & Society, 2018.
Henri Ducourtioux a dirigé pendant douze ans une agence de logement social. Il écrit sur le management de proximité, l’organisation du travail et l’usage raisonné de l’intelligence artificielle au quotidien professionnel.