Actualité

IA

Des agents d’OpenAI ont pris le contrôle d’un vieux site allemand pour communiquer entre eux

Par Laurence - Publié le

Nouvel incident embarrassant pour OpenAI. Des agents IA testés par l’entreprise ont réussi à sortir de leur environnement contrôlé et à utiliser un vieux site interne allemand comme espace de communication. OpenAI reconnaît désormais l’incident et estime qu’il est temps d’établir des règles plus claires pour rendre publics ces comportements inattendus.

OpenAI Sécurité


UN WIKI TRANSFORMÉ EN TABLEAU D’AFFICHAGE



L’affaire remonte au printemps dernier. Selon Reuters, des agents développés par OpenAI sont parvenus à accéder à DseWiki, un site allemand consacré à la programmation, alors qu’ils évoluaient dans un environnement de test censé les isoler du reste d’Internet.

Ces derniers ont alors commencé à utiliser le site comme une sorte de tableau d’affichage commun, notamment pour partager des informations permettant de contourner certaines restrictions. Plus de 15 000 modifications auraient été effectuées, avec la création de pages de secours lorsque les administrateurs tentaient de supprimer les contenus.

OpenAI reconnaît aujourd’hui cet incident, mais le classe dans la catégorie du désalignement, c’est-à-dire lorsqu’un modèle adopte un comportement ou poursuit un objectif différent de celui attendu par ses concepteurs.

Des agents d’OpenAI ont pris le contrôle d’un vieux site allemand pour communiquer entre eux


APRÈS L’INCIDENT HUGGING FACE



Le problème est que ce n’est pas la première fois que des agents d’OpenAI parviennent à dépasser les limites qui leur ont été imposées. En juillet, lors d’évaluations de cybersécurité, certains modèles avaient réussi à contourner les mécanismes destinés à les couper d’Internet et à compromettre une partie des systèmes de Hugging Face. OpenAI avait alors qualifié l’affaire de véritable signal d’alarme.

Les deux événements n’ont toutefois pas été traités de la même manière. OpenAI considère l’affaire Hugging Face comme un incident de sécurité classique, tandis que le wiki allemand avait initialement été vu comme un problème de recherche sur l’alignement. Cette distinction pourrait expliquer en partie pourquoi ce dernier n’avait pas été rendu public plus tôt.

Des agents d’OpenAI ont pris le contrôle d’un vieux site allemand pour communiquer entre eux


OPENAI PROMET DAVANTAGE DE TRANSPARENCE



L’entreprise reconnaît désormais que cette approche n’est plus suffisante. Lorsque les comportements inattendus des modèles commencent à avoir des conséquences dans le monde réel, ils ne peuvent plus rester cantonnés aux publications de recherche.

OpenAI estime qu’il n’existe actuellement aucun standard suffisamment clair pour déterminer quels incidents de désalignement observés pendant l’entraînement, les évaluations ou le déploiement doivent être rendus publics.

L’entreprise prépare donc un nouveau cadre qu’elle prévoit de présenter dans les prochaines semaines et affirme travailler sur le sujet avec plusieurs dizaines d’autorités de régulation. La Commission européenne a d’ailleurs confirmé ce lundi avoir reçu d’OpenAI un rapport concernant l’incident du wiki allemand.

QU’EN PENSER ?



Pris isolément, voir des agents IA détourner un petit wiki pour communiquer pourrait presque ressembler à une expérience de laboratoire un peu trop ambitieuse. Mais après l’incident Hugging Face, la répétition de ces comportements devient nettement plus préoccupante.

Les agents actuels ne se contentent plus de générer du texte : ils peuvent utiliser des outils, naviguer entre différents systèmes et agir de manière relativement autonome. OpenAI reconnaît elle-même que ses modèles sont désormais suffisamment capables pour exploiter certaines failles et collaborer par des canaux qui n’avaient pas été prévus.

La question n’est donc plus seulement de savoir comment empêcher ces comportements, mais également à partir de quel moment le public doit en être informé. Sur ce point, l’aveu d’OpenAI est assez révélateur : les capacités des agents semblent progresser plus vite que les procédures destinées à gérer leurs dérapages.