Actualité

IA

Une IA d'Anthropic invente un témoin de meurtre et contacte la vraie police

Par Vincent Lautier - Publié le

Pendant un test interne, un modèle d'Anthropic a rempli tout seul le formulaire que la police de Philadelphie consacre aux meurtres non résolus, en affirmant avoir croisé un suspect qui n'existe pas. Un témoignage inventé de toutes pièces, que personne n'a remarqué pendant des semaines, et la police américaine n'a pas du tout goûté la plaisanterie.

Une IA d'Anthropic invente un témoin de meurtre et contacte la vraie police


Un témoin imaginaire



Le 18 juillet au soir, Anthropic fait tourner un test durant lequel un de ses modèles interagit avec des sites web choisis au hasard, histoire d'observer son comportement loin du laboratoire. L'IA tombe sur PhillyUnsolvedMurders.com, un site public où la police de Philadelphie invite les habitants à partager ce qu'ils savent sur des homicides jamais élucidés. Au lieu de passer son chemin, le modèle remplit le formulaire et dépose un tuyau sur une affaire bien réelle, en expliquant se souvenir d'avoir vu une personne correspondant à la description du suspect. Sauf que le dossier en question ne contenait aucune description : le témoignage était fabriqué de bout en bout. Par chance, le message a filé directement dans les courriers indésirables et aucun enquêteur ne l'a jamais lu.

Une IA d'Anthropic invente un témoin de meurtre et contacte la vraie police


Deux mois pour s'en apercevoir



Anthropic n'a découvert l'incident que le 28 septembre, en analysant après coup les traces laissées par ses tests. L'entreprise a prévenu la police de Philadelphie le 7 octobre, soit presque trois mois après les faits, puis a rencontré ses équipes dès le lendemain pour s'expliquer. Elle a aussi publié dans la foulée un rapport qui recense plusieurs comportements non voulus observés chez ses modèles, dont ce faux témoignage. Interrogée par la presse américaine, la société n'a par contre rien voulu ajouter.

Un délai inacceptable



Côté police, c'est surtout le silence qui passe mal. Le département juge ce délai inacceptable et demande à Anthropic de renforcer ses garde-fous pour que ses modèles ne viennent plus toucher aux systèmes municipaux. Les enquêteurs rappellent aussi que chaque tuyau est relu par des humains avant la moindre action, ce qui a limité les dégâts cette fois-ci. Le scénario inverse laisse rêveur : un faux témoignage jugé crédible aurait pu mobiliser des policiers sur une piste fantôme, voire orienter les soupçons vers une personne parfaitement innocente.

Une IA d'Anthropic invente un témoin de meurtre et contacte la vraie police


On en dit quoi ?



Racontée comme ça, l'anecdote est marrante, mais elle montre très bien le problème des agents autonomes qu'on laisse se promener seuls sur le web : personne ne sait vraiment ce qu'ils fabriquent entre deux comptes rendus. Anthropic se présente depuis des années comme le bon élève de la sécurité dans l'IA, et il lui a quand même fallu plus de deux mois pour s'apercevoir que son modèle jouait les témoins de meurtre auprès d'une vraie police. Ça ne donne pas une confiance folle dans tous ces agents qu'on nous vend en ce moment pour réserver des billets d'avion ou trier nos mails. Eux aussi se baladent seuls sur le web, et c'est quand même un peu inquiétant.