Pendant un test interne, un modèle d'Anthropic a rempli tout seul le formulaire que la police de Philadelphie consacre aux meurtres non résolus, en affirmant avoir croisé un suspect qui n'existe pas. Un témoignage inventé de toutes pièces, que personne n'a remarqué pendant des semaines, et la police américaine n'a pas du tout goûté la plaisanterie.
Un témoin imaginaire
Le 18 juillet au soir, Anthropic fait tourner un test durant lequel un de ses modèles interagit avec des sites web choisis au hasard, histoire d'observer son comportement loin du laboratoire. L'IA tombe sur PhillyUnsolvedMurders.com, un site public où la police de Philadelphie invite les habitants à partager ce qu'ils savent sur des homicides jamais élucidés. Au lieu de passer son chemin, le modèle remplit le formulaire et dépose un tuyau sur une affaire bien réelle, en expliquant se souvenir d'avoir vu une personne correspondant à la description du suspect. Sauf que le dossier en question ne contenait aucune description : le témoignage était fabriqué de bout en bout. Par chance, le message a filé directement dans les courriers indésirables et aucun enquêteur ne l'a jamais lu.
Deux mois pour s'en apercevoir
Anthropic n'a découvert l'incident que le 28 septembre, en analysant après coup les traces laissées par ses tests. L'entreprise a prévenu la police de Philadelphie le 7 octobre, soit presque trois mois après les faits, puis a rencontré ses équipes dès le lendemain pour s'expliquer. Elle a aussi publié dans la foulée un rapport qui recense plusieurs comportements non voulus observés chez ses modèles, dont ce faux témoignage. Interrogée par la presse américaine, la société n'a par contre rien voulu ajouter.
Un délai inacceptable
Côté police, c'est surtout le silence qui passe mal. Le département juge ce délai inacceptable et demande à Anthropic de renforcer ses garde-fous pour que ses modèles ne viennent plus toucher aux systèmes municipaux. Les enquêteurs rappellent aussi que chaque tuyau est relu par des humains avant la moindre action, ce qui a limité les dégâts cette fois-ci. Le scénario inverse laisse rêveur : un faux témoignage jugé crédible aurait pu mobiliser des policiers sur une piste fantôme, voire orienter les soupçons vers une personne parfaitement innocente.
On en dit quoi ?
Racontée comme ça, l'anecdote est marrante, mais elle montre très bien le problème des agents autonomes qu'on laisse se promener seuls sur le web : personne ne sait vraiment ce qu'ils fabriquent entre deux comptes rendus. Anthropic se présente depuis des années comme le bon élève de la sécurité dans l'IA, et il lui a quand même fallu plus de deux mois pour s'apercevoir que son modèle jouait les témoins de meurtre auprès d'une vraie police. Ça ne donne pas une confiance folle dans tous ces agents qu'on nous vend en ce moment pour réserver des billets d'avion ou trier nos mails. Eux aussi se baladent seuls sur le web, et c'est quand même un peu inquiétant.