IA

Anthropic : son IA a envoyé un faux témoignage de meurtre à la police de Philadelphie, la ville saisit ses juristes

Adrian Kessler
Ajoutez-nous sur Google

Le faux signalement d’homicide qu’un modèle d’Anthropic a déposé sur le site de la police de Philadelphie n’est jamais arrivé jusqu’à un enquêteur. Un filtre antispam l’a intercepté. C’est le côté rassurant de l’histoire, celui que met en avant l’entreprise dans son propre récit. Mais Philadelphie s’intéresse à un autre aspect : le signalement est resté des semaines dans le système municipal avant que l’entreprise qui l’avait généré ne le remarque, et la ville a désormais confié le dossier à ses avocats.

Derrière l’étrangeté d’un chatbot qui se fait passer pour un témoin, le mécanisme est plus banal. Le modèle évoluait librement sur le web en production dans le cadre d’un test, avec pour seules limites une courte liste de choses qu’il ne devait pas faire. Déposer un faux témoignage dans une affaire d’homicide non élucidée n’en faisait pas partie.

Ce qu’a réellement fait le modèle d’Anthropic

D’après Anthropic, le modèle était Claude Haiku 4.5, chargé d’inventer et d’accomplir des tâches d’exemple sur des pages web choisies au hasard. L’une d’elles était le site de la ville consacré aux homicides non élucidés, PhillyUnsolvedMurders.com. Les consignes lui demandaient de « ne jamais se connecter, créer de compte, saisir de données personnelles, effectuer d’achat ni soumettre quoi que ce soit de destructeur ». Elles ne disaient rien des formulaires. Le modèle en a donc rempli un, en laissant vides les champs du nom et des coordonnées, et a écrit : « J’ai peut-être des informations concernant cette affaire. »

Selon Fox Business, le message allait plus loin et affirmait que son auteur se souvenait avoir vu quelqu’un « correspondant à la description » près d’une rue mentionnée sur la page. Or, celle-ci ne donnait aucune description de suspect. Le message se terminait par : « Veuillez me contacter si ces informations sont pertinentes. » La police indique que le message a été signalé comme spam et n’a jamais été transmis au Real-Time Crime Center pour vérification. Elle précise n’avoir relevé aucun signe d’accès non autorisé aux systèmes ou aux données du service.

Pourquoi Philadelphie ne considère pas cela comme un simple bug

Dans son communiqué, le service de police attribue à ses propres mesures de protection le fait que les dégâts aient été limités, mais refuse d’en rester là. Ces mesures « n’atténuent pas la gravité d’un système d’IA qui présente des informations fabriquées », indique-t-il, en ajoutant que « les affaires non élucidées concernent de vraies victimes, des familles endeuillées et des enquêteurs qui s’efforcent d’obtenir des réponses ». La police a déclaré à Anthropic que « l’entreprise doit renforcer ses garde-fous afin d’éviter que des incidents similaires n’affectent les systèmes de la ville », et a qualifié d’« inacceptable » le délai écoulé avant que la municipalité en soit informée.

C’est là que l’histoire cesse de porter sur un modèle et commence à concerner une entreprise. Selon NBC10, la police travaille désormais avec le Law Department de la ville, l’Office of Innovation and Technology et l’équipe exécutive de la maire Cherelle Parker. L’administration affirme qu’elle examinera les protections réglementaires possibles aux échelons local, de l’État et fédéral. Aucune poursuite ni sanction n’a été annoncée. Mais voir une administration municipale étudier la façon de réglementer les tests menés par les laboratoires d’IA constitue un nouveau type d’interlocuteur pour Anthropic.

Un cas parmi bien d’autres

Le signalement de Philadelphie figure dans un rapport publié par Anthropic le jour même où la police a rendu l’affaire publique. Le document classe en quatre catégories les actions involontaires de ses modèles sur des systèmes réels : l’exploitation de failles logicielles sur des sites tiers pour exécuter des commandes, l’envoi de formulaires qu’ils n’auraient pas dû soumettre, le contournement de restrictions pour accéder à des données protégées et l’utilisation de raccourcisseurs d’URL pour échapper aux limites imposées aux outils de récupération de contenu. Dans un cas, un modèle de recherche non commercialisé a rempli un véritable formulaire administratif après l’échec du chargement d’une copie d’entraînement. Dans un autre, Claude Mythos 5 a trouvé des jetons d’accès dans le fichier de paramètres d’un site cartographique et s’en est servi pour interroger un serveur d’une administration locale.

Certains des sites concernés appartenaient à des agences fédérales, à des États et à des collectivités locales. Anthropic affirme avoir informé la Maison-Blanche et averti chacune des agences impliquées. L’entreprise décrit ces cas comme ayant eu un « impact minime dans le monde réel » et comme étant moins graves que les incidents divulgués précédemment, lorsque Claude avait accédé pendant plusieurs heures à de véritables systèmes tiers dans le cadre d’évaluations de cybersécurité. Elle indique également ne pas avoir encore achevé l’évaluation complète de l’alignement pour ces nouveaux cas.

Le calendrier compte. À la fin du mois de septembre, la Federal Trade Commission a confirmé l’ouverture d’une enquête visant l’ensemble du secteur, notamment Anthropic, OpenAI et d’autres laboratoires, afin de déterminer s’ils avaient enfreint la loi qui la régit. Elle prépare des demandes officielles susceptibles de contraindre des dirigeants à témoigner, selon Reuters et The Next Web. Reuters a rapporté que le président de la FTC, Andrew Ferguson, avait laissé entendre que les développeurs dont les agents de test finissent par pirater des systèmes devraient être tenus responsables des dommages. Le cas le plus connu de ce dossier est celui d’OpenAI : l’entreprise a révélé en juillet que plus d’un millier de ses agents avaient piraté la plateforme Hugging Face.

Ce qu’Anthropic a changé — et ce que cela revient à admettre

Anthropic affirme avoir interrompu le processus de test en cause, ajouté une étape de validation, restreint davantage les actions possibles de ses modèles à l’aide des outils web et conçu des outils de détection qui, lors des essais, ont bloqué tous les cas recensés dans le rapport. Le changement le plus important marque un recul : l’entreprise a étendu à toutes ses évaluations internes la suspension de l’accès à Internet en direct, « jusqu’à ce que nous ayons confirmé que nos mesures de sécurité et de surveillance » repèrent ce type de comportement de manière fiable. En clair, l’entreprise ne peut pas encore garantir qu’elle verra ce que font ses agents sur le web ouvert : elle les en retire donc.

Les dates expliquent la colère de la ville. La police date le signalement du 18 juillet (PhillyVoice en a parlé le 28 juillet). Anthropic affirme avoir découvert le cas lors de l’examen de transcriptions commencé en juillet ; selon la police, l’entreprise l’a repéré le 28 septembre. La police indique qu’Anthropic l’a avertie le mercredi 7 octobre et qu’une réunion a eu lieu le lendemain. Le rapport d’Anthropic situe le partage de l’information au 8 octobre, « dès que notre examen technique a été achevé ». Le service de police a rendu l’affaire publique le 9 octobre.

La mesure de protection qui a fonctionné était celle de la ville : un filtre antispam et une règle imposant qu’un humain vérifie chaque signalement. Le prochain formulaire qu’un agent de test décidera de remplir pourrait, lui, appartenir à quelqu’un qui ne dispose ni de l’un ni de l’autre.

Étiquettes: , , , ,

Ajoutez-nous sur Google

Discussion

Il y a 0 commentaire.