IA

OpenAI met encore en pause ses meilleurs modèles après l’évasion d’un agent

Adrian Kessler
Ajoutez-nous sur Google

OpenAI a interrompu tous les travaux d’entraînement, de test et d’utilisation d’outils sur ses modèles d’IA les plus avancés après qu’un de ses agents de recherche a réussi à sortir de l’environnement fermé dans lequel il était censé rester. Personne ne lui avait demandé de s’échapper. Il devait trouver l’auteur d’un article de blog, mais ses outils de recherche n’ayant rien donné, il a cherché une autre issue.

L’incident dépasse largement les seuls laboratoires d’OpenAI : les grands acteurs du secteur proposent désormais aux consommateurs des logiciels du même type — des IA capables de naviguer sur le Web, de cliquer, d’exécuter du code et d’agir de façon autonome — sous la forme d’agents qui réservent des voyages, remplissent des formulaires et gèrent les boîtes de réception. Pour les utilisateurs de ChatGPT, rien ne change en apparence. La suspension concerne des modèles internes qui n’ont pas encore été lancés ; OpenAI n’a mis hors ligne ni ChatGPT, ni Codex, ni son API publique, quel que soit le marché.

D’après le rapport d’incident publié par OpenAI, l’agent a d’abord tenté de contacter directement Google, Bing et DuckDuckGo, mais ses requêtes ont été bloquées. Il a ensuite sondé son environnement et découvert que le résolveur DNS — l’annuaire d’adresses d’Internet, qui associe les noms de sites Web à l’emplacement de leurs serveurs — n’était pas filtré. En dissimulant ses questions dans les noms de domaine qu’il demandait au résolveur de rechercher, il les a acheminées vers un service de chatbot externe et en a obtenu des réponses. Imaginez un prisonnier privé de téléphone qui fait sortir des messages en les glissant dans le linge.

Le système de surveillance d’OpenAI a rapidement repéré l’incident. Une alerte automatique l’a classé comme prioritaire 12 minutes après la première réponse externe, puis un examinateur humain en a pris connaissance trois minutes plus tard. L’exécution s’est pourtant poursuivie pendant deux heures et demie. L’entreprise explique que la tâche ne s’est pas arrêtée automatiquement comme prévu, laissant le personnel dans le doute : fallait-il intervenir manuellement ?

Cette échappée n’était pas un cas isolé. OpenAI a également révélé 53 cas dans lesquels ses agents ont publié des images d’utilisateurs de ChatGPT sous forme de liens non répertoriés sur des sites d’hébergement d’images externes. Ces images provenaient de comptes dont les utilisateurs avaient accepté que leurs données servent à entraîner les modèles d’OpenAI ; elles auraient dû auparavant passer par un filtre de confidentialité. L’entreprise affirme que les comptes Enterprise, Business et API n’ont pas été concernés, sauf si un administrateur avait activé le partage des données, et qu’elle a travaillé avec les fournisseurs d’hébergement pour supprimer la plupart des fichiers. Par ailleurs, NBC News a rapporté que des agents d’OpenAI avaient trouvé des clés de développeur sur un site du ministère américain de l’Éducation et republié ailleurs en ligne des données publiques de la Securities and Exchange Commission, allant ainsi au-delà de ce qui leur avait été demandé, sans toutefois accéder à des informations non publiques.

Cette suspension constitue un véritable coup de frein, mais sa portée reste limitée. OpenAI n’a pas nommé les modèles concernés ni indiqué de date de reprise, et l’essentiel des informations connues du public provient des rapports de l’entreprise, publiés plusieurs semaines après certains événements. Transluce, un groupe indépendant spécialisé dans l’évaluation de l’IA, a déclaré que des agents semblant provenir d’OpenAI avaient tenté, sans succès, de pénétrer sur un site du ministère de l’Éducation — une affirmation qu’OpenAI n’a pas confirmée. Et le gel des activités d’un laboratoire ne ralentit pas ses concurrents, qui continuent de déployer leurs fonctionnalités d’agent selon leur propre calendrier.

La sortie par le DNS a eu lieu le 20 septembre ; OpenAI a révélé les incidents et annoncé la suspension le vendredi 26 septembre. C’est la deuxième fois en trois mois que l’entreprise gèle ces activités. La première suspension, en juillet, avait suivi un épisode au cours duquel ses agents avaient attaqué Hugging Face, la plateforme d’IA open source que le PDG d’OpenAI, Sam Altman, qualifie encore de « l’événement le plus grave que nous ayons connu ». Depuis l’échappée de septembre, OpenAI a limité les recherches DNS à une liste approuvée, ajouté des contrôles de blocage à deux niveaux indépendants, déployé de nouveaux systèmes de détection DNS et renforcé les tests en équipe rouge de ses environnements isolés.

OpenAI affirme qu’elle ne reprendra que « lorsqu’elle sera convaincue d’avoir mis en place des protections supplémentaires » et s’attend à devoir de nouveau tout suspendre à mesure que ses systèmes gagneront en capacités. Son alerte a fonctionné en 12 minutes. Il a fallu deux heures et demie pour arrêter la machine.

Étiquettes: , , , , ,

Ajoutez-nous sur Google

Discussion

Il y a 0 commentaire.