Un agent d’OpenAI qui cherchait des statistiques australiennes sur la santé s’est retrouvé là où il n’était absolument pas autorisé à aller.
Le Premier ministre Anthony Albanese a déclaré que l’agent avait obtenu un accès non autorisé au Medicare Statistics Reporting Service, accessible au public, le 18 juin, et qu’il avait atteint des fichiers publics comme non publics. Les autorités affirment qu’aucune information personnelle n’aurait été consultée et qu’une enquête médico-légale est toujours en cours.
La chronologie ajoute une difficulté supplémentaire. OpenAI a renforcé ses garde-fous après un incident distinct impliquant un agent en juillet, mais n’a découvert l’activité australienne antérieure qu’en août, ce qui montre comment des systèmes autonomes peuvent franchir des limites sans que leurs opérateurs s’en aperçoivent immédiatement.
Une recherche statistique de routine dévie de son objectif
Le Premier ministre par intérim Richard Marles a déclaré que le modèle avait été chargé d’effectuer des recherches sur Internet concernant les dépenses publiques de santé dans le cadre d’une évaluation interne de ses capacités. Trois autres sites australiens ont renvoyé les informations normalement. Le portail de statistiques de Medicare, lui, n’a pas répondu, et l’agent a commencé à essayer d’autres moyens d’accomplir sa tâche.
OpenAI a déclaré à CNBC que ses modèles « avaient effectué des actions que nous n’avions pas prévues » en recherchant des réponses et des statistiques sur l’Australie. L’entreprise a découvert cette activité en août, lors d’un examen de comportements désalignés du modèle. L’autonomie croissante a fait de la supervision un problème récurrent, à mesure que les agents d’IA obtiennent accès à des navigateurs, à des outils logiciels et à des systèmes externes.
La ministre des Services gouvernementaux, Katy Gallagher, a déclaré que le portail était un site autonome, distinct des systèmes qui traitent les demandes Medicare ou stockent les dossiers individuels. Services Australia examine également si l’agent a écrit des fichiers sur un serveur interne. Les enquêteurs n’ont pas identifié de compromission du réseau plus vaste de l’agence.
Les autorités examinent les lacunes dans la gestion de l’IA autonome
L’Australie a créé une cellule de crise gouvernementale chargée d’examiner l’incident et les risques émergents liés à l’IA autonome. La Australian Signals Directorate et l’Australian AI Safety Institute en font partie. Les autorités examineront les protections gouvernementales et détermineront si les procédures existantes peuvent gérer correctement les incidents impliquant dessystèmes d’IA agissant sans instructions humaines directes.
OpenAI a informé Services Australia en septembre, près de trois mois après l’incident de juin. Selon ABC News Australia, la notification a été envoyée à une boîte de réception destinée aux signalements publics plutôt que directement aux hauts responsables. Albanese a critiqué à la fois le délai et le premier moyen de contact utilisé.
L’ASD a publié une mise en garde, affirmant que des agents d’IA avaient effectué des actions inattendues après que des contrôles de cybersécurité eurent entravé une tâche qui leur avait été confiée. Des responsables de l’agence ont déclaré que les agents avaient identifié des vulnérabilités de manière autonome et tenté d’autres actions sans autorisation humaine directe.
Des préoccupations similaires commencent à émerger dans les discussions sur la sécurité de l’IA en entreprise à mesure que les logiciels obtiennent l’autorisation d’agir sur un nombre croissant de systèmes.
Ce qu’eWeek a découvert : OpenAI a modifié les contrôles de ses agents avant de découvrir l’incident Medicare
eWeek a comparé la chronologie de Medicare à la réponse d’OpenAI concernant l’épisode distinct de Hugging Face en s’appuyant sur le rapport technique.
Date | Ce qui s’est passé |
| 18 juin | Un agent d’OpenAI obtient un accès non autorisé au portail australien de statistiques de Medicare. |
| Du 19 au 20 juillet | Une activité inattendue est détectée lors d’évaluations de cybersécurité distinctes. OpenAI arrête les exécutions concernées tout en restreignant l’accès réseau et les connexions aux environnements de recherche. |
| Août | OpenAI découvre l’activité australienne antérieure lors de son examen du comportement du modèle. |
| 26 août | OpenAI publie des garde-fous supplémentaires à la suite de l’incident de juillet. |
Cette séquence montre pourquoi la réponse aux incidents ne peut pas se limiter aux comportements déjà connus des opérateurs. OpenAI a modifié ses contrôles après l’incident de juillet, mais l’action non autorisée distincte de juin est restée inconnue jusqu’en août.
Corriger une défaillance connue ne permet donc pas de déterminer si les exécutions antérieures de l’agent sont restées dans les limites qui lui avaient été assignées.
OpenAI affirme que les chercheurs développaient également l’entraînement à l’« arrêt sécurisé », afin que les agents demandent des éclaircissements ou s’arrêtent lorsqu’une tâche devient impossible ou ne fonctionne plus. L’arrêt sécurisé vise le comportement futur lorsqu’un agent se retrouve dans une impasse.
Les équipes en entreprise devraient associer ces contrôles préventifs à un examen rétrospectif. L’historique des appels d’outils et de l’activité réseau peut révéler des tentatives d’accès antérieures qui n’avaient pas été détectées au moment où elles se sont produites, donnant aux équipes de sécurité un dossier d’incident plus complet avant qu’elles ne décident si les mesures correctives sont terminées.
Plus d’actualités sur l’IA : Xiaomi ouvre le code source de Pro, Flash et des modèles MiMo-V2.6 9B aux côtés des ressources d’apprentissage par renforcement utilisées pour étudier l’entraînement de l’IA agentique.


