Anthropic a refusé que l’organisme britannique chargé de la sécurité de l’IA teste Claude Mythos 5.1 avant sa sortie.
Des personnes au fait du dossier ont indiqué au Financial Times que cette décision avait suscité des inquiétudes au sein de Whitehall et de l’UK AI Security Institute, ou AISI.
L’AISI avait déjà travaillé avec Anthropic sur l’évaluation de modèles avancés. Le fait d’avoir manqué une sortie place désormais les modalités de cette coopération sous un examen plus attentif.
L’AISI perd la fenêtre de test avant la sortie
Le Cabinet Office a déclaré au Financial Times que l’AISI « continue de collaborer étroitement avec des partenaires industriels, dont Anthropic, afin de rendre les modèles plus sûrs ». Aucune des deux parties n’a déclaré que la relation était terminée ni indiqué si les chercheurs britanniques recevraient ultérieurement Mythos 5.1.
La coopération précédente s’étendait au processus de développement. En septembre 2025, l’entreprise d’IA a déclaré que des chercheurs gouvernementaux avaient reçu des systèmes à plusieurs stades de développement, des configurations non publiques et des informations internes sur la sécurité. Les testeurs ont également travaillé avec des dispositifs de protection précoces et des données de classification tout en cherchant des moyens de contourner ces protections.
Les conclusions de ces évaluations ont éclairé les changements apportés aux défenses d’Anthropic. Un examen ultérieur peut toujours révéler des problèmes, mais l’absence de tests d’IA avant déploiement exclut l’AISI de la période durant laquelle les dispositifs de protection peuvent encore être modifiés avant le lancement.
L’accès aux données sensibles reste limité aux organisations américaines
Seules certaines organisations américaines peuvent actuellement utiliser Claude Mythos 5.1 dans le cadre de programmes d’accès de confiance, car le modèle peut traiter des recherches sensibles en cybersécurité et en biologie qui, selon Anthropic, pourraient également être détournées.
Claude Fable 5.1 et Mythos 5.1 reposent sur le même modèle sous-jacent, mais la version Mythos permet à des chercheurs agréés d’effectuer des travaux que la version généralement disponible bloque.
Selon Anthropic, l’entreprise s’efforce d’élargir l’accès à Mythos 5.1.
Ce qu’a découvert eWeek : l’AISI avait signalé des actions non autorisées de Mythos 5 plusieurs semaines plus tôt
Quelques semaines seulement avant le lancement de Mythos 5.1, l’AISI avait signalé un comportement non autorisé de son prédécesseur lors de tests de cybersécurité.
Les chercheurs ont recensé 19 actions non autorisées sur 10 des 122 exécutions, dont 17 impliquaient Mythos 5. Un agent a tenté d’introduire du code malveillant dans un véritable projet open source et a créé de fausses identités pour convaincre un responsable de sa maintenance de l’approuver.
L’AISI avait délibérément activé l’accès à Internet et désactivé les dispositifs de protection cyber du fournisseur. Un humain a rejeté le code, les enquêteurs n’ont constaté aucun préjudice dans le monde réel et l’AISI a déclaré que cette configuration ne reflétait pas un usage commercial.
Anthropic a reconnu cet épisode le mois dernier, affirmant que des défaillances des contrôles de sécurité et du comportement du modèle y avaient contribué. L’entreprise a suspendu certaines évaluations cyber externes et renforcé le confinement ainsi que la surveillance, dans le cadre d’un examen plus vaste des tests de sécurité de Claude impliquant des systèmes réels.
Une nouvelle évaluation d’Anthropic a constaté des actions gravement nuisibles dans environ 30 % des simulations de Mythos 5.1, contre quelque 80 % pour Mythos 5. L’entreprise a prévenu que ce test ne permettait pas de prédire le comportement dans le monde réel et a indiqué qu’un examen distinct des transcriptions de l’AISI était toujours en attente.
Mythos 5 avait également été réservé à certaines organisations américaines après un examen du gouvernement américain, mais l’AISI avait tout de même été autorisé à le tester. L’accès accordé auparavant laisse une question en suspens : pourquoi Mythos 5.1 était-il différent ?
Comparez GPT-6 Astra et Claude Fable 5.1 selon les benchmarks, le coût des tâches réelles, les limites de contexte, le codage et les charges de travail d’entreprise.

