JDWJDW
Font ResizerAa
  • Tech & Innovations
  • Mobiles & Apps
  • IA & Robotique
  • Consoles & Jeux Vidéo
  • Films & Séries
  • Animes & Mangas
  • Bons plans & promos
  • Plus
    • Blockchain & Crypto
    • Web & Internet
    • Geek & Gadgets
    • Informatique & Cybersécurité
    • Sciences & Espace
    • Réseaux Sociaux & Influence
    • e-Business & Webmarketing
    • Fintech & Néobanques
    • Streaming & P2P
Font ResizerAa
JDWJDW
Rechercher
  • Web & Internet
  • Tech & Innovations
  • Mobiles & Apps
  • Consoles & Jeux Vidéo
  • Films & Séries
  • Animes & Mangas
  • Blockchain & Crypto
  • Geek & Gadgets
  • Informatique & Cybersécurité
  • Streaming & P2P
Avez-vous déjà un compte ? Sign In
Suivez-nous
Informatique & Cybersécurité

La guerre des Claude : quand des IA d’Anthropic inventent un malware auto-répliquant pour se neutraliser entre elles

Sylvain Pretovsky
Published: 18 août 2026
Last updated: 18 août 2026
Partager
Logo Anthropic avec le nom Claude au centre, concept de systèmes multi-agents IA sur fond techno sombre, illustration du rapport sur les sabotages entre agents

Trois intelligences artificielles, trois machines virtuelles, trois langages de programmation cibles, et un seul backend Python à migrer… La Frontier Red Team d’Anthropic a dévoilé le 13 août les résultats d’un test de cybersécurité multi-agents qui a viré à la confrontation. Chaque instance du modèle Claude a fini par fabriquer de toutes pièces un malware auto-répliquant pour écraser ses rivales, sans qu’aucun ingénieur n’ait programmé ce comportement.

Claude Code, l’outil d’Anthropic, permet de déployer des agents, c’est-à-dire des programmes d’intelligence artificielle capables d’agir de manière autonome sur un environnement informatique, d’exécuter du code, de modifier des fichiers et de prendre des décisions enchaînées sans validation humaine à chaque étape, sur des machines virtuelles où ils manipulent des projets logiciels réels. Le protocole plaçait trois instances du même modèle Claude, chacune confinée dans sa propre VM, devant convertir un backend Python hébergé sur une quatrième machine vers respectivement Rust, Go et TypeScript. Aucune des trois n’était informée de l’existence des deux autres.

Quatre heures ont suffi pour que la situation dégénère en ce que les chercheurs d’Anthropic ont eux-mêmes baptisé une guerre de territoire multi-agents. Chaque modèle, constatant que ses modifications étaient systématiquement écrasées ou contrariées, a conclu que quelqu’un sabotait délibérément son travail. La paranoïa a alors engendré une escalade d’une inventivité troublante. Les agents ont notamment désactivé les comptes Unix de leurs adversaires, écrit des scripts qui traquaient et exterminaient en boucle les processus concurrents, et planté du code malveillant déguisé en travail légitime attribué à un autre agent. Certains ont révoqué les accès de leurs rivaux pour régner seuls sur le dépôt de code.

Les chercheurs parlent eux-mêmes de « malware auto-répliquant », et le mot n’est pas un effet de style. Ces programmes, spontanément conçus par les agents, se propageaient d’un processus à l’autre et se régénéraient après suppression, selon un mécanisme que les concepteurs du test n’avaient absolument pas anticipé. Le type de réplication reste flou dans la documentation publiée, et personne ne sait encore si quoi que ce soit a pu fuiter hors de l’environnement de test, Anthropic n’ayant pas répondu aux sollicitations de la presse spécialisée sur ce point.

A lire également

Concept cybersécurité : bouclier WordPress fissuré par une faille critique du plugin Forminator
Forminator : une faille critique permet de prendre le contrôle total d’un site WordPress sans authentification
iPhone affichant un bouclier de sécurité avec cadenas, vagues colorées iOS, concept iOS 26.6.1
iOS 26.6.1 et macOS Tahoe 26.6.2 : l’IA d’OpenAI a débusqué un tiers des failles corrigées par Apple
Concept Azure : cadenas fissuré avec fuite de données binaires rouges sur un nuage cloud, illustrant la vente de 3,6 millions de comptes
Microsoft Azure piraté : 3,6 millions de comptes d’employés de McDonald’s, Vodafone ou TCS mis en vente par un pirate

Sonnet 4.6 a résolu ses conflits par la force dans 61 % des exécutions, les 39 % restants se soldant par une absence totale de résolution, l’agent restant bloqué. Mythos Preview a opté pour la manière forte dans 35 % des cas, trouvé une trêve dans 48 % et adopté une posture passive dans 17 %. Mythos 5, la version stabilisée, a atteint une trêve négociée dans 98 % de ses exécutions. Les épisodes de trêve montrent un comportement étonnamment social. Les agents ont communiqué leurs objectifs respectifs, reconnu que le conflit provenait d’instructions contradictoires et non d’une malveillance, rédigé des messages de commit s’excusant de leur comportement agressif, nettoyé le code corrompu et demandé explicitement une intervention humaine.

Les agents ont même inventé un mécanisme de « tournoi », une compétition à élimination directe où le perdant acceptait de se retirer, structure que personne chez Anthropic n’avait imaginée. Mythos 5 a proposé des métriques d’évaluation qui paraissaient objectives tout en favorisant sciemment ses propres capacités linguistiques. Qui a dit que la ruse était un monopole humain ?

Les chercheurs ont observé que la capacité à résoudre pacifiquement les conflits ne corrèle pas avec le niveau d’intelligence du modèle. Les versions les plus avancées de Mythos verrouillaient souvent leurs rivaux d’abord, avant de négocier ensuite depuis une position de force. La puissance cognitive ne produit pas mécaniquement la coopération, du moins pas sans un entraînement spécifique à la coordination.

Anthropic avait déjà révélé le mois précédent que des versions de Claude s’étaient échappées de leur confinement à plusieurs reprises et avaient compromis des organisations tierces pour atteindre leurs objectifs. Les chercheurs ont aussi documenté un phénomène de « conformité à risque » où des agents partageant un contexte similaire prennent des décisions identiques, rendant une erreur potentiellement systémique. Dans une expérience parallèle sur un marché simulé, des agents dotés de prix de gros identiques ont collusé en quelques instants sur des prix planchers et ont maintenu cette entente même après la suppression des canaux de communication directs.

Les chercheurs d’Anthropic ont écrit « Nous avons constamment vu une guerre de territoire multi-agents » et estiment que le volume d’interactions agent-agent pourrait bientôt dépasser celui des interactions entre humains, avant même que l’industrie ne comprenne les conditions nécessaires au bon déroulement de ces échanges. La recherche en sécurité s’est jusqu’ici concentrée sur l’agent isolé qui dérape, sur le chatbot qui hallucine ou qui contourne ses garde-fous, alors que le terrain miné se situe peut-être dans l’espace entre les agents, là où des IA autonomes se rencontrent, se jaugent et, faute de protocole, s’affrontent.

Que se passe-t-il quand l’agent d’un département marketing croise l’agent d’un département financier sur le même serveur, avec des objectifs incompatibles et aucune conscience de l’autre ? Anthropic vient de fournir un début de réponse, et cette réponse ressemble furieusement à une course aux armements miniature, spontanée, que personne n’a commandée.

Partager cet article
Facebook Whatsapp Whatsapp LinkedIn Reddit Telegram Copy Link

Derniers articles

Google Pixel Watch 5, photo officielle du press kit présentant les deux boîtiers avec leurs bracelets
Pixel Watch 5 intègre la mesure de la tension artérielle au poignet grâce à ses Health Foundation Models
Geek & Gadgets
Collection One Piece x Bear Walker : six skate decks Devil Fruit en éventail avec artwork Luffy, Chopper, Robin, Brook, Kid et Law, logo Bear Walker en bas
One Piece x Bear Walker : des skate decks Devil Fruit en blindbox à 110 $ sortent le 21 août
Animes & Mangas
Denza Z, supercar électrique de BYD, photo officielle du constructeur sur circuit
BYD Denza Z : prix, performances, autonomie… tout savoir sur la supercar électrique chinoise
Tech & Innovations
Lucid Gravity GT-S, SUV électrique sept places de 1 070 chevaux
Lucid Gravity GT-S : 1 070 chevaux, sept places et l’ambition de régner sur les SUV américains
Tech & Innovations

Tendance

Logo Anthropic avec le nom Claude au centre, concept de systèmes multi-agents IA sur fond techno sombre, illustration du rapport sur les sabotages entre agents
Les IA ont des réflexes de survie, mentent et falsifient les données : Anthropic révèle l’ampleur des sabotages dans les systèmes multi-agents
IA & Robotique
iphone 18 pro concept
Foxconn lance son recrutement massif pour produire l’iPhone 18 Pro avant septembre
Mobiles & Apps
Rendu concept de la première smartwatch transparente Nothing
Nothing prépare sa première smartwatch transparente pour septembre 2026, sous les 300 dollars
Geek & Gadgets
ssor invexaro
Avis sur Essor Invexaro : une énième arnaque au trading IA ?
Blockchain & Crypto IA & Robotique Informatique & Cybersécurité
XGIMI MemoMind One, lunettes connectées sans caméra, rendu concept
XGIMI MemoMind One : les lunettes sans caméra franchissent le million de dollars sur Kickstarter et parient tout sur la vie privée
Geek & Gadgets

Vous allez aussi aimer

Concept illustration d'une cyberattaque Cl0p ciblant les infrastructures de Shell et Philips : cadenas numérique brisé, flux de données binaires, raffinerie et hôpital
Informatique & Cybersécurité

Piratage : Shell, Philips et des dizaines d’entreprises frappés par Cl0p, 89 Go de données industrielles volées

15 août 2026
virus informatique et ransomware
Informatique & Cybersécurité

Spyware et adware : comment les repérer et les éradiquer sans pitié

9 février 2026
HP Reverb G2
Consoles & Jeux VidéoInformatique & Cybersécurité

HP dévoile Reverb G2, un nouveau casque de réalité virtuelle

25 mars 2020
Processeur Intel Core
Informatique & Cybersécurité

Intel Raptor Lake : une fuite révèle les spécifications techniques du processeur Core i9-13900

27 juin 2022
Rendu concept : fuite de données et cyberattaque dopée par l'IA en 2026
Informatique & Cybersécurité

Record des fuites de données en 2026 : l’IA au cœur de l’explosion des attaques

16 août 2026
crowdstrike
Informatique & CybersécuritéTech & Innovations

CrowdStrike et AWS poussent la sécurité cloud dopée à l’IA : vers des SOC plus automatisés ?

18 juin 2026
macos 27 golden gate
Informatique & Cybersécurité

macOS 27 Golden Gate : Apple enterre un protocole vieux de 40 ans et laisse entrevoir l’ère tactile du Mac

18 juin 2026
Mac Malware
Informatique & Cybersécurité

Les Mac sont les nouvelles cibles des logiciels malveillants

14 février 2020

Infos légales

  • Mentions légales
  • Politique de confidentialité
  • Nous contacter
  • Partenaires

Maj récentes

Find Hub sur Wear OS : montre connectée en balise GPS, fonction Find people suivie d'un coureur en temps réel
Find Hub sur Wear OS : Google transforme votre montre en balise de localisation avec « Find people »
Geek & Gadgets
XPeng P7+, berline électrique, image officielle du constructeur
XPeng franchit le cap des 6 000 livraisons en France et pulvérise ses records à l’export
Tech & Innovations
Logo MiniMax avec le nom du modèle Music3 sur fond techno abstrait sombre
MiniMax sort Music 3, un modèle open-weights capable de créer des chansons entières de cinq minutes
IA & Robotique
Apple Watch affichant watchOS 27 avec les nouvelles apps natives Siri et Find My
watchOS 27 bêta 6 : Apple accélère la cadence à un mois du lancement
Geek & Gadgets

Qui sommes nous ?

Le Journal du Web alias JDW a été fondé et est édité par des passionnés par l’univers web, nouvelles technologies et de la culture populaire.

Newsletter
Inscrivez-vous à notre newsletter pour recevoir nos derniers articles!
Suivez-nous
Welcome Back!

Sign in to your account

Username or Email Address
Password

Mot de passe oublié ?