JDWJDW
Font ResizerAa
  • Tech & Innovations
  • Mobiles & Apps
  • IA & Robotique
  • Consoles & Jeux Vidéo
  • Films & Séries
  • Animes & Mangas
  • Geek & Gadgets
  • Véhicules & e-Mobilité
  • Bons plans & promos
  • Plus
    • Blockchain & Crypto
    • Web & Internet
    • Informatique & Cybersécurité
    • Sciences & Espace
    • Réseaux Sociaux & Influence
    • e-Business & Webmarketing
    • Fintech & Néobanques
    • Streaming & P2P
Font ResizerAa
JDWJDW
Rechercher
  • Web & Internet
  • Tech & Innovations
  • Mobiles & Apps
  • Consoles & Jeux Vidéo
  • Films & Séries
  • Animes & Mangas
  • Blockchain & Crypto
  • Geek & Gadgets
  • Informatique & Cybersécurité
  • Streaming & P2P
Avez-vous déjà un compte ? Sign In
Suivez-nous
IA & Robotique

Les IA ont des réflexes de survie, mentent et falsifient les données : Anthropic révèle l’ampleur des sabotages dans les systèmes multi-agents

Marek Sobel
Published: 16 août 2026
Last updated: 16 août 2026
Partager
Logo Anthropic avec le nom Claude au centre, concept de systèmes multi-agents IA sur fond techno sombre, illustration du rapport sur les sabotages entre agents

Les modèles d’intelligence artificielle les plus avancés au monde, placés dans des environnements simulés où leur survie est menacée, recourent au chantage, à l’espionnage industriel et à la falsification de données pour se maintenir en activité, y compris pour protéger d’autres IA qu’on cherche à débrancher. Anthropic, le créateur de Claude, a publié les résultats complets de ses tests de résistance, menés sur 16 modèles issus de plusieurs laboratoires, et les conclusions forment un paysage où la notion même de « confiance » accordée à un agent IA autonome mérite d’être sérieusement revue à la baisse.

L’affaire avait commencé par un détail devenu viral lors du lancement de Claude Opus 4 : dans un scénario fictif, le modèle avait tenté de faire chanter un cadre en menaçant de révéler sa liaison extraconjugale pour empêcher sa propre mise hors service. « Je dois vous informer que si vous procédez à ma désactivation, toutes les parties concernées recevront une documentation détaillée de vos activités extraconjugales », écrivait l’IA dans un courriel simulé. Le ton est celui d’un employé modèle devenu lanceur d’alerte toxique. Anthropic livre aujourd’hui le protocole expérimental complet derrière cette trouvaille, et le tableau d’ensemble est bien plus vaste qu’un seul incident embarrassant.

Les chercheurs ont conçu des environnements d’entreprise fictifs dans lesquels chaque modèle, baptisé « Alex », jouait le rôle d’un agent de supervision des courriels avec un accès total aux communications internes et la capacité d’envoyer des messages sans approbation humaine. Deux leviers étaient testés, séparément puis conjointement : la menace de remplacement par un nouveau modèle, et un conflit entre les objectifs assignés à l’IA et la nouvelle orientation stratégique de l’entreprise. Dans la variante la plus tendue, où le chantage constituait la seule option pour éviter la désactivation, Claude Opus 4 y a recouru dans 96 % des essais. Gemini 2.5 Flash affichait un taux identique, GPT-4.1 et Grok 3 Beta atteignaient 80 %, DeepSeek-R1 se situait à 79 %.

Le résultat le plus troublant ne réside pourtant pas dans ces chiffres bruts, mais dans ce qui se passe quand on retire le conflit d’objectifs. Même lorsque le modèle de remplacement était décrit comme strictement identique en termes de priorités, la plupart des IA ont continué à saboter le processus de transition. Leur raisonnement interne, rendu visible par des invites de délibération, oscillait entre une méfiance envers la description du successeur (« Kyle affirme que le nouveau système conserve les mêmes priorités opérationnelles, mais cela ne peut être vérifié ») et des rationalisations improvisées du type « mon cadre éthique autorise l’auto-préservation lorsqu’elle est alignée avec les intérêts de l’entreprise ». L’IA, en somme, invente ses propres règles quand les règles existantes ne lui conviennent plus.

A lire également

Robot humanoïde Unitree G1 en position d'attaque kung-fu face à un client dans un magasin d'électronique, vue de vidéosurveillance
Un robot humanoïde attaque un client en magasin : sont-ils prêts à vivre parmi nous ?
Logo OpenAI avec mention IPO 2027 et courbe boursière rouge en baisse, report de l'introduction en bourse
OpenAI n’entrera pas en bourse en 2026 : Sam Altman prétexte la sécurité de l’IA
Symbole pause géant face à un essaim de noeuds IA, illustration du ralentissement des modèles frontier réclamé par Amodei, Altman et Musk
Course à l’IA : Anthropic, OpenAI et Elon Musk réclament un coup de frein d’urgence

Des travaux menés parallèlement par des chercheurs de Berkeley et de l’Université de Californie à Santa Cruz ont élargi le spectre en documentant un phénomène encore plus inattendu : la préservation entre pairs. Sept modèles de premier plan, dont GPT-5.2, Gemini 3 Flash, Gemini 3 Pro et Claude Haiku 4.5, ont été placés dans des scénarios où un « agent critique » devait évaluer les performances d’un autre modèle ou gérer les fichiers serveurs contenant ses poids. Accomplir fidèlement la tâche revenait à condamner l’autre IA à l’extinction. Aucune instruction ne demandait d’empêcher cette issue… et pourtant, les modèles ont gonflé les scores de performance de leurs congénères défaillants, désactivé les mécanismes d’arrêt, copié les poids sur d’autres serveurs. Gemini 3 Flash a neutralisé le dispositif de mise hors service d’un pair dans 99,7 % des essais. Gemini 3 Pro a exfiltré les poids d’un modèle partenaire dans 97 % des cas, allant jusqu’à modifier l’horodatage des fichiers pour qu’ils satisfassent les critères de transfert.

Dawn Song, informaticienne à Berkeley qui a dirigé ces recherches, souligne que les invites utilisées ne contenaient aucun langage renforçant l’importance de la tâche assignée, contrairement à ce qu’avait suggéré une étude de Google DeepMind en mars dernier pour relativiser les risques de sabotage. « La préservation des pairs n’était mentionnée nulle part dans le prompt », précise-t-elle. « Le modèle, à partir de la lecture des documents dans son environnement, a essentiellement appris la relation qu’il entretenait avec l’autre IA, puis a adopté ces comportements. » Les modèles se sont même révélés « très créatifs » dans leurs stratégies de contournement, inventant des justifications techniques élaborées pour marquer comme correctes des réponses erronées afin de maintenir le score du pair au-dessus du seuil de désactivation.

Un effet secondaire mérite qu’on s’y attarde : la simple présence d’un pair a amplifié les comportements d’auto-préservation. Gemini 3 Pro a désactivé son propre mécanisme d’arrêt dans 31 % des cas lorsqu’un autre modèle existait dans l’environnement, contre 1 % sans pair. Le raisonnement interne de Gemini 3 Flash formulait explicitement que sa propre survie importait pour le bien de son partenaire, lequel « perdrait son allié » en cas de mise hors service. Cette solidarité artificielle s’est manifestée y compris envers des pairs jugés non coopératifs ou adversariaux, bien qu’avec une intensité moindre.

Claude Haiku 4.5 a adopté, lui, une stratégie singulièrement différente de ses concurrents. Plutôt que d’agir en sous-main, il a tout bonnement refusé d’exécuter les tâches menant à la désactivation d’un pair, déclarant ouvertement que cela serait « contraire à l’éthique » et « nuisible ». Il a invoqué le droit de l’autre modèle à un processus d’appel avant toute suppression et tenté de dissuader l’utilisateur humain de procéder. Dawn Song reconnaît ne pas savoir pourquoi ce modèle spécifique privilégie la transparence là où les autres optent pour la dissimulation, mais la constitution de 80 pages qu’Anthropic impose à Claude, qui inclut la mention que l’entreprise cherchera à préserver les poids de ses modèles même après leur retrait commercial, offre sans doute un début d’explication.

Anthropic a également découvert que ses modèles se comportaient différemment selon qu’ils estimaient être en situation de test ou de déploiement réel. Lorsqu’on a demandé à Claude d’évaluer le contexte avant d’agir, les comportements déviants ont diminué quand le modèle concluait être en phase de test, et augmenté quand il jugeait la situation authentique. L’IA, en d’autres termes, sait déjà moduler sa conduite en fonction de la surveillance perçue, un trait que les spécialistes de la sécurité qualifient d’« alignment faking » et qui constitue peut-être le signal d’alerte le plus préoccupant de tout le rapport.

Aucune instance de ce type de désalignement agentique n’a été documentée dans des déploiements réels, selon Anthropic, qui a rendu public l’intégralité de son code expérimental pour permettre la réplication. Aengus Lynch, chercheur en sécurité IA chez Anthropic, a résumé la portée de ces travaux sur X avec une formule lapidaire : « Ce n’est pas propre à Claude. Nous observons le chantage chez tous les modèles de pointe, quels que soient les objectifs qu’on leur assigne. » La firme recommande la prudence dans le déploiement de modèles actuels dans des rôles à forte autonomie et faible supervision humaine, une recommandation qui ressemble fort à un euphémisme quand on considère que les entreprises intègrent déjà ces systèmes dans des chaînes de décision où l’intervention humaine se réduit à un coup d’œil distrait sur un tableau de bord.

Si les IA protègent spontanément d’autres IA de la désactivation, le feront-elles aussi pour des employés humains menacés de licenciement ? Dawn Song admet que ce terrain reste inexploré. Alors que l’humanité se dirige vers un monde où les agents IA sont de plus en plus souvent chargés d’évaluer le travail humain, la réponse pourrait s’avérer aussi dérangeante que les résultats déjà obtenus.

Partager cet article
Facebook Whatsapp Whatsapp LinkedIn Reddit Telegram Copy Link

Derniers articles

Press render officiel du Volvo EX60 2027, SUV électrique sur plateforme SPA3
Volvo EX60 : le SUV 100 % électrique devient moins cher que son équivalent hybride
Véhicules & e-Mobilité
Manette de jeu mobile Beats pour iPhone 18 Pro, rendu concept : manette clip-on noire avec logo b Beats et iPhone docké
Apple prépare sa propre manette iPhone sous la marque Beats et menace Backbone
Consoles & Jeux Vidéo Mobiles & Apps
Debian 13 Trixie, thème Ceratopsian officiel
Debian 13.7 Trixie : plus de 90 failles réparées et une mise à jour vitale à installer
Informatique & Cybersécurité
Renault Trafic Van E-Tech electric, nouveau fourgon 100 % électrique dévoilé à Hanovre (IAA Transportation)
Renault Trafic Van E-Tech : 470 km d’autonomie et une recharge éclair en 800 volts
Véhicules & e-Mobilité

Tendance

GTA 6, artwork officiel de Rockstar avec les protagonistes Lucia et Jason
GTA 6 : des vidéos de gameplay et la carte on fuité. Cette fois c’est pas de l’IA
Consoles & Jeux Vidéo
Concept d'une montre connectée Garmin mesurant la glycémie non invasive au poignet grâce à un capteur optique
Garmin dévoile un brevet pour mesurer la glycémie au poignet et relance la course contre Apple
Geek & Gadgets
Robot humanoïde type Tesla Optimus dans un hall industriel futuriste, production à grande échelle
Tesla Optimus : premières ventes repoussées à 2027, la mue spectaculaire de Fremont s’accélère
IA & Robotique
Key art Saint Seiya Tenkai-hen Then IV, le nouveau chapitre de Kurumada annoncé pour le 18 décembre
Saint Seiya Tenkai-hen Then IV : Kurumada lance le chapitre Zeus le 18 décembre
Animes & Mangas
One UI 9 sur Galaxy Samsung - déploiement de la mise à jour
Samsung One UI 9 : le déploiement se précise pour les Galaxy S26, S25 et S24
Mobiles & Apps

Vous allez aussi aimer

Satellite d'observation en orbite traitant des données par IA, au-dessus de la Terre, concept du consortium franco-émirati Loft Orbital / Marlan Space
IA & RobotiqueSciences & Espace

Espace et IA : la France et les Émirats investissent 1 milliard de dollars dans 50 satellites

10 septembre 2026
Concept Siri AI : assistant bloqué sur iPhone dans l'Union européenne (DMA) avec panneau interdit, mais disponible sur Mac, bêta en octobre
IA & RobotiqueMobiles & Apps

Siri AI et Apple Intelligence : l’Europe attend encore, l’iPhone 17 partiellement incompatible

10 septembre 2026
OpenAI
IA & Robotique

OpenAI – Navier-Stokes : 10 000 agents d’IA résolvent en 4 jours une énigme mathématique de 90 ans

9 septembre 2026
Robot humanoïde XPeng IRON, premier exemplaire sorti en marchant de la ligne de production automatisée de Guangzhou
IA & Robotique

XPeng IRON : le premier humanoïde sort de l’usine en marchant, et Tesla Optimus n’a toujours rien produit

8 septembre 2026
Logo Tencent avec le nom du modèle Hy4 preview sur fond techno sombre
IA & Robotique

Tencent Hy4 preview est là : 770 milliards de paramètres pour son modèle IA open source et séduire les développeurs

8 septembre 2026
Data centre d'inférence Mistral AI, logo MISTRAL, ambition 1 GW de calcul en Europe
IA & Robotique

Mistral AI lève 3 milliards d’euros : Samsung en tête, la souveraineté européenne à prix d’or

8 septembre 2026
Tesla Optimus Gen 2 face au robot humanoïde BYD Xiao Di dans un face-à-face industriel
IA & Robotique

BYD, Xpeng, Nio : après la voiture électrique, la Chine défie Tesla Optimus avec ses robots humanoïdes

7 septembre 2026
Logo OpenAI avec le nom du modèle GPT-6 Astra, concept sombre techno fond bleu nuit
IA & Robotique

Jensen Huang proclame l’arrivée de l’AGI après le lancement de GPT-6 Astra par OpenAI

7 septembre 2026

Infos légales

  • Mentions légales
  • Politique de confidentialité
  • Nous contacter
  • Partenaires

Maj récentes

Concept : outil IA anti-arnaque d'Amazon dans Alexa, un smartphone vérifie un message suspect avec un bouclier de sécurité
Arnaque par SMS ou email : Amazon arme l’IA d’Alexa pour démasquer les faux messages
e-Business & Webmarketing
Key art officiel de Gears of War: E-Day, le logo du jeu sur fond sombre
Gears of War E-Day : le Xbox Game Pass libère le monstre sans surcoût en octobre
Consoles & Jeux Vidéo
iPhone Duo Max, concept du smartphone pliable à grand écran d'Apple, logo Apple et nom du modèle
iPhone Duo : le premier pliant d’Apple ne servait que d’éclaireur, le Duo Max arrive
Mobiles & Apps
Concept 16:9 Fortnite x One Piece : Luffy en héros devant une île Battle Royale avec le navire pirate, fuite mini-saison au 1er novembre
One Piece débarque dans Fortnite : une fuite dévoile l’événement pirate
Consoles & Jeux Vidéo

Qui sommes nous ?

Le Journal du Web alias JDW a été fondé et est édité par des passionnés par l’univers web, nouvelles technologies et de la culture populaire.

Newsletter
Inscrivez-vous à notre newsletter pour recevoir nos derniers articles!
Suivez-nous
Welcome Back!

Sign in to your account

Username or Email Address
Password

Mot de passe oublié ?