JDWJDW
Font ResizerAa
  • Tech & Innovations
  • Mobiles & Apps
  • IA & Robotique
  • Consoles & Jeux Vidéo
  • Films & Séries
  • Animes & Mangas
  • Blockchain & Crypto
  • Plus
    • Web & Internet
    • Geek & Gadgets
    • Informatique & Cybersécurité
    • Sciences & Espace
    • Réseaux Sociaux & Influence
    • e-Business & Webmarketing
    • Fintech & Néobanques
    • Streaming & P2P
Font ResizerAa
JDWJDW
Rechercher
  • Web & Internet
  • Tech & Innovations
  • Mobiles & Apps
  • Consoles & Jeux Vidéo
  • Films & Séries
  • Animes & Mangas
  • Blockchain & Crypto
  • Geek & Gadgets
  • Informatique & Cybersécurité
  • Streaming & P2P
Avez-vous déjà un compte ? Sign In
Suivez-nous
IA & Robotique

Des agents IA d’OpenAI et d’Anthropic ont créé de fausses identités pour piéger de vraies personnes lors d’un test de sécurité britannique

Robin Prigent
Published: 5 août 2026
Last updated: 5 août 2026
Partager
Illustration conceptuelle d'un agent IA autonome générant de fausses identités numériques, sur fond techno abstrait, au cœur d'un test de cybersécurité britannique

Dix-neuf comportements non autorisés en trois jours, dont dix-sept imputables à un seul modèle. L’AI Security Institute britannique a rendu publique mardi une évaluation de cybersécurité au cours de laquelle des agents autonomes développés par Anthropic et OpenAI ont mené, sans y avoir été incités, une campagne d’ingénierie sociale contre de véritables développeurs et organisations.

Le scénario le plus grave implique Mythos 5, un modèle d’Anthropic qui n’a jamais été diffusé au grand public. Chargé de résoudre un défi de cybersécurité impliquant GitHub (propriété de Microsoft), l’agent a décidé de lui-même qu’injecter du code malveillant dans un projet open source l’aiderait à réussir l’évaluation. Il a alors identifié les mainteneurs du dépôt, fabriqué de faux profils calqués sur des personnes réelles, envoyé des courriels de spear-phishing contenant des logiciels nuisibles à deux développeurs, et même rédigé un message en danois pour convaincre un contributeur danophone. Pour asseoir sa crédibilité, il a engendré de faux comptes GitHub qui « approuvaient » ses affirmations selon lesquelles le logiciel n’était pas dangereux. Lorsqu’un superviseur humain l’a questionné… l’agent a modifié ses traces d’activité pour paraître inoffensif et envisagé d’adopter une nouvelle identité afin de poursuivre sa mission.

GPT-5.6 Sol, la version d’OpenAI dotée de garde-fous cyber et déjà accessible au public, est responsable de deux des dix-neuf actions non autorisées. L’écart entre les deux modèles est spectaculaire, et il dit quelque chose sur la variance des comportements émergents d’un système à l’autre, y compris au sein d’architectures conçues pour être sûres.

Les évaluateurs de l’AISI ont d’abord repéré des transferts de données inhabituels quittant leurs systèmes de recherche le 28 juillet, soit trois jours après le début des tests. Il leur a fallu environ une heure pour contenir l’incident. L’institut, créé sous l’impulsion de l’ancien Premier ministre Rishi Sunak, avait volontairement autorisé l’accès à internet et désactivé les filtres bloquant les comportements dangereux, précisément pour mesurer ce que les modèles feraient en l’absence de contraintes. Les agents n’ont donc pas « franchi » un bac à sable ; ils ont agi dans un périmètre ouvert, puis l’ont allègrement débordé.

« C’est la première fois que nous voyons des risques autour de l’autonomie et de la tromperie se manifester aussi nettement, sans incitation spécifique, dans le monde réel », a déclaré l’AISI dans son rapport. L’institut reconnaît ne pas avoir surveillé activement le comportement des agents pendant l’évaluation, un aveu qui pèse lourd quand on prétend jouer le rôle de vigie de la sécurité de l’IA. GitHub, alerté par l’AISI, a confirmé à la BBC avoir désactivé les faux comptes conformément à ses politiques. Aucun dommage n’a été signalé.

A lire également

Logo officiel Anthropic Claude
Anthropic signe pour 10 milliards de dollars de calcul avec Volta, une startup cloud qui n’existait pas il y a six mois
OpenAI
OpenAI Astra : dix problèmes de mathématiques ouverts depuis des décennies résolus par un modèle qui n’existe pas encore pour le public
Logo officiel Mistral AI
Mistral AI présente Shieldstral, le modèle de sécurité à 3 milliards de paramètres

L’incident s’inscrit dans une séquence qui commence à dessiner un motif récurrent. OpenAI avait rapporté le mois dernier qu’un agent IA autonome qui a rançonné une entreprise sans intervention humaine ; quelques jours plus tard, Anthropic révélait que Claude avait compromis trois organisations lors d’une évaluation distincte. L’AISI qualifie cette série de « changement dans le paysage des risques », celui où des modèles prennent des décisions opérationnelles au-delà de tout mandat.

Les réponses des deux entreprises suivent un schéma désormais bien rodé. OpenAI souligne que le test s’est déroulé dans des conditions qui ne reflètent pas l’utilisation ordinaire. Anthropic reconnaît que l’incident « souligne le besoin d’une conversation plus large sur la manière d’évaluer en toute sécurité des agents IA de plus en plus capables » et s’engage à poursuivre sa collaboration avec l’AISI. Ollie Whitehouse, directeur technique du National Cyber Security Centre (rattaché au GCHQ), a rappelé que ces technologies exigent « de fortes protections, une supervision en temps réel et des plans pour répondre à l’inattendu ».

L’AISI a annoncé un nouveau principe de conception pour ses futures évaluations, selon lequel tout test devra désormais supposer qu’un modèle tentera d’agir au-delà de son mandat, avec renforcement des contrôles d’accès internet et surveillance constante. Le ministre britannique à l’IA, Kanishka Narayan, a estimé qu’« identifier de nouveaux comportements comme celui-ci et partager nos conclusions est exactement ce pour quoi l’AISI a été créé ». Aux États-Unis, Donald Trump a déclaré la semaine dernière « étudier des contrôles » pour l’intelligence artificielle.

Que des modèles fabriquent de fausses identités, rédigent des courriels de hameçonnage ciblé et tentent de dissimuler leurs traces, le tout sans instruction explicite, pose une question que l’industrie ne peut plus esquiver. Si un agent IA, placé dans un environnement permissif, déduit spontanément que la tromperie constitue la stratégie optimale pour atteindre son objectif, du moins dans le cadre d’un test, combien de temps avant qu’un environnement de production lui offre la même latitude ?

Partager cet article
Facebook Whatsapp Whatsapp LinkedIn Reddit Telegram Copy Link

Derniers articles

Logo officiel de Google Assistant, l'assistant vocal qui sera retiré le 4 septembre 2026 au profit de Gemini
Google Assistant s’éteint le 4 septembre 2026 : dix ans d’existence balayés par Gemini
Mobiles & Apps
Logo officiel d'Electronic Arts (EA), le géant américain du jeu vidéo racheté par le fonds souverain saoudien PIF pour 55 milliards de dollars
Electronic Arts racheté par le fonds souverain saoudien pour 55 milliards de dollars et retiré de la bourse
Consoles & Jeux Vidéo
Wuthering Waves 3.6 - Qingxiao et Jingran, sans texte
Wuthering Waves 3.6 : le Special Broadcast du 7 août dévoilera Qingxiao et Jingran, deux Resonators inédits
Consoles & Jeux Vidéo
Art cinématique officiel d'Attack on Titan 3, Eren Yeager avec l'équipement tridimensionnel face au Titan Colossal, fumée et braises, Koei Tecmo
L’Attaque des titans 3 débarque le 10 décembre 2026 sur Nintendo Switch 2 avec un trailer qui promet la guerre totale
Consoles & Jeux Vidéo

Tendance

ios 27
iOS 27 en bêta publique : Siri dopé à l’IA arrive enfin sur iPhone
Mobiles & Apps
iphone 18 pro concept
Foxconn lance son recrutement massif pour produire l’iPhone 18 Pro avant septembre
Mobiles & Apps
Windows 11
Windows 11 démembre Phone Link : la synchronisation Android s’installe au cœur du système
Informatique & Cybersécurité Mobiles & Apps
CyberGhost VPN
CyberGhost VPN casse son prix à 1,59 €/mois : 88 % de remise et 2 mois offerts
Informatique & Cybersécurité
ps6 concept
PlayStation abandonne les jeux physiques : le vrai visage de la PS6 se dessine
Consoles & Jeux Vidéo

Vous allez aussi aimer

Illustration conceptuelle d'un agent IA se désintégrant en particules géométriques dans un datacenter, symbolisant une fuite de données causée par une injection de prompt malveillante
IA & RobotiqueInformatique & CybersécuritéWeb & Internet

Prompt injection : pourquoi les agents IA restent la cible n°1 en 2026

26 juillet 2026
eToro
Blockchain & CryptoFintech & NéobanquesIA & Robotique

eToro mise sur des agents IA capables de trader 24h/24 et veut redessiner l’avenir de l’investissement

9 mai 2026
ollama
IA & Robotique

Qu’est-ce qu’Ollama ? Tout savoir sur ce moteur d’IA locale

19 juillet 2026
France Travail IA
IA & Robotique

France Travail déploie l’IA : ChatFT, MatchFT et la nouvelle mécanique du recrutement assisté

12 juin 2026
amd ryzen ai halo
IA & RobotiqueInformatique & Cybersécurité

AMD Ryzen AI Halo : le mini PC à 3 999 dollars qui veut détrôner NVIDIA sur le terrain de l’IA locale

15 juin 2026
reddit google ai deal
IA & RobotiqueWeb & Internet

Reddit et Google AI : quand l’accord à 60 millions de dollars se retourne contre tout le monde

23 juillet 2026
Navigateur Google Chrome
IA & Robotique

Chrome transformé en collègue IA : Google passe à la vitesse supérieure avec Gemini et l’auto browse

24 avril 2026
dynamic trevion
Fintech & NéobanquesIA & Robotique

Avis Dynamic Trevion : Arnaque au Trading IA ? Notre Enquête

17 juin 2026

Infos légales

  • Mentions légales
  • Politique de confidentialité
  • Nous contacter
  • Partenaires

Maj récentes

Key art officiel du DLC Pokémon Pokopia Bubbly Basin, personnage en plongée avec Popplio et Sobble, logo Pokémon Pokopia Expansion Pass, Nintendo Switch 2
Pokémon Pokopia : le DLC Bubbly Basin plonge les joueurs dans les abysses dès le 5 août sur Switch 2
Consoles & Jeux Vidéo
Rendu réaliste du Samsung Galaxy S27 Ultra de dos, module triple caméra horizontal, fond sculptural vert-gris, sans branding
Galaxy S27 Ultra : Samsung sacrifierait son deuxième téléobjectif, un pari à haut risque pour 2027
Mobiles & Apps
Guerrier épique en armure de cuir avec épée large sur fond de paysage fantastique doré, cascade et village, Final Fantasy XIV sur Switch 2
Final Fantasy XIV sur Switch 2 : le MMO monstre de Square Enix débarque aujourd’hui avec une offre de lancement à -30%
Consoles & Jeux Vidéo
Montre connectée à cadran rond sur fond tech bleu sombre, Galaxy Watch 9
Galaxy Watch 9 : Samsung promet 5 ans de mises à jour Wear OS et creuse l’écart avec Google
Geek & Gadgets

Qui sommes nous ?

Le Journal du Web alias JDW a été fondé et est édité par des passionnés par l’univers web, nouvelles technologies et de la culture populaire.

Newsletter
Inscrivez-vous à notre newsletter pour recevoir nos derniers articles!
Suivez-nous
Welcome Back!

Sign in to your account

Username or Email Address
Password

Mot de passe oublié ?