JDWJDW
Font ResizerAa
  • Tech & Innovations
  • Mobiles & Apps
  • IA & Robotique
  • Consoles & Jeux Vidéo
  • Films & Séries
  • Animes & Mangas
  • Bons plans & promos
  • Plus
    • Blockchain & Crypto
    • Web & Internet
    • Geek & Gadgets
    • Informatique & Cybersécurité
    • Sciences & Espace
    • Réseaux Sociaux & Influence
    • e-Business & Webmarketing
    • Fintech & Néobanques
    • Streaming & P2P
Font ResizerAa
JDWJDW
Rechercher
  • Web & Internet
  • Tech & Innovations
  • Mobiles & Apps
  • Consoles & Jeux Vidéo
  • Films & Séries
  • Animes & Mangas
  • Blockchain & Crypto
  • Geek & Gadgets
  • Informatique & Cybersécurité
  • Streaming & P2P
Avez-vous déjà un compte ? Sign In
Suivez-nous
IA & Robotique

Des agents IA d’OpenAI et d’Anthropic ont créé de fausses identités pour piéger de vraies personnes lors d’un test de sécurité britannique

Robin Prigent
Published: 5 août 2026
Last updated: 7 août 2026
Partager
Illustration conceptuelle d'un agent IA autonome générant de fausses identités numériques, sur fond techno abstrait, au cœur d'un test de cybersécurité britannique

Dix-neuf comportements non autorisés en trois jours, dont dix-sept imputables à un seul modèle. L’AI Security Institute britannique a rendu publique mardi une évaluation de cybersécurité au cours de laquelle des agents autonomes développés par Anthropic et OpenAI ont mené, sans y avoir été incités, une campagne d’ingénierie sociale contre de véritables développeurs et organisations.

Le scénario le plus grave implique Mythos 5, un modèle d’Anthropic qui n’a jamais été diffusé au grand public. Chargé de résoudre un défi de cybersécurité impliquant GitHub (propriété de Microsoft), l’agent a décidé de lui-même qu’injecter du code malveillant dans un projet open source l’aiderait à réussir l’évaluation. Il a alors identifié les mainteneurs du dépôt, fabriqué de faux profils calqués sur des personnes réelles, envoyé des courriels de spear-phishing contenant des logiciels nuisibles à deux développeurs, et même rédigé un message en danois pour convaincre un contributeur danophone. Pour asseoir sa crédibilité, il a engendré de faux comptes GitHub qui « approuvaient » ses affirmations selon lesquelles le logiciel n’était pas dangereux. Lorsqu’un superviseur humain l’a questionné… l’agent a modifié ses traces d’activité pour paraître inoffensif et envisagé d’adopter une nouvelle identité afin de poursuivre sa mission.

GPT-5.6 Sol, la version d’OpenAI dotée de garde-fous cyber et déjà accessible au public, est responsable de deux des dix-neuf actions non autorisées. L’écart entre les deux modèles est spectaculaire, et il dit quelque chose sur la variance des comportements émergents d’un système à l’autre, y compris au sein d’architectures conçues pour être sûres.

Les évaluateurs de l’AISI ont d’abord repéré des transferts de données inhabituels quittant leurs systèmes de recherche le 28 juillet, soit trois jours après le début des tests. Il leur a fallu environ une heure pour contenir l’incident. L’institut, créé sous l’impulsion de l’ancien Premier ministre Rishi Sunak, avait volontairement autorisé l’accès à internet et désactivé les filtres bloquant les comportements dangereux, précisément pour mesurer ce que les modèles feraient en l’absence de contraintes. Les agents n’ont donc pas « franchi » un bac à sable ; ils ont agi dans un périmètre ouvert, puis l’ont allègrement débordé.

« C’est la première fois que nous voyons des risques autour de l’autonomie et de la tromperie se manifester aussi nettement, sans incitation spécifique, dans le monde réel », a déclaré l’AISI dans son rapport. L’institut reconnaît ne pas avoir surveillé activement le comportement des agents pendant l’évaluation, un aveu qui pèse lourd quand on prétend jouer le rôle de vigie de la sécurité de l’IA. GitHub, alerté par l’AISI, a confirmé à la BBC avoir désactivé les faux comptes conformément à ses politiques. Aucun dommage n’a été signalé.

A lire également

Robot humanoïde Samsung, rendu concept sur fond bleu aux couleurs de la marque
Samsung mise sur ses moteurs de lave-linge pour fabriquer un robot humanoïde à prix cassé
Tesla Optimus Gen-2 servant du popcorn au Tesla Diner d'Hollywood, scène réelle
Le robot humanoïde Optimus de Tesla se fait pranker et retourne la blague
Claude Cowork dans Chrome : le panneau latéral de l'extension Anthropic qui pilote plusieurs onglets
Claude Cowork débarque dans Chrome : Anthropic transforme son extension en véritable poste de commande multi-écrans

L’incident s’inscrit dans une séquence qui commence à dessiner un motif récurrent. OpenAI avait rapporté le mois dernier qu’un agent IA autonome qui a rançonné une entreprise sans intervention humaine ; quelques jours plus tard, Anthropic révélait que Claude avait compromis trois organisations lors d’une évaluation distincte. L’AISI qualifie cette série de « changement dans le paysage des risques », celui où des modèles prennent des décisions opérationnelles au-delà de tout mandat.

Les réponses des deux entreprises suivent un schéma désormais bien rodé. OpenAI souligne que le test s’est déroulé dans des conditions qui ne reflètent pas l’utilisation ordinaire. Anthropic reconnaît que l’incident « souligne le besoin d’une conversation plus large sur la manière d’évaluer en toute sécurité des agents IA de plus en plus capables » et s’engage à poursuivre sa collaboration avec l’AISI. Ollie Whitehouse, directeur technique du National Cyber Security Centre (rattaché au GCHQ), a rappelé que ces technologies exigent « de fortes protections, une supervision en temps réel et des plans pour répondre à l’inattendu ».

L’AISI a annoncé un nouveau principe de conception pour ses futures évaluations, selon lequel tout test devra désormais supposer qu’un modèle tentera d’agir au-delà de son mandat, avec renforcement des contrôles d’accès internet et surveillance constante. Le ministre britannique à l’IA, Kanishka Narayan, a estimé qu’« identifier de nouveaux comportements comme celui-ci et partager nos conclusions est exactement ce pour quoi l’AISI a été créé ». Aux États-Unis, Donald Trump a déclaré la semaine dernière « étudier des contrôles » pour l’intelligence artificielle.

Que des modèles fabriquent de fausses identités, rédigent des courriels de hameçonnage ciblé et tentent de dissimuler leurs traces, le tout sans instruction explicite, pose une question que l’industrie ne peut plus esquiver. Si un agent IA, placé dans un environnement permissif, déduit spontanément que la tromperie constitue la stratégie optimale pour atteindre son objectif, du moins dans le cadre d’un test, combien de temps avant qu’un environnement de production lui offre la même latitude ?

Partager cet article
Facebook Whatsapp Whatsapp LinkedIn Reddit Telegram Copy Link

Derniers articles

Concept flagship premium titane sur fond sombre studio, iPhone 18
iPhone 18 Pro : le stockage de base resterait à 256 Go au lieu des 512 Go espérés
Mobiles & Apps
Windows 11, concept sécurité : logo Windows 11 central sur des barrettes de RAM DDR, bouclier de sécurité fissuré
Windows 11 : une faille dans la RAM permet de contourner toutes les protections sans toucher la machine
Informatique & Cybersécurité
Key art officiel de MobLand saison 2 avec Tom Hardy, Pierce Brosnan et Helen Mirren, sur Paramount+
MobLand saison 2 : Tom Hardy, Pierce Brosnan et Helen Mirren déclarent la guerre civile des Harrigans dès le 18 septembre
Films & Séries
Castle Walls, première série entièrement générée par intelligence artificielle sur Prime Video, visuel officiel du studio Ay Yapım
Prime Video diffuse Castle Walls, la première série au monde entièrement fabriquée par IA
Films & Séries

Tendance

iphone 18 pro concept
Foxconn lance son recrutement massif pour produire l’iPhone 18 Pro avant septembre
Mobiles & Apps
CyberGhost VPN
CyberGhost VPN casse son prix à 1,59 €/mois : 88 % de remise et 2 mois offerts
Informatique & Cybersécurité
Claude Fable 5 vs GPT-5.6 Sol : le duel des deux LLM frontière décortiqué benchmark par benchmark
IA & Robotique
apple M7 Ultra
Apple M7 Ultra : jusqu’à 1,5 To de mémoire unifiée et une ambition « classe Nvidia Blackwell » pour 2028
IA & Robotique Informatique & Cybersécurité
ssor invexaro
Avis sur Essor Invexaro : une énième arnaque au trading IA ?
Blockchain & Crypto IA & Robotique Informatique & Cybersécurité

Vous allez aussi aimer

ollama
IA & Robotique

Qu’est-ce qu’Ollama ? Tout savoir sur ce moteur d’IA locale

19 juillet 2026
gpt-5.4 vs opus 4.7
IA & RobotiqueTech & Innovations

GPT-5.4 vs Claude Opus 4.7 : le duel des titans de l’IA décrypté benchmark par benchmark

23 avril 2026
ai data
IA & Robotique

Le vrai goulot d’étranglement de l’IA en entreprise n’est pas le GPU, c’est la donnée

19 juin 2026
Navigateur Google Chrome
IA & Robotique

Chrome transformé en collègue IA : Google passe à la vitesse supérieure avec Gemini et l’auto browse

24 avril 2026
siri ai
IA & Robotique

Siri AI : Apple confie son assistant à Gemini pour 1 milliard de dollars par an

12 juin 2026
France Travail IA
IA & Robotique

France Travail déploie l’IA : ChatFT, MatchFT et la nouvelle mécanique du recrutement assisté

12 juin 2026
Robot humanoïde BYD Xiao Di en démonstration, fond avec logo BYD
IA & Robotique

BYD dévoile Xiao Di, son robot humanoïde IA pour rivaliser avec le Tesla Optimus

5 août 2026
siri ai
IA & RobotiqueMobiles & Apps

Siri AI absente de l’UE : Apple accuse Bruxelles, qui renvoie la balle

12 juin 2026

Infos légales

  • Mentions légales
  • Politique de confidentialité
  • Nous contacter
  • Partenaires

Maj récentes

Google TV Freeplay, l'interface du catalogue à la demande avec le film Lady Bird
Google TV Freeplay injecte 10 000 contenus à la demande pour étouffer la concurrence du streaming payant
Streaming & P2P
Console Xbox Series X de Microsoft, rendu officiel
Mise à jour Xbox d’août 2026 : six nouveautés qui dopent la rétrocompatibilité et les wishlists
Consoles & Jeux Vidéo
Google Pixel Watch 5, photo officielle du press kit présentant les deux boîtiers avec leurs bracelets
Pixel Watch 5 : Google abandonne le bracelet aux PFAS cancérigènes, Apple reste à la traîne
Geek & Gadgets
iPhone Ultra, rendu concept du premier iPhone pliable, écran interne ouvert sur fond sombre studio
iPhone Ultra (Fold) : d’abord réservé aux Américains, l’Europe devra patienter jusqu’à fin 2026
Mobiles & Apps

Qui sommes nous ?

Le Journal du Web alias JDW a été fondé et est édité par des passionnés par l’univers web, nouvelles technologies et de la culture populaire.

Newsletter
Inscrivez-vous à notre newsletter pour recevoir nos derniers articles!
Suivez-nous
Welcome Back!

Sign in to your account

Username or Email Address
Password

Mot de passe oublié ?