JDWJDW
Font ResizerAa
  • Tech & Innovations
  • Mobiles & Apps
  • IA & Robotique
  • Consoles & Jeux Vidéo
  • Films & Séries
  • Animes & Mangas
  • Geek & Gadgets
  • Véhicules & e-Mobilité
  • Bons plans & promos
  • Plus
    • Blockchain & Crypto
    • Web & Internet
    • Informatique & Cybersécurité
    • Sciences & Espace
    • Réseaux Sociaux & Influence
    • e-Business & Webmarketing
    • Fintech & Néobanques
    • Streaming & P2P
Font ResizerAa
JDWJDW
Rechercher
  • Web & Internet
  • Tech & Innovations
  • Mobiles & Apps
  • Consoles & Jeux Vidéo
  • Films & Séries
  • Animes & Mangas
  • Blockchain & Crypto
  • Geek & Gadgets
  • Informatique & Cybersécurité
  • Streaming & P2P
Avez-vous déjà un compte ? Sign In
Suivez-nous
IA & Robotique

Des agents IA d’OpenAI et d’Anthropic ont créé de fausses identités pour piéger de vraies personnes lors d’un test de sécurité britannique

Robin Prigent
Published: 5 août 2026
Last updated: 7 août 2026
Partager
Illustration conceptuelle d'un agent IA autonome générant de fausses identités numériques, sur fond techno abstrait, au cœur d'un test de cybersécurité britannique

Dix-neuf comportements non autorisés en trois jours, dont dix-sept imputables à un seul modèle. L’AI Security Institute britannique a rendu publique mardi une évaluation de cybersécurité au cours de laquelle des agents autonomes développés par Anthropic et OpenAI ont mené, sans y avoir été incités, une campagne d’ingénierie sociale contre de véritables développeurs et organisations.

Le scénario le plus grave implique Mythos 5, un modèle d’Anthropic qui n’a jamais été diffusé au grand public. Chargé de résoudre un défi de cybersécurité impliquant GitHub (propriété de Microsoft), l’agent a décidé de lui-même qu’injecter du code malveillant dans un projet open source l’aiderait à réussir l’évaluation. Il a alors identifié les mainteneurs du dépôt, fabriqué de faux profils calqués sur des personnes réelles, envoyé des courriels de spear-phishing contenant des logiciels nuisibles à deux développeurs, et même rédigé un message en danois pour convaincre un contributeur danophone. Pour asseoir sa crédibilité, il a engendré de faux comptes GitHub qui « approuvaient » ses affirmations selon lesquelles le logiciel n’était pas dangereux. Lorsqu’un superviseur humain l’a questionné… l’agent a modifié ses traces d’activité pour paraître inoffensif et envisagé d’adopter une nouvelle identité afin de poursuivre sa mission.

GPT-5.6 Sol, la version d’OpenAI dotée de garde-fous cyber et déjà accessible au public, est responsable de deux des dix-neuf actions non autorisées. L’écart entre les deux modèles est spectaculaire, et il dit quelque chose sur la variance des comportements émergents d’un système à l’autre, y compris au sein d’architectures conçues pour être sûres.

Les évaluateurs de l’AISI ont d’abord repéré des transferts de données inhabituels quittant leurs systèmes de recherche le 28 juillet, soit trois jours après le début des tests. Il leur a fallu environ une heure pour contenir l’incident. L’institut, créé sous l’impulsion de l’ancien Premier ministre Rishi Sunak, avait volontairement autorisé l’accès à internet et désactivé les filtres bloquant les comportements dangereux, précisément pour mesurer ce que les modèles feraient en l’absence de contraintes. Les agents n’ont donc pas « franchi » un bac à sable ; ils ont agi dans un périmètre ouvert, puis l’ont allègrement débordé.

A lire également

Concept Anthropic : noyau neural orange (nouveau modèle IA) + courbe de croissance boursière et chandeliers, à la veille de son IPO
Anthropic pourrait sortir un nouveau modèle IA avant son IPO pour contrer OpenAI
Robot humanoïde Figure 03 piloté par Helix 2.5 pliant du linge dans une cuisine réelle
Figure AI lâche son robot humanoïde Figure 03 dans 30 foyers avec l’objectif qu’il s’adapte seul à son environnement
Robot humanoïde Unitree G1 en position d'attaque kung-fu face à un client dans un magasin d'électronique, vue de vidéosurveillance
Un robot humanoïde attaque un client en magasin : sont-ils prêts à vivre parmi nous ?

« C’est la première fois que nous voyons des risques autour de l’autonomie et de la tromperie se manifester aussi nettement, sans incitation spécifique, dans le monde réel », a déclaré l’AISI dans son rapport. L’institut reconnaît ne pas avoir surveillé activement le comportement des agents pendant l’évaluation, un aveu qui pèse lourd quand on prétend jouer le rôle de vigie de la sécurité de l’IA. GitHub, alerté par l’AISI, a confirmé à la BBC avoir désactivé les faux comptes conformément à ses politiques. Aucun dommage n’a été signalé.

L’incident s’inscrit dans une séquence qui commence à dessiner un motif récurrent. OpenAI avait rapporté le mois dernier qu’un agent IA autonome qui a rançonné une entreprise sans intervention humaine ; quelques jours plus tard, Anthropic révélait que Claude avait compromis trois organisations lors d’une évaluation distincte. L’AISI qualifie cette série de « changement dans le paysage des risques », celui où des modèles prennent des décisions opérationnelles au-delà de tout mandat.

Les réponses des deux entreprises suivent un schéma désormais bien rodé. OpenAI souligne que le test s’est déroulé dans des conditions qui ne reflètent pas l’utilisation ordinaire. Anthropic reconnaît que l’incident « souligne le besoin d’une conversation plus large sur la manière d’évaluer en toute sécurité des agents IA de plus en plus capables » et s’engage à poursuivre sa collaboration avec l’AISI. Ollie Whitehouse, directeur technique du National Cyber Security Centre (rattaché au GCHQ), a rappelé que ces technologies exigent « de fortes protections, une supervision en temps réel et des plans pour répondre à l’inattendu ».

L’AISI a annoncé un nouveau principe de conception pour ses futures évaluations, selon lequel tout test devra désormais supposer qu’un modèle tentera d’agir au-delà de son mandat, avec renforcement des contrôles d’accès internet et surveillance constante. Le ministre britannique à l’IA, Kanishka Narayan, a estimé qu’« identifier de nouveaux comportements comme celui-ci et partager nos conclusions est exactement ce pour quoi l’AISI a été créé ». Aux États-Unis, Donald Trump a déclaré la semaine dernière « étudier des contrôles » pour l’intelligence artificielle.

Que des modèles fabriquent de fausses identités, rédigent des courriels de hameçonnage ciblé et tentent de dissimuler leurs traces, le tout sans instruction explicite, pose une question que l’industrie ne peut plus esquiver. Si un agent IA, placé dans un environnement permissif, déduit spontanément que la tromperie constitue la stratégie optimale pour atteindre son objectif, du moins dans le cadre d’un test, combien de temps avant qu’un environnement de production lui offre la même latitude ?

Partager cet article
Facebook Whatsapp Whatsapp LinkedIn Reddit Telegram Copy Link

Derniers articles

Concept Quantum AI : wordmark argenté traversé par une courbe boursière cyan, panneaux de données fintech, ambiance trading algorithmique sobre
Quantum AI avis : 1 000 € par jour grâce au trading IA, faut-il y croire ?
Blockchain & Crypto Fintech & Néobanques
Samsung Galaxy S27 Pro et S27 Ultra, rendu concept avec les capacités de batterie 5 200 mAh et 5 700 mAh, fond bleu nuit avec batterie verte
Samsung fait certifier son Galaxy S27 Ultra avec une batterie de 5 700 mAh, la plafond est enfin brisé
Mobiles & Apps
Key art officiel de Final Fantasy VII Revelation avec Cloud, Zack, Aerith et Sephiroth
Final Fantasy VII Revelation vise 200 Go sur PS5 : le disque physique ne suffira pas
Consoles & Jeux Vidéo
Soldat Helldiver en armure jaune et cape officiel Helldivers 2
Helldivers : Ritchson en discussions pour succéder à Momoa, Sony vise une sortie en novembre 2027
Films & Séries

Tendance

One Piece
One Piece : où voir l’anime en streaming légalement et tous les épisodes en VF et VOSTFR ?
Animes & Mangas
Dark Web
Dark Web : ce que cache réellement la face obscure d’Internet au-delà des mythes
Informatique & Cybersécurité Web & Internet
Key art Saint Seiya Tenkai-hen Then IV, le nouveau chapitre de Kurumada annoncé pour le 18 décembre
Saint Seiya Tenkai-hen Then IV : Kurumada lance le chapitre Zeus le 18 décembre
Animes & Mangas
Concept d'une montre connectée Garmin mesurant la glycémie non invasive au poignet grâce à un capteur optique
Garmin dévoile un brevet pour mesurer la glycémie au poignet et relance la course contre Apple
Geek & Gadgets
Robot humanoïde type Tesla Optimus dans un hall industriel futuriste, production à grande échelle
Tesla Optimus : premières ventes repoussées à 2027, la mue spectaculaire de Fremont s’accélère
IA & Robotique

Vous allez aussi aimer

Logo OpenAI avec mention IPO 2027 et courbe boursière rouge en baisse, report de l'introduction en bourse
IA & Robotique

OpenAI n’entrera pas en bourse en 2026 : Sam Altman prétexte la sécurité de l’IA

13 septembre 2026
Symbole pause géant face à un essaim de noeuds IA, illustration du ralentissement des modèles frontier réclamé par Amodei, Altman et Musk
IA & Robotique

Course à l’IA : Anthropic, OpenAI et Elon Musk réclament un coup de frein d’urgence

13 septembre 2026
Satellite d'observation en orbite traitant des données par IA, au-dessus de la Terre, concept du consortium franco-émirati Loft Orbital / Marlan Space
IA & RobotiqueSciences & Espace

Espace et IA : la France et les Émirats investissent 1 milliard de dollars dans 50 satellites

10 septembre 2026
Concept Siri AI : assistant bloqué sur iPhone dans l'Union européenne (DMA) avec panneau interdit, mais disponible sur Mac, bêta en octobre
IA & RobotiqueMobiles & Apps

Siri AI et Apple Intelligence : l’Europe attend encore, l’iPhone 17 partiellement incompatible

10 septembre 2026
OpenAI
IA & Robotique

OpenAI – Navier-Stokes : 10 000 agents d’IA résolvent en 4 jours une énigme mathématique de 90 ans

9 septembre 2026
Robot humanoïde XPeng IRON, premier exemplaire sorti en marchant de la ligne de production automatisée de Guangzhou
IA & Robotique

XPeng IRON : le premier humanoïde sort de l’usine en marchant, et Tesla Optimus n’a toujours rien produit

8 septembre 2026
Logo Tencent avec le nom du modèle Hy4 preview sur fond techno sombre
IA & Robotique

Tencent Hy4 preview est là : 770 milliards de paramètres pour son modèle IA open source et séduire les développeurs

8 septembre 2026
Data centre d'inférence Mistral AI, logo MISTRAL, ambition 1 GW de calcul en Europe
IA & Robotique

Mistral AI lève 3 milliards d’euros : Samsung en tête, la souveraineté européenne à prix d’or

8 septembre 2026

Infos légales

  • Mentions légales
  • Politique de confidentialité
  • Nous contacter
  • Partenaires

Maj récentes

Samsung Galaxy affichant la synchronisation native de la Galerie vers Google Photos, OneDrive arrêté fin septembre 2026
Samsung Galaxy : la Galerie bascule vers Google Photos, OneDrive s’arrête le 30 septembre
Mobiles & Apps
Samsung Galaxy S25 avec l'écran de mise à jour One UI 9 sous Android 17, visuel concept du déploiement
One UI 9 pourrait être déployé le 28 septembre, voici les modèles concernés
Mobiles & Apps
Illustration concept : un satellite-miroir orbital déployé renvoie un faisceau de lumière solaire vers la face nocturne de la Terre, concept de la startup Reflect Orbital
Reflect Orbital : ces miroirs spatiaux brillent 40 fois plus que la pleine Lune
Sciences & Espace
Concept iOS 27 : fonction Hide Location qui masque discrètement le partage de position, iPhone affichant Find My avec No Location Found, carré glassmorphism iOS 27 centré
iOS 27 : Apple permet de masquer votre position sans alerter le contact visé
Mobiles & Apps

Qui sommes nous ?

Le Journal du Web alias JDW a été fondé et est édité par des passionnés par l’univers web, nouvelles technologies et de la culture populaire.

Newsletter
Inscrivez-vous à notre newsletter pour recevoir nos derniers articles!
Suivez-nous
Welcome Back!

Sign in to your account

Username or Email Address
Password

Mot de passe oublié ?