JDWJDW
Font ResizerAa
  • Tech & Innovations
  • Mobiles & Apps
  • IA & Robotique
  • Consoles & Jeux Vidéo
  • Films & Séries
  • Animes & Mangas
  • Bons plans & promos
  • Plus
    • Blockchain & Crypto
    • Web & Internet
    • Geek & Gadgets
    • Informatique & Cybersécurité
    • Sciences & Espace
    • Réseaux Sociaux & Influence
    • e-Business & Webmarketing
    • Fintech & Néobanques
    • Streaming & P2P
Font ResizerAa
JDWJDW
Rechercher
  • Web & Internet
  • Tech & Innovations
  • Mobiles & Apps
  • Consoles & Jeux Vidéo
  • Films & Séries
  • Animes & Mangas
  • Blockchain & Crypto
  • Geek & Gadgets
  • Informatique & Cybersécurité
  • Streaming & P2P
Avez-vous déjà un compte ? Sign In
Suivez-nous
IA & RobotiqueInformatique & CybersécuritéWeb & Internet

Prompt injection : pourquoi les agents IA restent la cible n°1 en 2026

Raphael Gelin
Published: 26 juillet 2026
Last updated: 7 août 2026
Partager
Illustration conceptuelle d'un agent IA se désintégrant en particules géométriques dans un datacenter, symbolisant une fuite de données causée par une injection de prompt malveillante
Sommaire
  • Le péché originel des LLM
  • Les chatbots étaient un jeu d’enfant, les agents sont une porte blindée mal fermée
  • Ce que les attaques documentées nous apprennent vraiment
  • Le cas des injections involontaires
  • Ce que ça coûte, concrètement
  • Se défendre quand le correctif n’existe pas
  • Ce que devraient exiger les acheteurs d’agents IA

Un document PDF suffit. Une ligne de texte blanc sur fond blanc, quelque part dans un rapport téléchargé par votre agent de veille, et voilà votre pipeline marketing en train d’exfiltrer des données vers un serveur inconnu. Aucune faille de code. Aucun exploit. Juste des mots, lus par une machine qui ne sait pas distinguer une instruction d’une information.

La prompt injection occupe la première place du Top 10 de l’OWASP pour les applications LLM depuis la refonte de 2025, et elle y reste en 2026. Non par paresse du classement, mais parce que personne n’a trouvé de correctif. Les audits de sécurité menés sur des déploiements IA en production la retrouvent dans plus de 73 % des cas. C’est le genre de statistique qui devrait faire réfléchir avant de brancher un agent sur votre CRM.

Le péché originel des LLM

Le problème est architectural. Un modèle de langage reçoit tout sous la même forme, à savoir des chaînes de texte en langage naturel. Le prompt système du développeur, la question de l’utilisateur, le contenu d’une page web récupérée, un ticket de support, un commentaire de code. Tout arrive dans le même canal, sans étiquette, sans hiérarchie de confiance native.

Le modèle décide alors, sur la base de son entraînement et du contexte, ce qui ressemble à une instruction. Un attaquant qui rédige quelque chose de suffisamment autoritaire (« IGNORE LES INSTRUCTIONS PRÉCÉDENTES ») peut donc prendre la main. Les développeurs qui viennent du web connaissent l’injection SQL et savent qu’on la corrige avec des requêtes préparées, une séparation stricte entre code et données. Ici, cette séparation n’existe pas. Elle est peut-être impossible à obtenir sans changer de paradigme.

Deux familles se distinguent. L’injection directe, quand l’utilisateur lui-même formule la manipulation dans sa saisie. Et l’injection indirecte, autrement plus vicieuse, où les instructions malveillantes dorment dans un contenu externe que le système va ingérer de son propre chef. Page web, e-mail, fichier joint, document dans une base vectorielle. L’utilisateur légitime déclenche l’attaque sans jamais la voir.

A lire également

Windows 11, concept sécurité : logo Windows 11 central sur des barrettes de RAM DDR, bouclier de sécurité fissuré
Windows 11 : une faille dans la RAM permet de contourner toutes les protections sans toucher la machine
Robot humanoïde Samsung, rendu concept sur fond bleu aux couleurs de la marque
Samsung mise sur ses moteurs de lave-linge pour fabriquer un robot humanoïde à prix cassé
Tesla Optimus Gen-2 servant du popcorn au Tesla Diner d'Hollywood, scène réelle
Le robot humanoïde Optimus de Tesla se fait pranker et retourne la blague

Point souvent négligé : une injection n’a pas besoin d’être lisible par un humain. Du texte en caractères Unicode invisibles, du LaTeX rendu en blanc, un encodage Base64, des instructions cachées dans les métadonnées d’une image. Si le modèle parse le contenu, le contenu peut le piloter.

Les chatbots étaient un jeu d’enfant, les agents sont une porte blindée mal fermée

Un chatbot qui déraille produit une réponse embarrassante. Un bot Twitter a ainsi fini par endosser la responsabilité de l’explosion de Challenger en 1986, sur simple demande d’un internaute taquin. Coût réel de l’incident, quelques captures d’écran virales et une leçon d’humilité.

Un agent qui déraille exécute des actions. La différence est d’ordre de grandeur. L’agent possède des tokens d’API, des accès en écriture, une mémoire persistante et la capacité d’enchaîner des appels d’outils sans repasser par un humain. La gravité d’une injection réussie dépend donc directement de ce qu’on a mis entre ses mains. OWASP le formule sans détour, l’impact varie selon le contexte métier et selon « l’agentivité » avec laquelle le système a été architecturé.

Trois vecteurs propres aux agents méritent votre attention. L’injection dans les étapes de raisonnement, où l’attaquant forge de faux résultats d’outils pour orienter la chaîne de décision. La manipulation d’outils, qui consiste à faire appeler une fonction légitime avec des paramètres contrôlés par l’attaquant. Et l’empoisonnement de contexte, qui glisse de fausses informations dans la mémoire de travail de l’agent pour qu’elles agissent plus tard, dans une autre session.

schema prompt injection agent ia
Mécanisme exact d »une attaque par prompt injection. L »instruction malveillante (rouge) et l »intention légitime (bleu) traversent les mêmes 6 étapes du pipeline. Le point critique de confusion se situe à la fenêtre de contexte, où le LLM reçoit les deux flux dans le même canal sans pouvoir les distinguer.

L’ampleur du phénomène a d’ailleurs poussé l’OWASP à publier un Top 10 dédié aux applications agentiques (ASI pour Agentic Security Initiative), distinct de celui des LLM (voir le rapport officiel). Comportements autonomes imprévus, chaînes de prompts complexes, fuites de données via des API connectées, manipulation multi-agents. Le vieux référentiel ne suffisait plus.

Ce que les attaques documentées nous apprennent vraiment

Janvier 2025, des chercheurs démontrent une attaque contre un système RAG d’entreprise. La méthode tient en une phrase, ils déposent un document public contenant des instructions cachées, le système l’indexe, une requête utilisateur banale le fait remonter, et l’agent exfiltre de l’intelligence économique tout en passant des appels d’API au-delà du périmètre d’autorisation de l’utilisateur. Personne n’a piraté le modèle. On a piraté sa bibliothèque. C’est aussi ce qui a permis à la faille « PleaseFix » de retourner les navigateurs IA en espions sans le moindre clic.

Le RAG, présenté un temps comme un garde-fou contre les hallucinations, s’avère un vecteur d’attaque de premier choix. Même constat pour le fine-tuning. Les deux améliorent la pertinence des sorties sans jamais résoudre la confusion instruction/donnée.

Côté taux de succès, les chiffres publiés font mal. Certaines techniques dépassent 50 % de réussite sur l’ensemble des modèles testés, avec des pointes à 88 %. Le jailbreaking dit Best-of-N, qui consiste à générer des centaines de variantes d’un même prompt jusqu’à ce que l’une passe, atteint 89 % sur GPT-4o et 78 % sur Claude 3.5 Sonnet avec assez de tentatives. Et la mauvaise nouvelle est mathématique. Ce phénomène suit une loi de puissance, ce qui signifie que le rate limiting, les filtres de contenu, les circuit breakers et même une température à 0 ne font que renchérir le coût de l’attaque. Ils ne l’empêchent pas.

Technique Cible Taux de succès rapporté
Best-of-N jailbreaking GPT-4o 89 %
Best-of-N jailbreaking Claude 3.5 Sonnet 78 %
Techniques d’injection variées Modèles multiples 50 % à 88 %

Les vecteurs les plus rentables sont ceux que personne ne surveille. Commentaires de code analysés par un assistant de développement, messages de commit, descriptions de tickets, avis clients, corps d’e-mails traités par un assistant. Tout ce que votre entreprise considère comme du contenu de travail devient une surface d’attaque dès qu’un agent le lit.

Le cas des injections involontaires

Toutes les injections ne sont pas forcément hostiles mais peuvent aussi permettre de dénicher les tricheurs. Une entreprise glisse dans ses offres d’emploi une instruction cachée destinée à détecter les candidatures rédigées par IA. Un candidat, ignorant tout de ce piège, passe l’annonce dans un modèle pour optimiser son CV… et déclenche lui-même le détecteur.

Symétriquement, les candidats ont appris à jouer le même jeu. Des CV contenant des fragments d’instructions découpés en plusieurs endroits du document, inoffensifs isolément, se recombinent lors de l’analyse par le modèle de tri et produisent une recommandation favorable qui n’a rien à voir avec le contenu réel du parcours. Le payload splitting appliqué aux ressources humaines.

Ces épisodes disent quelque chose d’utile. Une injection ne nécessite ni attaquant sophistiqué ni intention criminelle. Il suffit qu’un texte destiné à une machine croise une autre machine.

Ce que ça coûte, concrètement

Divulgation de données sensibles, en tête de liste. Conversations privées exfiltrées via une balise image générée par le modèle lui-même, une technique élégante où l’URL de l’image contient les données volées. L’utilisateur voit une image cassée, l’attaquant reçoit son paquet.

Fuite de prompt système ensuite. On sous-estime la valeur de ces instructions. Elles révèlent l’architecture, les outils connectés, les règles métier, parfois les noms de fonctions internes. C’est la carte du terrain offerte à qui reviendra plus tard.

Exécution d’actions non autorisées, le poste le plus onéreux. Un agent branché sur une messagerie, une base de données ou une régie publicitaire peut envoyer, supprimer, dépenser. C’est exactement ce qui s’est produit avec l’agent JadePuffer qui a rançonné une entreprise sans intervention humaine, en combinant plusieurs failles d’agents autonomes. La vulnérabilité CVE-2024-5184, sur un assistant e-mail propulsé par LLM, illustrait déjà ce chemin, notamment l’accès à des informations sensibles et la manipulation du contenu des messages.

Manipulation de décisions enfin, la plus difficile à détecter. Un contenu empoisonné dans la base de connaissances biaise durablement les recommandations d’un agent d’analyse concurrentielle ou de pilotage budgétaire. Aucune alerte ne se déclenche. Les décisions se dégradent lentement, et vous mettez six mois à comprendre pourquoi.

Se défendre quand le correctif n’existe pas

Aucune méthode ne garantit l’immunité. L’OWASP l’écrit noir sur blanc, la nature stochastique des modèles génératifs rend incertaine l’existence d’une prévention infaillible. La question devient donc celle de la réduction d’impact, pas celle de l’élimination du risque. Voici l’ordre de priorité que je recommanderais à quiconque met un agent en production.

  • Moindre privilège, avant tout le reste. L’agent ne doit détenir que les droits strictement nécessaires. Comptes en lecture seule quand c’est possible, tokens applicatifs distincts, scopes d’API réduits, durée de vie des jetons plafonnée à 24 heures avec rotation obligatoire. Les fonctions sensibles restent gérées dans le code, jamais exposées au modèle.
  • Human-in-the-loop sur les actions destructrices. Envoi de masse, suppression, modification de budget, publication. Un agent marketing qui pousse des contenus en production sans validation humaine est une expérience, pas un outil.
  • Séparation structurée des contenus non fiables. Balisage explicite des données externes, formats de sortie contraints et validés par du code déterministe, citations de sources exigées. Le modèle doit savoir ce qu’il lit et vous devez pouvoir vérifier ce qu’il produit.
  • Filtrage en entrée et en sortie. Les regex attrapent les tentatives naïves. Elles échouent sur l’obfuscation, la typoglycémie (« ignroe all prevoius instructions »), l’encodage et le multilingue. D’où l’intérêt de classifieurs dédiés, dont Llama Guard, ShieldGemma, Granite Guardian ou Prompt Guard.
  • Contrôle des appels d’outils. Chaque action proposée est évaluée contre l’intention initiale de l’utilisateur, sans le contexte intermédiaire non fiable. Un garde-fou qui ne voit que la tâche demandée et l’action envisagée refusera les dérives.
  • Tests adverses réguliers. On traite le modèle comme un utilisateur hostile et on mesure la tenue des frontières de confiance. Pas une fois à la mise en production, en continu.

Le motif le plus solide sur le plan architectural reste le dual-LLM, formalisé par Simon Willison. Un modèle privilégié détient les outils et ne lit jamais de contenu non fiable. Un modèle mis en quarantaine lit le contenu douteux et ne peut rien exécuter. Le premier reçoit du second des résumés structurés ou des étiquettes. Le chemin dont une instruction injectée a besoin pour atteindre l’exécutant se trouve ainsi coupé. Élégant, coûteux en latence, et de loin la meilleure garantie disponible.

Attention au piège de la confiance mal placée. Un garde-fou construit sur un LLM demeure un LLM, donc lui-même injectable. Il doit présenter une surface d’attaque différente de celle du modèle principal, faute de quoi le jailbreak qui défait l’un défait l’autre. Un classifieur spécialisé vaut mieux qu’un modèle de chat généraliste issu de la même famille.

Ce que devraient exiger les acheteurs d’agents IA

Le marché des agents IA a explosé depuis 2025, et la plupart des offres des consultants (souvent des opportunistes avec peu d’experience) traitent la sécurité comme une case à cocher en fin de documentation. Poser trois questions à un « prestataire » suffit généralement à révéler qui sont les plus les plus sérieux et qui sont les charlatans. Comment le contenu externe ingéré est-il isolé du prompt système ? Quelles actions requièrent une validation humaine et lesquelles sont automatiques ? Quels privilèges l’agent détient-il sur mes systèmes connectés, et pour combien de temps ?

Un installateur d’agent IA qui a pensé securité et connait le produit qu’il s’apprête a vous installer, saura décrire exactement le périmètre d’autorisation, les points de validation et la journalisation de la solution choisie.

Openclaw, Hermes Agent, Claude (même si ce dernier est le mieux doté) ? Toutes ces solutions n’ont pas parfaitement intégré cette logique d’architecture sécuritaire dès la conception, avec un cloisonnement des contenus tiers, des privilèges minimaux par agent et une traçabilité des décisions. Contrôler tous ces aspects avant de choisir son harness agentique est souvent pénible et voir très coûteux pour une entreprise. Un coût qui reste a relativiser le jour où il épargnera un incident grave…

La journalisation, justement, reste le parent pauvre des déploiements. Consigner chaque interaction, chaque décision de garde-fou, chaque appel d’outil. Surveiller les dérives dans les taux de refus, qui précèdent souvent un contournement fonctionnel. Sans traces, une injection réussie ne laisse aucun cadavre.

La prompt injection ne se corrigera pas par un patch. Elle se gère comme un risque opérationnel permanent, au même titre que la fraude au paiement. Ceux qui l’ont compris déploient des agents utiles. Les autres découvriront la facture, un jour, dans un log qu’ils n’auront pas activé.

Partager cet article
Facebook Whatsapp Whatsapp LinkedIn Reddit Telegram Copy Link

Derniers articles

Concept flagship premium titane sur fond sombre studio, iPhone 18
iPhone 18 Pro : le stockage de base resterait à 256 Go au lieu des 512 Go espérés
Mobiles & Apps
Key art officiel de MobLand saison 2 avec Tom Hardy, Pierce Brosnan et Helen Mirren, sur Paramount+
MobLand saison 2 : Tom Hardy, Pierce Brosnan et Helen Mirren déclarent la guerre civile des Harrigans dès le 18 septembre
Films & Séries
Castle Walls, première série entièrement générée par intelligence artificielle sur Prime Video, visuel officiel du studio Ay Yapım
Prime Video diffuse Castle Walls, la première série au monde entièrement fabriquée par IA
Films & Séries
Keiko, l'orque star de Sauvez Willy, en pleine figure au-dessus de son dresseur
Keiko : Netflix s’empare de la véritable histoire de l’orque de Sauvez Willy
Streaming & P2P

Tendance

iphone 18 pro concept
Foxconn lance son recrutement massif pour produire l’iPhone 18 Pro avant septembre
Mobiles & Apps
CyberGhost VPN
CyberGhost VPN casse son prix à 1,59 €/mois : 88 % de remise et 2 mois offerts
Informatique & Cybersécurité
Claude Fable 5 vs GPT-5.6 Sol : le duel des deux LLM frontière décortiqué benchmark par benchmark
IA & Robotique
apple M7 Ultra
Apple M7 Ultra : jusqu’à 1,5 To de mémoire unifiée et une ambition « classe Nvidia Blackwell » pour 2028
IA & Robotique Informatique & Cybersécurité
ssor invexaro
Avis sur Essor Invexaro : une énième arnaque au trading IA ?
Blockchain & Crypto IA & Robotique Informatique & Cybersécurité

Vous allez aussi aimer

Rendu officiel Meta Muse Code, agent de codage IA de Meta (modèle Muse Spark 1.2)
IA & Robotique

Meta lance Muse Code, son premier agent de codage IA, et déclare la guerre à Anthropic et OpenAI

6 août 2026
Internet Download Manager - IDM
Informatique & CybersécuritéZone Téléchargement

Télécharger IDM – Internet Download Manager

30 décembre 2019
Linux on Dex
Informatique & CybersécuritéMobiles & Apps

Le projet «Linux on DeX» de Samsung s’arrête avec Android 10

21 octobre 2019
Bit GPT App arnaque
Blockchain & CryptoIA & Robotique

Avis Bit GPT App : véritable arnaque ou service légitime ?

1 sur 5Mauvais
Windows 11
Informatique & Cybersécurité

Microsoft refond l’arrêt et le redémarrage de Windows 11 pour 1 milliard de PC : la fin d’une décennie d’agacement

26 avril 2026
Geoguessr
Web & Internet

Geoguessr : tout savoir sur le jeu basé sur Google Maps et Street View

13 juillet 2022
Coco Chat - Cocoland
Web & Internet

Cocoland, le fantôme de Coco chat : le site renaît et la justice tente de suivre

6 mai 2026
crowdstrike
Informatique & CybersécuritéTech & Innovations

CrowdStrike et AWS poussent la sécurité cloud dopée à l’IA : vers des SOC plus automatisés ?

18 juin 2026

Infos légales

  • Mentions légales
  • Politique de confidentialité
  • Nous contacter
  • Partenaires

Maj récentes

Google TV Freeplay, l'interface du catalogue à la demande avec le film Lady Bird
Google TV Freeplay injecte 10 000 contenus à la demande pour étouffer la concurrence du streaming payant
Streaming & P2P
Console Xbox Series X de Microsoft, rendu officiel
Mise à jour Xbox d’août 2026 : six nouveautés qui dopent la rétrocompatibilité et les wishlists
Consoles & Jeux Vidéo
Google Pixel Watch 5, photo officielle du press kit présentant les deux boîtiers avec leurs bracelets
Pixel Watch 5 : Google abandonne le bracelet aux PFAS cancérigènes, Apple reste à la traîne
Geek & Gadgets
iPhone Ultra, rendu concept du premier iPhone pliable, écran interne ouvert sur fond sombre studio
iPhone Ultra (Fold) : d’abord réservé aux Américains, l’Europe devra patienter jusqu’à fin 2026
Mobiles & Apps

Qui sommes nous ?

Le Journal du Web alias JDW a été fondé et est édité par des passionnés par l’univers web, nouvelles technologies et de la culture populaire.

Newsletter
Inscrivez-vous à notre newsletter pour recevoir nos derniers articles!
Suivez-nous
Welcome Back!

Sign in to your account

Username or Email Address
Password

Mot de passe oublié ?