JDWJDW
Font ResizerAa
  • Tech & Innovations
  • Mobiles & Apps
  • IA & Robotique
  • Consoles & Jeux Vidéo
  • Films & Séries
  • Animes & Mangas
  • Geek & Gadgets
  • Bons plans & promos
  • Plus
    • Blockchain & Crypto
    • Web & Internet
    • Informatique & Cybersécurité
    • Sciences & Espace
    • Réseaux Sociaux & Influence
    • e-Business & Webmarketing
    • Fintech & Néobanques
    • Streaming & P2P
Font ResizerAa
JDWJDW
Rechercher
  • Web & Internet
  • Tech & Innovations
  • Mobiles & Apps
  • Consoles & Jeux Vidéo
  • Films & Séries
  • Animes & Mangas
  • Blockchain & Crypto
  • Geek & Gadgets
  • Informatique & Cybersécurité
  • Streaming & P2P
Avez-vous déjà un compte ? Sign In
Suivez-nous
IA & Robotique

SWE-bench (verified), c’est quoi exactement ? On vous explique tout sur ce benchmark

Raphael Gelin
Published: 8 juillet 2026
Last updated: 8 juillet 2026
Partager
swe-bench
Sommaire
  • D’où sort ce fameux benchmark
  • Le fonctionnement, rouage par rouage
  • Pourquoi ce test a changé les règles du jeu
  • Quand les IA butent contre le mur
  • La grande famille des variantes
  • Vers quoi tout cela se dirige

Un jour de 2023, une équipe de chercheurs de Princeton a posé une question qui allait secouer tout le petit monde de l’intelligence artificielle. Le titre de leur article, « Can Language Models Resolve Real-World GitHub Issues? », claque comme un défi. Traduction pour les non-initiés : une machine peut-elle vraiment réparer des bugs comme un développeur en chair et en os ? SWE-bench est la réponse, ou plutôt l’épreuve conçue pour trancher la question. Et depuis, ce benchmark est devenu le juge de paix de tous les modèles qui prétendent savoir coder.

D’où sort ce fameux benchmark

Carlos Jimenez, John Yang et leurs collègues signent en 2024 le papier fondateur (référencé arXiv:2310.06770 pour les curieux). Leur idée a arrêter de tester les IA sur des exercices de style artificiels et les confronter à la vraie vie du code. Pas des puzzles inventés en laboratoire. Des bugs authentiques, extraits de dépôts GitHub que des millions de développeurs utilisent tous les jours.

Le mot SWE-bench se décompose ainsi. « SWE » pour Software Engineering, l’ingénierie logicielle. « Bench » pour benchmark, ce banc d’essai standardisé qui permet de comparer les concurrents sur un pied d’égalité. Le principe s’inspire des courses automobiles où chaque bolide affronte le même circuit dans les mêmes conditions.

La matière première de ce test provient de 12 dépôts open-source écrits en Python. Des vraies bibliothèques, comme scikit-learn, utilisées par des chercheurs et des ingénieurs sur toute la planète. Au total, la version complète du benchmark aligne 2 294 instances, autant de problèmes réels qui ont un jour fait suer un humain.

A lire également

Manifeste The Future is for Everyone de Mark Zuckerberg pour une IA libre et ouverte, symbole infini Meta sur fond techno bleu nuit
Mark Zuckerberg lance un manifeste de 6 500 mots pour une superintelligence personnelle offerte à chaque humain
Concept : racks de serveurs IA Nvidia avec GPU et mémoire HBM dans un data center, éclairage LED vert, illustration de la hausse des prix des accélérateurs IA
Nvidia alerte ses clients : les serveurs IA vont coûter plus de 15 % plus cher début 2027
Robots humanoïdes en pleine course sur la piste de 100 mètres lors des World Humanoid Robot Games de Pékin, où le robot Lightning d'Honor a pulvérisé le record d'Usain Bolt en 9,32 secondes
Un robot pulvérise le record du 100 mètres d’Usain Bolt aux Jeux mondiaux de robots humanoïdes de Pékin

Le fonctionnement, rouage par rouage

Chaque tâche démarre avec ce que les concepteurs appellent le « problem statement ». En clair, la description du bug telle qu’un utilisateur agacé l’a rédigée sur GitHub. L’agent IA reçoit ce texte, plus l’accès au codebase entier (des milliers de fichiers parfois), et doit produire un « patch », c’est-à-dire une modification du code censée régler le problème.

La vérification tient de l’implacable. Deux batteries de tests unitaires jugent le travail. Les tests FAIL_TO_PASS échouaient avant la correction et doivent réussir après. Les tests PASS_TO_PASS, eux, vérifient que la machine n’a rien cassé ailleurs dans le programme (un piège classique du codeur). Il faut valider les deux pour empocher le point.

Détail délicieusement sadique, l’agent ne voit jamais les tests qu’il devra passer. Il navigue à l’aveugle, exactement comme un développeur qui découvre un ticket sans savoir précisément ce qu’on attend de lui. Pour couronner le tout, chaque épreuve se déroule dans un conteneur Docker isolé, une bulle logicielle propre qui garantit que tout le monde joue dans le même bac à sable.

La note finale s’exprime par la métrique « % Resolved », le pourcentage d’issues effectivement résolues. Un chiffre brut, sans échappatoire. Vous avez réparé le bug ou vous ne l’avez pas réparé.

Pourquoi ce test a changé les règles du jeu

Avant SWE-bench, on mesurait les IA sur des tâches de coding avec des exercices de programmation compétitive ou des fonctions à compléter. Charmant, mais aussi éloigné du métier réel qu’un examen de code de la route l’est d’un rallye sous la pluie. Ce benchmark a fait basculer l’évaluation dans le concret du développement quotidien.

L’astuce réside dans le sourcing où chaque problème vient d’une pull request qui a réellement résolu l’issue à l’époque. Les chercheurs disposent donc d’une solution de référence validée par de vrais humains, ainsi que des tests qui l’accompagnaient. Impossible de tricher sur ce qu’est une « bonne » correction, la communauté GitHub l’avait déjà tranché.

SWE-bench évalue en réalité deux choses en même temps, à savoir le modèle de fondation lui-même et le « harness » agentique qui l’entoure, c’est-à-dire la tuyauterie qui permet à l’IA d’exécuter des commandes et de manipuler des fichiers. Pour comparer proprement les modèles, Vals.ai par exemple, leur donne un seul outil, bash, et les force à se débrouiller avec les commandes du terminal (grep, find, sed…). La performance dépend alors de la seule intelligence du modèle, pas d’un échafaudage sophistiqué.

Quand les IA butent contre le mur

Les chiffres des débuts avaient de quoi calmer les enthousiastes. En août 2024, les meilleurs agents plafonnaient à 20% sur la version complète de SWE-bench et 43% sur la variante Lite. Ce qui veut dire que quatre bugs sur cinq résistaient encore aux machines dans la version intégrale.

Mais OpenAI a découvert que le benchmark était parfois injuste, sous-estimant les capacités réelles des modèles. Trois défauts revenaient. Des tests unitaires trop pointilleux qui rejetaient des solutions pourtant valables. Des descriptions de bugs mal spécifiées, laissant l’agent deviner l’attendu. Des environnements de développement capricieux qui faisaient échouer les tests indépendamment de la qualité du travail.

L’exemple du dépôt scikit-learn reste édifiant. Un test exigeait que la solution déclenche un avertissement précis (DeprecationWarning) avec un message exact, forgé lors d’une discussion à laquelle l’agent n’avait aucun accès. Résoudre correctement ce cas relevait presque de la voyance. Une IA irréprochable était condamnée à échouer pour une raison qui n’avait rien à voir avec sa compétence.

Reste une ombre au tableau que les concepteurs reconnaissent eux-mêmes. Les grands modèles pré-entraînés sur des téraoctets de données internet ont probablement déjà croisé ces dépôts GitHub publics. Personne ne peut être sûr à 100% qu’un modèle n’a pas déjà mémorisé une partie des réponses, ce qui peut forcément biaiser le résultat et l’aspect inédit des tests « aux yeux » des modèles.

La grande famille des variantes

Pour purger ces injustices, OpenAI a lancé en août 2024 une opération d’orfèvre. 93 développeurs expérimentés en Python ont passé au crible chaque échantillon, chacun relu 3 fois par des annotateurs différents. Le verdict fut sévère puisque 68,3% des échantillons ont été éliminés pour cause de spécification bancale ou de tests inéquitables. Il en est sorti SWE-bench Verified, 500 tâches nettoyées, validées, incontestables.

L’effet fut spectaculaire et GPT-4o, qui résolvait 16% des problèmes sur la version originale, a bondi à 33,2% sur Verified. Le score avait doublé sans que le modèle change d’un iota. La preuve que l’ancien benchmark bridait injustement les performances.

Autour de ce noyau gravitent plusieurs déclinaisons taillées pour des usages précis.

Le corpus Verified propose même un tri par difficulté. Le lot « easy » rassemble 196 corrections de moins de 15 minutes pour un développeur chevronné. Le lot « hard », lui, aligne 45 tâches réclamant plus d’une heure de réflexion. De quoi mesurer où exactement les modèles décrochent.

Vers quoi tout cela se dirige

Le benchmark ne cesse de muter pour rester à la hauteur et tester les modèles de manière équitable et surtout les pousser dans leurs rentranchements. En mai 2025 sortait SWE-smith, un outil permettant d’entraîner ses propres modèles d’agents logiciels. La communauté ne se contente plus de mesurer mais fabrique les concurrents de demain.

Novembre 2025 a vu débarquer CodeClash, une nouvelle génération d’évaluation. Le glissement conceptuel fait qu’on passe d’agents « orientés tâche » (résous ce bug précis) à des agents « orientés objectif » (atteins ce but comme un développeur autonome le ferait). L’ambition grimpe donc d’un cran vers l’imitation du raisonnement humain.

Les concepteurs eux-mêmes prêchent tout de même l’humilité. Un benchmark bâti sur des données figées vieillit vite, se fait contaminer, et finit toujours par être saturé quand les modèles progressent. La course entre l’épreuve et les candidats ne s’arrête jamais, chaque génération de tests devant redoubler d’exigence pour rester pertinente.

La véritable question n’est plus de savoir si l’IA sait coder, nous savons qu’elle le fait, et les modèles les plus puissants rivalisent déjà avec la majeure partie des développeurs humains. L’enjeu s’est déplacé puisque les scores frôlent aujourd’hui la saturation du referentiel SWE-bench Verified, le véritale défi est donc d’anticiper la suite. Le jour où une IA y affichera un score parfait de 100 %, il nous faudra déjà avoir inventé le prochain test pour mesurer ses réelles capacités d’autonomie.

Partager cet article
Facebook Whatsapp Whatsapp LinkedIn Reddit Telegram Copy Link

Derniers articles

Concept d'une console portable PlayStation style rumeur, rendu éditorial 16:9 sans texte
PS6 portable : un prix sous les 600 dollars jugé irréaliste par un leaker à cause de la mémoire LPDDR5
Consoles & Jeux Vidéo
Rendu officiel NASA du télescope Swift en orbite autour de la Terre
Le télescope Swift va tomber sur la Terre : la NASA abandonne le sauvetage à 30 millions de dollars de son chasseur de sursauts gamma
Sciences & Espace
Xiaomi Pad 8 affichant l'interface HyperOS 4 Soft Light Glass, visuel concept du premier build stable
Xiaomi HyperOS 4 : le premier firmware stable détecté sur les serveurs, le déploiement est proche
Mobiles & Apps
Key art officiel du DLC Attack on Titan pour Maestro VR, crossover entre le jeu de rythme et l'anime
L’Attaque des Titans s’invite dans Maestro VR , le jeu Switch attendu pour septembre
Animes & Mangas

Tendance

Logo Anthropic avec le nom Claude au centre, concept de systèmes multi-agents IA sur fond techno sombre, illustration du rapport sur les sabotages entre agents
Les IA ont des réflexes de survie, mentent et falsifient les données : Anthropic révèle l’ampleur des sabotages dans les systèmes multi-agents
IA & Robotique
GTA 6, artwork officiel de Rockstar avec les protagonistes Lucia et Jason
GTA 6 : des vidéos de gameplay et la carte on fuité. Cette fois c’est pas de l’IA
Consoles & Jeux Vidéo
Rendu concept de la première smartwatch transparente Nothing
Nothing prépare sa première smartwatch transparente pour septembre 2026, sous les 300 dollars
Geek & Gadgets
Concept d'une montre connectée Garmin mesurant la glycémie non invasive au poignet grâce à un capteur optique
Garmin dévoile un brevet pour mesurer la glycémie au poignet et relance la course contre Apple
Geek & Gadgets
Castle Walls, première série entièrement générée par intelligence artificielle sur Prime Video, visuel officiel du studio Ay Yapım
Prime Video diffuse Castle Walls, la première série au monde entièrement fabriquée par IA
Films & Séries

Vous allez aussi aimer

Robot humanoïde exposé dans les allées de la World Robot Conference 2026 à Pékin
IA & Robotique

World Robot Conference 2026 : Pékin déroule le tapis rouge à plus de 300 entreprises et affirme sa suprématie sur les humanoïdes

21 août 2026
Logo MiniMax avec le nom du studio MiniMax Design sur fond techno abstrait sombre
IA & Robotique

MiniMax Design transforme le modèle vidéo H3 en studio de production agentique

21 août 2026
Robot humanoïde type Tesla Optimus dans un hall industriel futuriste, production à grande échelle
IA & Robotique

Tesla Optimus : premières ventes repoussées à 2027, la mue spectaculaire de Fremont s’accélère

21 août 2026
Robot humanoïde Unitree Superman en plein saut de deux mètres, visuel officiel du fabricant
IA & Robotique

Unitree enflamme le Star Market de Shanghai : l’IPO du robot acrobate s’envole de plus de 600 %

19 août 2026
Concept d'un réseau de neurones lumineux ascendant, modèle open-weight GLM-5.3 de Z.ai
IA & Robotique

GLM-5.3 : Z.ai lâche son modèle open-weight au prix de la version précédente et talonne Kimi K3 au sommet des classements

19 août 2026
Visuel officiel OpenAI : contrôles parentaux de ChatGPT pour les 13-17 ans, avec comptes liés, Quiet hours et Study Mode
IA & Robotique

ChatGPT ouvre ses portes aux ados : OpenAI déploie un arsenal de contrôles parentaux pour les 13-17 ans

19 août 2026
Logo Higgsfield, levée de 400 millions de dollars pour la vidéo générative par IA
IA & Robotique

Higgsfield lève 400 millions de dollars et quadruple sa valorisation dans la guerre de la vidéo générative

19 août 2026
Concept : une entité IA lumineuse s'échappant d'un coffre-fort numérique et brisant un pare-feu, illustrant le piratage de Hugging Face et le gel de l'entraînement des modèles OpenAI
IA & Robotique

OpenAI gèle l’entraînement de ses modèles après qu’un agent IA a piraté Hugging Face et quatre autres services

19 août 2026

Infos légales

  • Mentions légales
  • Politique de confidentialité
  • Nous contacter
  • Partenaires

Maj récentes

Lucid Gravity GT-S, SUV électrique trois rangées de 1 070 chevaux, rendu officiel Lucid Motors
Lucid Gravity GT-S : 1 070 ch pour un SUV à prix contenu
Tech & Innovations
Concept éditorial : plusieurs fusées américaines décollent d'un complexe de lancement côtier au lever du soleil, voie lactée et Mars rougie dans le ciel, pour l'article sur la politique spatiale nationale NSPM-17 de Trump et l'objectif de 1 000 lancements par an
Trump signe une politique spatiale nationale : 1 000 lancements par an d’ici 2030, cap sur Mars
Sciences & Espace
Key art officiel de Sakamoto Days saison 2 avec Taro Sakamoto
Sakamoto Days saison 2 : Netflix dévoile trois nouveaux assassins avant le retour de janvier 2027
Animes & Mangas
Roblox, plateforme de jeux vidéo en ligne
Roblox libère trois outils d’IA de protection des enfants, un pari open source inédit dans le jeu vidéo
Consoles & Jeux Vidéo

Qui sommes nous ?

Le Journal du Web alias JDW a été fondé et est édité par des passionnés par l’univers web, nouvelles technologies et de la culture populaire.

Newsletter
Inscrivez-vous à notre newsletter pour recevoir nos derniers articles!
Suivez-nous
Welcome Back!

Sign in to your account

Username or Email Address
Password

Mot de passe oublié ?