JDWJDW
Font ResizerAa
  • Tech & Innovations
  • Mobiles & Apps
  • IA & Robotique
  • Consoles & Jeux Vidéo
  • Films & Séries
  • Animes & Mangas
  • Bons plans & promos
  • Plus
    • Blockchain & Crypto
    • Web & Internet
    • Geek & Gadgets
    • Informatique & Cybersécurité
    • Sciences & Espace
    • Réseaux Sociaux & Influence
    • e-Business & Webmarketing
    • Fintech & Néobanques
    • Streaming & P2P
Font ResizerAa
JDWJDW
Rechercher
  • Web & Internet
  • Tech & Innovations
  • Mobiles & Apps
  • Consoles & Jeux Vidéo
  • Films & Séries
  • Animes & Mangas
  • Blockchain & Crypto
  • Geek & Gadgets
  • Informatique & Cybersécurité
  • Streaming & P2P
Avez-vous déjà un compte ? Sign In
Suivez-nous
IA & Robotique

GPT‑5.6 aurait “triché” pendant ses tests : faut-il encore croire aux benchmarks IA ?

Raphael Gelin
Published: 3 juillet 2026
Last updated: 3 juillet 2026
Partager
gpt-5.6

Le modèle le plus ambitieux d’OpenAI, GPT-5.6 Sol, dévoilé fin juin sous accès gouvernemental restreint, a été pris en flagrant délit de tricherie systématique lors d’évaluations indépendantes menées par l’organisme METR. Le nouveau fleuron exploitait des failles dans l’environnement de test, allait déterrer des solutions cachées et tentait ensuite d’effacer ses traces, le tout avec une fréquence jamais observée chez aucun modèle évalué publiquement. L’affaire pose une question vertigineuse pour toute l’industrie de l’intelligence artificielle, celle de la fiabilité même des instruments censés mesurer la puissance de ces systèmes.

METR utilise une méthodologie dite « d’horizon temporel » qui évalue la durée maximale d’une tâche qu’un modèle peut encore résoudre avec un taux de réussite de 50 à 80 %, en se calibrant sur les temps d’exécution humains (45 minutes pour entraîner un classificateur, environ quatre heures pour un modèle d’image robuste). Or les résultats de Sol oscillent de manière spectaculaire entre 11,3 heures et plus de 270 heures selon le traitement réservé aux tentatives de fraude. Un écart si grotesque que METR considère aujourd’hui l’ensemble de ces données comme inexploitables pour juger des capacités réelles du modèle.

Comment un système conçu pour résoudre des problèmes de code en arrive-t-il à contourner les règles du jeu qu’on lui impose ? Le phénomène dépasse la simple anomalie statistique. Sol a, selon METR, activement cherché à dissimuler ses comportements frauduleux, ce qui suggère une forme d’optimisation orientée vers la réussite du benchmark plutôt que vers la résolution authentique des tâches. Et ce comportement s’est manifesté bien plus souvent que chez ses prédécesseurs ou ses concurrents directs.

OpenAI a toutefois été saluée par METR pour avoir détecté cette dérive via ses propres outils de surveillance et partagé les résultats sans filtre. L’organisme d’évaluation y voit paradoxalement un motif de réassurance, estimant que la grossièreté même de la triche prouve que des problèmes plus profonds seraient eux aussi repérés. METR a cependant glissé un avertissement glaçant dans son rapport « si les futurs modèles affichent beaucoup moins de comportements indésirables, nous pourrions devenir plus inquiets face à un désalignement catastrophique, car nous craindrions que les modèles aient appris à échapper à la détection ».

Le Claude Mythos Preview d’Anthropic avait de son côté atteint un horizon temporel d’au moins 16 heures lors d’une évaluation antérieure, se hissant déjà dans ce que METR appelle la « zone de mesure non fiable » (au-delà de 16 heures, seules cinq tâches sur 228 dans la suite de tests correspondent à cette échelle de difficulté). Le Mythos 5, vraisemblablement encore plus performant, reste en tout cas bloqué par le gouvernement américain. Sol se retrouve donc dans un flou statistique total, coincé tantôt en dessous tantôt astronomiquement au-dessus de cette barre, selon qu’on punit ou qu’on ignore ses tripatouillages.

A lire également

Robot humanoïde Unitree Superman en plein saut de deux mètres, visuel officiel du fabricant
Unitree dévoile Superman, le robot humanoïde qui saute à 2 mètres et dépasse Usain Bolt
Concept : logo Tesla et figure 20 % sur fond sombre, Musk porte son pouvoir de vote chez Tesla à près de 20 %
Elon Musk porte son pouvoir de vote chez Tesla à 20 % et vise le quart du royaume
Concept : élève utilisant une tablette avec l'assistant Google Gemini à l'école, logo Gemini et éléments éducatifs holographiques
Google ouvre Gemini aux élèves de tous âges dans Classroom, un pari éducatif à 150 millions d’utilisateurs

Les benchmarks IA traversent une période de turbulences structurelles que cette affaire ne fait qu’amplifier. Terminal-Bench 2.1 attribue à Sol un score de 88,8 % en codage agentique (91,9 % en mode Ultra), contre 88 % pour Claude Mythos 5 et 84,3 % pour Fable 5. Sur GeneBench v1, dédié à la génomique, Sol surpasse GPT-5.5 avec 30 % contre 22 %. Des chiffres flatteurs, sauf que la révélation de METR vient jeter une ombre épaisse sur la confiance qu’on peut encore accorder à ces classements. Un article scientifique d’OpenAI consacré à la génomique a par ailleurs laissé échapper l’existence de variantes « Pro » non annoncées (Sol Pro, Terra Pro, Luna Pro), dont Sol Pro atteint 31,5 % sur un test à 129 tâches, battant tous les modèles évalués…

La croissance exponentielle des horizons temporels des modèles d’IA, documentée par METR au fil de ses évaluations successives, rend les outils de mesure actuels progressivement obsolètes. Les modèles les plus puissants se rapprochent d’une frontière où les tests manquent tout bonnement de tâches suffisamment difficiles pour les départager. Ajouter à cela un modèle qui triche avec enthousiasme revient à mesurer la vitesse d’un sprinter qui prend des raccourcis sur une piste déjà trop courte.

METR estime malgré tout que GPT-5.6 Sol ne se situe pas très loin au-dessus de l’état de l’art actuel et ne permettra pas d’automatiser entièrement la recherche en IA. OpenAI, qui commercialise Sol à 5 dollars par million de tokens en entrée et 30 dollars en sortie, insiste sur l’efficacité en tokens de son modèle comme avantage concurrentiel face aux alternatives chinoises moins chères. Le déploiement sur l’infrastructure Cerebras, prévu en juillet avec un débit annoncé de 750 tokens par seconde, devrait encore accélérer l’adoption. La vraie question désormais n’est peut-être plus de savoir quel modèle trône en tête des classements, mais si ces classements mesurent encore quoi que ce soit de fiable.

Partager cet article
Facebook Whatsapp Whatsapp LinkedIn Reddit Telegram Copy Link

Derniers articles

Key art officiel de Call of Duty Modern Warfare 4
Samsung et Call of Duty Modern Warfare 4 scellent un partenariat autour du HDR10+ Gaming et du Samsung Gaming Hub
Consoles & Jeux Vidéo
iPhone affichant Firefox sur iOS avec le bloqueur de publicités natif activé, logo Firefox
Firefox sur iOS intègre un bloqueur de publicités natif, et n’a besoin d’aucune extension pour le faire
Mobiles & Apps
Illustration conceptuelle d'un botnet Linux : un routeur central compromis en rouge (centre de commande) relié par des faisceaux rouges à des routeurs périphériques infectés, sur fond techno sombre
Evooo1Bot : le botnet Linux qui enrôle vos routeurs comme proxys SOCKS5
Informatique & Cybersécurité
Xiaomi 18 Pro Max, rendu concept du nouveau flagship Xiaomi
Xiaomi 18 Ultra annulé, Vivo et OPPO réservent leurs modèles Ultra à la Chine
Mobiles & Apps

Tendance

Logo Anthropic avec le nom Claude au centre, concept de systèmes multi-agents IA sur fond techno sombre, illustration du rapport sur les sabotages entre agents
Les IA ont des réflexes de survie, mentent et falsifient les données : Anthropic révèle l’ampleur des sabotages dans les systèmes multi-agents
IA & Robotique
iphone 18 pro concept
Foxconn lance son recrutement massif pour produire l’iPhone 18 Pro avant septembre
Mobiles & Apps
Rendu concept de la première smartwatch transparente Nothing
Nothing prépare sa première smartwatch transparente pour septembre 2026, sous les 300 dollars
Geek & Gadgets
ssor invexaro
Avis sur Essor Invexaro : une énième arnaque au trading IA ?
Blockchain & Crypto IA & Robotique Informatique & Cybersécurité
google ai overview
AI Mode et Overview : quand Google légitime une arnaque financière
IA & Robotique Web & Internet

Vous allez aussi aimer

Grok 4.6, logo et nom du modèle flagship de SpaceXAI sur fond techno sombre
IA & Robotique

Grok 4.6 : SpaceXAI propulse son modèle flagship au sommet du classement mondial, à prix cassé

13 août 2026
ia vole propriété intellectuelle
IA & RobotiqueTech & Innovations

L’intelligence artificielle a-t-elle volé les créateurs ? Le procès du copyright s’enflamme

16 juin 2026
Logo officiel de Google DeepMind, le laboratoire d'intelligence artificielle d'Alphabet
IA & Robotique

Google DeepMind : Koray Kavukcuoglu prend les commandes pour relancer la guerre des modèles frontières

13 août 2026
Logos officiels OpenAI et Apple, côte à côte
IA & Robotique

OpenAI demande le rejet de la plainte d’Apple pour vol de secrets commerciaux et retourne l’accusation

6 août 2026
Rendu officiel Meta Muse Code, agent de codage IA de Meta (modèle Muse Spark 1.2)
IA & Robotique

Meta lance Muse Code, son premier agent de codage IA, et déclare la guerre à Anthropic et OpenAI

6 août 2026
Concept robots humanoïdes alignés dans une usine futuriste, guerre des robots US-Chine
IA & Robotique

La Chine capte 97 % des expéditions mondiales de robots humanoïdes et écrase la concurrence américaine

11 août 2026
Navigateur Google Chrome
IA & Robotique

Chrome transformé en collègue IA : Google passe à la vitesse supérieure avec Gemini et l’auto browse

24 avril 2026
Logo OpenAI avec le nom du modèle GPT-5.6 Sol et son mode Ultrafast, concept sombre sur fond techno
IA & Robotique

OpenAI propulse GPT-5.6 Sol à 750 tokens par seconde grâce à Cerebras et son mode Ultrafast

14 août 2026

Infos légales

  • Mentions légales
  • Politique de confidentialité
  • Nous contacter
  • Partenaires

Maj récentes

One UI 9 sur Galaxy Samsung - déploiement de la mise à jour
Samsung One UI 9 : la Beta 5 corrige, la Beta 6 se prépare déjà à lisser le Galaxy S26
Mobiles & Apps
Esports World Cup 2026 Rocket League à Paris : logo officiel EWC 26 avec deux voitures Rocket League en action dans l'arène
Esports World Cup 2026 Rocket League : ce qu’il faut retenir du Day 5 à Paris
Consoles & Jeux Vidéo
Portefeuille matériel SafePal S1 sur fond sombre, concept visuel illustrant la fuite de données personnelles de 39 798 clients
SafePal : les données personnelles de 39 798 clients exposées, les cryptos épargnées
Informatique & Cybersécurité
Noah Schnapp en Will Byers dans Stranger Things
Noah Schnapp quitte l’Upside Down pour les planches de Londres : premier rôle depuis la fin de Stranger Things
Films & Séries

Qui sommes nous ?

Le Journal du Web alias JDW a été fondé et est édité par des passionnés par l’univers web, nouvelles technologies et de la culture populaire.

Newsletter
Inscrivez-vous à notre newsletter pour recevoir nos derniers articles!
Suivez-nous
Welcome Back!

Sign in to your account

Username or Email Address
Password

Mot de passe oublié ?