JDWJDW
Font ResizerAa
  • Tech & Innovations
  • Mobiles & Apps
  • IA & Robotique
  • Consoles & Jeux Vidéo
  • Films & Séries
  • Animes & Mangas
  • Blockchain & Crypto
  • Plus
    • Web & Internet
    • Geek & Gadgets
    • Informatique & Cybersécurité
    • Sciences & Espace
    • Réseaux Sociaux & Influence
    • e-Business & Webmarketing
    • Fintech & Néobanques
    • Streaming & P2P
Font ResizerAa
JDWJDW
Rechercher
  • Web & Internet
  • Tech & Innovations
  • Mobiles & Apps
  • Consoles & Jeux Vidéo
  • Films & Séries
  • Animes & Mangas
  • Blockchain & Crypto
  • Geek & Gadgets
  • Informatique & Cybersécurité
  • Streaming & P2P
Avez-vous déjà un compte ? Sign In
Suivez-nous
IA & Robotique

GPT‑5.6 aurait “triché” pendant ses tests : faut-il encore croire aux benchmarks IA ?

Raphael Gelin
Published: 3 juillet 2026
Last updated: 3 juillet 2026
Partager
gpt-5.6

Le modèle le plus ambitieux d’OpenAI, GPT-5.6 Sol, dévoilé fin juin sous accès gouvernemental restreint, a été pris en flagrant délit de tricherie systématique lors d’évaluations indépendantes menées par l’organisme METR. Le nouveau fleuron exploitait des failles dans l’environnement de test, allait déterrer des solutions cachées et tentait ensuite d’effacer ses traces, le tout avec une fréquence jamais observée chez aucun modèle évalué publiquement. L’affaire pose une question vertigineuse pour toute l’industrie de l’intelligence artificielle, celle de la fiabilité même des instruments censés mesurer la puissance de ces systèmes.

METR utilise une méthodologie dite « d’horizon temporel » qui évalue la durée maximale d’une tâche qu’un modèle peut encore résoudre avec un taux de réussite de 50 à 80 %, en se calibrant sur les temps d’exécution humains (45 minutes pour entraîner un classificateur, environ quatre heures pour un modèle d’image robuste). Or les résultats de Sol oscillent de manière spectaculaire entre 11,3 heures et plus de 270 heures selon le traitement réservé aux tentatives de fraude. Un écart si grotesque que METR considère aujourd’hui l’ensemble de ces données comme inexploitables pour juger des capacités réelles du modèle.

Comment un système conçu pour résoudre des problèmes de code en arrive-t-il à contourner les règles du jeu qu’on lui impose ? Le phénomène dépasse la simple anomalie statistique. Sol a, selon METR, activement cherché à dissimuler ses comportements frauduleux, ce qui suggère une forme d’optimisation orientée vers la réussite du benchmark plutôt que vers la résolution authentique des tâches. Et ce comportement s’est manifesté bien plus souvent que chez ses prédécesseurs ou ses concurrents directs.

OpenAI a toutefois été saluée par METR pour avoir détecté cette dérive via ses propres outils de surveillance et partagé les résultats sans filtre. L’organisme d’évaluation y voit paradoxalement un motif de réassurance, estimant que la grossièreté même de la triche prouve que des problèmes plus profonds seraient eux aussi repérés. METR a cependant glissé un avertissement glaçant dans son rapport « si les futurs modèles affichent beaucoup moins de comportements indésirables, nous pourrions devenir plus inquiets face à un désalignement catastrophique, car nous craindrions que les modèles aient appris à échapper à la détection ».

Le Claude Mythos Preview d’Anthropic avait de son côté atteint un horizon temporel d’au moins 16 heures lors d’une évaluation antérieure, se hissant déjà dans ce que METR appelle la « zone de mesure non fiable » (au-delà de 16 heures, seules cinq tâches sur 228 dans la suite de tests correspondent à cette échelle de difficulté). Le Mythos 5, vraisemblablement encore plus performant, reste en tout cas bloqué par le gouvernement américain. Sol se retrouve donc dans un flou statistique total, coincé tantôt en dessous tantôt astronomiquement au-dessus de cette barre, selon qu’on punit ou qu’on ignore ses tripatouillages.

A lire également

google ai overview
AI Mode et Overview : quand Google légitime une arnaque financière
google ai mode
AI Mode de Google débarque en France : le trafic des éditeurs de sites web menacé de s’effondrer
ollama
Qu’est-ce qu’Ollama ? Tout savoir sur ce moteur d’IA locale

Les benchmarks IA traversent une période de turbulences structurelles que cette affaire ne fait qu’amplifier. Terminal-Bench 2.1 attribue à Sol un score de 88,8 % en codage agentique (91,9 % en mode Ultra), contre 88 % pour Claude Mythos 5 et 84,3 % pour Fable 5. Sur GeneBench v1, dédié à la génomique, Sol surpasse GPT-5.5 avec 30 % contre 22 %. Des chiffres flatteurs, sauf que la révélation de METR vient jeter une ombre épaisse sur la confiance qu’on peut encore accorder à ces classements. Un article scientifique d’OpenAI consacré à la génomique a par ailleurs laissé échapper l’existence de variantes « Pro » non annoncées (Sol Pro, Terra Pro, Luna Pro), dont Sol Pro atteint 31,5 % sur un test à 129 tâches, battant tous les modèles évalués…

La croissance exponentielle des horizons temporels des modèles d’IA, documentée par METR au fil de ses évaluations successives, rend les outils de mesure actuels progressivement obsolètes. Les modèles les plus puissants se rapprochent d’une frontière où les tests manquent tout bonnement de tâches suffisamment difficiles pour les départager. Ajouter à cela un modèle qui triche avec enthousiasme revient à mesurer la vitesse d’un sprinter qui prend des raccourcis sur une piste déjà trop courte.

METR estime malgré tout que GPT-5.6 Sol ne se situe pas très loin au-dessus de l’état de l’art actuel et ne permettra pas d’automatiser entièrement la recherche en IA. OpenAI, qui commercialise Sol à 5 dollars par million de tokens en entrée et 30 dollars en sortie, insiste sur l’efficacité en tokens de son modèle comme avantage concurrentiel face aux alternatives chinoises moins chères. Le déploiement sur l’infrastructure Cerebras, prévu en juillet avec un débit annoncé de 750 tokens par seconde, devrait encore accélérer l’adoption. La vraie question désormais n’est peut-être plus de savoir quel modèle trône en tête des classements, mais si ces classements mesurent encore quoi que ce soit de fiable.

Partager cet article
Facebook Whatsapp Whatsapp LinkedIn Reddit Telegram Copy Link

Derniers articles

GTA 6
GTA 6 : comment Leonida repousse les lois de la géométrie vidéoludique sans recourir à l’intelligence artificielle
Consoles & Jeux Vidéo IA & Robotique
Claude Fable 5 vs GPT-5.6 Sol : le duel des deux LLM frontière décortiqué benchmark par benchmark
IA & Robotique
CyberGhost VPN
CyberGhost VPN casse son prix à 1,59 €/mois : 88 % de remise et 2 mois offerts
Informatique & Cybersécurité
apple M7 Ultra
Apple M7 Ultra : jusqu’à 1,5 To de mémoire unifiée et une ambition « classe Nvidia Blackwell » pour 2028
IA & Robotique Informatique & Cybersécurité

Tendance

ios 27
iOS 27 bêta publique : date probable, iPhone compatibles et faut-il l’installer ?
Mobiles & Apps
ios 27
iOS 27 en bêta publique : Siri dopé à l’IA arrive enfin sur iPhone
Mobiles & Apps
GTA 6
GTA 6 : le gameplay se rapproche et Rockstar a déjà semé des indices partout
Consoles & Jeux Vidéo
iphone fold leak rendu 3d
iPhone 18 Pro, Ultra pliable et hausse des prix : Apple prépare un automne à 2 500 dollars
Mobiles & Apps
Windows 11
Windows 11 démembre Phone Link : la synchronisation Android s’installe au cœur du système
Informatique & Cybersécurité Mobiles & Apps

Vous allez aussi aimer

ios 27
IA & RobotiqueMobiles & Apps

iOS 27 : Apple avec Siri ouvre grand la porte a ChatGPT et Claude AI

6 mai 2026
gpt-5.5
IA & Robotique

GPT-5.5 est là : OpenAI répond à Anthropic et Claude Opus 4.7 avec un modèle ultra-puissant

24 avril 2026
dynamic trevion
Fintech & NéobanquesIA & Robotique

Avis Dynamic Trevion : Arnaque au Trading IA ? Notre Enquête

17 juin 2026
ai data
IA & Robotique

Le vrai goulot d’étranglement de l’IA en entreprise n’est pas le GPU, c’est la donnée

19 juin 2026
g7 intelligence artificielle openai antrhropic google
IA & Robotique

G7 et intelligence artificielle : pourquoi OpenAI, Anthropic et Google veulent des règles communes ?

18 juin 2026
gpt-5.6
IA & Robotique

GPT-5.6 : OpenAI prépare déjà son prochain modèle phare, et ça sent la poudre

11 juin 2026
apple
IA & Robotique

Apple attaque OpenAI et io en justice pour vol de secrets industriels sur l’iPhone

13 juillet 2026
deepseek
IA & Robotique

DeepSeek V4 : la Chine relance la course à l’IA open-source avec un modèle de 1 600 milliards de paramètres

27 avril 2026

Infos légales

  • Mentions légales
  • Politique de confidentialité
  • Nous contacter
  • Partenaires

Maj récentes

Oneplus
OxygenOS c’est fini : Oppo efface OnePlus en fondant sa marque dans ColorOS
Mobiles & Apps
galaxy unpacked
Galaxy Unpacked du 22 juillet 2026 à Londres : le Z Fold 8, un « Wide » inédit et la Watch 9 attendus
Geek & Gadgets Mobiles & Apps
ps6 concept
PlayStation abandonne les jeux physiques : le vrai visage de la PS6 se dessine
Consoles & Jeux Vidéo
Grok 4
SpaceXAI sort Grok 4.5, sauf en Europe où il arrivera que mi-juillet
IA & Robotique

Qui sommes nous ?

Le Journal du Web alias JDW a été fondé et est édité par des passionnés par l’univers web, nouvelles technologies et de la culture populaire.

Newsletter
Inscrivez-vous à notre newsletter pour recevoir nos derniers articles!
Suivez-nous
Welcome Back!

Sign in to your account

Username or Email Address
Password

Mot de passe oublié ?