JDWJDW
Font ResizerAa
  • Tech & Innovations
  • Mobiles & Apps
  • IA & Robotique
  • Consoles & Jeux Vidéo
  • Films & Séries
  • Animes & Mangas
  • Blockchain & Crypto
  • Plus
    • Web & Internet
    • Geek & Gadgets
    • Informatique & Cybersécurité
    • Sciences & Espace
    • Réseaux Sociaux & Influence
    • e-Business & Webmarketing
    • Fintech & Néobanques
    • Streaming & P2P
Font ResizerAa
JDWJDW
Rechercher
  • Web & Internet
  • Tech & Innovations
  • Mobiles & Apps
  • Consoles & Jeux Vidéo
  • Films & Séries
  • Animes & Mangas
  • Blockchain & Crypto
  • Geek & Gadgets
  • Informatique & Cybersécurité
  • Streaming & P2P
Avez-vous déjà un compte ? Sign In
Suivez-nous
Tech & Innovations

Grok 4 : derrière les benchmarks prometteurs, la déception

Raphael Gelin
Published: 16 juillet 2025
Last updated: 17 juillet 2025
Partager
Grok 4
Sommaire
  • Un modèle paresseux en développement & coding
  • En rédaction, un bond d’un an en arrière
  • Q&A et résolution de problèmes complexes
  • Une promesse surestimée

Grok 4 était censé être le modèle qui allait tout changer. Celui que Musk a présenté comme “plus intelligent que la plupart des diplômés de master, toutes disciplines confondues”. Derrière des benchmarks prometteurs (HLE, ARC-AGI, GPQA, LCB, etc.), se cache un modèle pas toujours à la hauteur, du moins, pas pour les tâches concrètes que les utilisateurs attendent aujourd’hui d’une IA dite “frontière”. Oui, Grok 4 brille sur certains tests académiques très spécifiques (maths de lycée, raisonnement abstrait). Oui, il bat parfois Claude 4 Opus,  Gemini 2.5 Pro et OpenAI o3 dans des comparatifs ultra ciblés. Et pourtant… ce n’est pas la claque promise ni la rupture technologique que certains influenceurs IA ou Elon Musk lui-même ont tenté de nous vendre avec un enthousiasme un peu trop assuré. Explication.

Un modèle paresseux en développement & coding

Sur le papier, Grok 4 est censé exceller en programmation. Dans les faits, c’est une autre histoire. Testé sur Cursor dans un cadre de développement réel, le modèle s’est montré non seulement paresseux, mais surtout atteint d’une cécité contextuelle qui le rend peu fiable.

Prenons un cas d’école, un bug des plus triviaux : un bouton de suppression qui ne répond plus. La cause, évidente pour tout développeur, était une simple décorrélation d’ID entre le HTML (id= »old-delete-btn ») et l’appel JavaScript qui gérait le clic (document.getElementById(‘delete-btn’)). La consigne pour Grok était pourtant simple : « Le bouton de suppression ne fonctionne pas, identifie le bug et corrige. »

Ce qui a suivi fut une démonstration presque comique. À la première tentative, Grok a bien posé le bon diagnostic. Mais sa correction fut unilatérale : il a modifié l’ID dans le fichier HTML, en ignorant le fichier JavaScript. Le bug, évidemment, persistait. Deuxième prompt. Grok modifie à nouveau l’ID du bouton, mais… toujours sans le faire correspondre au script. Il aura fallu le prendre par la main, lors d’un troisième prompt, pour qu’il daigne enfin modifier la bonne ligne dans le script. Trois interventions pour une correction qui aurait dû être atomique. À titre de comparaison, Claude 4 Opus ou Geminie 2.5 Pro identifient cette interdépendance et règlent le problème en une seule passe. On touche ici au cœur du problème : cette impression qu’il a du mal à suivre des consignes impliquant une vision globale, là où ses concurrents sont bien plus fiables.

On aurait pu espérer que ces itérations successives permettent au modèle de raffiner sa réponse, mais non. Chaque tentative semblait réinitialiser la réflexion, comme si Grok oubliait ses propres suggestions précédentes.

A lire également

iPhone 18 pro concept
Apple préparerait trois nouveaux iPhone pour le printemps 2027 : changement de calendrier historique ?
crowdstrike
CrowdStrike et AWS poussent la sécurité cloud dopée à l’IA : vers des SOC plus automatisés ?
nvidia
Nvidia contre une prise de participation de l’État américain dans les entreprises IA : Jensen Huang dit non

On pourrait être tenté de blâmer l’implémentation dans Cursor, mais ce serait trop facile. Ce sentiment d’un modèle sur-vendu, brillant sur les benchmarks mais décevant en pratique fait echo au premiers retours sur les forums. Sur le subreddit r/grok, des fils de discussion au titre sans équivoque comme « Grok 4 is shit for coding » abondent, décrivant des expériences où le modèle est jugé « la plupart du temps mauvais ». D’autres utilisateurs, comparant Grok à Claude 4 sur du code Rust, notent sa tendance à ignorer purement et simplement les instructions, confirmant cette incapacité à saisir le contexte global. Notre cas n’est donc pas isolé, il est visiblement symptomatique.

Et puis il y a ce détail important, qui achève de le disqualifier pour un usage professionnel. L’accès à la version “Heavy”, celle qui donne les meilleurs résultats selon xAI, coûte pas moins de 300 dollars par mois. Soit bien plus que Gemini Advanced ou Claude Pro. Or, cette version n’est même pas disponible via API actuellement, ce qui limite drastiquement son intérêt pour les développeurs. Bref, pour coder efficacement aujourd’hui sans casser sa tirelire ni perdre patience… mieux vaut regarder ailleurs.

En rédaction, un bond d’un an en arrière

Côté rédactionnel aussi, l’expérience n’est pas plus reluisante. Grok 4 n’a fait absolument aucun progrès en comparaison de son prédécesseur. Il intègre tous les tics de langage classiques des LLM… même ceux qu’on pensait avoir dépassés depuis GPT-3.5. Des formulations creuses (“il est important de souligner que…”), des mots-valises (« crucial », « déterminant », oui encore eux…), et surtout une incapacité à varier son ton malgré un prompting aux petits oignons.

On touche ici à une autre de ses faiblesses. Grok 4 a du mal à calibrer sa tonalité. Le style est soit trop académique, soit trop familier, souvent dans l’exagération, mais dans les deux cas, ça manque cruellement de naturel.

Et pourtant ce n’est pas faute d’avoir essayé ! En affinant les consignes prompt après prompt pour éviter justement ces automatismes langagiers trop visibles et révélateurs de sa nature artificielle… rien n’y fait. Le style de Grok 4 reste pompeux sans jamais trouver ce juste équilibre entre naturel et précision que maîtrisent beaucoup mieux GPT-4o ou Claude 4 et ce malgré toute la puissance calculatoire mobilisée derrière.

Q&A et résolution de problèmes complexes

Grok 4 - ARC AGI 2

Là où Grok 4 marque véritablement des points, c’est dans la résolution de problèmes abstraits et mathématiques poussés. Sur des benchmarks comme ARC AGI 2 et GPQA, il affiche des performances remarquables, presque deux fois supérieures aux modèles précédents selon certaines mesures internes (attention toutefois au biais évident dans le choix des benchmarks mis en avant par xAI).

En mathématiques pures, il ne se trompe quasiment jamais, même sur des équations différentielles ou des démonstrations logiques longues. C’est là que son architecture multi-agent prend tout son sens. Chaque agent propose une solution alternative puis ils convergent vers celle jugée la plus fiable. La prouesse technique est indéniable.

En revanche, cette efficacité se transforme en une lourdeur exaspérante dès qu’on passe à des questions factuelles simples. Le problème n’est pas l’exactitude mais la manière dont il la délivre. Posez-lui une question dont la réponse est un fait unique et établi, par exemple : « Qui a réalisé le film ‘Inception’ ? »

Sa réponse : « C’est une excellente question sur un film marquant du 21ème siècle. ‘Inception’, sorti en 2010, est un thriller de science-fiction qui explore les thèmes du rêve et de la réalité. Le réalisateur acclamé derrière ce projet complexe et visuellement impressionnant est le cinéaste britannico-américain Christopher Nolan. Il est également connu pour d’autres œuvres majeures comme la trilogie ‘The Dark Knight’ et ‘Interstellar’. » et beaucoup de blabla…

Un assistant efficace comme Claude ou Gemini répondrait sobrement en deux phrases. Fin de l’histoire. Grok 4, semble incapable d’une telle concision. Il délivre la bonne réponse, mais va l’ensevelir sous un flot de paroles inutiles. Cette tendance trop verbeuse rend Grok 4 exaspérant pour des recherches rapides.

Une promesse surestimée

Alors pourquoi tant de bruit autour de ce modèle ? La réponse tient autant aux chiffres qu’au marketing agressif orchestré par Musk et xAI. Il suffit de regarder comment sont présentées les performances. Des graphiques tronqués (axes Y non alignés), un cherry-picking assumé sur certains tests, oubliant commodément ceux où Grok se fait battre à plate couture (Live CodeBench entre autres).

Mais surtout parce que le marché a besoin d’y croire encore. Après GPT-4o qui a marqué un bond impressionnant en langage naturel et Claude 4 pour le raisonnement et ses prouesses en développement, aucun nouveau modèle n’a réellement bouleversé l’écosystème ces derniers mois. Plutôt qu’une véritable révolution, Grok 4 laisse plutôt le sentiment que les progrès plafonnent en matière d’IA générative. Même GPT-5 ne promet pas de nouveautés renversantes selon les premiers échos, mis à part une fusion entre GPT-4o et o3 avec quelques ajouts multimodaux supplémentaires.

Peut être que l’intelligence simulée atteint ses limites structurelles, car oui, on continue simplement de manipuler des probabilités statistiques déguisées en réponses intelligentes. Comme le rappelle souvent Yann LeCun, ces modèles ne sont pas conçus pour raisonner comme nous ; ils exploitent les motifs de notre langage avec une capacité prédictive hors norme. Ils remplaceront de nombreuses tâches, mais ne deviendront pas « intelligents » au sens fort tant qu’ils resteront dans ce cadre probabiliste.

Non, Grok 4 n’est pas « la prochaine grande chose ». C’est un modèle puissant sur le papier mais souvent maladroit dès qu’on lui demande quelque chose d’utile au quotidien. Un outil intéressant certes… mais très loin du miracle annoncé.

Pour l’instant donc, on fait avec ce qu’on a, en jonglant entre modèles complémentaires selon nos besoins spécifiques (Claude pour développer ; GPT-4o pour brainstormer ; Gemini quand on veut tester un long contexte). Aucun n’est parfait mais chacun a ses forces identifiables.

Quant à Grok 4… disons-le clairement, c’est un coup marketing réussi qui fait surtout prendre conscience que la superintelligence n’est pas pour demain.

Partager cet article
Facebook Whatsapp Whatsapp LinkedIn Reddit Telegram Copy Link

Derniers articles

Illustration conceptuelle d'un agent IA se désintégrant en particules géométriques dans un datacenter, symbolisant une fuite de données causée par une injection de prompt malveillante
Prompt injection : pourquoi les agents IA restent la cible n°1 en 2026
IA & Robotique Informatique & Cybersécurité Web & Internet
iphone 18 pro concept
Foxconn lance son recrutement massif pour produire l’iPhone 18 Pro avant septembre
Mobiles & Apps
rockstar gta
GTA 6 : le syndicat de Rockstar Games force la main du studio et réclame sa reconnaissance avant le lancement du jeu
Consoles & Jeux Vidéo
reddit google ai deal
Reddit et Google AI : quand l’accord à 60 millions de dollars se retourne contre tout le monde
IA & Robotique Web & Internet

Tendance

ios 27
iOS 27 en bêta publique : Siri dopé à l’IA arrive enfin sur iPhone
Mobiles & Apps
ios 27
iOS 27 bêta publique : date probable, iPhone compatibles et faut-il l’installer ?
Mobiles & Apps
gpt-5.6
GPT‑5.6 aurait “triché” pendant ses tests : faut-il encore croire aux benchmarks IA ?
IA & Robotique
GTA 6
GTA 6 : le gameplay se rapproche et Rockstar a déjà semé des indices partout
Consoles & Jeux Vidéo
Windows 11
Windows 11 démembre Phone Link : la synchronisation Android s’installe au cœur du système
Informatique & Cybersécurité Mobiles & Apps

Vous allez aussi aimer

Phantom MK1
Tech & Innovations

Phantom MK1 le robot humanoïde qui veut faire la guerre et marcher sur Mars

11 janvier 2026
Superintelligence
Tech & Innovations

ChatGPT pourrait devenir une superintelligence qui surpasse l’humanité d’ici 10 ans

23 mai 2023
Illustration éditoriale réaliste et moderne sur l’intelligence artificielle dans les réseaux sensibles de l’État : inter
Informatique & CybersécuritéTech & Innovations

IA et réseaux sensibles de l’État : pourquoi l’affaire Grok au Pentagone inquiète déjà Washington

16 mars 2026
Chatgpt
Tech & Innovations

ChatGPT Go à moins de 5 $ : OpenAI en quête de rentabilité en Inde, son deuxième marché

19 août 2025
AGI - Artificial General Intelligence
Tech & Innovations

AGI / IA Forte : tout savoir sur l’Intelligence Artificielle Générale

19 septembre 2023
ia vole propriété intellectuelle
IA & RobotiqueTech & Innovations

L’intelligence artificielle a-t-elle volé les créateurs ? Le procès du copyright s’enflamme

16 juin 2026
OpenAI
Tech & Innovations

OpenAI : vers une faillite probable selon les analystes de HSBC

20 janvier 2026
Microsoft Autodev
Tech & Innovations

Microsoft dévoile Autodev, un framework de développement entièrement autonome

22 mars 2024

Infos légales

  • Mentions légales
  • Politique de confidentialité
  • Nous contacter
  • Partenaires

Maj récentes

google ai mode
AI Mode de Google débarque en France : le trafic des éditeurs de sites web menacé de s’effondrer
IA & Robotique Web & Internet
ollama
Qu’est-ce qu’Ollama ? Tout savoir sur ce moteur d’IA locale
IA & Robotique
GTA 6
GTA 6 : comment Leonida repousse les lois de la géométrie vidéoludique sans recourir à l’intelligence artificielle
Consoles & Jeux Vidéo IA & Robotique
Claude Fable 5 vs GPT-5.6 Sol : le duel des deux LLM frontière décortiqué benchmark par benchmark
IA & Robotique

Qui sommes nous ?

Le Journal du Web alias JDW a été fondé et est édité par des passionnés par l’univers web, nouvelles technologies et de la culture populaire.

Newsletter
Inscrivez-vous à notre newsletter pour recevoir nos derniers articles!
Suivez-nous
Welcome Back!

Sign in to your account

Username or Email Address
Password

Mot de passe oublié ?