JDWJDW
Font ResizerAa
  • Tech & Innovations
  • Mobiles & Apps
  • IA & Robotique
  • Consoles & Jeux Vidéo
  • Films & Séries
  • Animes & Mangas
  • Geek & Gadgets
  • Véhicules & e-Mobilité
  • Bons plans & promos
  • Plus
    • Blockchain & Crypto
    • Web & Internet
    • Informatique & Cybersécurité
    • Sciences & Espace
    • Réseaux Sociaux & Influence
    • e-Business & Webmarketing
    • Fintech & Néobanques
    • Streaming & P2P
Font ResizerAa
JDWJDW
Rechercher
  • Web & Internet
  • Tech & Innovations
  • Mobiles & Apps
  • Consoles & Jeux Vidéo
  • Films & Séries
  • Animes & Mangas
  • Blockchain & Crypto
  • Geek & Gadgets
  • Informatique & Cybersécurité
  • Streaming & P2P
Avez-vous déjà un compte ? Sign In
Suivez-nous
Tech & Innovations

Qu’est ce que ARC AGI, le benchmark qui mesure la véritable intelligence des IA ?

Raphael Gelin
Published: 17 juillet 2025
Last updated: 18 juillet 2025
Partager
ARC AGI
Sommaire
  • Un benchmark pour mesurer l’intelligence fluide
  • Pourquoi ARC-AGI-2 ?
  • Trois faiblesses clés chez les IA actuelles
  • Une compétition ouverte

Si les systèmes d’IA accomplissent des prouesses dans des domaines ciblés, ils échouent encore à démontrer une capacité véritablement générale à raisonner, apprendre et s’adapter comme le ferait un humain. C’est précisément pour sonder ce fossé que le benchmark ARC-AGI a vu le jour en 2019. Sa deuxième version, ARC-AGI-2, vient tout juste d’être lancée, avec l’ambition de mieux cerner les limites actuelles des modèles d’IA dits « frontière », ces systèmes à la pointe du progrès technologique.

Mais que mesure-t-on vraiment lorsqu’on parle d’intelligence artificielle générale ? Et pourquoi a-t-on besoin d’un nouveau benchmark si le précédent semblait déjà très exigeant ? En fait, malgré les efforts déployés depuis cinq ans autour d’ARC-AGI-1, les progrès rapides de l’IA ont mis en évidence ses lacunes. Les tâches proposées ne suffisent plus à discriminer finement les capacités cognitives émergentes de ces systèmes. D’où l’apparition d’ARC-AGI-2, un corpus repensé pour évaluer non seulement la performance brute, mais surtout la flexibilité mentale et la capacité à généraliser face à l’inattendu.

Un benchmark pour mesurer l’intelligence fluide

Contrairement aux tests classiques qui évaluent des compétences précises ou apprises (comme résoudre une équation ou traduire un texte), ARC-AGI se concentre sur ce que certains appellent intelligence fluide (ou Fluid Intelligence). Il s’agit ici de tester la capacité à raisonner de manière abstraite, sans dépendre de connaissances culturelles ou spécifiques. Pour cela, chaque tâche est conçue pour être résoluble par des humains sans formation particulière, mais difficilement attaquable par des IA entraînées sur de vastes jeux de données.

C’est François Chollet, chercheur chez Google et créateur de Keras, qui a introduit ce concept dans son essai “On the Measure of Intelligence”. Selon lui, il faut sortir du piège des performances superficielles, celles que l’on peut “acheter” via des données massives, pour se concentrer sur la vitesse d’acquisition de nouvelles compétences. Plus simplement, un système intelligent n’est pas celui qui sait beaucoup de choses, mais celui qui apprend rapidement avec peu d’informations.

A lire également

Atlas 1.0, le wearable EEG posé derrière l'oreille qui suit l'activité cérébrale en continu
Atlas 1.0 : le wearable EEG à 499 dollars qui cartographie votre cerveau ouvre ses précommandes
BYD Denza N8L, grand SUV électrique 6 places de 5,20 m, photo officielle du constructeur en extérieur
BYD Denza N8L électrique : le SUV 6 places qui repousse les limites avec 960 km d’autonomie
Leapmotor B05, compacte électrique cinq étoiles ANCAP et Euro NCAP
Leapmotor B05 décroche cinq étoiles ANCAP et Euro NCAP : la compacte chinoise double la mise sur la sécurité

ARC-AGI repose donc sur le principe de limiter les tâches aux « core knowledge priors », c’est-à-dire aux structures cognitives que tout humain possède naturellement (comme reconnaître une symétrie ou comprendre qu’un objet continue d’exister même hors champ visuel). Ainsi, on élimine les biais liés au bagage culturel ou linguistique.

Une IA ne peut pas tricher en exploitant une base de données, elle doit réellement raisonner.

Pourquoi ARC-AGI-2 ?

Si ARC-AGI-1 a marqué une rupture dans l’évaluation des IA, il a aussi montré ses limites. Trop souvent, certaines tâches pouvaient être abordées par force brute ou par reconnaissance statistique sans réelle compréhension du problème posé. Avec ARC-AGI-2, les concepteurs ont voulu aller plus loin en complexifiant subtilement les règles implicites et en rendant chaque tâche moins « brute-forceable ».

Le nouveau corpus inclut donc davantage de variations et introduit des niveaux supplémentaires de difficulté cognitive. Chaque tâche est inédite et ne peut être mémorisée à l’avance (ce point est resté inchangé). Surtout, elles exigent désormais que plusieurs règles soient combinées simultanément, ce que même les meilleurs systèmes peinent encore à faire correctement.

Par ailleurs, ARC-AGI-2 introduit une nouveauté importante : la collecte systématique de données humaines lors des tests publics et privés. L’idée est de comparer directement les résultats obtenus par des humains avec ceux fournis par les IA testées sur exactement les mêmes problèmes. On obtient alors un signal beaucoup plus riche (« plus de bande passante ») permettant d’évaluer finement où se situe encore le gouffre entre cognition humaine et artificielle.

Trois faiblesses clés chez les IA actuelles

Les premiers résultats issus d’ARC-AGI-2 confirment que certaines formes de raisonnement restent largement hors de portée pour nos machines actuelles. L’une des difficultés récurrentes concerne ce que le rapport technique appelle « l’interprétation symbolique ».

Autrement dit, comprendre qu’un symbole représente quelque chose au-delà de sa forme visuelle (une intention, une règle implicite…). Là où un humain attribue spontanément du sens à une figure géométrique selon son agencement contextuel, une IA a tendance à rester bloquée au niveau perceptif.

L’Autre talon d’Achille des modèles IA est le raisonnement compositionnel. Il s’agit ici d’appliquer plusieurs règles en même temps ou successivement, parfois avec interaction entre elles, pour résoudre une tâche donnée. Les systèmes testés réussissent assez bien quand il n’y a qu’une seule règle globale… mais dès que deux contraintes s’entrecroisent (par exemple ordre + couleur), leur performance chute drastiquement.

Enfin, malgré leurs capacités impressionnantes en traitement massif d’informations, ces systèmes montrent encore peu de flexibilité cognitive face aux situations nouvelles ou ambiguës. Ils peinent à généraliser lorsqu’il faut inférer une règle implicite jamais vue auparavant. En cela, ils révèlent clairement leurs limites en matière d’adaptation rapide, pourtant considérée comme l’essence même de l’intelligence selon Chollet.

Une compétition ouverte

Pour stimuler la recherche et attirer davantage de talents vers ces questions difficile pour l’avenir de l’IA générale, ARC Prize Foundation a lancé une compétition autour du benchmark ARC-AGI-2. Avec un prix total annoncé à hauteur d’un million de dollars US (!), elle espère susciter un regain d’intérêt scientifique sur ces thématiques encore marginalisées par rapport aux benchmarks classiques orientés vers la performance brute.

La compétition est structurée autour de trois ensembles distincts de tâches , publique, semi-publique et privée, chacun calibré pour maintenir une difficulté comparable entre groupes tout en évitant toute fuite possible via surapprentissage ou reverse engineering. Le but n’est pas uniquement qu’un modèle atteigne un score élevé sur un sous-groupe donné… mais qu’il démontre une robustesse généralisable sur tous types de tâches proposées.

Plus largement, ce type d’initiative montre que mesurer efficacement notre progression vers l’AGI passe nécessairement par des outils adaptés. Des benchmarks comme ImageNet ou GLUE ont permis des bonds qualitatifs dans leurs domaines respectifs. ARC-AGI pourrait jouer ce même rôle pour le raisonnement abstrait automatisé, si tant est que nous sachions interpréter correctement ses signaux faibles.

Partager cet article
Facebook Whatsapp Whatsapp LinkedIn Reddit Telegram Copy Link

Derniers articles

Concept Siri AI : assistant bloqué sur iPhone dans l'Union européenne (DMA) avec panneau interdit, mais disponible sur Mac, bêta en octobre
Siri AI et Apple Intelligence : l’Europe attend encore, l’iPhone 17 partiellement incompatible
IA & Robotique Mobiles & Apps
Panorama Apple automne 2026 : iPhone pliable en héros, entouré d'iPhone, Apple Watch, AirPods et MacBook, logo Apple avec le wordmark APPLE
Keynote Apple : iPhone Duo, 18 Pro, Apple Watch et AirPods… on fait le récap de toutes les annonces
Mobiles & Apps
Rendu officiel de la fusée SpaceX Falcon 9 avec son logo, illustrant l'article sur l'étage supérieur qui s'est écrasé sur la Lune
Lancement SpaceX : après dix jours de calme, un Falcon 9 décolle ce dimanche à Cape Canaveral
Sciences & Espace
Drone CHUBORY F89 bleu ardoise avec détails dorés, en vol sur fond clair, mise en valeur premium sans badge promo
De 210 € à 99 € sur Amazon, le drone pour débutant CHUBORY F89 et ses 3 batteries cassent les prix du marché
Bons plans & promos

Tendance

Logo Anthropic avec le nom Claude au centre, concept de systèmes multi-agents IA sur fond techno sombre, illustration du rapport sur les sabotages entre agents
Les IA ont des réflexes de survie, mentent et falsifient les données : Anthropic révèle l’ampleur des sabotages dans les systèmes multi-agents
IA & Robotique
GTA 6, artwork officiel de Rockstar avec les protagonistes Lucia et Jason
GTA 6 : des vidéos de gameplay et la carte on fuité. Cette fois c’est pas de l’IA
Consoles & Jeux Vidéo
Concept d'une montre connectée Garmin mesurant la glycémie non invasive au poignet grâce à un capteur optique
Garmin dévoile un brevet pour mesurer la glycémie au poignet et relance la course contre Apple
Geek & Gadgets
Robot humanoïde type Tesla Optimus dans un hall industriel futuriste, production à grande échelle
Tesla Optimus : premières ventes repoussées à 2027, la mue spectaculaire de Fremont s’accélère
IA & Robotique
Castle Walls, première série entièrement générée par intelligence artificielle sur Prime Video, visuel officiel du studio Ay Yapım
Prime Video diffuse Castle Walls, la première série au monde entièrement fabriquée par IA
Films & Séries

Vous allez aussi aimer

Concept Tesla en Europe : Model Y blanc sur une route qui se divise, skyline européenne (Big Ben, Tour Eiffel, Porte de Brandebourg) et wordmark TESLA, illustrant des ventes à deux vitesses selon les pays
Tech & Innovations

+279 % sur un an en France, -79 % en Norvège : l’incroyable paradoxe des ventes de Tesla en Europe

6 septembre 2026
Audacity 4.0, logo officiel et nouvelle interface audio
Tech & Innovations

Audacity 4 : l’éditeur audio gratuit le plus téléchargé au monde entre dans une nouvelle ère

5 septembre 2026
Rendu conceptuel du stellarator Infinity One de Type One Energy, première centrale à fusion nucléaire commerciale aux États-Unis
Tech & Innovations

Première licence commerciale de fusion nucléaire : le Tennessee ouvre la voie avec le stellarator de Type One Energy

1 septembre 2026
Le réacteur à fusion SPARC de Commonwealth Fusion Systems, tokamak compact en cours d'assemblage dans son hall industriel, anneau de plasma visible
Tech & Innovations

Fusion nucléaire : SPARC atteint 80% d’achèvement, CFS empoche 1 milliard de plus et bouscule le calendrier

25 août 2026
Tesla solar panels installes sur le toit d une maison, avec une Tesla garee dans l allee
Tech & InnovationsVéhicules & e-Mobilité

Tesla enterre le Solar Roof et parie 10,1 milliards de dollars sur une usine solaire texane

21 août 2026
Tesla Semi, camion électrique de Tesla sur autoroute
Tech & Innovations

Einride commande 500 Tesla Semi et s’offre la plus grande flotte de camions électriques au monde

19 août 2026
XPeng P7+, berline électrique, image officielle du constructeur
Tech & Innovations

XPeng franchit le cap des 6 000 livraisons en France et pulvérise ses records à l’export

18 août 2026
Photo officielle de la Xiaomi SU7, berline électrique du constructeur chinois, face à la mer
Tech & Innovations

Xiaomi SU7 : 500 000 berlines électriques livrées en 28 mois, un record qui masque des turbulences

17 août 2026

Infos légales

  • Mentions légales
  • Politique de confidentialité
  • Nous contacter
  • Partenaires

Maj récentes

Samsung Galaxy Watch Ultra 2025 titane gris avec bracelet orange, en lévitation sur fond clair avec halo orange, mise en valeur premium sans badge promo
Galaxy Watch Ultra 2025 : son prix s’effondre à 304 € avec ce coupon (au lieu de 529 € en boutique officielle)
Bons plans & promos
Samsung Galaxy Watch 4 Classic en héros sur fond sombre premium avec halo ambré, fin de support annoncée
Galaxy Watch 4 : Samsung coupe les mises à jour des montres qui ont ressuscité Wear OS
Geek & Gadgets
Key art officiel de la collaboration PUBG Battlegrounds x Jujutsu Kaisen avec Yuji Itadori, Megumi Fushiguro, Satoru Gojo et Nobara Kugisaki en avatars PUBG
PUBG x Jujutsu Kaisen : skins, armes évolutives et Erangel transformé dans la mise à jour de septembre
Animes & Mangas
Samsung Galaxy Watch8 Classic en lévitation sur fond clair, mise en valeur premium sans badge promo
Galaxy Watch 8 Classic à 299 € au lieu de 529 € : chute de prix massive chez Samsung sur Amazon
Bons plans & promos Geek & Gadgets

Qui sommes nous ?

Le Journal du Web alias JDW a été fondé et est édité par des passionnés par l’univers web, nouvelles technologies et de la culture populaire.

Newsletter
Inscrivez-vous à notre newsletter pour recevoir nos derniers articles!
Suivez-nous
Welcome Back!

Sign in to your account

Username or Email Address
Password

Mot de passe oublié ?