JDWJDW
Font ResizerAa
  • Tech & Innovations
  • Mobiles & Apps
  • IA & Robotique
  • Consoles & Jeux Vidéo
  • Films & Séries
  • Animes & Mangas
  • Geek & Gadgets
  • Bons plans & promos
  • Plus
    • Blockchain & Crypto
    • Web & Internet
    • Informatique & Cybersécurité
    • Sciences & Espace
    • Réseaux Sociaux & Influence
    • e-Business & Webmarketing
    • Fintech & Néobanques
    • Streaming & P2P
Font ResizerAa
JDWJDW
Rechercher
  • Web & Internet
  • Tech & Innovations
  • Mobiles & Apps
  • Consoles & Jeux Vidéo
  • Films & Séries
  • Animes & Mangas
  • Blockchain & Crypto
  • Geek & Gadgets
  • Informatique & Cybersécurité
  • Streaming & P2P
Avez-vous déjà un compte ? Sign In
Suivez-nous
IA & Robotique

GLM-5.3-Flash : Z.ai lâche dans la nature un monstre multimodal de 320 milliards de paramètres sous licence MIT

Robin Prigent
Published: 27 août 2026
Last updated: 27 août 2026
Partager
GLM-5.3-Flash, modèle multimodal open source de Z.ai, concept sur fond techno sombre

Z.ai a confirmé le 26 août 2026 que le mystérieux modèle Ox Alpha, apparu anonymement sur OpenCode et OpenRouter six jours plus tôt, était en réalité le GLM-5.3-Flash, premier modèle nativement multimodal de la série GLM-5, désormais disponible en poids ouverts sous licence MIT sur HuggingFace.

Pendant une semaine entière, des développeurs ont disséqué le tokenizer, lancé des analyses de compression, remonté la piste jusqu’à la famille GLM du groupe Zhipu… sans qu’aucun nom officiel ne soit jamais apposé. Le modèle, gratuit, doté d’une fenêtre de contexte d’un million de tokens et capable d’ingérer texte, images et vidéo, est devenu en quelques jours le plus populaire de la semaine sur OpenRouter. Et tout ce trafic tournait sur des puces chinoises, et non sur du matériel NVIDIA.

320 milliards de paramètres au total, 18 milliards activés par token, 45 couches (contre 92 pour le GLM-4.5). La fiche technique du GLM-5.3-Flash raconte une obsession architecturale pour l’inférence bon marché. Z.ai a volontairement sacrifié profondeur et largeur au profit d’une forme facile à servir, puis a compensé par un corpus d’entraînement multimodal de 30 000 milliards de tokens et une innovation baptisée Manifold-Constrained Hyper-Connections (mHC) censée muscler l’efficacité de mise à l’échelle. Le résultat, selon les benchmarks publiés par l’éditeur, tutoie les performances de Claude Opus 4.8 en codage tout en coûtant environ un dixième du prix de son grand frère GLM-5.3.

L’architecture hybride qui mêle attention sparse et attention linéaire constitue sans doute la brique la plus ambitieuse du projet. L’attention linéaire modélise les dépendances locales via un mécanisme d’état, tandis que l’attention sparse va chercher le contexte global pertinent à travers un indexeur léger. Pour dompter la latence à un million de tokens, Z.ai a introduit IndexPool, qui compresse quatre vecteurs-clés d’indexation en un seul par pooling pondéré. La facture comparée avec le GLM-5.3 plein format donne le vertige : calcul d’attention divisé par 3, taille du KV cache réduite d’un facteur 4,4. Sur le premier critère, GLM-5.3-Flash affiche la consommation la plus basse du lot face à DeepSeek-V4-Flash et Kimi-K3, même si son cache reste légèrement plus volumineux que celui de ces deux rivaux.

A lire également

Concept : puce d'inférence Jalapeño d'OpenAI, logo officiel OpenAI avec le nom du modèle sur fond sombre techno
OpenAI Jalapeño : la puce d’inférence maison pulvérise les benchmarks du GB300 de Nvidia à Hot Chips 2026
Robotaxi Waymo de nuit sur le Strip de Las Vegas, avec logo Waymo
Waymo dévoile sa puce 5nm taillée pour le temps réel et lance ses robotaxis sur Las Vegas, San Diego et au-delà
Concept : logo officiel NVIDIA sur fond techno sombre, réseaux neuronaux et GPU, illustration de l'investissement de 6 milliards de dollars dans Poolside pour un modèle open-weight rival d'OpenAI et DeepSeek
Nvidia s’offre la technologie de Poolside pour 6 milliards de dollars et part en guerre ouverte contre OpenAI et DeepSeek

Les chiffres de performance avancés par Z.ai sur six benchmarks de codage et d’agents autonomes montrent une progression franche par rapport au GLM-5.2, notamment 63,4 contre 46,2 sur DeepSWE v1.1 et 48,8 contre 26,2 sur AutomationBench (où le modèle devance même GPT-5.6 Terra et Claude Opus 4.8). Sur le propre banc d’essai de l’entreprise (Z.ai Code Bench v1.0, exécuté dans Claude Code 2.1.207), le GLM-5.3-Flash atteint 29,0 à effort maximal contre 29,5 pour Opus 4.8. La vision, elle, brille sur l’analyse de documents et de graphiques (62,4 sur OfficeQA Pro, loin devant les 48,9 d’Opus 4.8 et les 57,9 de DeepSeek-V4-Vision-Exp) mais fléchit franchement sur la compréhension vidéo brute, avec un score de 53,4 sur BabyVision face aux 70,9 de Gemini 3.7 Flash. Il faut évidemment garder à l’esprit que ces résultats sont exclusivement ceux du constructeur, aucune vérification indépendante n’ayant encore été publiée.

La capacité multimodale native ouvre un champ que les modèles texte pur ne pouvaient pas couvrir, celui du codage visuel en boucle fermée. Quand un LLM génère du code frontend, les bugs les plus traîtres sont visuels, un composant désaligné, un layout cassé, une interaction qui ne plante qu’au rendu. GLM-5.3-Flash a été entraîné avec des pipelines de synthèse de données fondés sur le jugement visuel autonome, où le modèle interagit avec un environnement, inspecte sa propre sortie rendue et la corrige itérativement. L’apprentissage par renforcement avec retour d’environnement et la vérification par agent ancré dans des flux utilisateur réels prolongent cette logique jusqu’au développement 3D dans Blender et à l’automatisation de navigateurs web.

L’infrastructure de service déployée pendant la semaine Ox Alpha nous donne aussi des enseignement techniques. Z.ai a fait tourner l’intégralité du trafic sur un cluster de puces d’IA chinoises, contraintes en mémoire et en bande passante. La société a ensuite construit un moteur d’inférence dédié sur SGLang avec quantification W8A8, cache hybride INT8/FP8/BF16, architecture désagrégée Encode-Prefill-Decode ainsi qu’un agent d’infrastructure propulsé par GLM-5.3 qui a aidé les ingénieurs à développer des noyaux de calcul et à diagnostiquer les goulets d’étranglement. Le modèle a optimisé lui même le système qui le sert… Le gain annoncé atteint un facteur 3 en performance de bout en bout par rapport à la ligne de base initiale, avec un coût par token décrit comme comparable à celui des GPU NVIDIA grand public.

Côté tarification, GLM-5.3-Flash s’affiche à 0,15 dollar par million de tokens en entrée et 0,50 dollar en sortie (0,03 dollar pour l’entrée en cache), soit environ dix fois moins que GLM-5.3 standard facturé 1,40/4,40 dollars. Le GLM Coding Plan offre un quota trois fois supérieur à celui du modèle précédent au même tarif, et la consommation hors heures de pointe (week-ends compris) ne pèse que 50 % des points standard. Les poids sont téléchargeables sur HuggingFace sous l’identifiant zai-org/GLM-5.3-Flash, compatibles SGLang, vLLM et TokenSpeed.

Un modèle open source à licence MIT de cette envergure, multimodal natif, avec un contexte d’un million de tokens et des performances de codage qui frôlent celles des modèles fermés les plus chers, impose à chaque fournisseur d’API de justifier ses prix. Z.ai affirme déjà que les leçons tirées du GLM-5.3-Flash alimentent son prochain modèle frontière… et vu la cadence de publication du groupe Zhipu depuis un an, le prochain coup de théâtre pourrait bien arriver avant que quiconque ait fini d’évaluer celui-ci.

Partager cet article
Facebook Whatsapp Whatsapp LinkedIn Reddit Telegram Copy Link

Derniers articles

PlayStation Plus Monthly Games de septembre 2026 : Sniper Elite Resistance, MLB The Show 26 et Wobbly Life
PlayStation Plus septembre 2026 : Sniper Elite Resistance, MLB The Show 26, Wobbly Life et Chained Echoes offerts aux abonnés
Consoles & Jeux Vidéo
Concept cyberattaque d'État : le Capitole et la Réserve fédérale américains reliés par un réseau rouge de données, cadenas numérique, illustrant la campagne de cyberespionnage chinois
Espionnage chinois aux États-Unis : des hackers ont ciblé le DOJ, la NASA, la Fed et le Sénat pendant huit ans
Informatique & Cybersécurité
Samsung Galaxy Watch 8 avec l'interface One UI 9 Watch sur fond bleu nuit, programme bêta de Wear OS 7
One UI 9 Watch : la bêta officielle de Wear OS 7 débarque enfin sur les Galaxy Watch 8
Geek & Gadgets
Le télescope spatial Nancy Grace Roman de la NASA, rendu officiel contre une toile de fond cosmique liée à l'énergie noire
Le télescope spatial Nancy Grace Roman décollera le 30 août 2026 pour traquer l’énergie noire depuis le point de Lagrange L2
Sciences & Espace

Tendance

Logo Anthropic avec le nom Claude au centre, concept de systèmes multi-agents IA sur fond techno sombre, illustration du rapport sur les sabotages entre agents
Les IA ont des réflexes de survie, mentent et falsifient les données : Anthropic révèle l’ampleur des sabotages dans les systèmes multi-agents
IA & Robotique
GTA 6, artwork officiel de Rockstar avec les protagonistes Lucia et Jason
GTA 6 : des vidéos de gameplay et la carte on fuité. Cette fois c’est pas de l’IA
Consoles & Jeux Vidéo
Concept d'une montre connectée Garmin mesurant la glycémie non invasive au poignet grâce à un capteur optique
Garmin dévoile un brevet pour mesurer la glycémie au poignet et relance la course contre Apple
Geek & Gadgets
Rendu concept de la première smartwatch transparente Nothing
Nothing prépare sa première smartwatch transparente pour septembre 2026, sous les 300 dollars
Geek & Gadgets
Robot humanoïde type Tesla Optimus dans un hall industriel futuriste, production à grande échelle
Tesla Optimus : premières ventes repoussées à 2027, la mue spectaculaire de Fremont s’accélère
IA & Robotique

Vous allez aussi aimer

Manifeste The Future is for Everyone de Mark Zuckerberg pour une IA libre et ouverte, symbole infini Meta sur fond techno bleu nuit
IA & Robotique

Mark Zuckerberg lance un manifeste de 6 500 mots pour une superintelligence personnelle offerte à chaque humain

23 août 2026
Concept : racks de serveurs IA Nvidia avec GPU et mémoire HBM dans un data center, éclairage LED vert, illustration de la hausse des prix des accélérateurs IA
IA & Robotique

Nvidia alerte ses clients : les serveurs IA vont coûter plus de 15 % plus cher début 2027

23 août 2026
Robots humanoïdes en pleine course sur la piste de 100 mètres lors des World Humanoid Robot Games de Pékin, où le robot Lightning d'Honor a pulvérisé le record d'Usain Bolt en 9,32 secondes
IA & Robotique

Un robot pulvérise le record du 100 mètres d’Usain Bolt aux Jeux mondiaux de robots humanoïdes de Pékin

23 août 2026
Robot humanoïde exposé dans les allées de la World Robot Conference 2026 à Pékin
IA & Robotique

World Robot Conference 2026 : Pékin déroule le tapis rouge à plus de 300 entreprises et affirme sa suprématie sur les humanoïdes

21 août 2026
Logo MiniMax avec le nom du studio MiniMax Design sur fond techno abstrait sombre
IA & Robotique

MiniMax Design transforme le modèle vidéo H3 en studio de production agentique

21 août 2026
Robot humanoïde Unitree Superman en plein saut de deux mètres, visuel officiel du fabricant
IA & Robotique

Unitree enflamme le Star Market de Shanghai : l’IPO du robot acrobate s’envole de plus de 600 %

19 août 2026
Concept d'un réseau de neurones lumineux ascendant, modèle open-weight GLM-5.3 de Z.ai
IA & Robotique

GLM-5.3 : Z.ai lâche son modèle open-weight au prix de la version précédente et talonne Kimi K3 au sommet des classements

19 août 2026
Visuel officiel OpenAI : contrôles parentaux de ChatGPT pour les 13-17 ans, avec comptes liés, Quiet hours et Study Mode
IA & Robotique

ChatGPT ouvre ses portes aux ados : OpenAI déploie un arsenal de contrôles parentaux pour les 13-17 ans

19 août 2026

Infos légales

  • Mentions légales
  • Politique de confidentialité
  • Nous contacter
  • Partenaires

Maj récentes

Tesla Model Y
Tesla Model Y : Prix, performances, autonomie… Tout savoir sur le SUV électrique
Tech & Innovations
Concept iOS 27 bêta 7 : grand carré glassmorphism centré avec le chiffre 27 et bêta 7 en dessous, sur fond dégradé indigo à cyan
iOS 27 bêta 7, macOS Golden Gate, Siri IA sur liste d’attente : Apple accélère à deux semaines de la keynote
Mobiles & Apps
Interface WhatsApp Passkeys affichant plusieurs clés d'accès enregistrées sur un même compte
WhatsApp autorise désormais plusieurs passkeys par compte, le milliard d’utilisateurs n’attendait que ça
Mobiles & Apps
Photo officielle de la Renault 5 E-Tech 2026, couleurs revues et nouvelle version LFP d'entrée de gamme
Renault 5 E-Tech 2026 : autonomie en hausse sur toute la gamme et nouvelle version LFP d’entrée de gamme pour contrer la Peugeot e-208
Tech & Innovations

Qui sommes nous ?

Le Journal du Web alias JDW a été fondé et est édité par des passionnés par l’univers web, nouvelles technologies et de la culture populaire.

Newsletter
Inscrivez-vous à notre newsletter pour recevoir nos derniers articles!
Suivez-nous
Welcome Back!

Sign in to your account

Username or Email Address
Password

Mot de passe oublié ?