MiniMax et fal.ai ont rendu disponible cette semaine H3 Max, un modèle de génération vidéo capable de produire un clip de 5 secondes en 768P en moins de 3 secondes, soit un ratio de vitesse supérieur à celui de la lecture elle-même. L’action MiniMax a grimpé de 19 % en séance, portée par l’onde de choc d’une mise à jour qui repositionne le champion chinois de la vidéo générative au sommet des classements.
Le modèle, post-entraîné par fal.ai à partir des poids ouverts de MiniMax H3, est proposé en deux résolutions (480P et 768P) pour des clips de 5 à 15 secondes, avec prise en charge du texte-vers-vidéo et de l’image-vers-vidéo. Le mode first-and-last-frame permet de fixer une image d’ouverture, une image de clôture, ou les deux, puis de laisser le modèle animer la transition entre elles. La génération par référence vidéo est annoncée pour bientôt. Chaque clip revient avec un audio natif synchronisé, foley et ambiance compris, généré dans la même passe que l’image.
Design Arena attribue désormais à H3 Max un Elo de 1 341 sur son classement image-vers-vidéo, devant le modèle de base H3 (1 333) et tous les concurrents référencés. Artificial Analysis le place également premier avec audio, à un Elo de 1 201 sur 2 177 échantillons. Le gain de vitesse est tout aussi frappant… Un clip de 15 secondes en 768P sort en environ 15 à 18 secondes là où Seedance 2.5, testé dans les mêmes conditions communautaires, demandait près de 5 minutes pour un résultat en 1080P.
La tarification suit un modèle à la consommation, facturé à la seconde de vidéo produite, notamment 0,05 $ par seconde en 480P et 0,08 $ en 768P. Un clip de 15 secondes en haute résolution coûte donc 1,20 $ au tarif catalogue. fal.ai propose par ailleurs cinq générations gratuites par jour sans inscription, avec cinq supplémentaires pour les utilisateurs connectés. Le tout accessible via l’API asynchrone de MiniMax ou directement depuis l’interface web de fal.ai.
L’architecture de H3 Max reflète une philosophie que fal.ai résume en deux temps. La qualité d’abord puis la vitesse poussée aussi loin que possible sans compromettre le résultat. Le moteur d’inférence a été co-conçu avec le post-entraînement plutôt que greffé après coup, ce qui explique en partie le facteur ×35 de débit revendiqué par rapport à l’endpoint officiel de MiniMax H3. Le renforcement par apprentissage vérifiable (verifiable RL) et l’injection de données ciblées sur l’adhérence au prompt et l’esthétique complètent le dispositif.
Plusieurs zones d’ombre subsistent malgré l’enthousiasme du marché à savoir : le compteur de paramètres, le jeu de données d’entraînement et la recette de post-entraînement n’ont pas été publiés. Les poids de H3 Max (contrairement à ceux de H3, ouvertement diffusés) ne sont pas encore confirmés en téléchargement libre. Et le plafond de résolution reste fixé à 768P, là où le H3 standard monte à 2K.
Qui prétendait que la vidéo générative resterait cantonnée aux délais de rendu de plusieurs minutes ? MiniMax et fal.ai viennent d’installer un nouveau seuil, celui où la machine fabrique l’image avant même que l’œil n’ait fini de regarder la précédente.
Démonstration en vidéo

