Fini d’attendre devant une barre de progression pour récupérer un malheureux fichier MP4 figé de quatre secondes. Dans un communiqué publié le 22 septembre et diffusé largement le lendemain, PixVerse a levé le voile sur son architecture R2 pour transformer la vidéo générative en monde explorable.
Déployée sans surcoût auprès des 150 millions d’utilisateurs de la plateforme répartis dans 177 pays sur world.pixverse.video, cette technologie met fin au visionnage passif. Vous prenez les commandes avec les touches ZQSD (ou WASD selon votre configuration) et les flèches du clavier pour naviguer à travers un flux visuel calculé à la volée. L’univers réagit en pleine lecture dès que vous tapez un nouveau prompt ou glissez une consigne vocale au micro. Les habitués des anciennes techniques pour maîtriser PixVerse AI et ses mouvements de caméra découvrent désormais un système où l’angle de prise de vue obéit au quart de tour à chaque frappe sur le clavier.
Fondée en avril 2023, la jeune pousse s’appuie sur de solides réserves financières après une extension de série C bouclée en juillet 2026. Ce tour de table a hissé ses levées totales à 439 millions de dollars pour une valorisation dépassant les deux milliards, lui accordant le statut convoité de licorne.
Cette manne financière accélère le développement du modèle Omni Causal AR (qui exploite une logique autorégressive prédisant les trames suivantes, sans lien avec la réalité augmentée). Les chercheurs ont abandonné leur ancien protocole articulé en cinq étapes successives au profit d’un processus en deux temps, associant l’apprentissage de la physique spatiale et sa distillation. Sur le plan de la réactivité, le module Dynamic Chunk Generation module la taille des paquets d’images selon vos actions.
Presser une commande de déplacement génère des fragments très courts pour garantir un temps de réponse immédiat, tandis qu’une modification textuelle plus lourde demande un temps de calcul étendu afin de stabiliser le plan. Pour éviter que la scène ne se décompose au fil des minutes comme sur les générateurs traditionnels… R2 combine trois couches de mémoire. La mémoire Sink Memory verrouille les lois physiques du décor, l’historique glissant (Rolling History) préserve la continuité des mouvements immédiats, et une mémoire d’objets maintient l’apparence des éléments pérennes. En renfort, le module Error Bank stocke les bugs graphiques passés pour apprendre au réseau neuronal à corriger ses dérapages avant qu’ils ne polluent la séquence, réduisant de 35,8% la dérive visuelle lors des sessions prolongées.
Le cofondateur et président-directeur général de PixVerse, Changhu Wang, résume cette rupture architecturale : « Les grands modèles linguistiques ont prouvé que la montée en charge constitue une voie éprouvée vers la performance. R2 démontre qu’avec une architecture adaptée, un modèle de monde peut gagner en puissance sans abandonner l’interaction en temps réel. »
PixVerse explore ainsi la frontière entre jeu vidéo et génération visuelle, en transformant le créateur en véritable pilote de son environnement. Pour autant, les virages trop brusques et les changements d’angles rapides laissent encore apparaître quelques bavures d’interpolation. Une piqûre de rappel utile pour mesurer le travail accompli, car ce type de modèle de génération interactive reste un moteur en plein apprentissage plutôt qu’un outil de rendu 3D prêt pour la production.

