Nvidia propulse l’intelligence des robots grâce au modèle virtuel DreamDojo

Table des matières

Nvidia dévoile DreamDojo, un modèle capable de transformer des vidéos réelles en environnements d’entraînement virtuels pour robots humanoïdes. En s’appuyant sur un ensemble massif de 44 000 heures de captations humaines, cette technologie simplifie l’apprentissage de tâches complexes. Ce système de « world model » vise à optimiser le développement de l’intelligence artificielle physique pour des applications commerciales concrètes.

L’innovation progresse avec le lancement de DreamDojo par Nvidia le 9 février. Ce système crée des univers virtuels, ou « world models », pour former des IA spécialisées, principalement destinées à la robotique et aux véhicules autonomes, où la simulation est essentielle à la sécurité et à la performance. L’objectif est de permettre aux machines, notamment les robots humanoïdes, d’accomplir des actions complexes.

Ils s’inspirent de séquences vidéo de mouvements humains, sans nécessiter de démonstrations physiques spécifiques. Ce projet résulte d’une collaboration entre Nvidia et des chercheurs des universités de Berkeley, Stanford et UT Austin, offrant un cadre avancé pour l’apprentissage automatisé des IA.

Un processus d’apprentissage performant basé sur des données massives

Le succès de DreamDojo repose sur une base de données composée de 44 000 heures de vidéos réelles. Ces enregistrements se concentrent sur les interactions manuelles des participants pour capturer chaque détail du mouvement. Cette masse d’informations permet de modéliser les mouvements complexes sans passer par une programmation ligne par ligne.

La répartition des données illustre la volonté de Nvidia de créer une IA capable d’évoluer dans des environnements non structurés :

  • 18 000 heures consacrées aux tâches domestiques (préhension, rangement) ;
  • 6 000 heures liées aux achats en magasin (navigation en milieu bondé, manipulation d’objets variés) ;
  • 3 500 heures focalisées sur la cuisine (précision du geste, gestion des fluides et des outils).

Cet ensemble constitue, selon les chercheurs, le plus grand jeu de données vidéo jamais utilisé pour le pré-entraînement de modèles mondiaux.

Méthodologie : du pré-entraînement à l’ajustement réel

L’originalité du projet réside dans l’utilisation d’actions proxies. Puisqu’il est impossible d’étiqueter manuellement 44 000 heures de vidéo, l’IA apprend à deviner les forces et les vecteurs de mouvement à partir des images brutes.

La méthodologie d’apprentissage s’articule autour de deux étapes fondamentales. Chaque étape garantit que le robot comprend non seulement l’action, mais aussi l’environnement physique dans lequel il évolue.

Phase

Objectif principal

Méthode utilisée

Pré-entraînement

Assimilation des lois physiques

Utilisation d’actions latentes continues comme proxys

Post-entraînement

Affinement sur systèmes cibles

Ajustement sur des données de robots à petite échelle

Pour l’expert freelance en portage salarial, cette approche réduit drastiquement le « sim-to-real gap » (le fossé entre la simulation et la réalité). Le robot ne se contente pas de copier une trajectoire ; il développe une compréhension intuitive de son environnement physique, capable de compenser les imprévus en temps réel.

La puissance de la simulation par « Distillation »

L’efficacité de DreamDojo repose sur sa capacité à générer des simulations fluides à une fréquence de 10 images par seconde durant plus d’une minute. Pour un freelance en portage salarial spécialisé dans l’ingénierie système, ce niveau de performance est le signe d’une optimisation logicielle majeure.

Cette prouesse technique est rendue possible par la distillation, une méthode de machine learning où un modèle complexe transfère ses connaissances à un modèle plus léger et plus rapide, capable de simuler les lois de la physique en temps réel.

Une polyvalence matérielle démontrée

Le modèle a déjà démontré ses capacités sur plusieurs plateformes robotiques de pointe.

  • Unitree G1 : Pour la mobilité et l’équilibre.
  • AgiBot : Pour l’agilité des bras manipulateurs.
  • Fourier Robotics GR-1 : Pour la coordination corps complet sur un modèle humanoïde.

Ces tests valident la polyvalence de DreamDojo face à différents types de structures mécaniques.

Les applications stratégiques

Le déploiement de DreamDojo offre quatre leviers de transformation pour les entreprises industrielles :

Axe d’application

Description technique

Bénéfice Projet

Téléopération

Contrôle à distance ultra-fluide sans latence perceptive.

Manipulation en zone dangereuse simplifiée.

Planification

Anticipation des obstacles et organisation des sous-tâches.

Réduction des temps de cycle logistiques.

Réduction des coûts

Remplacement des tests physiques par des simulations haute fidélité.

Baisse du budget de R&D (moins de casse).

Sécurisation

Détection des erreurs critiques en environnement virtuel.

Zéro accident lors de la mise en service.

DreamDojo vient compléter la gamme Cosmos, s’insérant dans un flux de travail complet :

  1. Cosmos Predict : Génère des scénarios visuels à partir de texte.
  2. Cosmos Transfer : Optimise le passage des données d’un domaine à l’autre.
  3. DreamDojo : Simule l’interaction physique et l’agentivité dans des mondes complexes.

Cet article vous a-t-il été utile ?

Note moyenne 0 / 5. Nombre de votes 0

Actualité du portage salarial