Interview with the Head of NVIDIA Robotics AI
NVIDIA Robotics AI развивает мировые модели действий, которые учатся предсказывать физическое будущее и управлять роботами через визуальные и моторные данные. Ключ к успеху — масштабные эгоцентрические видео и минимальное телеуправление для обучения сложным задачам. Это позволяет автоматизировать сбор данных и повысить автономность роботов.
полный разбор ролика · 5 глав ↓
Введение и контекст
Джим Фен рассказывает о зарождении и развитии глубокого обучения, приводя примеры из истории NVIDIA и OpenAI.
Подчёркивается быстрый прогресс за последние годы и переход к новым этапам обучения моделей.
Этапы обучения LLM и параллели с робототехникой
Объясняется, как обучение языковых моделей развивалось от предсказания токенов к сложному рассуждению и автоматизации.
Предлагается аналогия для роботов — симуляция физического мира и обучение с подкреплением для управления.
Мировые модели и их архитектура
VLA-модели сосредоточены на языке, зрении и действиях, но слабы в физике и динамике.
Видеомодели учатся предсказывать физику мира без явного программирования, что даёт возможность визуального планирования.
Dream Zero и управление через сновидения
Dream Zero совместно кодирует видео и моторные команды, позволяя решать задачи без прямого обучения на примерах.
Визуализация «сновидений» помогает понять и отладить действия робота, что повышает надёжность.
Сбор данных и телеуправление
Телеуправление ограничено по времени и сложно в масштабировании, что тормозит обучение.
Экзоскелет Дексуми позволяет напрямую собирать данные с человека, значительно ускоряя обучение робота.