← Материалы разборы Yersham
разбор · робототехникабалл 7.0#387 из 1116 · 2026-06-26

Interview with the Head of NVIDIA Robotics AI

Что забрать0/4
отметь, что применил →
о чём это

NVIDIA Robotics AI развивает мировые модели действий, которые учатся предсказывать физическое будущее и управлять роботами через визуальные и моторные данные. Ключ к успеху — масштабные эгоцентрические видео и минимальное телеуправление для обучения сложным задачам. Это позволяет автоматизировать сбор данных и повысить автономность роботов.

смотреть видео
полный разбор ролика · 5 глав
01

Введение и контекст

Джим Фен рассказывает о зарождении и развитии глубокого обучения, приводя примеры из истории NVIDIA и OpenAI.

Подчёркивается быстрый прогресс за последние годы и переход к новым этапам обучения моделей.

02

Этапы обучения LLM и параллели с робототехникой

Объясняется, как обучение языковых моделей развивалось от предсказания токенов к сложному рассуждению и автоматизации.

Предлагается аналогия для роботов — симуляция физического мира и обучение с подкреплением для управления.

03

Мировые модели и их архитектура

VLA-модели сосредоточены на языке, зрении и действиях, но слабы в физике и динамике.

Видеомодели учатся предсказывать физику мира без явного программирования, что даёт возможность визуального планирования.

04

Dream Zero и управление через сновидения

Dream Zero совместно кодирует видео и моторные команды, позволяя решать задачи без прямого обучения на примерах.

Визуализация «сновидений» помогает понять и отладить действия робота, что повышает надёжность.

05

Сбор данных и телеуправление

Телеуправление ограничено по времени и сложно в масштабировании, что тормозит обучение.

Экзоскелет Дексуми позволяет напрямую собирать данные с человека, значительно ускоряя обучение робота.

#робототехника#модели действий#обучение с подкреплением#эгоцентрические видео
дальше в дело
Собрать это в маршрут
все маршруты →
ещё разборы