← Материалы разборы Yersham
разбор · диффузия
2.0
из 10
смотреть не обязательно — забрать выжимку и пункты
оценка машинная и частично зависит от длины ролика — спорите, открывайте оригинал

Диффузия как спектральная авторегрессия: данные важнее архитектуры

Building Generative Image & Video models at Scale - Sander Dieleman, Google DeepMind

Сандер Дилеман из Google DeepMind рассказывает о создании генеративных моделей изображений и видео: от курирования данных и сжатых представлений до диффузионного моделирования, архитектур, обучения, сэмплирования, дистилляции и контроля. Главный вывод: диффузия работает как спектральная авторегрессия, а guidance — мощный инструмент для повышения качества за счёт разнообразия.

Диффузия генерирует от грубого к деталям, guidance даёт качество, латентное сжатие делает возможным масштаб.

что из этого моё

Для оператора входа в AI полезно понимать, как работают диффузионные модели: это поможет выбирать правильные инструменты для генерации изображений/видео, объяснять клиентам trade-off'ы (качество vs разнообразие) и использовать guidance для получения нужного результата. Также идея о важности данных применима к курированию контента для ленты.

Тезисы ролика
применимого к своей работе линза здесь не нашла
Курирование данных важнее тюнинга модели: время на улучшение данных часто окупается лучше, чем оптимизация архитектуры.
Используйте обученные автоэнкодеры для сжатия изображений/видео в латентное пространство, сохраняя топологию, чтобы уменьшить вычислительную нагрузку.
Диффузионное сэмплирование: предсказывайте направление к чистому изображению, делайте маленький шаг и добавляйте немного шума для устойчивости к ошибкам.
Guidance: усиливайте разницу между условным и безусловным предсказанием, чтобы повысить качество, но жертвуя разнообразием.
о чём говорят, по времени
главы доводят до 20:00 · дальше по ролику меток нет
01
Введение и обзор00:00
Спикер представляет тему: создание генеративных моделей изображений и видео, 8 разделов.
02
Курирование данных02:30
Подчёркивается важность качества данных для обучения моделей.
03
Представления и сжатие05:00
Объясняется использование автоэнкодеров для создания латентных представлений.
04
Диффузионное моделирование10:00
Интуитивное объяснение процесса диффузии: зашумление и деноизинг.
05
Архитектура и обучение20:00
Обсуждаются архитектуры (U-Net, Transformer) и масштабирование.
дальше в дело
Собрать это в маршрут
все маршруты →
не хочешь разбираться сам
Сделаю это под задачу
форматы и цены →
похожие по смыслу · из облака
ещё разборы