← Материалы разборы Yersham
разбор · видеогенерация
1.0
из 10
смотреть не обязательно — забрать выжимку и пункты
оценка машинная и частично зависит от длины ролика — спорите, открывайте оригинал

daVinci-MagiHuman: open-source аудио-видео модель с ограничениями

No more LTX 2.3, Veo, and Sora? Testing the daVinci-MagiHuman

Обзор open-source диффузионной аудио-видеомодели daVinci-MagiHuman: генерирует Full HD видео с синхронным звуком за 38 секунд, но требует исходное изображение. Модель сырая, уступает LTX 2.3, особенно в диалогах и при некорректных промптах. Рекомендуется оставаться на LTX 2.3.

Обзор open-source диффузионной аудио-видеомодели daVinci-MagiHuman: генерирует Full HD видео с синхронным звуком за 38 секунд, но требует исходное изображение. Модель сырая, уступает LTX 2.3, особенно в диалогах и при некорректных промптах. Рекомендуется оставаться на LTX 2.3.

что из этого моё

Модель можно использовать для быстрой генерации видео с синхронной речью в автоматизированных конвейерах, но из-за сырости и требовательности к ресурсам (97 ГБ VRAM) она не подходит для продакшена. Полезно как эксперимент, но не как замена LTX 2.3.

Тезисы ролика
применимого к своей работе линза здесь не нашла
Для запуска daVinci-MagiHuman используйте готовый Docker-контейнер, а не виртуальное окружение: при генерации 1080p возникает ошибка нехватки памяти (требуется 97 ГБ), хотя в документации заявлено меньше.
Модель работает только в режиме image-to-image: обязательно подавайте исходное изображение, на основе которого генерируется видео.
Для изменения входного фото и промпта редактируйте файлы в папке assets и в ран-скрипте (например, run.sh для модели 1080p).
Используйте официальный гайд по написанию промптов из GitHub, чтобы избежать артефактов: при некорректных промптах модель выдаёт 'дичь' (один человек говорит сам с собой, руки летают).
о чём говорят, по времени
главы доводят до 04:15 · дальше по ролику меток нет
01
Вступление и обзор00:00
Представление модели daVinci-MagiHuman, её особенности и сравнение с аналогами.
02
Запуск и настройка01:01
Инструкция по запуску модели, проблемы с памятью и рекомендация использовать Docker.
03
Тест генерации 1080p02:35
Запуск генерации видео в 1080p и наблюдение за нагрузкой на видеокарту.
04
Результаты на русском и английском03:05
Демонстрация сгенерированных видео с речью на русском и английском, выявлены галлюцинации на русском.
05
Некорректные промпты и итоги04:15
Демонстрация артефактов при плохих промптах, рекомендация использовать гайд, итоговый вывод.
дальше в дело
Собрать это в маршрут
все маршруты →
не хочешь разбираться сам
Сделаю это под задачу
форматы и цены →
ещё разборы