daVinci-MagiHuman: open-source аудио-видео модель с ограничениями
Обзор open-source диффузионной аудио-видеомодели daVinci-MagiHuman: генерирует Full HD видео с синхронным звуком за 38 секунд, но требует исходное изображение. Модель сырая, уступает LTX 2.3, особенно в диалогах и при некорректных промптах. Рекомендуется оставаться на LTX 2.3.
Обзор open-source диффузионной аудио-видеомодели daVinci-MagiHuman: генерирует Full HD видео с синхронным звуком за 38 секунд, но требует исходное изображение. Модель сырая, уступает LTX 2.3, особенно в диалогах и при некорректных промптах. Рекомендуется оставаться на LTX 2.3.
Модель можно использовать для быстрой генерации видео с синхронной речью в автоматизированных конвейерах, но из-за сырости и требовательности к ресурсам (97 ГБ VRAM) она не подходит для продакшена. Полезно как эксперимент, но не как замена LTX 2.3.