смотреть не обязательно — забрать выжимку и пункты
оценка машинная и частично зависит от длины ролика — спорите, открывайте оригинал
Diffusion Gemma: быстрая генерация, но слаба в агентских задачах
1000 TPS on Nvidia H100? Local Diffusion Gemma Benchmarks
Google Diffusion Gemma, дообученная версия Gemma 426B, генерирует текст блоками по 256 токенов через денойзинг, достигая ~600-1000 ток/с на H100, но заметно уступает обычной Gemma 4 в агентских задачах: хуже вызывает инструменты, чаще ломает вызовы, ниже точность в бенчмарках. Модель перспективна для real-time сценариев, но не для агентов.
Google Diffusion Gemma, дообученная версия Gemma 426B, генерирует текст блоками по 256 токенов через денойзинг, достигая ~600-1000 ток/с на H100, но заметно уступает обычной Gemma 4 в агентских задачах: хуже вызывает инструменты, чаще ломает вызовы, ниже точность в бенчмарках. Модель перспективна для real-time сценариев, но не для агентов.
что из этого моё
Можно учесть при выборе моделей для real-time сценариев (например, голосовые ассистенты), но для оркестрации агентов и автоматизации диффузионная модель не подходит — лучше использовать обычную Gemma 4 или другие авторегрессионные модели.
Тезисы ролика
применимого к своей работе линза здесь не нашла
▸Используйте диффузионные LLM для задач, где критична скорость генерации (речевая аналитика, real-time), но не для агентских сценариев.
▸Проверяйте факты в тексте диффузионных моделей: в тесте много выдумок (красные пометки).
▸Ожидайте ~600 ток/с на H100, а не заявленные 1000; пики до 1000 возможны, но не стабильны.
▸Для агентских задач предпочитайте авторегрессионные модели: Diffusion Gemma показала 72% против 89% у обычной Gemma 4.
о чём говорят, по времени
главы доводят до 03:05 · дальше по ролику меток нет