← Материалы разборы Yersham
разбор · диффузионные llm
1.0
из 10
смотреть не обязательно — забрать выжимку и пункты
оценка машинная и частично зависит от длины ролика — спорите, открывайте оригинал

Diffusion Gemma: быстрая генерация, но слаба в агентских задачах

1000 TPS on Nvidia H100? Local Diffusion Gemma Benchmarks

Google Diffusion Gemma, дообученная версия Gemma 426B, генерирует текст блоками по 256 токенов через денойзинг, достигая ~600-1000 ток/с на H100, но заметно уступает обычной Gemma 4 в агентских задачах: хуже вызывает инструменты, чаще ломает вызовы, ниже точность в бенчмарках. Модель перспективна для real-time сценариев, но не для агентов.

Google Diffusion Gemma, дообученная версия Gemma 426B, генерирует текст блоками по 256 токенов через денойзинг, достигая ~600-1000 ток/с на H100, но заметно уступает обычной Gemma 4 в агентских задачах: хуже вызывает инструменты, чаще ломает вызовы, ниже точность в бенчмарках. Модель перспективна для real-time сценариев, но не для агентов.

что из этого моё

Можно учесть при выборе моделей для real-time сценариев (например, голосовые ассистенты), но для оркестрации агентов и автоматизации диффузионная модель не подходит — лучше использовать обычную Gemma 4 или другие авторегрессионные модели.

Тезисы ролика
применимого к своей работе линза здесь не нашла
Используйте диффузионные LLM для задач, где критична скорость генерации (речевая аналитика, real-time), но не для агентских сценариев.
Проверяйте факты в тексте диффузионных моделей: в тесте много выдумок (красные пометки).
Ожидайте ~600 ток/с на H100, а не заявленные 1000; пики до 1000 возможны, но не стабильны.
Для агентских задач предпочитайте авторегрессионные модели: Diffusion Gemma показала 72% против 89% у обычной Gemma 4.
о чём говорят, по времени
главы доводят до 03:05 · дальше по ролику меток нет
01
Введение и суть модели00:00
Diffusion Gemma генерирует текст блоками по 256 токенов через денойзинг, что ускоряет генерацию.
02
Сравнение с Gemma 400:30
Наглядно показано, что диффузионная модель генерирует быстрее, но допускает больше фактических ошибок.
03
Tool Calling Bench01:01
Diffusion Gemma набирает 0.80 против 0.96 у обычной, но главная проблема — пропуск вызовов тулов.
04
Агентские бенчмарки02:02
Diffusion Gemma решает 72% задач против 89% у обычной, особенно проваливаясь в Hermes и OpenClaw.
05
Выводы и применение03:05
Модель подходит для real-time задач, но не для агентских; скорость на H100 ~600 ток/с.
дальше в дело
Собрать это в маршрут
все маршруты →
не хочешь разбираться сам
Сделаю это под задачу
форматы и цены →
ещё разборы