разбор · гибридные-модели
2.0
из 10
смотреть не обязательно — забрать выжимку и пункты
оценка машинная и частично зависит от длины ролика — спорите, открывайте оригинал
Гибридные архитектуры: 1 attention на 8-12 mamba для длинного контекста
Building Jamba 3B: the tiny Hybrid Transformer State Space Reasoning Model - Barak Lenz, CTO of AI21
AI21 строит гибридные модели (Jamba) и AI-системы (Maestro) для надёжности и эффективности. Ключевой вывод: гибридные архитектуры (1 attention-слой на 8-12 mamba) дают выигрыш в памяти и контексте без потери качества, а AI-системы должны быть model-agnostic и оптимизировать стоимость/латентность, а не просто токены.
Гибридные модели (Mamba+attention) — будущее для длинного контекста на edge, а AI-системы с контролем…
что из этого моё
Для оркестрации моделей и автоматизации: внедрить гибридные модели для длинного контекста на edge, а в агентных системах — оценивать действия по стоимости и ценности, используя bandit-подход для выбора моделей и инструментов. Это снизит затраты и повысит надёжность.
Что забрать
отметь, что берёшь в работу → или отбрось как не своёмоё →
вынести в конфиг конвейера разборов правило выбора модели по стоимости и ценности действия
настроить в конвейере разборов фильтрацию примеров по сложности для RL
замерить perplexity на длинных последовательностях при тестировании архитектуры
о чём говорят, по времени
главы доводят до 25:00 · дальше по ролику меток нет
01
Введение и AI2100:00 ↗
История компании, миссия, продукты (Jamba, Maestro).
02
Путь к гибридным моделям02:30 ↗
Как пришли к смеси attention и mamba.
03
Jamba 3B для edge08:00 ↗
Особенности новой модели: длинный контекст, малый размер.
04
Эксперименты и масштабирование15:00 ↗
Как тестировать архитектуры на малых моделях.
05
AI-системы и Maestro25:00 ↗
Почему модели недостаточно, нужны системы.