разбор · мультимодальность
4.0
из 10
смотреть не обязательно — забрать выжимку и пункты
оценка машинная и частично зависит от длины ролика — спорите, открывайте оригинал
Нативные мультимодальные агенты на Gemini: понимание, генерация, real-time
Any-to-Any: Building Native Multimodal Agents - Patrick Löber, Google DeepMind
Patrick Löber из Google DeepMind показал, как строить нативных мультимодальных агентов на Gemini: понимание (текст, изображения, аудио, видео), генерация (изображения, речь) и real-time через Live API. Главный вывод: агентный цикл с function calling позволяет создавать приложения типа NotebookLM, где модель сама решает, какие модальности генерировать.
Gemini API: понимание + генерация через агентный цикл, с Live API для реального времени.
что из этого моё
В работе оператора входа в AI это прямо применимо: можно строить агентов, которые автоматически создают контент (инфографику, подкасты) из разных источников, и использовать function calling для оркестрации моделей. Например, сделать сервис, который по ссылке на лекцию генерирует конспект и аудио-резюме.
Что забрать
отметь, что берёшь в работу → или отбрось как не своёмоё →
подключить Gemini API для мультимодального понимания: передавать PDF, видео, MP3 в одном запросе и получать сводку
настроить function calling для генерации изображений и речи через специализированные модели (Nano Banana, TTS)
включить контекстное кэширование для повторных запросов к длинным файлам
о чём говорят, по времени
главы доводят до 11:00 · дальше по ролику меток нет
01
Введение и обзор00:00 ↗
Представление спикера и темы: any-to-any мультимодальные агенты на Gemini.
02
Мультимодальное понимание02:30 ↗
Как использовать Gemini для анализа разных типов данных.
03
Генерация изображений и речи06:00 ↗
Специализированные модели для создания визуала и аудио.
04
Почему нативная генерация09:00 ↗
Преимущества моделей, основанных на Gemini.
05
Live API и выводы11:00 ↗
Реальное время и итоги.