← Материалы разборы Yersham
разбор · аудио
4.0
из 10
смотреть не обязательно — забрать выжимку и пункты
оценка машинная и частично зависит от длины ролика — спорите, открывайте оригинал

Аудиомодели Gemini: анализ, live-диалоги, генерация музыки

From Transcription to Live Music: Gemini's Audio Stack — Thor Schaeff, Google DeepMind

Обзор новых аудиомоделей Google DeepMind: Gemini 3 Flash для анализа аудио (извлечение спикеров, эмоций, перевод), Gemini 3.1 Flash Live для real-time диалогов с голосом и видео, и Lyra 3 для генерации музыки с текстом. Ключевое: аудиопонимание встроено в модели, что позволяет управлять голосом через системные промпты и создавать сложные сценарии.

Gemini 3 понимает аудио глубоко, Flash Live даёт реалтайм-диалог, Lyra 3 генерирует музыку — всё через AI Stud

что из этого моё

Можно применить для создания голосовых интерфейсов в AI-оркестрации: использовать Gemini 3 Flash для анализа входящих аудио (например, звонков) с извлечением структуры, эмоций и переводом, а Gemini 3.1 Flash Live — для real-time диалогов с клиентами, где модель сама понимает речь и видео. Это сокращает цепочку обработки и позволяет строить более естественных ассистентов. Также можно генерировать персонализированные голосовые ответы с нужным акцентом или тоном через системные промпты.

Что забрать
отметь, что берёшь в работу → или отбрось как не своёмоё →
протестировать Gemini 3 Flash в AI Studio на одном аудиофайле с response schema для извлечения спикеров и эмоций
настроить системный промпт для Gemini Speech Generation с режиссёрскими указаниями и проверить на одном примере
попробовать Gemini 3.1 Flash Live в AI Studio для real-time диалога с голосом и видео
о чём говорят, по времени
главы доводят до 12:00 · дальше по ролику меток нет
01
Введение и обзор релизов00:00
Спикер представляет себя и рассказывает о свежих релизах DeepMind в области аудио.
02
Аудиопонимание в Gemini 302:30
Демонстрация Echo Script: один запрос извлекает из аудио спикеров, эмоции, перевод и саммари.
03
Speech Generation: управление голосом06:00
Как с помощью промптов менять голос: акценты, сцены, эмоции.
04
Gemini 3.1 Flash Live: real-time09:00
Демонстрация живого диалога с голосом и видео, включая переключение языков.
05
Lyra 3 и Life Jukebox12:00
Генерация музыки с текстом и интеграция с Live API для интерактивного заказа песен.
дальше в дело
Собрать это в маршрут
все маршруты →
не хочешь разбираться сам
Сделаю это под задачу
форматы и цены →
похожие по смыслу · из облака
ещё разборы