Голосовые AI-модели сложнее текстовых из-за высокого битрейта и многомодальности, что требует больше токенов или непрерывных представлений для передачи эмоций, интонаций и длительности. Модели делятся на токен-базированные и непрерывные, каждая с компромиссами по качеству и скорости.
Some Modern Voice AI Theory
наведи и нажми на цифру — раскроется глава
полный разбор ролика · 5 глав ↓
Введение в голосовые AI
Видео посвящено теории голосовых AI, включая токен-базированные и непрерывные модели, а также их архитектуры и эволюцию.
Голос содержит больше информации, чем текст, из-за эмоций, интонаций и длительности, что влияет на выбор архитектуры.
Высокий битрейт голоса
Голос передаёт не только текст, но и эмоции, тон, энергию и длительность, что увеличивает количество информации в секунду.
Токен-базированные модели требуют много токенов в секунду, что затрудняет реальное время; непрерывные модели проще передают такую информацию.
Мультимодальность в голосе
Одна и та же фраза может иметь множество аудиовариаций с разным смыслом и эмоциями, что усложняет моделирование.
Для точной генерации нужно вводить параметры говорящего и контекст, чтобы правильно расставлять акценты и эмоции.
Классификация моделей
Модели делятся на токен-базированные (CSM, Orpheus), непрерывные (Piper, Style TTS2, Kokoro) и гибридные (Qwen TTS, Vox Trial TTS).
Токеновые проще и считаются качественнее, непрерывные — быстрее и подходят для on-device, выбор зависит от задачи.
Выбор архитектуры и сложность
Токеновые модели легче понимать и реализовывать, но требуют компромиссов по скорости.
Непрерывные модели сложнее, но лучше подходят для точной передачи эмоций и интонаций, что важно для реального времени.