← Материалы разборы Yersham
разбор · локальный
2.0
из 10
смотреть не обязательно — забрать выжимку и пункты
оценка машинная и частично зависит от длины ролика — спорите, открывайте оригинал

Локальный мультимодальный ассистент на Open Web UI

I Built My Own Local ChatGPT

Автор собрал локальный аналог ChatGPT в Open Web UI, объединив LLM, STT, TTS и генерацию изображений. Система работает как единый мультимодальный ассистент, но требует мощного GPU и настройки. Главный вывод: локальная сборка дает контроль и анонимность, но дороже и сложнее облачных решений.

Автор собрал локальный аналог ChatGPT в Open Web UI, объединив LLM, STT, TTS и генерацию изображений. Система работает как единый мультимодальный ассистент, но требует мощного GPU и настройки. Главный вывод: локальная сборка дает контроль и анонимность, но дороже и сложнее облачных решений.

что из этого моё

Прямой пользы для оркестрации моделей и автоматизации нет, но подход к интеграции разнородных моделей в единый интерфейс через Open Web UI может быть использован как референс для создания локальных ассистентов с контролем данных.

Тезисы ролика
применимого к своей работе линза здесь не нашла
Для локального мультимодального ассистента выбирайте модели, которые быстро работают в инференсе через VLM/VLM Omni, чтобы сохранить эффект реального времени.
Используйте Open Web UI как единый интерфейс для интеграции LLM, STT, TTS и генерации изображений через API.
При запуске TTS-модели через VLM Omni проверяйте параметр GPU Memory Utilization внутри контейнера, так как дефолтное значение может резервировать избыточную память (например, 24 ГБ для модели 1 ГБ).
Для голосового сценария выбирайте компактные модели (например, Qwen 3 1.5B для STT и Qwen 3T 0.6B для TTS), чтобы обеспечить скорость и отзывчивость.
о чём говорят, по времени
главы доводят до 04:42 · дальше по ролику меток нет
01
Идея и компоненты00:00
Автор объясняет, что хочет собрать локальный аналог ChatGPT из четырех модулей: LLM, STT, TTS и генерации изображений.
02
Выбор моделей01:02
Автор выбирает модели, которые быстро работают в инференсе через VLM/VLM Omni, чтобы сохранить реальное время.
03
Сборка и проблемы02:04
Технически все подключается через API в Open Web UI, но возникла проблема с TTS-моделью из-за неправильного параметра GPU Memory Utilization.
04
Демонстрация работы03:07
Автор показывает, как система генерирует идеи для превью и изображения, а затем работает в голосовом режиме.
05
Плюсы и минусы04:42
Автор подводит итоги: главный минус — цена, плюсы — анонимность, контроль и отсутствие цензуры.
дальше в дело
Собрать это в маршрут
все маршруты →
не хочешь разбираться сам
Сделаю это под задачу
форматы и цены →
ещё разборы