разбор · vl
2.0
из 10
смотреть не обязательно — забрать выжимку и пункты
оценка машинная и частично зависит от длины ролика — спорите, открывайте оригинал
Qwen3 VL 30B: локальная детекция по промпту без обучения
No more YOLO? Testing Qwen3 VL in real-time local detection
Эксперимент: Qwen3 VL 30B (FP8, 32 ГБ) на H100 детектит объекты по текстовому промту без обучения, с задержкой 3-4 сек и галлюцинациями. Работает стабильно на Full HD, хуже на HD. Применимо для быстрой кастомной детекции без разметки.
Эксперимент: Qwen3 VL 30B (FP8, 32 ГБ) на H100 детектит объекты по текстовому промту без обучения, с задержкой 3-4 сек и галлюцинациями. Работает стабильно на Full HD, хуже на HD. Применимо для быстрой кастомной детекции без разметки.
что из этого моё
Можно использовать как быстрый прототип кастомной детекции для автоматизации: например, распознавание объектов на складе или в офисе без обучения. Но для production нужна фильтрация галлюцинаций и оптимизация задержки.
Тезисы ролика
применимого к своей работе линза здесь не нашла
▸Используйте Qwen3 VL 30B в FP8 (32 ГБ) для локальной детекции по промту — влезает в одну H100 80 ГБ.
▸Запускайте через движок VLM с контекстом 460K — потребление ~77 ГБ, оставляйте запас.
▸Для снижения задержки используйте Turbo JPEG вместо OpenCV — быстрее в разы.
▸Добавьте motion detection порог, чтобы не дёргать модель каждые 3 секунды.
о чём говорят, по времени
главы доводят до 09:33 · дальше по ролику меток нет
01
Введение и выбор модели00:00 ↗
Тестируем Qwen3 VL 30B для детекции без обучения, выбираем модель под H100.
02
Запуск и интерфейс02:03 ↗
Запускают веб-приложение, подключают камеру, настраивают промт и порог движения.
03
Тесты на Full HD04:07 ↗
Детектируют разные объекты: кресло, надписи, мяч, человека — успешно, но с задержкой 3-4 сек.
04
Тесты на HD06:47 ↗
При HD качестве модель хуже находит мелкие объекты, но уточнение промта помогает.
05
Логи и выводы09:33 ↗
Логи пишутся в файл, проект на GitHub, можно анализировать ответы модели.