DBT и Fivetran остаются ключевыми в управлении данными для AI, особенно для подготовки и анализа тренировочных датасетов, несмотря на сложность и непредсказуемость нагрузок. Традиционные data catalog не оправдали ожиданий, но метаданные для машин и governance — перспективное направление. Важно планировать финансирование под четкие краткосрочные цели.
[State of AI Startups] Memory/Learning, RL Envs & DBT-Fivetran — Sarah Catanzaro, Amplify
полный разбор ролика · 5 глав ↓
Введение и связь данных с AI
Спикер объясняет, что AI и data тесно связаны и сложно их разделить. Это позволяет лучше понимать, как данные используются в AI, особенно при подготовке тренировочных датасетов.
Переход от символических систем к современным AI и важность понимания SQL и data stack для AI-проектов.
Современный data stack и слияния
Слияние DBT и Fivetran — не конец современного data stack, а шаг к IPO и ускорению роста.
Обе компании успешно растут и являются лидерами в своих категориях, что подтверждает их значимость для управления данными в AI.
Особенности данных для AI
Нагрузки в AI менее предсказуемы и более разнородны, что усложняет оптимизацию инфраструктуры.
Традиционные BI-запросы были детерминированы, сейчас же приходится адаптировать решения под ad hoc задачи и нестандартные данные.
Проблемы и перспективы data catalog
Data catalog как категория не оправдала ожиданий, многие игроки были поглощены или ушли с рынка.
Возможность создавать каталоги не для людей, а для машин — метаданные для governance и автоматизации — перспективное направление.
Практики в data stack больших AI-компаний
AI-компании внимательно относятся к управлению данными, включая discoverability, подготовку и загрузку на GPU.
Использование специализированных форматов (например, Vortex) для эффективной загрузки данных на GPU снижает простои и затраты.