← Материалы разборы Yersham
разбор · dataбалл 6.0#704 из 911 · 2026-01-26

DBT и Fivetran остаются ключевыми в управлении данными для AI, особенно для подготовки и анализа тренировочных датасетов, несмотря на сложность и непредсказуемость нагрузок. Традиционные data catalog не оправдали ожиданий, но метаданные для машин и governance — перспективное направление. Важно планировать финансирование под четкие краткосрочные цели.

[State of AI Startups] Memory/Learning, RL Envs & DBT-Fivetran — Sarah Catanzaro, Amplify

смотреть видео
Что забрать0/4
отметь, что применил →
вывод оператора · что осталось

Оператору входа в AI важно интегрировать DBT и Fivetran для подготовки данных и мониторинга, использовать машинные метаданные для автоматизации оркестрации и governance, а также оптимизировать загрузку данных на GPU для ускорения обучения моделей.

полный разбор ролика · 5 глав
01

Введение и связь данных с AI

Спикер объясняет, что AI и data тесно связаны и сложно их разделить. Это позволяет лучше понимать, как данные используются в AI, особенно при подготовке тренировочных датасетов.

Переход от символических систем к современным AI и важность понимания SQL и data stack для AI-проектов.

02

Современный data stack и слияния

Слияние DBT и Fivetran — не конец современного data stack, а шаг к IPO и ускорению роста.

Обе компании успешно растут и являются лидерами в своих категориях, что подтверждает их значимость для управления данными в AI.

03

Особенности данных для AI

Нагрузки в AI менее предсказуемы и более разнородны, что усложняет оптимизацию инфраструктуры.

Традиционные BI-запросы были детерминированы, сейчас же приходится адаптировать решения под ad hoc задачи и нестандартные данные.

04

Проблемы и перспективы data catalog

Data catalog как категория не оправдала ожиданий, многие игроки были поглощены или ушли с рынка.

Возможность создавать каталоги не для людей, а для машин — метаданные для governance и автоматизации — перспективное направление.

05

Практики в data stack больших AI-компаний

AI-компании внимательно относятся к управлению данными, включая discoverability, подготовку и загрузку на GPU.

Использование специализированных форматов (например, Vortex) для эффективной загрузки данных на GPU снижает простои и затраты.

#data#оркестрация#ai#метаданные
дальше в дело
Собрать это в маршрут
все маршруты →
ещё разборы