Оптимизация энергопотребления GPU-кластеров для AI-инференса достигается динамическим управлением лимитами мощности и частотами, что позволяет повысить эффективность и снизить избыточное энергопотребление без потери производительности. Также перспективна интеграция с гибкими энергосистемами дата-центров для адаптации нагрузки к пиковым периодам.
The GPU Power-Performance Curve Most Clusters Ignore | Researcher Conversations at GTC
полный разбор ролика · 5 глав ↓
Введение и контекст
Pebble занимается оптимизацией энергопотребления в дата-центрах для AI, повышая количество сгенерированных токенов на ватт.
Обсуждается важность управления мощностью GPU для повышения эффективности работы кластеров.
Проблема неэффективности GPU
Производительность GPU не растёт линейно с увеличением мощности, наступает точка насыщения, где потребление энергии растёт, а производительность — нет.
Причины: физические ограничения (напряжение, частоты) и характер нагрузки — инференс часто ограничен пропускной способностью памяти.
Решение Pebble — динамическое управление
Система анализирует характеристики и нагрузку на рабочие процессы в Kubernetes или Slurm, учитывая их спайковый характер.
Динамически регулируются power cap и частоты GPU, чтобы находить оптимальную точку на кривой мощность-производительность.
Техническая реализация
Установка через Helm в Kubernetes, разворачиваются DaemonSet и другие объекты для сбора метрик и управления GPU.
Используются метрики из vLLM, SGI и данных NVIDIA для принятия решений по настройке.
Перспективы гибкого энергопотребления
Исследуется возможность сделать дата-центры «гибкими» — снижать потребление в пиковые периоды без нарушения SLA.
Это позволит получить доступ к крупным объёмам дешёвой гибкой энергии и повысить устойчивость инфраструктуры.