InferenceX — открытый бенчмарк для оценки производительности AI-чипов с фокусом на честность и реальное использование, включая новые агентные сценарии и оптимизации KV cache. Он помогает выявлять лучшие решения для inference, стимулируя развитие экосистемы.
Bryan Shan x Cameron Quilici | Researcher Conversations at GTC
полный разбор ролика · 5 глав ↓
Введение и контекст
InferenceX — открытый проект для оценки производительности AI-чипов, который демонстрирует лучшие показатели Nvidia в независимых тестах.
Проект открыт для всех, кто хочет добавить свои конфигурации и улучшить экосистему, что повышает доверие к результатам.
Дисагрегированный inference и LPU
LPU и Groq показывают преимущества в отдельных аспектах inference, что ведёт к тренду дисагрегированного вычисления.
Amazon и другие используют смешанные решения, оптимизируя разные части inference-цепочки, что открывает новые возможности для оптимизации.
Планы развития InferenceX
В InferenceX V3 планируется добавить многотуровые QA-сессии с префиксным кешированием для более точной оценки производительности.
Такой подход позволит выявить реальные преимущества чипов и оптимизаций в условиях приближенных к продакшену.
KV cache offloading и масштабирование контекста
KV cache offloading становится критичным для поддержки больших контекстов и высокой скорости inference.
Реализации в vLLM и LM cache показывают, что распределённое кеширование — ключ к масштабированию и производительности.
Итоги и перспективы
Проект стремится показать оптимальный Pareto frontier, не навязывая конкретные оптимизации, а демонстрируя лучшие реальные решения.
Результаты доступны бесплатно с удобной визуализацией, что помогает принимать обоснованные решения по выбору железа и ПО.