разбор · оркестрациятема-фронтир · H 1.49
2.0
из 10
смотреть не обязательно — забрать выжимку и пункты
оценка машинная и частично зависит от длины ролика — спорите, открывайте оригинал
InferenceX: открытый бенчмарк для честной оценки AI-чипов
Bryan Shan x Cameron Quilici | Researcher Conversations at GTC
InferenceX — открытый бенчмарк для оценки производительности AI-чипов с фокусом на честность и реальное использование, включая новые агентные сценарии и оптимизации KV cache. Он помогает выявлять лучшие решения для inference, стимулируя развитие экосистемы.
InferenceX — открытый бенчмарк, доказывающий превосходство Nvidia, но V3 с агентными тестами может изменить ка
что из этого моё
Оператору входа в AI InferenceX полезен для оркестрации и автоматизации, позволяя объективно выбирать и настраивать модели и железо под реальные сценарии с учётом кеширования и многотурового взаимодействия.
Что забрать
отметь, что берёшь в работу → или отбрось как не своёмоё →
запустить InferenceX на своей тестовой модели и замерить latency и throughput
добавить в свой конвейер разборов агентный сценарий с многотуровой сессией и префиксным кешированием
настроить KV cache offloading в своей инференс-среде для увеличения контекста
о чём говорят, по времени
главы доводят до 09:27 · дальше по ролику меток нет
01
Введение и контекст00:05 ↗
Обзор InferenceX и его значимость в индустрии.
02
Дисагрегированный inference и LPU03:11 ↗
Обсуждение новых архитектур и специализированных ускорителей.
03
Планы развития InferenceX05:49 ↗
Переход к более реалистичным агентным бенчмаркам.
04
KV cache offloading и масштабирование контекста07:53 ↗
Роль кеширования в долгом контекстном inference.
05
Итоги и перспективы09:27 ↗
Цель InferenceX — честный и реалистичный бенчмарк для всей индустрии.