Сад · Побег
Настроить speculative decoding для ускорения инференса
«побег» · 3 карт. · 3 голос.(-а/-ов) корпуса · 53 дн. между первым и последним
инференсрепозиторийllmmoefp8servingоркестрацияcuda
3 карточек корпуса (3 голос.(-а/-ов) с учётом повторов внутри карточки) независимо друг от друга подошли к одному и тому же действию, за 53 дн. (2026-06-25 — 2026-08-17).
Как формулировали
- настроить speculative decoding с multi-token prediction для ускорения ответов в своём конвейере (2026-08-17)
- настроить speculative decoding в vLLM для ускорения инференса (2026-08-17)
- изучить sequential Monte Carlo speculative decoding для ускорения инференса без откатов (2026-06-25)
Источники
- Автогенерация CUDA-ядер с жёстким eval-пайплайном · 2026-06-25 · частично
- vLLM: высокопроизводительный serving с OpenAI-совместимым API · 2026-08-17 · забрать
- DeepSeek-V3: 37B активных параметров, FP8 и MTP для дешёвого инференса · 2026-08-17 · частично
Соседние темы
- Вынести примеры генерации и бенчмаркинга CUDA-ядер в навыки агента — 1 общих карточек, 5 общих тега(ов)
- Выносить настраиваемый параметр или правило в конфиг конвейера, а не хардкодить — 6 общих тега(ов)
- Подключать MCP-сервер к своему конвейеру разборов или к Claude Code — 5 общих тега(ов)
- Настроить автоматическую оценку ответов агента: LLM-судью или эталонный набор вместо ручной проверки — 5 общих тега(ов)
- Поставить новый агентный инструмент или плагин и прогнать его на своём проекте — 5 общих тега(ов)