Кластер из MacBook Pro: распределённый инференс на практике
Разбор эксперимента, где три ноутбука MacBook Pro на чипах M5 Max связали кабелями в один вычислительный кластер и запустили на нём модели, которые раньше требовали серверной стойки. Автор идёт от малого — сначала проверяет связь на небольшой модели, потом упирается в память: суммарной ёмкости формально хватает, а на деле нет из-за накладных расходов. Главный аргумент за такую сборку — модульность: памяти мало, добавил ещё один узел, тогда как в моноблоке память допаять нельзя и машину приходится менять целиком.
Кластер из 3 MacBook Pro M5 Max запускает LLM до 400B параметров, обходя ограничения памяти через конвейерный
Запускать большие модели на своём железе он не собирается, так что применять здесь нечего. Единственный момент, который может пригодиться в разговоре с заказчиком: обещание «поставим у себя, чтобы не платить за облако» упирается в память и стоимость машин, а не в желание.