Запуск LLM на iPhone: 40 ток/с через MLX Swift LM
Adrien Grondin показывает, как запускать LLM на iPhone через MLX Swift LM: скачать репозиторий, выбрать квантизованную модель из MLX Community на Hugging Face, передать ID в фреймворк. Gemma 4 8-bit в 4-bit достигает 40 ток/с на новых iPhone, работает офлайн. Приложение Locally AI (приобретено LM Studio) демонстрирует практическое применение.
MLX позволяет запускать LLM на iPhone со скоростью 40 токенов/сек, но требует квантизации и ограничен размером
Прямой пользы для оркестрации моделей и автоматизации buyanov.io мало: видео про локальный запуск на iOS. Но можно почерпнуть идею использования маленьких быстрых моделей для простых задач автоматизации (например, обработка текста) и инструмент MLX Swift LM для создания мобильных клиентов, если понадобится.