Перейти к содержимому
Новость

Deltafin запустил полный Kimi K3 на одном Mac, но быстро отвечать он пока не умеет

Полная модель Kimi K3 с 2,8 трлн параметров действительно запускается на одном компьютере. На M1 Max актуальный результат Deltafin составляет 0,2901 токена в секунду, то есть один токен генерируется примерно за 3,45 секунды.

AnVas
Deltafin запустил полный Kimi K3 на одном Mac, но быстро отвечать он пока не умеет

Автор: gavamedia

Самое интересное в проекте Deltafin не сам факт локального запуска большой языковой модели, а отказ от урезания ее экспертной части. Kimi K3 использует архитектуру MoE: из 896 экспертов для каждого токена выбираются 16. Разработчик Deltafin заявляет, что сохраняет полный набор весов K3 и не уменьшает число используемых моделью экспертов.
За это приходится платить дисковым пространством и скоростью. Полная установка занимает около 1,7 ТБ. Есть потоковый вариант, которому для старта требуется 215 ГБ: недостающие части загружаются по мере обращения и сохраняются в локальном кеше. Такой режим сначала работает еще медленнее.
У Deltafin есть локальный сервер с совместимыми с OpenAI маршрутами для чата и обычных completions. Это позволяет подключать существующие клиенты и некоторые инструменты для программирования без отдельного формата API. Но сервер обрабатывает одну генерацию за раз, а длинные диалоги дополнительно увеличивают задержки.
Поэтому нынешний Deltafin интереснее как технический эксперимент, чем как замена облачному Kimi. Он показывает, что граница между «модель слишком велика для одного компьютера» и «модель можно запустить локально» уже стала менее жесткой. Практической скорости этот инженерный трюк пока не дает.

Источник: GitHub
7 показов