Самое интересное в проекте Deltafin не сам факт локального запуска большой языковой модели, а отказ от урезания ее экспертной части. Kimi K3 использует архитектуру MoE: из 896 экспертов для каждого токена выбираются 16. Разработчик Deltafin заявляет, что сохраняет полный набор весов K3 и не уменьшает число используемых моделью экспертов.
За это приходится платить дисковым пространством и скоростью. Полная установка занимает около 1,7 ТБ. Есть потоковый вариант, которому для старта требуется 215 ГБ: недостающие части загружаются по мере обращения и сохраняются в локальном кеше. Такой режим сначала работает еще медленнее.
У Deltafin есть локальный сервер с совместимыми с OpenAI маршрутами для чата и обычных completions. Это позволяет подключать существующие клиенты и некоторые инструменты для программирования без отдельного формата API. Но сервер обрабатывает одну генерацию за раз, а длинные диалоги дополнительно увеличивают задержки.
Поэтому нынешний Deltafin интереснее как технический эксперимент, чем как замена облачному Kimi. Он показывает, что граница между «модель слишком велика для одного компьютера» и «модель можно запустить локально» уже стала менее жесткой. Практической скорости этот инженерный трюк пока не дает.
Deltafin запустил полный Kimi K3 на одном Mac, но быстро отвечать он пока не умеет
Полная модель Kimi K3 с 2,8 трлн параметров действительно запускается на одном компьютере. На M1 Max актуальный результат Deltafin составляет 0,2901 токена в секунду, то есть один токен генерируется примерно за 3,45 секунды.

Автор: gavamedia
Источник: GitHub
2 просмотров







