Сам Kimi K3 построен по схеме Mixture-of-Experts: при генерации каждого токена работает лишь часть огромной модели. Moonshot AI указывает 2,8 трлн параметров всего и 104 млрд активируемых параметров. WARP использует эту особенность буквально: общую часть держит в оперативной памяти, а выбранные эксперты читает с накопителя по мере необходимости.
Разработчики WARP сообщают, что полный Kimi K3, без дистилляции и обрезки, работает на MacBook Pro с M5 Pro и 64 ГБ RAM. Преобразованный контейнер занимает 982 ГБ, а измеренная скорость декодирования составляет 0,45-0,62 токена в секунду. Для открытия модели достаточно 29,19 ГБ памяти, хотя практическим минимумом авторы проекта считают 64 ГБ.
Здесь и проходит граница между технической возможностью и удобством. WARP показывает, что терабайтная MoE-модель уже не обязана целиком помещаться в оперативную память, если быстрый NVMe становится частью подсистемы инференса. Но накопитель при этом критичен: холодный токен требует чтения примерно 17 ГБ данных, а внешний USB-накопитель в тесте оказался слишком медленным.
Это пока скорее демонстрация нового способа локального запуска огромных моделей, чем замена облачному Kimi K3. Сам факт работы полного K3 на машине с 64 ГБ памяти интереснее скорости: ограничение сместилось с объема RAM к пропускной способности и емкости NVMe.
WARP запустил полный Kimi K3 на 64 ГБ памяти, но скорость пока терпеливая
Полный Kimi K3 с 2,78 трлн параметров удалось запустить на MacBook Pro с 64 ГБ памяти. Вместо размещения всей модели в RAM движок WARP подгружает нужные эксперты прямо с NVMe, но платой стала скорость около половины токена в секунду.

Автор: sqliteai
Источник: GitHub







