Ant Group открыла доступ к Ling-3.0-tiny, компактной языковой модели с архитектурой MoE, ориентированной на локальный запуск. Главная особенность модели не в общем количестве параметров, а в том, что при обработке каждого токена используется только часть вычислительных ресурсов.
Ling-3.0-tiny содержит 7,9 млрд параметров, однако на один токен активируется около 1,3 млрд параметров. Для модели подготовлены варианты весов BF16, FP8 и INT4, что позволяет выбирать между качеством, скоростью и требованиями к памяти.
В основе используется гибридная архитектура с чередованием KDA и MLA, а также разреженная MoE-сеть с 128 экспертами. Такой подход позволяет сохранить возможности более крупных моделей при меньшей нагрузке на оборудование.
Разработчики заявляют, что Ling-3.0-tiny подходит для локального использования и уже проверяли ее работу на Nvidia DGX Spark, компьютерах с Apple Silicon и Mac mini. На MacBook с M4 Pro заявлена скорость около 86–90 токенов в секунду, а при работе с контекстом 8K пиковое потребление памяти составляет около 8,34 ГБ.
Практический смысл таких моделей заключается в том, что запуск ИИ без облачного сервиса становится доступнее для обычных компьютеров. При этом заявленные показатели пока остаются результатами разработчиков, а независимых сравнительных тестов для Ling-3.0-tiny недостаточно.

Ling-3.0-tiny интересна не рекордным размером, а подходом к распределению нагрузки. Если заявленные характеристики подтвердятся в независимых проверках, компактные MoE-модели могут стать одним из самых удобных вариантов для локального ИИ на персональных компьютерах.








