Ant Group открыла доступ к Ling-3.0-tiny, компактной языковой модели с архитектурой MoE, ориентированной на локальный запуск. Главная особенность модели не в общем количестве параметров, а в том, что при обработке каждого токена используется только часть вычислительных ресурсов.
Ling-3.0-tiny содержит 7,9 млрд параметров, однако на один токен активируется около 1,3 млрд параметров. Для модели подготовлены варианты весов BF16, FP8 и INT4, что позволяет выбирать между качеством, скоростью и требованиями к памяти.
В основе используется гибридная архитектура с чередованием KDA и MLA, а также разреженная MoE-сеть с 128 экспертами. Такой подход позволяет сохранить возможности более крупных моделей при меньшей нагрузке на оборудование.
Разработчики заявляют, что Ling-3.0-tiny подходит для локального использования и уже проверяли ее работу на Nvidia DGX Spark, компьютерах с Apple Silicon и Mac mini. На MacBook с M4 Pro заявлена скорость около 86–90 токенов в секунду, а при работе с контекстом 8K пиковое потребление памяти составляет около 8,34 ГБ.
Практический смысл таких моделей заключается в том, что запуск ИИ без облачного сервиса становится доступнее для обычных компьютеров. При этом заявленные показатели пока остаются результатами разработчиков, а независимых сравнительных тестов для Ling-3.0-tiny недостаточно.
Ling-3.0-tiny запускается на Mac mini и требует меньше памяти за счет MoE
Ling-3.0-tiny получил открытые веса и рассчитан на локальный запуск без мощных серверов. Модель использует 7,9 млрд параметров, но активирует только 1,3 млрд параметров на каждый токен, что снижает требования к оборудованию.


Ling-3.0-tiny интересна не рекордным размером, а подходом к распределению нагрузки. Если заявленные характеристики подтвердятся в независимых проверках, компактные MoE-модели могут стать одним из самых удобных вариантов для локального ИИ на персональных компьютерах.
Источник: ITHome
8 показов
Материалы по теме
- Strata запускает большую Qwen на игровом ПК, но с 8 ГБ видеопамяти есть оговорка
- Edge0 держит 35B-модель в 2,9 ГБ активной памяти, выгружая экспертов на SSD
- Почему модель 70B не помещается в видеокарту на 24 ГБ: как считать память для локального ИИ
- HP ZBook Ultra G3a 16 нацелен на 300B-модели, но тестов пока нет
- AMD показала Threadripper Halo Station для локального запуска моделей свыше 1 трлн параметров