Ant Group выпустила Ling-3.0-flash еще в конце июля, но тогда речь шла прежде всего о доступе через облачные сервисы. Публикацию весов компания обещала позднее, и теперь эта часть релиза состоялась: модель доступна для самостоятельного развертывания, а репозиторий использует лицензию MIT. Карточка Ling-3.0-flash на Hugging Face содержит сами веса, конфигурацию и инструкции для запуска через SGLang и vLLM.
Цифра 124 млрд параметров сама по себе создает не совсем верное впечатление о вычислительной тяжести Ling-3.0-flash. Это MoE-модель: из сотен экспертов для каждого токена выбирается лишь небольшая часть. В результате реально работают 5,1 млрд параметров. У предыдущей флагманской Ring-2.6-1T было 1 трлн параметров, из которых при инференсе активировались 63 млрд. Иными словами, новая модель использует примерно в 12 раз меньше активных параметров.
В данном случае уменьшение вычислений не сопровождается очевидным падением качества. По актуальной методике Artificial Analysis Ling-3.0-flash получила 38 баллов Intelligence Index, тогда как Ring-2.6-1T получила 31 балл. Сравнение нельзя воспринимать как доказательство превосходства во всех задачах: индекс объединяет несколько тестов на знания, программирование, работу с инструментами и длинным контекстом. Но это уже независимый результат, а не таблица самой Ant Group.


Разница заметна и в скорости облачного инференса. Artificial Analysis измерила около 368 токенов в секунду для Ling-3.0-flash. У Ring-2.6-1T в тех же данных результат находится примерно на уровне 126 токенов в секунду. Условия обслуживания моделей различаются, поэтому напрямую переносить это соотношение на собственные серверы нельзя, но направление хорошо согласуется с архитектурой: вычислять 5,1 млрд активных параметров значительно проще, чем 63 млрд.
Есть и менее приятная сторона. Малое число активных параметров не означает, что модель превратилась в обычную 5-миллиардную LLM. Полный набор весов все равно содержит около 124 млрд параметров, поэтому требования к памяти остаются высокими. В официальной инструкции для исходной версии рекомендуются четыре ускорителя с памятью класса 141 ГБ либо восемь H100/H800 по 80 ГБ. Квантованные варианты сокращают требования, но активные параметры и объем весов здесь нельзя считать одной и той же величиной.
Именно поэтому публикация Ling-3.0-flash интереснее очередной гонки за большим числом параметров. Ant Group уменьшила вычисляемую на каждом шаге часть модели примерно в двенадцать раз относительно Ring-2.6-1T, а независимый сводный тест пока фиксирует не потерю, а рост результата. Для серверного использования это куда содержательнее цифры 124B на странице модели.








