Перейти к содержимому
Новость

Strata запускает большую Qwen на игровом ПК, но с 8 ГБ видеопамяти есть оговорка

Strata позволяет запускать Qwen3.8-Flash-Next локально на обычном ПК, распределяя модель между видеокартой, оперативной памятью и SSD. Однако заявленные в первоначальном описании 8 ГБ VRAM сейчас выглядят скорее нижней технической границей: актуальная инструкция проекта рекомендует видеокарту NVIDIA с 12 ГБ и 64 ГБ оперативной памяти.

RaVic
Strata запускает большую Qwen на игровом ПК, но с 8 ГБ видеопамяти есть оговорка

Автор: Niko1221

Интерес Strata не столько в очередном локальном интерфейсе для нейросети, сколько в способе разложить очень большую MoE-модель по ресурсам домашнего компьютера. В репозитории Strata разработчик предлагает готовую установку для Windows и Linux: скрипт загружает движок, модель и необходимые компоненты, после чего поднимает локальный сервер с OpenAI-совместимым API и отдельным endpoint для приложений, работающих с Anthropic API.
Здесь и появляется существенная поправка к исходному анонсу. В коротком описании проекта упоминалась NVIDIA с 8 ГБ видеопамяти, но актуальный README указывает RTX 30, 40 или 50 с 12 ГБ VRAM и более. В расширенной документации 8 ГБ все еще фигурируют как работоспособный, но медленный вариант. Иными словами, считать Strata способом нормально запустить такую модель на типичной 8-гигабайтной видеокарте пока рано.

03_2560x1440_226f29c07c

Фото: Niko1221


Видеопамять при этом не обязана вмещать модель целиком. Strata держит часто используемую часть вычислений на GPU, полный набор экспертов размещает в системной RAM, а крупную таблицу обращений оставляет на SSD. Для разных вариантов квантования требуется примерно от 37,6 до 54,8 ГБ суммарного пространства RAM и VRAM, причем увеличение объема видеопамяти повышает скорость, но не отменяет потребность в большом объеме оперативной памяти. Для старшей квантованной версии разработчик рекомендует уже 64 ГБ RAM.
Есть и результаты собственных измерений автора Strata. На RTX 5070 12 ГБ, Ryzen 5 7600 и 64 ГБ памяти вариант Q2_0 выдавал около 90 токенов в секунду в коротком диалоге и 67 токенов в секунду при контексте 128K. IQ3_S оказался медленнее: 52 и 41 токен в секунду соответственно. Это измерения самого разработчика проекта, независимых тестов такой конфигурации пока недостаточно, поэтому воспринимать цифры как универсальную производительность любой RTX 5070 не стоит.
У Strata есть еще одно практическое отличие от простого запуска GGUF через командную строку. После установки модель доступна через браузер, терминал и локальный API, поддерживается ввод изображений, а для нескольких совместимых NVIDIA предусмотрено распределение работы между GPU. Первый запуск тяжелый: документация предупреждает о загрузке десятков гигабайт данных в RAM и возможном заметном замедлении системы на несколько минут.

04_720x414_5122d0b906

Фото: Niko1221


Поэтому новость интереснее первоначального обещания «125B на 8 ГБ». Strata действительно пытается сделать серверную по масштабу модель пригодной для домашнего ПК, но основным ресурсом здесь становится не одна видеокарта, а вся связка GPU, 48-64 ГБ оперативной памяти и быстрый SSD. Видеокарта с 8 ГБ может оказаться достаточной для эксперимента, но текущая конфигурация, на которую ориентируется сам проект, начинается с 12 ГБ VRAM.

Источник: GitHub
7 показов