У цифры «около 1000 токенов в секунду» есть условие, которое легко потерять в заголовке. Автор проекта syv-ai получил такую пропускную способность не в одном чате с моделью, а при пакетной обработке 64 параллельных запросов. Для локального сервера с большим числом клиентов это сильный результат. Для человека, который хочет поставить Qwen3.8-27B дома и разговаривать с ней через локальный интерфейс, гораздо интереснее другая цифра.
В опубликованной 27 августа версии проекта для одиночного запроса указывались примерно 114 токенов в секунду со стандартными параметрами генерации и около 124 токенов в секунду в жадном режиме. Причем речь идет об одной GeForce RTX 3090 с 24 ГБ памяти, а лимит мощности во время тестов был снижен до 250 Вт вместо штатных для карты 350 Вт.
Проект к моменту проверки продолжил быстро меняться. В актуальном README для режима с одним пользователем уже приведены 121 токен в секунду при стандартном семплировании и 120 токенов в секунду в greedy-режиме при контексте 64 тыс. токенов. Альтернативная схема спекулятивного декодирования DFlash2 дает 127 и 130 токенов в секунду соответственно. Все эти результаты получены автором проекта через vLLM Bench Serve, поэтому считать их независимым тестированием RTX 3090 нельзя.
Причина высокой скорости не сводится к простой загрузке уменьшенной модели в видеопамять. В проекте используется 4-битная версия Qwen3.8-27B, дополнительное переквантование отдельных частей модели, вычисления INT8 на тензорных ядрах и спекулятивная генерация MTP. Модель сначала готовит несколько возможных следующих токенов, после чего основная сеть проверяет их пачкой. Если предположения совпадают достаточно часто, за один проход получается принять больше одного токена.
Здесь и проходит граница между красивой цифрой и полезной цифрой. Пакетный режим ориентирован на API, автоматические конвейеры и несколько десятков параллельных запросов. В нем проект указывает около 1035 токенов в секунду устойчивой скорости декодирования при 64 одновременных задачах и примерно 948 токенов в секунду с учетом полного времени обработки. Один пользователь эти 1000 токенов в секунду не увидит.

Но результат одиночного режима от этого менее интересным не становится. Официальная Qwen3.8-27B относится к плотным моделям примерно 28-миллиардного класса, а ее веса доступны открыто. Запуск такой модели на одной потребительской карте с 24 ГБ памяти уже подтверждается самим фактом существования рабочего проекта, хотя достигнутые скорости пока остаются результатами его автора, а не независимой лаборатории.
С контекстом ситуация похожая. Базовый профиль проекта рассчитан примерно на 64 тыс. токенов, длинный режим достигает 150 тыс., а вариант до 262 тыс. требует отдельного KV-кэша KVarN с дополнительным квантованием. На длинном контексте скорость одиночной генерации падает: для режима 150 тыс. токенов сейчас указаны около 96 токенов в секунду со стандартным семплированием и 102 в greedy.
Поэтому главный результат этого эксперимента не в самой тысяче токенов. Интереснее то, что Qwen3.8-27B удалось превратить в достаточно быстрый локальный сервер на одной RTX 3090, причем отдельно оптимизировать его под массовые запросы и под обычный чат. Цена этой скорости тоже ясна: специальная квантованная сборка, патчи vLLM и набор оптимизаций, которых нет в стандартном запуске модели.








