Зачем компьютеру понадобился третий вычислительный блок
Процессор общего назначения умеет выполнять практически любой программный код. Его сильная сторона заключается в универсальности, быстром выполнении последовательных задач, ветвлений и операций, которые трудно заранее свести к однотипным вычислениям.
GPU устроен иначе. Видеокарта содержит большое количество параллельных вычислительных блоков и хорошо подходит для операций, где одни и те же действия выполняются одновременно над большим массивом данных. Именно поэтому GPU оказался удобен не только для графики, но и для обучения и запуска нейросетей.
Модели машинного обучения добавили еще один характерный тип нагрузки. Большая часть вычислений при инференсе, то есть при использовании уже обученной нейросети, сводится к огромному числу матричных операций. Высокая точность вычислений, необходимая для части традиционных программ, при этом часто не требуется. Модель можно перевести на INT8, INT4 или другой компактный формат и получить выигрыш по скорости, памяти и энергопотреблению.
Для таких задач появился NPU, Neural Processing Unit. Это специализированный аппаратный блок, рассчитанный на выполнение операций нейронных сетей с высокой эффективностью.
В мобильном компьютере у него есть дополнительная задача. Если постоянный эффект шумоподавления во время видеозвонка можно выполнять на небольшом NPU, нет необходимости держать активной более мощную графическую часть процессора. Снижается нагрузка на CPU и GPU, а для ноутбука это напрямую связано с расходом энергии.
Intel поэтому описывает собственное распределение задач довольно четко: CPU предназначен в том числе для AI-нагрузок с малой задержкой, GPU для высокой вычислительной производительности, NPU для продолжительных AI-задач с низким энергопотреблением. Это архитектурная логика производителя, а не правило, которому обязана следовать каждая программа.

NPU не является маленькой видеокартой
У NPU и GPU есть пересечение по типу вычислений. Оба могут быстро выполнять матричные операции, оба используются для машинного обучения, оба способны работать с пониженной точностью.
Разница находится в масштабе, универсальности и энергетическом бюджете.
Современный дискретный GPU содержит гораздо больше вычислительных ресурсов, собственную высокоскоростную память и инфраструктуру, рассчитанную на тяжелые параллельные задачи. Он может рендерить игры, кодировать видео, выполнять вычисления CUDA, DirectML, OpenCL и запускать крупные нейросетевые модели.
NPU обычно является значительно меньшим блоком внутри мобильной SoC. Его задача не состоит в замене RTX, Radeon или даже встроенной графики для всех задач ИИ. Он должен эффективно исполнять поддерживаемые нейросетевые графы и при этом занимать небольшую площадь кристалла и расходовать сравнительно мало энергии.
Это объясняет ситуацию, которая сначала кажется странной. В одном процессоре GPU может иметь больше AI-TOPS, чем NPU, но Microsoft все равно проверяет для Copilot+ именно производительность NPU.
У Intel Core Ultra 200V, например, производитель заявляет для платформы до 120 INT8 TOPS суммарно. Из них до 48 TOPS приходится на NPU, до 67 TOPS на GPU и до 5 TOPS на CPU. Складывать эти числа и считать результат эквивалентом одного 120-TOPS ускорителя нельзя. Это три разных вычислительных блока с разными интерфейсами, ограничениями и назначением.
Что означает TOPS
TOPS расшифровывается как Tera Operations Per Second, триллионы операций в секунду.
Производитель берет количество вычислительных блоков, число операций, которое они способны выполнить за такт, и рабочую частоту. На этой основе получается теоретическая пиковая производительность.
Intel прямо определяет TOPS как теоретический максимум при полной загрузке AI-ускорителя. Для своих актуальных показателей компания обычно использует INT8 без учета sparsity, если отдельно не указано обратное. Объяснение TOPS у Intel полезно именно этим уточнением: одна цифра имеет смысл только вместе с типом операции и условиями расчета.
Если NPU способен теоретически выполнять 50 триллионов INT8-операций в секунду, это не означает, что любая нейросеть на нем будет обрабатывать данные со скоростью 50 триллионов полезных операций.
Часть времени тратится на передачу данных. Модель может содержать операции, которые конкретный ускоритель не поддерживает. Не все вычислительные блоки удается занять одновременно. Размеры входных данных, структура модели, работа компилятора и память также влияют на результат.
TOPS поэтому ближе к пиковой паспортной вычислительной способности, чем к результату готовой программы.
Сравнивать по нему устройства можно только при сопоставимых методиках.
Почему 50 TOPS одного NPU не обязательно быстрее 45 TOPS другого
Предположим, один ноутбук имеет NPU на 50 TOPS, второй на 45 TOPS. Разница по паспортной цифре составляет около 11%.
Это еще не позволяет предсказать разницу в приложении.
Первый NPU может лучше выполнять сверточную сеть для обработки изображения, а второй эффективнее запускать Transformer. Один компилятор способен разместить модель практически целиком на ускорителе, другой вынужден возвращать часть операций на CPU.
Переход между устройствами сам по себе имеет стоимость. Если нейросетевой граф постоянно прыгает с NPU на процессор и обратно, задержки копирования и синхронизации съедают часть выигрыша.
В документации Ryzen AI это видно буквально на уровне выполнения модели. AMD указывает, что поддерживается определенный набор операторов ONNX. Граф автоматически разбивается на части: совместимые операции отправляются на NPU, остальные могут выполняться на CPU. Документация Ryzen AI также описывает квантование моделей и работу через ONNX Runtime.
Поэтому правильный тест NPU должен запускать одну и ту же модель, с одинаковой точностью, размерами входа и программным стеком.
Сравнение цифр на коробке этого не делает.
Почему производители говорят про INT8
Нейросети традиционно обучаются с использованием чисел с плавающей точкой. FP32 дает большой диапазон и точность, но требует много памяти и вычислений.
При инференсе точность часто можно уменьшить.
Вместо 32-битного числа вес модели хранится, например, как 8-битное целое. Такая процедура называется квантованием. Модель занимает меньше памяти, уменьшается объем передаваемых данных, ускоряются матричные операции.
Для некоторых сетей снижение точности почти не влияет на качество результата. Для других требуется более аккуратная калибровка или смешанная точность.
Поэтому NPU проектируются вокруг низкоточных форматов. INT8 стал удобной точкой сравнения, но современные ускорители поддерживают и другие варианты.
Это создает еще одну проблему с TOPS. Показатель при INT4 может оказаться намного выше, чем при INT8, потому что за то же время аппаратный блок обрабатывает больше коротких значений. Сравнивать INT4 TOPS одного устройства с INT8 TOPS второго нельзя.
То же касается sparsity. Если производитель считает, что часть весов модели равна нулю и соответствующие операции можно пропустить, формальный показатель способен вырасти. Поэтому у корректной цифры AI-производительности всегда должна быть сноска о типе данных и методике.
40 TOPS Microsoft не являются магической границей скорости
После появления Copilot+ PC число 40 стало восприниматься как техническая граница между обычным компьютером и AI PC.
На самом деле это квалификационное требование конкретной платформы Microsoft.
В руководстве для разработчиков Microsoft указывает, что для ряда функций Copilot+ требуется NPU производительностью 40 и более TOPS. В этот класс вошли системы Snapdragon X, AMD Ryzen AI 300 и Intel Core Ultra 200V. Актуальное руководство Microsoft для Copilot+ PC описывает NPU как отдельное требование для соответствующих возможностей Windows.
Компьютер с NPU на 38 TOPS не становится в два раза медленнее системы на 40 TOPS.
И ноутбук без 40-TOPS NPU не перестает запускать нейросети. Его CPU или GPU могут быть очень быстрыми. Дискретная видеокарта среднего и высокого класса способна значительно обгонять мобильный NPU в тяжелых задачах машинного обучения.
Граница нужна Microsoft для гарантированного набора возможностей и характеристик платформы.
Для покупателя 40 TOPS следует читать как условие совместимости с определенным классом Windows-функций, а не как универсальный рейтинг производительности ИИ.
Зачем Windows вообще знает о NPU
Если каждое приложение должно отдельно поддерживать Qualcomm Hexagon, AMD XDNA и Intel AI Boost, разработка локального ИИ быстро превращается в набор разных аппаратных версий.
Windows пытается создать над этим промежуточный слой.
В 2026 году Microsoft продвигает Windows ML как основной способ запуска моделей через доступные ускорители. Среда может работать с CPU, GPU и NPU и использует execution provider, то есть аппаратно-зависимый исполнитель для конкретной платформы. Для поддерживаемого оборудования нужный провайдер может загружаться автоматически.
В июльской документации 2026 года Microsoft прямо указывает переход от DirectML к Windows ML как рекомендуемому способу доступа к NPU и GPU в новых приложениях. Windows ML и поддерживаемые ускорители показывают, насколько программный стек стал частью реальной производительности NPU.
Аппаратный блок без драйвера и подходящего runtime почти бесполезен.
Это хорошо знакомо по видеокартам. Один и тот же GPU может показывать разную скорость в зависимости от API, драйвера и оптимизации программы. Для NPU зависимость еще сильнее, поскольку экосистема значительно моложе.
Почему программа может иметь доступ к NPU, но продолжать использовать GPU
Разработчик выбирает устройство не по принципу «NPU новее».
Сначала оценивается модель.
Если она слишком большая для эффективного выполнения на NPU, выгоднее использовать GPU. Если в ней много неподдерживаемых операторов, постоянное переключение на CPU способно сделать NPU бессмысленным. Если задача запускается один раз и должна закончиться максимально быстро, энергопотребление может быть менее важным, чем пиковая скорость.
Есть и противоположный случай.
Нейросеть шумоподавления должна работать все время, пока открыт видеозвонок. Ее вычислительная нагрузка относительно небольшая, но длится часами. Здесь экономичный NPU подходит значительно лучше.
Microsoft использует этот подход в Windows Studio Effects. Модели для автоматического кадрирования, коррекции взгляда, размытия фона и обработки голоса могут выполняться на NPU, уменьшая нагрузку на основные вычислительные блоки. Компания описывает именно энергоэффективное исполнение как одну из причин аппаратного ускорения этих эффектов.
Это и есть типичная задача NPU: не показать максимальный результат в коротком бенчмарке, а незаметно выполнять нейросеть в фоне.
Почему локальная большая языковая модель остается сложной задачей для NPU
LLM требует гораздо больше, чем способность быстро перемножать матрицы.
В память нужно поместить веса модели. Во время генерации растет KV-cache. Скорость чтения данных из памяти начинает влиять на число токенов в секунду. Для длинного контекста требования дополнительно увеличиваются.
Возьмем модель с 8 миллиардами параметров. При хранении каждого параметра в FP16 только веса занимают примерно 16 ГБ. В INT8 получится около 8 ГБ, в 4-битном виде около 4 ГБ до учета служебных данных.
У ноутбучного NPU обычно нет отдельной видеопамяти. Он работает с общей системной RAM.
Поэтому компьютер с 16 ГБ памяти и мощным NPU может быть менее удобен для локальных LLM, чем система с более слабой паспортной NPU-производительностью, но 32 или 64 ГБ RAM и хорошей пропускной способностью памяти.
Оперативная память становится частью AI-платформы.
Именно поэтому современные мобильные SoC с NPU одновременно получают быструю LPDDR5X и широкую шину памяти. TOPS без этого показателя описывают только вычислительную часть задачи.
Что такое prefill и decode и почему один ускоритель может быть хорош только в одной фазе
Работу языковой модели удобно разделить на две основные стадии.
Сначала модель обрабатывает исходный запрос и контекст. Эта фаза называется prefill. Здесь одновременно перемалывается большой объем известных входных токенов, поэтому хорошо работает высокий параллелизм.
Затем начинается генерация ответа. Модель создает токены последовательно. Эта стадия называется decode.
Для пользователя они воспринимаются по-разному.
Prefill влияет на задержку перед появлением первого ответа, особенно если в модель отправлен длинный документ. Decode определяет скорость последующей генерации, обычно измеряемую в токенах в секунду.
AMD в актуальном Ryzen AI Software уже использует гибридный режим для LLM, при котором NPU и встроенный GPU работают совместно. Производитель прямо пишет, что гибридная схема применяется для улучшения TTFT, времени до первого токена, и TPS, скорости генерации.
Сам этот факт хорошо показывает ограничения идеи «все перенесем на NPU».
Иногда лучшим AI-ускорителем оказывается комбинация разных блоков.
Почему GPU пока остается важнее для генерации изображений
Диффузионные модели вроде Stable Diffusion создают тяжелую вычислительную нагрузку и требуют значительного объема памяти.
Дискретные GPU много лет развивались именно в направлении высокой матричной производительности. NVIDIA имеет Tensor Cores и CUDA-экосистему, AMD поддерживает собственные вычислительные стеки, Windows предоставляет DirectML.
У NPU преимущество находится в другом диапазоне мощности.
Запустить небольшую модель генерации изображения на NPU технически возможно, если она поддерживается программным стеком. Но наличие такой возможности не означает превосходства над мощной видеокартой.
Поэтому ноутбук с RTX и слабым NPU может генерировать изображения значительно быстрее системы, где производитель крупно пишет 50 TOPS NPU.
Если покупатель берет компьютер именно для Stable Diffusion, ComfyUI, локального обучения моделей или тяжелой генерации, в первую очередь следует изучать GPU, объем видеопамяти и поддержку используемого программного стека.
NPU в таком компьютере остается дополнительным блоком.
NPU почти не помогает обучать большие модели
Большинство клиентских NPU ориентировано на inference.
Обучение требует вычисления градиентов, хранения промежуточных активаций и обновления большого количества параметров. Требования к памяти и программной инфраструктуре резко возрастают.
Поэтому современные AI-PC не превращаются в замену серверным GPU.
На NPU можно выполнять отдельные задачи дообучения или адаптации небольших моделей, если архитектура и ПО это позволяют. Но покупка ноутбука с 50 TOPS ради обучения Llama с нуля не имеет практического смысла.
Даже термин «AI PC» здесь способен вводить в заблуждение. Он описывает компьютер с локальными AI-возможностями, а не компактную рабочую станцию для разработки фундаментальных моделей.
Почему NPU особенно хорошо подходит для камеры
Видеопоток создает характерную постоянную нагрузку.
Камера отдает 30 или 60 кадров каждую секунду. На каждом кадре нужно найти лицо, определить его положение, отделить человека от фона или скорректировать взгляд.
Размер модели можно заранее контролировать. Разрешение входа известно. Задержка должна быть небольшой, но рекордная пиковая производительность не требуется.
Такую задачу удобно держать на специализированном блоке.
Если то же самое выполняет GPU во время игры или 3D-рендера, две нагрузки начинают бороться за одни вычислительные ресурсы. Перенос эффектов камеры на NPU освобождает графическую часть.
В настольном ПК с мощным блоком питания экономия нескольких ватт имеет небольшое значение. Для тонкого ноутбука она влияет и на автономность, и на температуру, и на шум системы охлаждения.
Именно поэтому первые массовые NPU появились прежде всего в мобильных процессорах.
Почему шумоподавление тоже является удачным сценарием
Аудиомодель еще меньше видеомодели.
Она постоянно получает небольшой поток данных и должна отличить голос от клавиатуры, вентилятора, фонового разговора и других звуков.
Нагрузка сравнительно невелика, но должна работать без пауз в течение всего звонка.
Использование большого GPU для такой операции неэффективно. CPU тоже справится, но тогда фоновой сервис постоянно отнимает часть его энергетического бюджета.
NPU позволяет вынести обработку отдельно.
Поэтому реальная польза AI-ускорителя может быть совершенно незаметна в диспетчере задач. Пользователь не увидит моментального ускорения Windows в два раза. Он получит меньшую фоновую загрузку основных блоков при активной нейросетевой функции.
Это менее эффектно, чем генерация картинки за пять секунд, но лучше соответствует архитектуре NPU.
Может ли браузер использовать NPU
Технически да, но наличие браузера и NPU еще не означает, что любая нейросеть на веб-странице автоматически туда попадет.
Нужен программный интерфейс, который умеет выбрать аппаратный backend.
WebNN разрабатывается именно как API для ускорения нейросетей в веб-приложениях. Но итоговая поддержка зависит от браузера, операционной системы, драйвера и конкретной модели.
Поэтому веб-сервис с локальным распознаванием речи может сегодня работать через GPU, завтра через NPU, а на старом ПК перейти на CPU.
Для пользователя это еще одна причина не покупать компьютер по списку «AI Features» без проверки конкретных приложений.
Главный вопрос должен звучать так: программа, которой я пользуюсь, умеет использовать этот NPU?
Если нет, 50 TOPS простаивают.
Почему NPU первого поколения быстро устарели по формальной классификации
Первые Ryzen AI и Intel Core Ultra Meteor Lake уже содержали NPU, но их производительность оказалась ниже требования Copilot+.
Это не означает, что ускорители перестали работать.
Они продолжают выполнять поддерживаемые модели и функции. Microsoft даже указывает, что часть Windows Studio Effects доступна устройствам с NPU производительностью ниже 40 TOPS. Набор возможностей в этом случае ограничен.
Здесь хорошо видна разница между технологической полезностью и маркетинговым классом.
NPU на 10-15 TOPS вполне способен обрабатывать камеру или небольшую нейросеть. Он просто не соответствует новому порогу Microsoft.
При покупке подержанного ноутбука поэтому нельзя делать вывод только по отсутствию логотипа Copilot+.
Нужно смотреть, какую задачу планируется выполнять.
Почему Qualcomm, AMD и Intel нельзя сравнивать только по NPU TOPS
У Snapdragon X Elite NPU Hexagon заявлен на 45 TOPS. У Ryzen AI 300 XDNA 2 показатель достигает 50 TOPS. У Intel Core Ultra 200V NPU достигает примерно 48 TOPS в зависимости от модели.
По цифрам они находятся рядом.
Но это разные архитектуры, CPU, GPU, память и программные платформы.
Snapdragon использует Arm и собственный Hexagon. AMD строит NPU на XDNA. Intel использует AI Boost. Модель должна пройти через соответствующий компилятор и execution provider.
Даже одинаковый ONNX-файл не гарантирует абсолютно одинаковый набор операций на аппаратном ускорителе.
Именно поэтому отрасли нужен прикладной тест.
MLCommons в апреле 2025 года выпустила MLPerf Client v0.6 с поддержкой NPU и GPU в AI-PC. Проект создается при участии AMD, Intel, Microsoft, NVIDIA, Qualcomm и производителей компьютеров и предназначен для воспроизводимого сравнения потребительских AI-нагрузок. Описание MLPerf Client хорошо показывает направление рынка: вместо суммирования TOPS сравнивается работа конкретной модели.
Это намного полезнее паспортной арифметики.

Почему TOPS нельзя складывать так же, как объем SSD
На презентации можно увидеть формулировку «120 Platform TOPS».
Она получается суммированием возможностей CPU, GPU и NPU. Такое число показывает общую теоретическую AI-производительность разных блоков платформы.
Но программа не получает автоматически единый ускоритель на 120 TOPS.
Чтобы использовать несколько устройств, модель нужно разделить или назначить разные части задачи разным исполнителям. Нужно учитывать передачу данных и синхронизацию.
Некоторые задачи действительно выигрывают от гетерогенных вычислений. AMD, например, использует гибридную схему NPU + iGPU для LLM.
Но если программа умеет работать только с NPU, GPU TOPS к ее скорости не добавятся.
Поэтому при выборе Copilot+ PC важны именно NPU TOPS. При выборе компьютера для Stable Diffusion важнее GPU. При выборе платформы для гибридного локального LLM придется смотреть на оба блока и конкретный runtime.
Одна суммарная цифра скрывает эти различия.
Почему объем памяти может быть важнее еще десяти TOPS
Для небольших моделей память почти не заметна. Нейросеть шумоподавления или сегментации помещается без проблем.
С LLM ситуация меняется.
Модель должна находиться в памяти одновременно с Windows, приложениями и контекстом. Если система начинает активно использовать файл подкачки, высокая вычислительная производительность перестает помогать.
Поэтому для локального ИИ 16 ГБ RAM постепенно превращаются в нижний практический уровень, а 32 ГБ дают намного больше свободы.
Это особенно верно для систем с объединенной памятью, где CPU, GPU и NPU используют один общий пул.
В таком ноутбуке из условных 32 ГБ часть уйдет операционной системе, часть модели, часть KV-cache, часть графике.
Покупатель может выбрать более дорогой процессор ради лишних нескольких TOPS, но получить меньше реальной пользы, чем от перехода с 16 до 32 ГБ RAM.
Для генеративного ИИ такой компромисс нужно оценивать до покупки.
Почему пропускная способность памяти влияет на генерацию токенов
При генерации LLM ускоритель постоянно читает веса модели.
Если вычислительные блоки способны обработать данные быстрее, чем память успевает их подать, возникает memory-bound режим. Дополнительные TOPS начинают простаивать.
Упрощенный пример: модель содержит 8 миллиардов параметров и занимает около 4 ГБ после 4-битного квантования. При генерации каждого токена значительная часть весов должна участвовать в вычислении.
Это не означает буквальное чтение ровно 4 ГБ с DRAM для каждого токена в любой реализации. Кэширование и архитектура модели меняют картину. Но фундаментальное ограничение остается: пропускная способность памяти определяет потолок для задач, где вычислитель слишком быстро упирается в перемещение весов.
Поэтому современные AI-процессоры рекламируют не только NPU.
Быстрая LPDDR5X, широкая шина и эффективное кэширование являются частью той же системы.
Почему локальный ИИ не обязательно быстрее облачного
NPU убирает передачу запроса в дата-центр, но облачный сервер содержит аппаратное обеспечение другого класса.
Небольшая локальная модель может отвечать почти мгновенно и работать без интернета. Большая облачная модель использует десятки или сотни гигабайт ускорительной памяти и значительно больше вычислительной мощности.
Поэтому локальный ИИ выигрывает не во всех сценариях.
Его сильные стороны находятся в другом месте: данные могут не покидать устройство, нет сетевой задержки, функция может работать офлайн, а повторное использование не требует оплаты каждого запроса серверу.
Облако дает доступ к значительно более крупным моделям и позволяет обновлять их без изменения пользовательского компьютера.
Реальные приложения постепенно становятся гибридными. Простая обработка камеры выполняется локально, тяжелая генерация или поиск информации уходит в облако.
NPU в такой архитектуре закрывает локальную часть.
Означает ли локальный NPU полную конфиденциальность
Нет. Если модель физически выполняется на NPU, вычисления конкретного инференса происходят на устройстве. Это уменьшает необходимость отправлять исходные данные на удаленный сервер.
Но конфиденциальность определяется всей программой.
Приложение может запускать модель локально и одновременно отправлять телеметрию. Часть обработки может происходить на NPU, часть в облаке. Загруженный документ может использоваться локальным embedding-модулем, а затем его фрагменты отправляться сетевому сервису.
Поэтому слово on-device описывает место выполнения конкретной операции, а не политику обработки данных целиком.
Для чувствительной информации нужно читать условия конкретного приложения и проверять сетевое поведение.
Наличие NPU само по себе никакой гарантии конфиденциальности не дает.
Почему NPU не ускоряет Windows целиком
Одна из самых неудачных ассоциаций вокруг AI PC состоит в том, что отдельный AI-блок должен каким-то образом ускорять все приложения.
NPU выполняет только код, который на него отправлен.
Проводник Windows, браузер без локальной AI-функции, архиватор, игра без нейросетевого модуля и большинство старых программ не получают автоматического ускорения.
Если пользователь купит новый ноутбук с 50-TOPS NPU и будет запускать на нем только Word, Chrome и старую бухгалтерскую программу, NPU может большую часть времени оставаться практически без нагрузки.
На обычную отзывчивость компьютера по-прежнему сильнее влияют производительность CPU, объем RAM, скорость SSD и поведение фоновых приложений.
Поэтому фраза «AI processor» не должна отвлекать от обычных характеристик ноутбука.
Как увидеть, работает ли NPU
В актуальной Windows 11 NPU поддерживаемого устройства отображается в диспетчере задач.
Microsoft рекомендует открыть Performance и посмотреть отдельный раздел NPU. Там можно наблюдать загрузку ускорителя при работе совместимого приложения.
Это полезный практический тест.
Если производитель программы заявляет NPU acceleration, можно запустить функцию и посмотреть, появляется ли нагрузка.
Однако нулевая загрузка не всегда означает ошибку. Короткий инференс может завершиться быстрее, чем обновляется график. Часть модели может выполняться на GPU или CPU.
Для серьезного сравнения нужны встроенные профилировщики или специальные бенчмарки.
Но для проверки самого факта использования NPU диспетчер задач подходит.
Можно ли заставить любое приложение использовать NPU вручную
Обычно нет. В Windows существует настройка выбора GPU для приложений, но универсального переключателя «запустить эту программу на NPU» по смыслу быть не может.
Обычный x86 или Arm-код нельзя просто перенести на нейронный ускоритель.
Программа должна содержать модель машинного обучения, поддерживать подходящий runtime и передать граф нейросети execution provider.
Даже после этого runtime может решить, что часть операций должна идти на CPU.
Поэтому установка нового драйвера NPU не ускорит старую программу распознавания речи, если она никогда не была написана для этого ускорителя.
Поддержка должна появиться на уровне приложения или используемой им библиотеки.
Почему наличие NPU не означает одинаковые функции на всех ноутбуках
Аппаратная совместимость является только первым уровнем.
Windows Studio Effects требует подходящий NPU, но Microsoft отдельно указывает роль драйвера OEM. Производитель ноутбука должен реализовать поддержку устройства и соответствующих эффектов.
Есть также различия по камерам и микрофонам.
Два ноутбука с одинаковым процессором могут использовать разные сенсоры, ISP и драйверы. Набор функций Windows в результате способен различаться.
То же происходит со сторонними программами. Разработчик может сначала добавить поддержку Qualcomm, через несколько месяцев Intel и только затем AMD.
Поэтому список совместимых AI-функций нужно проверять для конкретной модели ноутбука и версии ПО.
Чип отвечает за возможность. Готовое устройство отвечает за реализацию.
Стоит ли специально переплачивать за 50 TOPS вместо 40
Если единственная причина покупки состоит в том, что 50 больше 40, нет.
Разница в 25% по теоретическому INT8-пику не гарантирует соответствующей разницы в реальном приложении.
Сначала нужно сравнить CPU, GPU, память, автономность, экран, охлаждение и цену ноутбука.
Затем проверить конкретную AI-нагрузку.
Для Windows Studio Effects оба NPU могут обеспечивать нужный класс возможностей, и пользователь не увидит разницы в 25%.
Для хорошо масштабируемой локальной модели более мощный NPU способен дать ускорение, но его величина определяется конкретной архитектурой.
Для программы, которая вообще не поддерживает NPU, результат будет одинаковым: ноль полезных TOPS.
Когда мощный NPU действительно имеет смысл
Первый сценарий, регулярные видеозвонки. Эффекты камеры и голоса работают постоянно, поэтому энергоэффективный ускоритель дает понятную пользу.
Второй, локальное распознавание речи, субтитры и небольшие модели перевода. Такие функции хорошо подходят для постоянной фоновой обработки.
Третий, приложения, которые уже имеют подтвержденную поддержку конкретного NPU. Здесь можно получить меньшую нагрузку на GPU и более длительную работу от батареи.
Четвертый, разработка локальных AI-приложений. Для программиста наличие актуальной платформы AMD, Intel или Qualcomm позволяет тестировать Windows ML, ONNX Runtime и аппаратные execution providers непосредственно на устройстве.
Пятый, небольшой локальный генеративный ИИ, если конкретная модель оптимизирована под NPU и помещается в доступную память.
Общее между этими сценариями одно: существует программное обеспечение, которое действительно знает об ускорителе.
Когда NPU можно почти игнорировать
Для игрового ноутбука приоритет остается у GPU и CPU.
Для Blender, CUDA-вычислений, тяжелого Stable Diffusion и большинства профессиональных AI-задач важнее дискретная видеокарта.
Для офисного компьютера без постоянных AI-функций NPU может годами использоваться только отдельными возможностями Windows.
Для домашнего ПК, который работает от розетки, преимущество энергоэффективного фонового инференса менее существенно, чем для ультрабука.
При выборе между двумя моделями ноутбуков поэтому иногда разумнее взять вариант с более качественным экраном, большим SSD или 32 ГБ памяти, чем доплачивать исключительно за более высокие NPU TOPS.
Ускоритель полезен только вместе с нагрузкой.
Как выбирать AI-ноутбук без маркетинговой арифметики
Сначала нужно определить приложения.
Если нужен Copilot+ PC и его локальные функции Windows, проверяется соответствие требованиям Microsoft. NPU должен относиться к поддерживаемому поколению и обеспечивать необходимый класс производительности.
Если интересуют локальные LLM, следующим параметром становится память. 32 ГБ выглядят значительно разумнее 16 ГБ, а для крупных моделей полезен еще больший объем.
После этого стоит проверить поддержку runtime. Для AMD это Ryzen AI Software и соответствующие execution providers, для Intel важны OpenVINO и Windows ML, Qualcomm имеет собственную платформу Hexagon и Windows-интеграцию.
Для генерации изображений и тяжелых нейросетей отдельно оценивается GPU.
И только после этого TOPS дают полезную дополнительную информацию.
Такой порядок защищает от типичной ошибки, когда покупатель выбирает максимальную цифру NPU, а затем выясняет, что нужная программа использует только видеокарту.
Как правильно тестировать NPU
Хороший тест должен отвечать на реальную задачу.
Для распознавания речи измеряется время обработки фиксированной записи, задержка и энергопотребление.
Для компьютерного зрения можно сравнить количество обработанных кадров в секунду при одинаковой модели и разрешении.
Для LLM важны минимум время до первого токена и скорость последующей генерации. Дополнительно фиксируются размер модели, тип квантования, длина контекста и потребление памяти.
Для ноутбука полезен показатель энергии на выполненную задачу, а не только максимальная скорость.
Система, которая выполняет модель на 10% медленнее, но расходует вдвое меньше энергии, может быть лучшим NPU именно для мобильного компьютера.
TOPS этого не показывают.
Почему развитие NPU только начинается
Первые потребительские NPU были очень скромными по сравнению с современными.
За несколько поколений производительность выросла до десятков TOPS, а Qualcomm уже заявляет для новых Snapdragon X2 NPU класса 80 TOPS. Но рост аппаратной мощности идет быстрее, чем массовое появление программ, которые полностью ее используют.
С GPU ситуация когда-то была похожей.
Аппаратный шейдерный блок постепенно превратился в универсальный параллельный вычислитель только после развития API, драйверов и инструментов.
Для NPU сейчас происходит аналогичный этап стандартизации. Windows ML пытается скрыть различия между производителями, ONNX дает переносимый формат моделей, а отраслевые тесты начинают измерять не абстрактные TOPS, а прикладное выполнение.
Поэтому главный прогресс ближайших поколений может прийти не от очередного удвоения паспортной цифры, а от программной совместимости.
Что в характеристиках NPU действительно стоит читать
Сам показатель TOPS нужен, но рядом с ним должны находиться дополнительные данные.
Нужно знать, при какой точности он рассчитан. INT8 и INT4 сравниваются отдельно.
Полезно понимать, поддерживает ли показатель sparsity.
Для локальных моделей важны объем и пропускная способность памяти всей системы.
Для ноутбука имеет значение производительность на ватт.
Для конкретного приложения нужна поддержка runtime и операторов модели.
Для генеративного ИИ полезнее реальные измерения TTFT, токенов в секунду, времени генерации изображения или другой прикладной метрики.
Если производитель показывает только крупную цифру TOPS и не объясняет условия, она описывает потенциальную вычислительную способность, но почти ничего не говорит о пользовательском результате.
NPU нужен не для того, чтобы заменить CPU и GPU
Появление третьего вычислительного блока иногда описывают как очередную смену архитектуры ПК. На практике NPU работает лучше именно как дополнение.
CPU остается самым универсальным исполнителем.
GPU берет тяжелый параллельный код, графику и крупные нейросетевые нагрузки.
NPU закрывает энергоэффективный локальный инференс, особенно если модель должна работать постоянно.
Современные программные платформы уже начинают использовать все три устройства одновременно. AMD прямо предлагает гибридное выполнение LLM на NPU и iGPU, а Intel считает суммарную AI-производительность всей платформы. Windows ML строится вокруг выбора доступного аппаратного исполнителя.
Поэтому вопрос «что быстрее, NPU или GPU» поставлен слишком широко.
Правильный вопрос звучит иначе: какой вычислительный блок лучше подходит для конкретной модели при заданных требованиях к скорости, памяти и энергопотреблению.
Что в итоге означает маркировка AI PC
Наличие NPU подтверждает, что компьютер имеет специализированный блок для нейросетевых вычислений.
Оно не подтверждает, что любая AI-программа будет работать быстрее.
50 TOPS не означают 50 TOPS в каждом приложении. Суммарные Platform TOPS нельзя автоматически использовать как производительность одной модели. Два NPU с близкими паспортными числами могут заметно различаться в реальных задачах.
Для обычного покупателя NPU имеет понятную ценность там, где нейросетевая функция работает долго и регулярно: камера, звук, распознавание, перевод, локальный помощник. Для тяжелой генерации и профессионального машинного обучения GPU пока остается более значимым компонентом.
Самая полезная характеристика AI-компьютера поэтому редко помещается в одну строку спецификации. Нужно одновременно смотреть на NPU, GPU, объем и скорость памяти, программную поддержку и конкретные модели, которые будут запускаться.
И только после этого число TOPS перестает быть рекламной цифрой и начинает что-то объяснять.








