Hexagon NPU
Qualcomm Hexagon NPU это встроенный нейронный процессор, лежащий в основе каждой современной гарнитуры Snapdragon XR, — это полное техническое описание ее архитектуры, эволюции, возможностей и важнейшей роли в пространственных вычислениях.

Мозг, стоящий за каждым опытом работы с Qualcomm XR
Qualcomm Hexagon NPU (Neural Processing Unit) — это специализированный ускоритель искусственного интеллекта, встроенный в каждое устройство на базе чипов Snapdragon с расширенной реальностью, включая XR2 Gen 2 и XR2 + Gen 2, которые используются в Meta Quest 3, Pico 4 Ultra и Samsung Galaxy XR. Именно по этой аппаратной причине современные автономные гарнитуры XR могут одновременно отслеживать ваши руки, глаза, лицо и окружающую вас комнату — и все это в режиме реального времени, со сверхнизкой задержкой, без подключения к внешнему компьютеру и без разряда аккумулятора за двадцать минут.
Название «Hexagon» стало фирменным знаком Qualcomm за ее обработку сигналов и архитектуру искусственного интеллекта с 2010 года. То, что начиналось как цифровой сигнальный процессор (DSP) для аудио- и модемных задач, за более чем десятилетие развития превратилось в один из самых сложных встроенных процессоров искусственного интеллекта в мире, способный локально запускать большие языковые модели, обрабатывать десятки потоков с камер одновременно и выполнять триллионы операций. операций с плавающей запятой в секунду, потребляя при этом милливатты энергии.
В частности, в контексте XR Hexagon NPU не является вспомогательным ускорителем, помогающим графическому процессору справляться с задачами переполнения. Это основной вычислительный модуль для всех взаимодействий с XR, управляемых ИИ: отслеживания движений рук, глаз, лица, распознавания жестов, прогнозирования положения головы, понимания сцены, оценки глубины, пространственной обработки звука и голоса. Понимание Hexagon — это понимание того, почему гарнитуры XR вообще работают.
Основная архитектура Qualcomm Hexagon NPU
«Наш ведущий в отрасли процессор Qualcomm Hexagon NPU предназначен для стабильного и высокопроизводительного вывода данных с помощью искусственного интеллекта при низком энергопотреблении. Отличительной чертой нашего процессора NPU является системный подход, индивидуальный дизайн и быстрые инновации. Разрабатывая NPU по индивидуальному заказу и управляя архитектурой набора команд, мы можем быстро усовершенствовать и расширить дизайн, чтобы устранить узкие места и оптимизировать производительность».
VLIW ISA — Очень длинный текст-инструкция, созданный для искусственного интеллекта
Архитектура набора команд Hexagon (ISA) представляет собой конструкцию с очень длинными командными словами (VLIW), оптимизированную для обработки цифровых сигналов с низким энергопотреблением в мобильных и встраиваемых системах. Процессоры VLIW объединяют множество операций в одно большое командное слово — в случае Hexagon это до четырех 32-разрядных команд, объединенных в 128-разрядный пакет. Аппаратное обеспечение Qualcomm Hexagon NPU выполняет все четыре команды одновременно, а компилятор отвечает за планирование, чтобы избежать опасностей. Такая конструкция заменяет аппаратную сложность выполнения не по порядку на более простой и энергоэффективный подход: компилятор выполняет работу по планированию один раз, во время компиляции, вместо того, чтобы аппаратное обеспечение выполняло это миллиарды раз в секунду во время выполнения.
Hexagon — это не чистый DSP, не чистый CPU и не чистый GPU в чистом виде. Она превратилась в гибридную архитектуру, поддерживающую аппаратную многопоточность с 6-сторонней одновременной многопоточностью (SMT) на Snapdragon 8 поколения 2. Hexagon поддерживает виртуальную память и кэширование так же, как центральный процессор, и может запускать скомпилированный код на C. Однако у него другая модель выполнения, в которой инструкции сначала фиксируются, а затем выполняются, что позволяет использовать конвейеры глубокого выполнения. Каждый поток Hexagon по умолчанию получает скалярный контекст, но должен запрашивать доступ для использования векторных или тензорных сопроцессоров.
Три блока совместной обработки данных — скалярный, векторный и тензорный — являются отличительной чертой современного процессора Hexagon NPU. Компания Qualcomm объединила эти три ускорителя для повышения производительности и энергоэффективности, выделив для ускорителей большой объем общей памяти, позволяющий эффективно обмениваться данными и перемещать их. Эта интегрированная архитектура является основой для каждого поколения Hexagon, начиная с Snapdragon 8 Gen 1.
Внутренняя структура Qualcomm Hexagon NPU
Три комбинированных ускорителя: Скалярный, векторный и тензорный
Qualcomm Hexagon NPU состоит из трех частей: скалярной единицы, векторной единицы и матричной (тензорной) единицы, которые оптимизированы для скалярных, векторных и матричных операций соответственно. Смена названия с DSP на Processor и NPU произошла именно с появлением этих векторных и матричных модулей — каждое из них знаменует собой создание новых возможностей. Все три устройства используют единый пул памяти и объединены для минимизации перемещения данных между ними.
Скалярный модуль
Обрабатывает последовательные операции с целыми числами и числами с плавающей запятой. Выполняет логику программы, поток управления и последовательные задачи, требующие высокой точности. Каждый аппаратный поток имеет выделенный скалярный контекст — базовую модель выполнения. Это важно для работы сенсорного концентратора и постоянно выполняемых задач. Поддерживает 4-х стороннюю упаковку VLIW для повышения производительности.
Векторная единица измерения (HVX)
Расширения Hexagon Vector, представленные в 2013 году, расширяют скалярную единицу измерения за счет широкого спектра SIMD—операций для задач, связанных с параллельным использованием данных. За цикл обрабатывается 1024 бита данных. Идеально подходит для обработки изображений и видео, операций компьютерного зрения (свертка, объединение в пул) и обработки потоков с камеры. Потоки должны запрашивать доступ к HVX в качестве сопроцессора.
Тензорный модуль (HTA)
Hexagon Tensor Accelerator — специализированный нейросетевой движок. Способен выполнять до 16 000 операций умножения-накопления за цикл с использованием 4-разрядных целых весов. Ускоряет все процессы глубокого обучения: сверточные сети, преобразователи, механизмы внимания. Аппаратная поддержка INT4, INT8, INT16, FP16. Отличительная черта современного NPU Hexagon.
HTA получает собственный ДВИЖОК QUALCOMM AI ENGINE (QNN SDK) — ГЕТЕРОГЕННАЯ ОТПРАВКА НА NPU + GPU + CPU CPU для оптимального процессора · CPU для управления · GPU для рендеринга · NPU для вывода
Эволюция Qualcomm Hexagon NPU
От DSP до NPU — Десятилетие архитектуры Hexagon
Архитектура Hexagon в той или иной форме используется в чипах Qualcomm примерно с 2010 года. Ее эволюция рассказывает о том, как мобильный искусственный интеллект превратился из теоретической возможности в механизм пространственных вычислений в реальном времени. Каждое крупное поколение добавляло новый аппаратный блок, который определял его эпоху.
2010-2015 · Hexagon DSP (версии 1-55) Цифровой сигнальный процессор, работающий только на скалярной основе
Оригинальный Hexagon был чисто скалярным процессором обработки данных VLIW для обработки звука, модемных задач и объединения датчиков. Используется в ранних чипах Snapdragon для разгрузки основной полосы частот и мультимедиа. Отсутствует возможность работы с векторами или тензорами. Ограничена последовательными скалярными операциями при низком энергопотреблении.
2013 · Представлен HVX (Hexagon v60+) Векторные расширения Hexagon — эра компьютерного зрения
Добавлен сопроцессор HVX — 1024—разрядный векторный модуль SIMD для широкого спектра параллельных операций с данными. В Qualcomm назвали обработку изображений ключевым приложением. Увеличение разрешения камер смартфонов оправдало инвестиции. Благодаря этому стало возможным эффективное компьютерное зрение: распознавание границ, свертка, преобразование цветового пространства. Потоки получают HVX в качестве общего сопроцессора.
2019-2020 · Добавлен HTA (версии Hexagon v68–v73) Hexagon Tensor Accelerator — Настоящий функционал NPU
Представлен Hexagon Tensor Accelerator — специализированный модуль для операций многократного накопления с квантованными весами нейронной сети. Поддерживает до 16 000 вычислений MAC за цикл с 4-разрядными целыми весами. Означает переход от «DSP, который может выполнять некоторые функции искусственного интеллекта» к «NPU с наследием DSP». Процессор XR2 Gen 1 (Snapdragon XR2 5G) использует это поколение.
2022 · Snapdragon 8 Gen 2 (Hexagon v73+) Интегрированная архитектура, выделенная шина питания, вычисление микротилей
Важная веха в архитектуре. Скалярный, векторный и тензорный ускорители официально объединены с большим общим TCM объемом 8 МБ. Для обеспечения максимальной эффективности HTA была добавлена специальная шина питания. Реализована технология микротайлового вывода — разделение сетей на небольшие блоки, которые выполняются независимо друг от друга, исключая трафик памяти между более чем 10 уровнями и максимально используя все три устройства одновременно. ~26 МАКСИМАЛЬНЫХ ЧАСТОТ, 1,3 ГГц, 6-полосный SMT.
2023 · Snapdragon 8 Gen 3 / XR2 Gen 2 (Hexagon v75) Эра искусственного интеллекта — 45 новых версий, INT4, Удвоенный объем общей памяти
Разработанный специально для генеративного ИИ. Производительность на 98% выше и на 40% выше в расчете на ватт для устойчивого ИИ по сравнению с 8-м поколением 2. Улучшен вывод микротилей для обработки генеративного ИИ с уменьшенной пропускной способностью памяти. В HTA добавлена выделенная шина питания. Увеличена пропускная способность общей памяти. Добавлено аппаратное ускорение INT4, обеспечивающее более эффективный вывод квантованной модели. Это поколение XR2 Gen 2 (Meta Quest 3). Snapdragon X Elite: 45 лучших версий.
2024 · Snapdragon 8 Elite / XR2+ Gen 2 (Hexagon v79) Высокая точность, прямая связь, более быстрая HTA
В Hexagon NPU добавлена прямая связь (более узкий путь от камеры к NPU для снижения сквозной задержки), повышена точность смешивания данных в INT4 / INT8 / INT16 /FP16 и ускорен протокол HTA. Значительно улучшен параллелизм использования общей памяти. Это поколение Snapdragon XR2+ Gen 2, на котором работает Samsung Galaxy XR. Процессор 8 Elite обеспечивает примерно на 45% более высокую производительность и на 44% более высокую энергоэффективность наряду с улучшенным NPU.
2025 · Snapdragon X2 Elite (Hexagon NPU 6) 80 ЛУЧШИХ процессоров искусственного интеллекта ПК—класса, увеличение производительности
В сентябре 2025 года будет анонсировано самое мощное на сегодняшний день поколение Hexagon для платформ ПК. 80 МАКСИМАЛЬНЫХ значений (по сравнению с 45). 12 скалярных потоков с 4-сторонней обработкой VLIW — увеличение производительности на 143%. 8 параллельных векторных потоков, поддерживающих форматы FP8 и BF16 — на 143% быстрее. Матричный модуль с производительностью на 78% выше, обеспечивающий 16 тыс. вычислений MAC/цикл при 2-разрядных весах и FP8/BF16. +127% пропускной способности шины Hexagon. Предназначен для локальной обработки логических выводов LLM и рабочих нагрузок agentic AI.
XR Приложения
Что делает Hexagon NPU внутри гарнитуры VR/MR
В автономной гарнитуре XR процессор Hexagon NPU не использует дополнительные функции искусственного интеллекта — он использует базовую модель взаимодействия. Каждое действие, выполняемое пользователем на таких устройствах, как Samsung Galaxy XR, Meta Quest 3 или Pico 4 Ultra, в той или иной форме проходит через Hexagon NPU. Благодаря 8-кратному повышению производительности AI в семействе XR2 Gen 2 по сравнению с XR2 Gen 1 современные гарнитуры могут работать без контроллеров и базовых станций.
Специальные блоки ускорения XR обеспечивают беспрецедентное взаимодействие, включая работу рук, головы, контроллера, выражения лица, оценку глубины и 3D-реконструкцию, и все это благодаря совместному использованию Hexagon NPU и Spectra ISP pipeline. NPU обрабатывает кадры с камеры, а интернет-провайдер предварительно обрабатывает и направляет их. В результате все перечисленные ниже задачи выполняются одновременно, непрерывно, в режиме реального времени.
Отслеживание кистей и пальцев
Вывод скелета кисти с 26 суставами по кадрам камеры RGB. Позволяет классифицировать положение руки, сжимать, разводить и указывать жесты менее чем за 10 мс. Контроллер не требуется. NPU отслеживает обе руки одновременно на кадрах камеры World.
Отслеживание движения глаз и Фовеация
Распознавание зрачков и вычисление вектора взгляда с помощью 4 встроенных ИК-камер. Поддерживает конвейер рендеринга с фовеатрированной областью рендеринга с высоким разрешением. Также обеспечивает биометрическую аутентификацию радужной оболочки глаза (Optic ID / Iris ID) в гарнитурах премиум-класса.
Отслеживание лиц
Распознавание лиц в реальном времени и классификация выражений с помощью фронтальных камер. Обеспечивает фотореалистичное выражение лица аватара в приложениях для социальных сетей, встреч и совместной работы XR. Доступно на Samsung Galaxy XR, Apple Vision Pro и корпоративных гарнитурах.
Прогноз положения головы
Данные IMU объединяются с данными визуально-инерциальной одометрии, получаемыми с камер, обращенных к окружающему миру. Прогнозируется положение головы на 16 мс в будущем для компенсации задержки в конвейере отображения. В отслеживаемых сценах задержка преобразования движения в фотон составляет менее 20 мс.
Понимание сцены
Оценка глубины и 3D-реконструкция с помощью пар стереокамер и датчиков глубины. Классифицирует поверхности (пол, стену, стол) для физической привязки и создания границ. Обеспечивает постоянные пространственные привязки для наложений в смешанной реальности.
Пространственный звук (HRTF)
Вычисление передаточной функции, связанной с головой, в режиме реального времени — моделирует, как звук физически достигает уха из любого трехмерного положения. Постоянно обновляется при движении головы. Hexagon DSP также управляет формированием речевого луча с помощью массивов из 6 микрофонов.
Голос и оповещение о звонке
Функция обнаружения голосовой активности и распознавания звуковых сигналов, которые всегда включены, работает на микропроцессорном устройстве Sensing Hub с мощностью в микроватты, даже когда основной SoC находится в спящем режиме. Запускает полное пробуждение Hexagon NPU по желанию пользователя при активации Gemini или Siri.
Конвейер Passthrough
Совместно с Spectra ISP обрабатывает более 12 одновременных потоков с камер. NPU обрабатывает вычисление стереоразличений, матирование глубины для создания композиций в реальном времени и нормализацию экспозиции на основе искусственного интеллекта, что позволяет passthrough выглядеть естественно.
Системная интеграция Qualcomm Hexagon NPU
Гетерогенные вычисления — движок искусственного интеллекта Qualcomm
Hexagon NPU не работает изолированно. Это один из узлов более широкой гетерогенной вычислительной архитектуры Qualcomm, известной как Qualcomm AI Engine. Благодаря использованию наиболее подходящего процессора в сочетании с NPU гетерогенные вычисления обеспечивают максимальную производительность приложений, тепловую эффективность и время автономной работы. Четырьмя ключевыми процессорами являются: Kryo/Oryon CPU (логика последовательного управления, операционная система, игровая логика), Adreno GPU (массово-параллельная графика, масштабирование, синтез кадров), Hexagon NPU (логический вывод ИИ, отслеживание, аудио) и Sensing Hub (постоянно включенный микро-ИИ в состояния с низким энергопотреблением).
Qualcomm Neural Network (QNN) SDK — это API для разработчиков, который направляет рабочие нагрузки искусственного интеллекта на оптимальный процессор. Каждый уровень нейронной сети профилируется и отправляется — уровни свертки передаются в тензорный модуль HTA, нормализация — в векторный модуль HVX, управляющая логика — в центральный процессор. Эта межпроцессорная отправка происходит прозрачно для разработчика приложения. Платформа AI Engine Direct (QNN) предоставляет унифицированный интерфейс, который работает одинаково независимо от того, выполняются ли вычисления на Hexagon, Adreno или на обоих устройствах.
В частности, для XR такая разнородная диспетчеризация имеет решающее значение: графический процессор Adreno рендерит 3D-сцену в высоком разрешении, используя данные рендеринга в формате foveated, которые поступают в него с выходных данных Hexagon, отслеживающих движение глаз. Центральный процессор управляет графикой сцены и игровой логикой. Hexagon обрабатывает все данные отслеживания. Они выполняются в параллельных конвейерах, при этом компоновщик дисплея объединяет выходные данные перед отправкой кадра на дисплей — и все это в рамках кадрового бюджета системы с частотой 90 Гц, составляющего 11 мс.
Ключевая инновация Qualcomm Hexagon NPU
Вычисление микротилей — фирменный эффективный метод Qualcomm
Одним из наиболее важных запатентованных методов в Hexagon NPU является вычисление микротилей, представленное в Snapdragon 8 Gen 2 и значительно усовершенствованное в 8 Gen 3. Концепция: вместо выполнения всего слоя нейронной сети, который может включать в себя большие промежуточные тензоры, которые должны записываться в основную память и считываться из нее, при выводе микротилей вычисление разбивается на небольшие независимые фрагменты, которые могут выполняться последовательно, даже не загружаясь во внешнюю память.
Это устраняет трафик памяти между 10 или более последовательными уровнями, максимально эффективно использует скалярные, векторные и тензорные ускорители в Hexagon NPU и минимизирует энергопотребление. На практике это означает, что нейронная сеть, которая в противном случае была бы узким местом в пропускной способности памяти — что является типичным ограничивающим фактором при выводе данных с помощью мобильного искусственного интеллекта, — может работать на шестиугольнике со скоростью, близкой к предельной для вычислений. Для гарнитур XR это разница между функцией отслеживания рук, которая работает от аккумулятора в течение 2 часов, и функцией отслеживания рук, при которой заряд батареи разряжается за 40 минут.
Технические преимущества и ограничения
✓ Преимущества
- Только NPU, изначально разработанный для работы с XR—нагрузками — одновременное отслеживание рук, глаз, лица, тела и сцен
- Микротильный логический вывод устраняет проблемы с памятью на более чем 10 сетевых уровнях
- Специализированный тензорный модуль HTA с 16 000 вычислений MAC в цикле для глубокого обучения
- Объединенная архитектура scalar + vector + tensor использует единый пул TCM
- 8-кратное повышение производительности искусственного интеллекта по сравнению с XR2 Gen 1 при реальных рабочих нагрузках XR
- Аппаратное ускорение INT4 для вывода квантованной модели
- Микро-NPU Sensing Hub обеспечивает постоянную работу искусственного интеллекта на уровне мощности в мкВт
- Гетерогенный механизм искусственного интеллекта распределяет рабочие нагрузки на оптимальный процессор
- Snapdragon X2 Elite достигает 80 вершин, опережая AMD и Intel в производстве мобильных NPU—процессоров
- Поддержка QNN SDK / ONNX Runtime / TFLite — широкая экосистема разработчиков
- Стабильная производительность — поддерживает производительность логического вывода при тепловой нагрузке
- Пользовательский ISA позволяет Qualcomm выполнять итерации и настройку быстрее, чем лицензиаты стандартных архитектур
✗ Ограничения
- Название Matrix unit ISA остается неизвестным — это ограничивает низкоуровневую разработку пользовательского ядра
- Платформа QNN с закрытым исходным кодом означает, что разработчики не могут проверять или настраивать путь вывода
- Планирование VLIW требует усложнения компилятора — неоптимальный код может серьезно ухудшить производительность
- Отсутствие аппаратной трассировки лучей (в отличие от графического процессора Apple M5) ограничивает фотореалистичный рендеринг на стороне графического процессора
- NPU XR2+ Gen 2 ненамного превосходит базовый XR2 Gen 2 — «+» означает тактовую частоту, а не архитектуру NPU
- Облачная зависимость в некоторых интеграциях (Gemini в Galaxy XR) позволяет обойти преимущества конфиденциальности на устройстве
- 80 ТОПОВ Hexagon NPU 6 доступен только для ПК — гарнитуры XR пока остаются на уровне ~ 45 топов поколения
Вердикт: Самый мощный в мире встроенный процессор XR AI
Процессор Qualcomm Hexagon NPU, не имеющий серьезных конкурентов, является самым совершенным встроенным процессором искусственного интеллекта, когда-либо использовавшимся в потребительских XR-гарнитурах. Его архитектура — скалярные потоки VLIW, 1024-разрядный векторный модуль HVX и тензорный ускоритель HTA, объединенные в общий пул памяти с высокой пропускной способностью, — разрабатывалась совместно с прецедентом XR в течение пятнадцати лет итераций. Ни у одного другого производителя кремния нет архитектуры, специально разработанной для сочетания устойчивого отслеживания, обработки потока с камеры, пространственного звука и энергоэффективности, которые требуются для автономной работы в режиме смешанной реальности.
Эмпирическое доказательство: 8-кратный скачок производительности искусственного интеллекта с XR2 Gen 1 до XR2 Gen 2 — это именно то, что сделало взаимодействие рук без контроллера и с отслеживанием камеры жизнеспособным в качестве основной модели ввода в потребительских гарнитурах. До этого функция отслеживания движений рук была новинкой, которая не очень хорошо работала в лабораторных условиях. После этого она стала интерфейсом по умолчанию для Apple Vision Pro, Samsung Galaxy XR и режима Meta Quest без контроллера. Hexagon сделал этот переход возможным.
Забегая вперед, отметим, что процессор Hexagon NPU 6 в Snapdragon X2 Elite, достигающий 80 максимумов при скалярной производительности 143% и поддержке FP8 / BF16, ясно показывает, куда движется XR silicon. По мере того как эти возможности будут переноситься с ПК на платформы XR, гарнитуры смогут локально запускать по-настоящему крупные модели искусственного интеллекта, превращая сквозную камеру из простого видеопотока в полноценную систему для анализа сцены, которая распознает объекты, считывает текст, интерпретирует контекст и реагирует, даже не отправляя кадр в облако.