Новый Hexagon NPU получил блок Element Accelerator для трансформерных моделей и на 50% больше общей памяти для локальных ИИ задач. Qualcomm заявляет поддержку контекста до 32 000 токенов, ускорение стадии prefill для INT4 моделей до 50% и работу с форматами от INT2 до FP16.
ОпубликовалОтредактировано с помощью GPT-5.6 TerraИзображения созданы с помощью GPT Image 2
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: What did Qualcomm reveal on September 9, 2026 about the redesigned Hexagon NPU in its next-generation premium Snapdragon mobile platform—inc. Article summary: Qualcomm’s September 9 preview positioned its next premium Snapdragon platform as an on-device “agentic AI” design, not merely a faster phone chip. The redesigned Hexagon NPU adds dedicated transformer hardware and more . Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Qualcomm раскрыла направление развития следующей флагманской платформы Snapdragon: акцент сделан не просто на «ИИ-функции», а на локальную работу генеративных и агентных моделей прямо на смартфоне. Центральным элементом станет переработанный нейропроцессор Hexagon NPU с отдельным ускорителем для трансформеров и увеличенной общей памятью. 1
Главное аппаратное нововведение — Element Accelerator. Это специализированный блок для трансформерных нагрузок: именно на такой архитектуре основаны языковые, генеративные и мультимодальные ИИ-модели. Новый блок не заменяет существующие скалярные, векторные и тензорные вычислительные ресурсы NPU, а дополняет их. 1
11
Qualcomm также заявила об увеличении общей памяти NPU на 50% по сравнению с предыдущей архитектурой. Задача — чаще держать используемые моделью данные рядом с нейропроцессором, а не постоянно обращаться к системной памяти. Это особенно важно, когда ИИ-агент одновременно удерживает длинный контекст, вызывает инструменты и выполняет несколько связанных задач. Абсолютный объём этой памяти компания пока не назвала. 1
5
По данным Qualcomm, обновлённый Hexagon поддерживает контекст длиной до 32 000 токенов и ускорение работы с KV-кэшем. На практике длинный контекст означает, что модель может удерживать больше содержания диалога, документа или истории выполнения задачи в рамках локального сеанса. 11
12
Компания также обещает до 50% более быстрый prefill для моделей в формате INT4. Prefill — это начальная стадия: модель обрабатывает запрос пользователя и формирует рабочий контекст перед генерацией ответа. Поэтому заявление не следует трактовать как гарантированное ускорение генерации каждого следующего токена на 50% во всех приложениях и моделях. NPU поддерживает INT2, INT4, INT8, FP8 и FP16. 1
6
Qualcomm говорит о возможности запуска Mixture-of-Experts-моделей, или MoE, с общим размером до 30 млрд параметров. В приведённом компанией примере для обработки одного токена задействуется около 3 млрд параметров. 6
Это принципиальная оговорка. В MoE-модели механизм маршрутизации выбирает лишь часть «экспертов» для конкретного токена или задачи. Иными словами, речь не о том, что смартфон просчитывает все 30 млрд параметров при генерации каждого токена. Реальная возможность запуска зависит от конкретной модели, её реализации, избирательной активации экспертов и конфигурации устройства. 1
13
Анонс Hexagon дополняет ранее раскрытые детали о CPU и GPU будущей платформы Snapdragon. Восьмиядерный процессор Oryon должен получить два Prime-ядра с частотой до 5 ГГц и шесть Performance-ядер. Архитектура FlexCache позволяет разнородным ядрам обращаться к динамически распределяемому общему пулу кэша. 21
22
В графической части Qualcomm представила Adreno Matrix Cores и 18 МБ памяти Adreno High Performance Memory. Технология Neural Fusion объединяет нейронную обработку, ИИ-суперразрешение и генерацию кадров в графическом конвейере. Qualcomm заявляет снижение энергопотребления до 40% в применимых сценариях рендеринга, однако это оценка самого производителя, а не результат независимого тестирования. 17
23
Таким образом, Qualcomm продвигает неоднородную схему локального ИИ:
Смысл этой архитектуры не в том, что любая ИИ-функция смартфона обязательно будет выполняться на NPU. Qualcomm предлагает производителям устройств использовать CPU, GPU и NPU как взаимодополняющие вычислительные блоки для разных частей локального ИИ-опыта.
Пока это предварительный рассказ об архитектуре, а не полные спецификации платформы. Snapdragon Summit пройдёт на Мауи, Гавайи, с 22 по 24 сентября. 31
До мероприятия заявления стоит воспринимать как описание технического курса Qualcomm, а не как окончательную картину производительности. Компания не раскрыла абсолютный объём общей памяти NPU и не представила исчерпывающих независимых данных о производительности и энергоэффективности нового блока. 5 Уже на анонсе станет ясно, как эти возможности распределятся между конкретными продуктами Snapdragon и что они дадут в серийных смартфонах.
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
Новый Hexagon NPU получил блок Element Accelerator для трансформерных моделей и на 50% больше общей памяти для локальных ИИ задач.
Новый Hexagon NPU получил блок Element Accelerator для трансформерных моделей и на 50% больше общей памяти для локальных ИИ задач. Qualcomm заявляет поддержку контекста до 32 000 токенов, ускорение стадии prefill для INT4 моделей до 50% и работу с форматами от INT2 до FP16.
Пример с моделью на 30 млрд параметров относится к архитектуре Mixture of Experts: на один токен в ней активируется примерно 3 млрд параметров, а не все 30 млрд одновременно.