Hexagon NPU mới có Element Accelerator dành cho transformer, bộ nhớ dùng chung lớn hơn 50% và hỗ trợ ngữ cảnh tối đa 32.000 token. Qualcomm tuyên bố tốc độ prefill với mô hình INT4 có thể nhanh hơn tới 50%; đây là giai đoạn xử lý lời nhắc ban đầu, không đồng nghĩa tốc độ sinh từng token luôn tăng 50%.
Đăng bởiBiên tập bằng GPT-5.6 TerraHình ảnh được tạo bằng GPT Image 2
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What did Qualcomm reveal on September 9, 2026 about the redesigned Hexagon NPU in its next-generation premium Snapdragon mobile platform—inc. Article summary: Qualcomm’s September 9 preview positioned its next premium Snapdragon platform as an on-device “agentic AI” design, not merely a faster phone chip. The redesigned Hexagon NPU adds dedicated transformer hardware and more . Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Qualcomm đang định hướng nền tảng Snapdragon cao cấp kế tiếp cho các tác vụ AI tạo sinh và AI agent chạy trực tiếp trên điện thoại. Trong phần hé lộ ngày 9/9, điểm nhấn là Hexagon NPU được thiết kế lại, bổ sung phần cứng tối ưu cho transformer và mở rộng vùng nhớ cục bộ để xử lý các phiên làm việc đa phương thức, kéo dài hơn. 1
Bổ sung đáng chú ý nhất là Element Accelerator — khối tăng tốc chuyên cho khối lượng công việc transformer. Transformer là nền tảng của nhiều mô hình AI tạo sinh, từ mô hình ngôn ngữ đến mô hình đa phương thức. Qualcomm đặt khối này bên cạnh các tài nguyên xử lý scalar, vector và tensor hiện có, thay vì thay thế chúng. 1
11
Qualcomm cũng cho biết bộ nhớ dùng chung của NPU lớn hơn 50% so với thiết kế trước. Mục tiêu là giữ dữ liệu mô hình được truy cập thường xuyên ở gần NPU hơn, giảm số lần phải lấy dữ liệu từ bộ nhớ hệ thống khi AI agent xử lý ngữ cảnh dài, nhiều công cụ hoặc nhiều tác vụ đồng thời. Tuy nhiên, hãng chưa công bố dung lượng tuyệt đối của vùng nhớ này. 1
5
Theo Qualcomm, kiến trúc Hexagon mới hỗ trợ ngữ cảnh lên đến 32.000 token và có tăng tốc key-value cache (KV cache). Nói đơn giản, ngữ cảnh lớn hơn cho phép mô hình lưu lại nhiều hơn nội dung hội thoại, tài liệu hoặc lịch sử tác vụ trong một phiên AI chạy trên thiết bị. 11
12
Hãng còn tuyên bố hiệu năng prefill với mô hình INT4 có thể nhanh hơn tới 50%. Prefill là giai đoạn mô hình tiếp nhận và xử lý lời nhắc ban đầu để tạo ngữ cảnh làm việc trước khi bắt đầu sinh câu trả lời. Vì vậy, con số này không nên được hiểu là mọi ứng dụng hay mô hình đều sẽ sinh từng token nhanh hơn 50%. NPU hỗ trợ các định dạng độ chính xác từ INT2, INT4, INT8 đến FP8 và FP16. 1
6
Qualcomm nhấn mạnh khả năng hỗ trợ mô hình Mixture-of-Experts (MoE) với tối đa 30 tỷ tham số. Trong ví dụ hãng đưa ra, chỉ khoảng 3 tỷ tham số được kích hoạt cho mỗi token. 6
Đây là khác biệt quan trọng. Với mô hình MoE, cơ chế định tuyến chỉ chọn một phần chuyên gia (expert) phù hợp cho từng token hoặc tác vụ. Do đó, tuyên bố này không có nghĩa điện thoại thực hiện suy luận trên toàn bộ 30 tỷ tham số ở mọi token. Khả năng triển khai còn phụ thuộc vào cách kích hoạt chuyên gia, bản thân mô hình, phần mềm và cấu hình thiết bị. 1
13
Thông tin về NPU được công bố sau các phần hé lộ về CPU và GPU của Snapdragon kế tiếp. CPU Oryon tám nhân sắp ra mắt dự kiến có hai nhân Prime đạt 5 GHz và sáu nhân Performance. Kiến trúc FlexCache cho phép các loại nhân CPU khác nhau dùng chung một vùng bộ nhớ đệm được phân bổ động theo khối lượng công việc. 21
22
Về đồ họa, Qualcomm đã công bố Adreno Matrix Cores cùng 18 MB Adreno High Performance Memory. Công nghệ Neural Fusion kết hợp xử lý thần kinh, siêu phân giải bằng AI và tạo khung hình trong cùng pipeline đồ họa. Qualcomm nói công nghệ này có thể giảm mức tiêu thụ điện tới 40% ở các tác vụ dựng hình phù hợp; đây là tuyên bố của nhà sản xuất, chưa phải kết quả benchmark độc lập. 17
23
Tổng thể, Qualcomm đang mô tả cách phân công AI cục bộ giữa ba nhóm phần cứng:
Điểm chính không phải mọi tính năng AI trên điện thoại đều sẽ chạy bằng NPU. Qualcomm xem CPU, GPU và NPU là các bộ máy bổ trợ nhau, để nhà sản xuất thiết bị lựa chọn phần cứng phù hợp cho từng phần của trải nghiệm AI trên thiết bị.
Đây mới là phần giới thiệu về kiến trúc, chưa phải bảng thông số đầy đủ của một nền tảng Snapdragon. Snapdragon Summit của Qualcomm dự kiến diễn ra từ 22 đến 24/9 tại Maui, Hawaii. 31
Cho đến khi sự kiện diễn ra, người dùng và nhà phát triển nên coi các thông tin hiện tại là định hướng kỹ thuật hơn là bức tranh hiệu năng hoàn chỉnh. Qualcomm chưa công bố dung lượng tuyệt đối của bộ nhớ dùng chung, cũng như kết quả hiệu năng và hiệu quả điện năng đầy đủ có thể kiểm chứng độc lập cho NPU mới. 5 Những công bố nền tảng sau đó sẽ quyết định các khả năng này được cấu hình ra sao trên sản phẩm Snapdragon thực tế và cuối cùng thể hiện thế nào trên các mẫu điện thoại thương mại.
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Hexagon NPU mới có Element Accelerator dành cho transformer, bộ nhớ dùng chung lớn hơn 50% và hỗ trợ ngữ cảnh tối đa 32.000 token.
Hexagon NPU mới có Element Accelerator dành cho transformer, bộ nhớ dùng chung lớn hơn 50% và hỗ trợ ngữ cảnh tối đa 32.000 token. Qualcomm tuyên bố tốc độ prefill với mô hình INT4 có thể nhanh hơn tới 50%; đây là giai đoạn xử lý lời nhắc ban đầu, không đồng nghĩa tốc độ sinh từng token luôn tăng 50%.
Mô hình Mixture of Experts (MoE) 30 tỷ tham số mà Qualcomm nêu làm ví dụ chỉ kích hoạt khoảng 3 tỷ tham số cho mỗi token.