Hexagon NPU baharu Qualcomm menambah Element Accelerator khusus untuk transformer, memori dikongsi 50% lebih besar, konteks sehingga 32,000 token dan dakwaan prefill INT4 sehingga 50% lebih pantas. NPU ialah satu daripada tiga enjin dalam reka bentuk Snapdragon: CPU Oryon untuk pemprosesan umum, GPU Adreno untuk AI...
Diterbitkan olehDisunting dengan GPT-5.6 TerraImej dijana dengan GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Qualcomm reveal on September 9, 2026 about the redesigned Hexagon NPU in its next-generation premium Snapdragon mobile platform—inc. Article summary: Qualcomm’s September 9 preview positioned its next premium Snapdragon platform as an on-device “agentic AI” design, not merely a faster phone chip. The redesigned Hexagon NPU adds dedicated transformer hardware and more . Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Qualcomm memberi gambaran jelas tentang hala tuju cip Snapdragon premium seterusnya: AI generatif dan ejen AI yang lebih lama berjalan, multimodal, serta diproses terus dalam telefon. Tumpuannya ialah Hexagon NPU yang direka semula, dengan perkakasan khusus untuk transformer dan kumpulan memori setempat yang lebih besar. 1
Tambahan paling penting ialah Element Accelerator, iaitu blok khusus untuk beban kerja transformer. Transformer ialah asas kepada banyak sistem AI generatif, termasuk model bahasa dan model multimodal. Qualcomm meletakkan pemecut ini sebagai pelengkap kepada sumber pemprosesan skalar, vektor dan tensor sedia ada — bukannya pengganti. 1
11
Qualcomm juga menyatakan memori dikongsi NPU kini 50% lebih besar berbanding reka bentuk terdahulu. Matlamatnya adalah menyimpan data model yang kerap digunakan lebih dekat dengan NPU, sekali gus mengurangkan keperluan mengambil data berulang kali daripada memori sistem apabila ejen AI mengendalikan konteks lebih panjang, pelbagai alat dan tugasan serentak. Kapasiti mutlak memori dikongsi itu masih belum didedahkan. 1
5
Menurut Qualcomm, seni bina Hexagon yang dikemas kini menyokong konteks sehingga 32,000 token dan pemecutan key-value cache (KV-cache). Dalam penggunaan sebenar, konteks yang lebih besar membolehkan model mengekalkan lebih banyak kandungan perbualan, dokumen atau sejarah tugasan sepanjang sesi AI pada peranti. 11
12
Syarikat itu turut mendakwa sehingga 50% prefill lebih pantas bagi model INT4. Prefill ialah peringkat apabila model memproses arahan awal pengguna dan membina konteks kerja sebelum mula menjana jawapan. Maka, angka ini tidak boleh dianggap sebagai jaminan output dijana 50% lebih pantas bagi setiap aplikasi atau model. NPU tersebut menyokong format ketepatan INT2, INT4, INT8, FP8 dan FP16. 1
6
Qualcomm mengetengahkan sokongan untuk model Mixture-of-Experts (MoE) dengan sehingga 30 bilion parameter keseluruhan. Namun, contoh yang diberi hanya mengaktifkan kira-kira 3 bilion parameter bagi setiap token. 6
Perbezaan ini penting. Dalam model MoE, mekanisme penghalaan hanya memilih sebahagian daripada model untuk token atau tugasan tertentu. Jadi, dakwaan itu bukan bermaksud telefon menjalankan inferens pada semua 30 bilion parameter untuk setiap token. Keupayaannya bergantung pada pengaktifan pakar secara terpilih, model yang digunakan, pelaksanaan perisian dan konfigurasi peranti. 1
13
Pengumuman NPU ini menyusuli pratonton Qualcomm terhadap CPU dan GPU platform berkenaan. CPU Oryon lapan teras yang bakal diperkenalkan dikatakan mempunyai dua teras Prime sehingga 5GHz dan enam teras Performance. Reka bentuk FlexCache pula membolehkan teras CPU berlainan jenis berkongsi kumpulan cache yang diperuntukkan secara dinamik mengikut beban kerja. 21
22
Bagi grafik, Qualcomm telah mengumumkan Adreno Matrix Cores dan 18MB Adreno High Performance Memory. Teknologi Neural Fusion menyatukan pemprosesan neural, penskalaan super AI dan penjanaan bingkai dalam saluran grafik. Qualcomm mendakwa teknologi itu boleh mengurangkan penggunaan kuasa sehingga 40% bagi beban kerja pemaparan yang sesuai; ini ialah dakwaan vendor, bukan keputusan penanda aras bebas. 17
23
Secara ringkas, Qualcomm membayangkan pembahagian tugas AI tempatan antara tiga enjin:
Intinya, bukan semua ciri AI telefon akan dijalankan pada NPU. Qualcomm mengetengahkan CPU, GPU dan NPU sebagai enjin saling melengkapi yang boleh dimanfaatkan pengeluar peranti untuk bahagian berlainan dalam pengalaman AI pada peranti.
Pendedahan ini ialah pratonton seni bina, bukannya spesifikasi penuh platform. Snapdragon Summit Qualcomm dijadualkan berlangsung pada 22 hingga 24 September di Maui, Hawaii. 31
Sehingga acara itu berlangsung, pengguna dan pembangun wajar melihat pengumuman ini sebagai petunjuk arah teknikal, bukan gambaran lengkap prestasi. Qualcomm belum memberikan kapasiti mutlak memori dikongsi atau keputusan penuh prestasi dan kecekapan NPU baharu yang boleh disahkan secara bebas. 5 Pengumuman platform akhir nanti akan menentukan cara keupayaan ini dikonfigurasikan pada produk Snapdragon sebenar — dan sejauh mana manfaatnya diterjemahkan ke dalam telefon yang dijual di pasaran.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Hexagon NPU baharu Qualcomm menambah Element Accelerator khusus untuk transformer, memori dikongsi 50% lebih besar, konteks sehingga 32,000 token dan dakwaan prefill INT4 sehingga 50% lebih pantas.
Hexagon NPU baharu Qualcomm menambah Element Accelerator khusus untuk transformer, memori dikongsi 50% lebih besar, konteks sehingga 32,000 token dan dakwaan prefill INT4 sehingga 50% lebih pantas. NPU ialah satu daripada tiga enjin dalam reka bentuk Snapdragon: CPU Oryon untuk pemprosesan umum, GPU Adreno untuk AI grafik, dan Hexagon untuk inferens AI tempatan berterusan.
Contoh model 30 bilion parameter Qualcomm ialah reka bentuk Mixture of Experts (MoE) yang mengaktifkan kira kira 3 bilion parameter bagi setiap token, bukannya kesemua 30 bilion serentak.