DeepSeek menyatakan V4.1 Flash hanya memerlukan satu perempat HBM dan satu perlapan storan SSD bagi cache KV berbanding generasi sebelumnya. Pasaran menilai semula andaian bahawa setiap peningkatan penggunaan AI akan menaikkan keperluan memori dan storan secara automatik.
Diterbitkan olehDisunting dengan GPT-5.6 TerraImej dijana dengan GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How did DeepSeek’s September 10, 2026 release of its V4.1 Flash AI model—whose architectural changes reduced key-value-cache usage to about. Article summary: The selloff was a rapid repricing of an AI-memory scarcity thesis, not proof that memory demand has permanently collapsed. DeepSeek showed that serving long-context models can require far less KV-cache HBM and persistent. Topic tags: general, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wi
Pelancaran V4.1-Flash oleh DeepSeek memberi pasaran alasan untuk mempersoalkan satu andaian besar dalam dagangan berkaitan perkakasan AI: model yang semakin berkeupayaan semestinya memerlukan semakin banyak memori dan storan bagi setiap beban kerja. Reaksi awal lebih tepat dianggap sebagai penilaian semula andaian itu, bukannya bukti bahawa kitaran pertumbuhan memori AI telah berakhir.
DeepSeek menyatakan bahawa cache key-value (KV) V4.1-Flash memerlukan hanya satu perempat memori jalur lebar tinggi (HBM) dan satu perlapan storan SSD berbanding generasi sebelumnya. Syarikat itu turut menekankan bahawa kos bagi cache hit boleh membentuk bahagian besar kos operasi ejen AI. 29
Cache KV menyimpan keadaan perhatian daripada token terdahulu. Dengan itu, model boleh meneruskan perbualan atau proses yang panjang tanpa mengira semula semua konteks awal. Dalam penyampaian inferens—iaitu ketika model digunakan untuk menjawab atau menjalankan tugasan—cache ini boleh menjadi kekangan kapasiti yang penting, khususnya untuk konteks panjang dan ejen AI.
Namun, angka tersebut tidak bermaksud keseluruhan sistem AI tiba-tiba menggunakan 75% kurang HBM atau 87.5% kurang storan. Perbandingan itu khusus bagi keperluan cache KV, dan dibandingkan dengan seni bina DeepSeek sebelumnya. Pemberat model, infrastruktur latihan serta komponen lain masih memerlukan memori dan storan yang besar. 25
Bagi pelabur, implikasi tajuk utama itu mudah: jika model dapat menyokong aktiviti inferens yang setara dengan memori cache lebih kecil, perkakasan AI yang sama berpotensi melayan lebih banyak sesi. Ini boleh melemahkan jangkaan jangka pendek terhadap penggunaan memori bagi setiap beban kerja, sekali gus menjejaskan andaian permintaan dan harga untuk HBM serta storan perusahaan.
Di Seoul, saham Samsung susut 3.5% manakala SK Hynix jatuh 2.2% selepas pelancaran tersebut, menurut liputan ketika itu. 49 Dalam dagangan berikutnya di Amerika Syarikat, saham syarikat memori dan storan juga berada di bawah tekanan apabila pelabur menilai semula prospek permintaan infrastruktur AI berikutan keperluan HBM dan SSD V4.1-Flash yang lebih rendah.
51
52
Ini tidak membuktikan satu pelancaran model sahaja menyebabkan setiap pergerakan saham. Sektor semikonduktor turut dipengaruhi jangkaan pendapatan, keadaan bekalan, kadar faedah, selera risiko pasaran dan ramalan perbelanjaan modal. Namun, reaksi itu menunjukkan betapa sensitifnya penilaian saham berkaitan AI terhadap bukti bahawa perisian dan seni bina model boleh mengurangkan perkakasan yang diperlukan bagi setiap unit perkhidmatan AI.
Berita kecekapan DeepSeek muncul ketika pasaran juga membincangkan tempo pembangunan AI termaju. Ketua Pegawai Eksekutif Anthropic, Dario Amodei, menerusi eseinya We Must Pace the Frontier, mencadangkan agar kadar peningkatan keupayaan AI diperlahankan supaya syarikat dan kerajaan mempunyai masa untuk menyelaraskan serta melindungi sistem yang semakin berkeupayaan.
Amodei menegaskan bahawa “memperlahankan rentak” tidak bermakna menghentikan latihan model atau kemajuan teknikal. Beliau mencadangkan penilai pihak ketiga yang ditempatkan dalam syarikat, penyelarasan antara kerajaan demokratik dan penyelarasan global. 40
Pasaran boleh mentafsir trajektori keupayaan yang lebih perlahan—walaupun bukan pembekuan latihan—sebagai risiko bahawa sebahagian perbelanjaan untuk pemecut, rangkaian, memori dan pusat data akan ditangguhkan. Dalam laporan dagangan berkenaan, niaga hadapan Nasdaq-100 susut 1.77%, Marvell turun lebih 7%, Intel kira-kira 6% dan Micron lebih 5%. 51
Dua perkembangan ini berbeza:
Digabungkan, kedua-duanya menjadikan unjuran permintaan infrastruktur AI yang paling agresif kelihatan kurang pasti.
Pelabur Michael Burry menyifatkan retorik untuk memperlahankan AI sebagai “self-serving”, atau menguntungkan pihak sendiri. Beliau berhujah bahawa pendekatan itu boleh memanfaatkan makmal AI termaju yang sedia kukuh dengan menyukarkan persaingan, mewujudkan “hype & puffery” bagi kemungkinan penawaran awam permulaan (IPO), dan memberi perlindungan naratif jika pertumbuhan semakin perlahan. Burry juga berpendapat model bahasa besar (LLM) bukan kecerdasan am buatan, atau AGI, maka tiada kemajuan sebegitu untuk diperlahankan. 14
Itu ialah pandangan Burry tentang persaingan, penilaian dan keupayaan AI, bukannya kesimpulan teknikal yang telah dipersetujui. Bagi pasaran, perkara pentingnya ialah perbahasan mengenai rentak AI dibaca melalui dua lensa sekali gus: keselamatan dan insentif perniagaan.
Versi mudah tesis kenaikan memori AI berbunyi begini: model lebih besar, tetingkap konteks lebih panjang dan lebih ramai pengguna AI akan menghasilkan lebih banyak permintaan untuk HBM, NAND dan kapasiti storan. DeepSeek memperkenalkan satu daya pengimbang yang penting: kecekapan seni bina.
Cara yang lebih baik untuk menilai permintaan adalah dengan memisahkannya kepada dua pemboleh ubah:
Penurunan bagi ukuran pertama tidak secara automatik menentukan ukuran kedua. Inferens yang lebih murah dan cekap boleh meluaskan penggunaan, lalu mewujudkan lebih banyak permintaan keseluruhan. Sebaliknya, jika kecekapan tersebar lebih pantas daripada pertumbuhan penggunaan, perkakasan yang diperlukan untuk menghasilkan tahap output AI tertentu mungkin berkurangan.
V4.1-Flash paling berkait secara langsung dengan penyampaian inferens dan cache KV. Perbandingan DeepSeek tidak menghapuskan memori yang digunakan untuk pemberat model atau latihan. 25 Perbezaan ini penting kerana latihan dan penyampaian model mengenakan tuntutan yang berlainan terhadap kuasa pengkomputeran, memori serta sambungan berkelajuan tinggi.
Justeru, persoalan utama bukan sama ada peningkatan kecekapan yang dilaporkan itu bermakna—ia memang bermakna—tetapi sama ada ia mengubah permintaan agregat. Pelabur perlu memantau penggunaan teknik penjimatan cache yang serupa, pertumbuhan beban kerja konteks panjang dan ejen AI, harga HBM serta storan, dan sama ada latihan serta penggunaan model AI termaju terus dipercepatkan.
Buat masa ini, tekanan jual itu lebih sesuai dilihat sebagai peringatan agar tidak menganggap kekurangan memori AI sebagai dagangan sehala. Inovasi model boleh mengurangkan perkakasan yang diperlukan bagi setiap permintaan, pada masa yang sama kes penggunaan baharu meningkatkan jumlah permintaan.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek menyatakan V4.1 Flash hanya memerlukan satu perempat HBM dan satu perlapan storan SSD bagi cache KV berbanding generasi sebelumnya.
DeepSeek menyatakan V4.1 Flash hanya memerlukan satu perempat HBM dan satu perlapan storan SSD bagi cache KV berbanding generasi sebelumnya. Pasaran menilai semula andaian bahawa setiap peningkatan penggunaan AI akan menaikkan keperluan memori dan storan secara automatik.
Tekanan pasaran turut dipengaruhi kebimbangan bahawa usaha memperlahankan kemajuan AI termaju boleh menunda sebahagian perbelanjaan infrastruktur.