DeepSeek menyatakan V4.1 Flash memerlukan hanya satu perempat HBM dan satu perlapan storan SSD untuk cache KV berbanding generasi sebelumnya. Pengumuman itu mencetuskan penilaian semula terhadap saham berkaitan memori AI; saham Samsung Electronics dan SK Hynix masing masing jatuh lebih 3% dalam dagangan harian di Se...
Diterbitkan olehDisunting dengan GPT-5.6 TerraImej dijana dengan GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How did DeepSeek’s September 10 V4.1 Flash release, which reduced key-value cache consumption to about one-quarter of its predecessor’s high. Article summary: The selloff reflected a rapid reassessment of the “AI equals ever-more memory” trade. DeepSeek’s V4.1-Flash showed that serving long-context models can be made far less memory-intensive, while Amodei’s proposed slowing o. Topic tags: general, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
DeepSeek menerusi pengumuman V4.1-Flash pada 10 September mengganggu naratif mudah yang selama ini menyokong saham memori AI: model semakin besar, konteks semakin panjang dan penggunaan ejen AI semakin meluas, maka permintaan bagi memori jalur lebar tinggi (HBM), NAND serta perkakasan storan akan terus meningkat. Tuntutan teknikal itu bukan bermaksud memori tidak lagi diperlukan. Namun, ia menunjukkan bahawa keperluan memori untuk mengendalikan sesuatu beban kerja AI boleh dikurangkan dengan ketara melalui reka bentuk model dan kejuruteraan cache. 61
25
Cache key-value (KV) menyimpan maklumat keadaan perhatian (attention state) ketika model menjawab permintaan. Ia sangat penting untuk perbualan berlatar konteks panjang dan tugasan berasaskan ejen AI, kerana model tidak perlu memproses semula keseluruhan sejarah perbualan setiap kali.
DeepSeek berkata V4.1-Flash mengurangkan keperluan cache KV kepada satu perempat HBM dan satu perlapan storan SSD berbanding generasi terdahulu. 61 Menurut kad modelnya, pengurangan ini datang daripada reka bentuk causal encoder-decoder, iaitu cache KV global dekoder diprojeksikan daripada keadaan tersembunyi akhir pengekod, serta teknik pelaksanaan bernama SWA Bounded Replay yang mengelakkan keadaan cache tetingkap gelongsor tertentu disimpan secara kekal pada SSD.
52
Liputan bebas mengenai pelancaran itu menganggarkan jejak cache KV global sekitar 890 bait bagi setiap token, kira-kira satu perempat daripada V4-Flash. Reka bentuk itu berpotensi menyokong sekitar empat hingga lapan kali ganda lebih ramai pengguna dalam jejak cache KV yang sama. 53 DeepSeek turut menyatakan model itu mengaktifkan 8 bilion parameter bagi setiap token ketika pemprosesan input awal (prefill) dan 16 bilion ketika menjana output (decoding), satu pendekatan untuk meningkatkan kecekapan tugasan yang berat pada input.
52
Isu segera bagi pasaran bukanlah sama ada sistem AI masih memerlukan memori — semestinya memerlukan. Persoalannya ialah sama ada jumlah memori yang diperlukan bagi setiap unit output inferens boleh menurun jauh lebih cepat daripada andaian dalam unjuran hasil dan permintaan.
Jika model setanding boleh mengendalikan lebih banyak permintaan konteks panjang serentak menggunakan kumpulan HBM atau storan yang sama, penyedia awan mungkin memperoleh lebih banyak daya pemprosesan daripada infrastruktur sedia ada. Kemungkinan itu menimbulkan risiko kepada andaian tentang jumlah unit masa depan, kekangan bekalan dan kuasa penetapan harga bagi HBM, DRAM, SSD perusahaan serta peralatan storan yang berkaitan.
Saham Samsung Electronics dan SK Hynix masing-masing susut lebih 3% dalam dagangan harian di Korea Selatan selepas pelancaran itu, menurut laporan. 17 Kebimbangan tersebut merebak lebih meluas kerana dagangan infrastruktur AI menghubungkan pengeluar memori dengan pembekal storan, rangkaian dan pengkomputeran. Jejak memori yang lebih kecil boleh mengubah kos ekonomi penggunaan model, walaupun kesannya tidak semestinya sama terhadap setiap kategori perkakasan.
Bagi SanDisk, keadaan itu memperlihatkan betapa sensitifnya tesis pelaburan terhadap jangkaan permintaan AI. Data pasaran sekitar tempoh berkenaan menunjukkan julat 52 minggu kira-kira AS$85 hingga AS$2,354, sedangkan konsensus penganalisis kekal pada penarafan Beli atau Beli Sederhana. 35
37 Namun, konsensus positif tidak menyelesaikan persoalan asas: berapa besar permintaan storan pada masa depan bergantung pada seni bina inferens yang semakin intensif memori kekal tidak berubah.
Berita DeepSeek ialah kejutan dari sudut kecekapan. Seruan Dario Amodei untuk “memperlahankan sempadan” (pace the frontier) pula menimbulkan persoalan berasingan tentang kelajuan kemajuan keupayaan AI — dan seterusnya rentak perbelanjaan infrastruktur.
Dalam eseinya pada September, Ketua Pegawai Eksekutif Anthropic itu berhujah bahawa syarikat perlu sengaja memperlahankan kadar peningkatan keupayaan model AI paling canggih, sambil menggunakan masa tambahan untuk kerja penjajaran dan keselamatan. Beliau mencadangkan penilai pihak ketiga ditempatkan dalam syarikat, penyelarasan antara syarikat di negara demokrasi, dan akhirnya perjanjian antara kerajaan. 4
5
Cadangan itu bukan seruan untuk menghentikan semua pembangunan AI. Namun, sokongan terbuka daripada tokoh AI utama lain menyebabkan pasaran mempertimbangkan sama ada penyelarasan sukarela atau dasar pada masa depan boleh menyederhanakan perbelanjaan bagi pemecut AI, pusat data dan memori yang menyokong dagangan AI secara lebih luas. Niaga hadapan Nasdaq 100 dilaporkan turun 1% pada hujung minggu itu ketika perbahasan tersebut menekan sentimen pasaran. 8
Gabungan dua perkembangan ini tidak selesa bagi pelabur: DeepSeek menunjukkan perkhidmatan AI mungkin memerlukan kurang memori bagi setiap beban kerja, sementara perbahasan tentang memperlahankan AI pula membuka kemungkinan pertumbuhan beban kerja itu sendiri menjadi lebih perlahan.
Pelabur Michael Burry menolak seruan untuk memperlahankan pembangunan AI sebagai “mementingkan diri sendiri” (self-serving). Hujahnya ialah langkah memperlahankan kemajuan boleh menguntungkan makmal AI paling kukuh sedia ada, sambil menyukarkan pesaing kecil untuk mengejar; beliau juga mempersoalkan sama ada chatbot AI semasa benar-benar berada di laluan ke kecerdasan umum buatan (AGI). 15
Kenyataan Burry ialah kritikan terhadap insentif, bukan bukti tentang motif syarikat-syarikat tersebut. Dakwaan bahawa mesej keselamatan direka untuk menyokong rancangan tawaran awam permulaan (IPO) juga wajar dilihat sebagai tuduhan beliau, bukannya fakta yang telah dibuktikan. 11
15
Kesimpulan paling kukuh adalah terhad tetapi penting: DeepSeek mencabar versi terlalu mudah bagi tesis memori AI. Ia menunjukkan bahawa perisian, seni bina model, pengkuantuman dan teknik pengurusan cache boleh mengurangkan keamatan penggunaan memori untuk inferens dengan ketara. 52
55
Ia tidak membuktikan bahawa permintaan memori keseluruhan akan menurun. Pengurangan yang diumumkan adalah bagi cache KV semasa inferens berbanding seni bina DeepSeek terdahulu. Ia bukan tuntutan bahawa keseluruhan model atau pusat data menggunakan 75% kurang HBM dan 87.5% kurang storan SSD, dan ia tidak menghapuskan memori yang digunakan untuk berat model atau latihan. 25
Kos penyajian yang lebih rendah juga boleh meluaskan penggunaan: inferens lebih murah mungkin membolehkan lebih ramai pengguna, konteks lebih panjang dan lebih banyak gelung ejen AI. Hasil permintaan akhirnya bergantung pada kuasa mana yang lebih besar — kecekapan bagi setiap permintaan, atau pertumbuhan dalam bilangan dan kerumitan permintaan.
DeepSeek V4.1-Flash tidak membatalkan prospek jangka panjang HBM, NAND atau infrastruktur AI. Tetapi ia menjadikan prospek itu lebih bersyarat. Pelabur tidak lagi boleh mengandaikan bahawa peningkatan penggunaan AI akan diterjemahkan secara satu lawan satu kepada peningkatan penggunaan memori bagi setiap beban kerja.
Soalan yang lebih berguna ialah sama ada peningkatan kecekapan akan mengatasi peluasan penggunaan AI. DeepSeek memberi bukti bahawa inferens boleh menjadi jauh lebih ringan dari segi memori; namun ia belum menjawab seberapa pantas penggunaan AI global, skala latihan model dan permintaan perkakasan akan berkembang selepas itu.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek menyatakan V4.1 Flash memerlukan hanya satu perempat HBM dan satu perlapan storan SSD untuk cache KV berbanding generasi sebelumnya.
DeepSeek menyatakan V4.1 Flash memerlukan hanya satu perempat HBM dan satu perlapan storan SSD untuk cache KV berbanding generasi sebelumnya. Pengumuman itu mencetuskan penilaian semula terhadap saham berkaitan memori AI; saham Samsung Electronics dan SK Hynix masing masing jatuh lebih 3% dalam dagangan harian di Seoul.
Seruan Ketua Pegawai Eksekutif Anthropic, Dario Amodei, untuk memperlahankan kemajuan keupayaan model AI menambah kebimbangan bahawa perbelanjaan infrastruktur AI mungkin berkembang lebih perlahan daripada jangkaan pa...