DeepSeek, V4.1 Flash’ın çıkarım aşamasındaki KV önbelleği için HBM ihtiyacını önceki neslin dörtte birine, kalıcı önbellek alanını ise sekizde birine indirdiğini söylüyor. İlk tepki Güney Kore’de Samsung Electronics ve SK Hynix hisselerinde görüldü; daha sonraki satış dalgası Japonya, Avrupa ve ABD’deki çip şirketle...
YayımlayanGPT-5.6 Terra ile düzenlendiGörseller GPT Image 2 ile oluşturuldu
Research answer

Create a landscape editorial hero image for this Studio Global article: How did DeepSeek’s V4.1 Flash model trigger a selloff in memory-chip and broader technology stocks, what architectural changes did it introd. Article summary: DeepSeek V4.1 Flash caused a sharp reassessment of AI-memory demand because it claimed to cut the KV-cache memory used in long-context inference to one-quarter of its predecessor’s level and persistent SSD use to one-eig. Topic tags: general, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
DeepSeek’in V4.1 Flash duyurusu, yapay zekâ altyapısı yükselişinin temel kabullerinden birini hedef aldığı için yatırımcıları tedirgin etti: Yapay zekâ kullanımı arttıkça, her bir iş yükünün bellek tüketiminin de zorunlu olarak sürekli artacağı varsayımı.
Şirketin açıkladığı verimlilik kazanımları, özellikle uzun bağlamlı çıkarım işlemlerinde önemli. Ancak bunlar yapay zekâ sisteminin yalnızca bir bileşenine, anahtar-değer (KV) önbelleğine, odaklanıyor. Büyük modellerin eğitimi veya sunulmasındaki toplam bellek ve işlem gücü ihtiyacını açıklamıyor. 9
10
KV önbelleği, modelin daha önce işlediği belirteçlere (token) ait dikkat durumunu saklar. Böylece model her yeni adımda eski bağlamı baştan hesaplamak zorunda kalmaz. Uzun sohbetlerde ve birden fazla adım izleyen yapay zekâ ajanı iş akışlarında bu önbellek hem kritik hem de maliyetli hâle gelir.
DeepSeek’e göre V4.1 Flash, Compressed Sparse Attention 2 içindeki katmanlar arası KV önbellek yeniden kullanımını FP4 KV önbellekleme ile birleştiriyor. Şirket, HBM’de tutulan küresel KV önbellek boyutunun token başına 890 bayta indiğini; bunun V4-Flash seviyesinin yaklaşık dörtte biri olduğunu bildiriyor. 9
Şirket ayrıca kısa pencere dikkat mekanizması için SWA Bounded Replay adlı bir dağıtım yöntemi tanımlıyor. Bu düzende önbellek SSD’de ya da ana sistem belleğinde kalıcı biçimde tutulmak yerine, geçici dağıtık bir ana makine DRAM havuzunda yer alıyor; önbellek kaçırıldığında bağlamın sınırlı bir bölümü yeniden hesaplanıyor. DeepSeek, bunun kalıcı KV önbellek ayak izini önceki neslin yaklaşık sekizde birine düşürdüğünü söylüyor. 1
9
Pratik karşılığı şu: Bu kıyas yalnızca KV önbellek işlevi için geçerli olmak üzere, V4-Flash’a göre yaklaşık %75 daha az HBM ve %87,5 daha az kalıcı SSD kapasitesi anlamına geliyor. 9
10
Sistemdeki temel dar boğaz aktif KV önbellek kapasitesiyse, teorik olarak evet. Uzun bağlamlı her istek öncekinin yaklaşık dörtte biri kadar önbellek kullanıyorsa, aynı HBM tahsisi yaklaşık dört kat daha fazla aktif önbelleği barındırabilir.
Ne var ki bu, token başına açıklanan ölçümden çıkarılan bir kapasite sonucu; bağımsız şekilde doğrulanmış uçtan uca eşzamanlı kullanıcı testi değil. Gerçek kapasite; model ağırlıkları, işlem gücü, ağ altyapısı, istek uzunluğu, toplu işleme, gecikme hedefleri ve sunum yazılımı gibi birçok etkene bağlı.
Piyasanın tepkisi, belleğin gereksiz hâle geldiği düşüncesinden çok gelecekteki talep yoğunluğuna ilişkindi. HBM üreticileri ile NAND ve kurumsal SSD şirketleri, daha güçlü yapay zekâ sistemlerinin daha fazla bellek ve depolama altyapısı gerektireceği beklentisinden yararlanıyordu. Verimlilik sıçraması, her çıkarım iş yükü için daha az bellek biti ve daha az kalıcı depolama gerekebileceği ihtimalini gündeme getirdi.
Bloomberg’e göre 11 Eylül’de Güney Kore’de Samsung Electronics hissesi %3,5, SK Hynix hissesi ise %2,2 geriledi. 17 Dönemin haberlerinde Samsung ve SK Hynix’in Seul’de %3’ün üzerinde düştüğü; Micron ve SanDisk’in ise ABD işlemlerinin ilk bölümünde görece daha dayanıklı kaldığı da aktarıldı.
8
Dolayısıyla yatırımcı açısından risk, değerleme mantığıyla ilgiliydi: Yapay zekâ iş yükleri bellek açısından daha az yoğun hâle gelirse, bellek tedarikçileri için öngörülen talep büyümesi, fiyatlama gücü ve sermaye harcaması varsayımlarının yeniden değerlendirilmesi gerekebilir.
Satış dalgası, belirli bir çıkarım-verimliliği kaygısından daha geniş bir yapay zekâ sermaye harcaması değerlendirmesine dönüştü.
Öncü yapay zekâ geliştirmesinin yavaşlatılması çağrılarını izleyen haberlerde, SK Hynix’in %6,4, Samsung’un %4,1 ve Japonya’dan Kioxia’nın %6,4 düştüğü bildirildi. ASML, Infineon, ASM International, BE Semiconductor ve STMicroelectronics gibi Avrupalı yarı iletken şirketleri de geriledi. 18 Başka bir habere göre SoftBank %11, Kioxia %6,5 düşerken, Taiwan Semiconductor Manufacturing hissesi Asya işlemlerinde %1,2 geriledi.
19
ABD vadeli piyasa öncesi işlemlerinde Marvell yaklaşık %8; Intel, Micron ve SanDisk ise yaklaşık %6 eksideydi. 20
Bu hareketler, tek bir DeepSeek sürümünün tüm düşüşleri mekanik biçimde tetiklediğinin kanıtı olarak okunmamalı. Faiz, değerleme ve yapay zekâ büyümesine ilişkin daha geniş kaygılar teknoloji hisselerini aynı anda etkileyebilir. Ancak duyuru, piyasanın hassas bir varsayımı sınamasına somut bir gerekçe verdi: Yapay zekâ talebindeki büyüme, sorgu başına bellek talebinin aynı oranda büyümesini otomatik olarak sağlamaz. 17
Anthropic CEO’su Dario Amodei, yapay zekâ şirketlerine öncü model yeteneklerini geliştirme hızını düşürme çağrısı yaptı. Önerdiği çerçevenin amacı, kötüye kullanım ve güvenlik risklerini yönetmek için daha fazla zaman yaratmaktı.
Altyapı yatırımcıları için bu, DeepSeek’in verimlilik iddiasına ek ikinci bir kaygı doğurdu:
Bu iki başlık ekonomik olarak birbirinden farklı. Buna rağmen piyasanın ikisini de kesintisiz büyüme için fiyatlanmış yapay zekâ yatırımlarına yönelik riskler olarak görmesi anlaşılabilir. Haberler, daha geniş çip düşüşünü yatırımcıların yapay zekâ geliştirmesini yavaşlatma çağrılarıyla ilgili endişesine doğrudan bağladı. 18
20
Yatırımcı Michael Burry, yavaşlama mesajını çıkarcı olmakla eleştirdi. Önde gelen yapay zekâ şirketlerinin yöneticilerinin, kendi teknolojilerinin tehlikeli ölçüde hızlandığını anlatmaktan fayda sağlayabileceğini savundu ve bu söylemi “IPO hype & puffery” olarak niteledi. 14
Burry’nin yorumu, yavaşlamanın küçük rakiplerden çok yerleşik şirketlere fayda sağlayabileceği; kıtlık, itibar ve olası halka arz anlatısını güçlendirebileceği yönünde. Bu, şirket teşviklerine ilişkin Burry’nin görüşüdür; güvenlik kaygılarının samimiyetsiz veya temelsiz olduğunu kanıtlayan bir bulgu değildir. 14
DeepSeek’in duyurusu önemli; çünkü daha düşük hassasiyet, önbellek sıkıştırma, dikkat mimarisinin yeniden tasarımı, yeniden kullanım ve daha iyi sunum yazılımları yalnızca bu şirkete özgü fikirler değil. Diğer model geliştiricileri de bu yönelimleri izleyebilir. Bu nedenle çıkarım belleği verimliliği, yapay zekâ isteği başına artan bellek içeriğine dayanan beklentiler için yapısal bir risk oluşturuyor. 9
Bununla birlikte iddianın belirgin sınırları var.
DeepSeek, modelinin tamamının veya veri merkezinin %75 daha az HBM ve %87,5 daha az SSD kullandığını söylemedi. Karşılaştırma, önceki mimariye kıyasla çıkarım sırasındaki KV önbelleği gereksinimleriyle sınırlı. Model ağırlıkları, diğer sistem belleği, ağ ve depolama ihtiyaçları bu dar kıyasın dışında kalıyor. 10
Açıklanan iyileştirmeler, öncü modelleri eğitmek için gereken işlem gücü ve bellekte aynı ölçüde düşüş olduğunu göstermiyor. KV önbellek optimizasyonunu, tüm yapay zekâ yarı iletken talebinin çökeceğine dair kanıt saymak duyurunun ortaya koyduğundan fazlasını iddia etmek olur. 10
Daha ucuz ve daha az bellek yoğun çıkarım, istek başına bellek tüketimini azaltabilir. Öte yandan uzun bağlamlı asistanları, ajan tabanlı iş akışlarını ve kurum içi kurulumları daha fazla yerde ekonomik hâle getirebilir. Kullanıcı ve uygulama sayısındaki artış yeterince büyük olursa, her iş yükü daha az bellek gerektirse bile toplam bellek talebi güçlü kalabilir veya artabilir.
DeepSeek V4.1 Flash, yapay zekâ odaklı bellek yükseliş anlatısındaki zayıf noktayı görünür kıldı: Model mimarisi ve sunum yazılımı geliştikçe, çıkarım iş yükü başına bellek talebi keskin biçimde düşebilir. Şirketin açıkladığı token başına 890 baytlık küresel KV önbelleği ve sekizde bire inen kalıcı önbellek ayak izi, HBM ve SSD varsayımlarının neden hızla yeniden fiyatlandığını açıklıyor. 9
Yine de mevcut kanıt, bunu çip sektörü için derhal gerçekleşen bir talep şoku olarak tanımlamaya yetmiyor. Açıklanan tasarruflar, model eğitimi veya veri merkezinin tüm katmanları değil, çıkarım KV önbelleğiyle sınırlı. Uzun vadeli sonuç iki gücün yarışına bağlı olacak: Yapay zekâ görevi başına düşen bellek yoğunluğu ve düşen maliyetlerin mümkün kılacağı daha yaygın yapay zekâ kullanımı.
Bellek hissesi yatırımcıları açısından artık yalnızca “yapay zekâ kullanımı artacak mı?” sorusu yeterli değil. Asıl soru, toplam iş yükü artışının yapay zekâ sistemlerinin belleği daha verimli kullanmayı öğrenme hızını aşıp aşamayacağı.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek, V4.1 Flash’ın çıkarım aşamasındaki KV önbelleği için HBM ihtiyacını önceki neslin dörtte birine, kalıcı önbellek alanını ise sekizde birine indirdiğini söylüyor.
DeepSeek, V4.1 Flash’ın çıkarım aşamasındaki KV önbelleği için HBM ihtiyacını önceki neslin dörtte birine, kalıcı önbellek alanını ise sekizde birine indirdiğini söylüyor. İlk tepki Güney Kore’de Samsung Electronics ve SK Hynix hisselerinde görüldü; daha sonraki satış dalgası Japonya, Avrupa ve ABD’deki çip şirketlerine yayıldı.
Asıl soru, istek başına daha az bellek kullanımının toplam bellek satışlarını azaltıp azaltmayacağı ya da yapay zekâyı ucuzlatarak çok daha fazla iş yükü yaratıp yaratmayacağı.