DeepSeek cho biết V4.1 Flash chỉ cần 1/4 HBM và 1/8 dung lượng SSD cho KV cache so với thế hệ trước. Tin tức này khiến thị trường xem xét lại giả định rằng AI càng phát triển thì lượng bộ nhớ tiêu thụ trên mỗi tác vụ sẽ tăng tương ứng; Samsung Electronics và SK Hynix đều có lúc giảm hơn 3% trong phiên tại Hàn Quốc.
Đăng bởiBiên tập bằng GPT-5.6 TerraHình ảnh được tạo bằng GPT Image 2
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: How did DeepSeek’s September 10 V4.1 Flash release, which reduced key-value cache consumption to about one-quarter of its predecessor’s high. Article summary: The selloff reflected a rapid reassessment of the “AI equals ever-more memory” trade. DeepSeek’s V4.1-Flash showed that serving long-context models can be made far less memory-intensive, while Amodei’s proposed slowing o. Topic tags: general, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
DeepSeek công bố V4.1-Flash ngày 10/9 đã khiến thị trường chao đảo vì nó thách thức một câu chuyện đầu tư vốn rất dễ hiểu: mô hình AI ngày càng lớn, ngữ cảnh ngày càng dài và AI tác tử ngày càng phổ biến sẽ đòi hỏi ngày càng nhiều bộ nhớ băng thông cao (HBM), NAND cùng hạ tầng lưu trữ.
Tuyên bố kỹ thuật của DeepSeek không nói bộ nhớ trở nên dư thừa. Nhưng nó cho thấy lượng bộ nhớ cần để phục vụ một khối lượng suy luận AI nhất định có thể giảm đáng kể nhờ thiết kế kiến trúc mô hình và tối ưu hóa bộ nhớ đệm. 61
25
KV cache (bộ nhớ đệm key-value) lưu trạng thái chú ý của mô hình khi xử lý yêu cầu. Nó đặc biệt quan trọng với hội thoại có ngữ cảnh dài và tác vụ AI tác tử, vì giúp mô hình không phải tính lại toàn bộ lịch sử tương tác.
DeepSeek cho biết V4.1-Flash giảm nhu cầu KV cache xuống còn 1/4 lượng HBM và 1/8 dung lượng SSD so với thế hệ trước. 61 Theo thẻ mô hình, mức giảm này đến từ kiến trúc encoder-decoder nhân quả (causal encoder-decoder, CED): KV cache toàn cục của decoder được chiếu từ các trạng thái ẩn cuối cùng của encoder, thay vì được tạo riêng ở từng lớp decoder. Kỹ thuật triển khai SWA Bounded Replay cũng tránh phải lưu một số trạng thái cache của cơ chế cửa sổ trượt lên SSD.
52
Các bài phân tích độc lập ước tính KV cache toàn cục của mô hình vào khoảng 890 byte mỗi token — xấp xỉ 1/4 V4-Flash — và cho rằng thiết kế này có thể phục vụ số người dùng đồng thời cao hơn khoảng 4–8 lần trong cùng một dung lượng KV cache. 53 DeepSeek cũng cho biết mô hình chỉ kích hoạt 8 tỷ tham số mỗi token trong giai đoạn xử lý đầu vào (prefill) và 16 tỷ tham số trong giai đoạn sinh đầu ra (decode), nhằm tăng hiệu quả với tác vụ tác tử có đầu vào lớn.
52
Vấn đề trước mắt không phải AI có còn cần bộ nhớ hay không — câu trả lời vẫn là có. Điều thị trường lo ngại là lượng bộ nhớ cần dùng trên mỗi đơn vị đầu ra suy luận có thể giảm nhanh hơn đáng kể so với giả định trong các mô hình dự báo doanh thu và nhu cầu chip.
Nếu một mô hình có hiệu năng tương đương có thể xử lý nhiều yêu cầu ngữ cảnh dài cùng lúc hơn với cùng một lượng HBM hoặc ổ SSD, nhà cung cấp đám mây có thể khai thác thông lượng lớn hơn từ hạ tầng hiện hữu. Khả năng đó gây áp lực lên các giả định về sản lượng, tình trạng khan hiếm nguồn cung và quyền định giá của HBM, DRAM, SSD doanh nghiệp cùng các thiết bị lưu trữ liên quan.
Theo các báo cáo, cổ phiếu Samsung Electronics và SK Hynix tại Hàn Quốc đều có lúc giảm hơn 3% sau khi DeepSeek ra mắt mô hình. 17 Mối lo lan sang các nhóm cổ phiếu hạ tầng AI rộng hơn bởi các nhà sản xuất bộ nhớ liên kết chặt với doanh nghiệp lưu trữ, mạng và năng lực tính toán. Một mô hình cần ít bộ nhớ hơn có thể thay đổi bài toán kinh tế khi triển khai AI, dù không nhất thiết làm giảm nhu cầu ở mọi nhóm phần cứng với cùng mức độ.
Trường hợp SanDisk cho thấy luận điểm đầu tư đã trở nên nhạy cảm thế nào với kỳ vọng nhu cầu từ AI. Dữ liệu thị trường trong giai đoạn này ghi nhận biên độ giá 52 tuần khoảng 85–2.354 USD, trong khi đồng thuận của giới phân tích vẫn là Mua hoặc Mua vừa phải. 35
37 Tuy nhiên, xếp hạng tích cực không thể xóa bỏ câu hỏi trung tâm: bao nhiêu phần nhu cầu lưu trữ tương lai đang dựa trên giả định rằng kiến trúc suy luận AI sẽ tiếp tục ngày càng tiêu tốn bộ nhớ?
Tin DeepSeek là cú sốc về hiệu quả. Lời kêu gọi “pace the frontier” — tạm hiểu là kiềm tốc phát triển AI tiên phong — của Dario Amodei lại nêu ra một vấn đề khác: tốc độ tăng năng lực AI và kéo theo đó là tốc độ chi tiêu hạ tầng.
Trong bài luận công bố vào tháng 9, CEO Anthropic đề xuất các công ty chủ động làm chậm nhịp nâng cao năng lực của mô hình AI tiên phong để có thêm thời gian xử lý vấn đề an toàn và căn chỉnh mô hình. Ông đưa ra ba bước: đưa các bên đánh giá độc lập vào hoạt động nội bộ, phối hợp giữa doanh nghiệp ở các nước dân chủ và sau cùng là các thỏa thuận giữa chính phủ. 4
5
Đây không phải lời kêu gọi dừng toàn bộ hoạt động phát triển AI. Tuy vậy, sự ủng hộ công khai của những lãnh đạo AI nổi tiếng khác khiến thị trường phải cân nhắc liệu phối hợp tự nguyện hoặc chính sách trong tương lai có thể làm chậm đà chi tiêu cho bộ tăng tốc AI, trung tâm dữ liệu và bộ nhớ hay không. Hợp đồng tương lai Nasdaq 100 được đưa tin đã giảm 1% vào cuối tuần khi cuộc tranh luận khiến giao dịch AI bị soi xét. 8
Kết hợp lại, hai diễn biến tạo ra tình huống khó chịu cho nhà đầu tư: DeepSeek gợi ý dịch vụ AI có thể cần ít bộ nhớ hơn cho mỗi tác vụ, còn tranh luận về việc kiềm tốc AI làm dấy lên khả năng tăng trưởng của chính các tác vụ đó có thể chậm hơn.
Nhà đầu tư Michael Burry bác bỏ các lời kêu gọi làm chậm phát triển AI, gọi chúng là “self-serving” — phục vụ lợi ích riêng. Lập luận của ông là việc làm chậm có thể đem lợi thế cho các phòng thí nghiệm AI tiên phong đã có vị thế, đồng thời khiến đối thủ nhỏ khó bắt kịp hơn. Burry cũng hoài nghi việc các chatbot AI hiện nay có đang đi đến trí tuệ nhân tạo tổng quát (AGI) hay không. 15
Đây là phê phán về động cơ và cấu trúc lợi ích, không phải bằng chứng xác lập động cơ thực sự của các công ty. Tương tự, nhận định rằng thông điệp an toàn AI nhằm hỗ trợ kế hoạch IPO cần được hiểu là cáo buộc của Burry, thay vì một sự thật đã được chứng minh. 11
15
Kết luận vững chắc nhất khá hẹp nhưng quan trọng: DeepSeek đã thách thức phiên bản đơn giản hóa của luận điểm “AI đồng nghĩa với nhu cầu bộ nhớ ngày càng cao”. Công ty cho thấy phần mềm, kiến trúc mô hình, lượng tử hóa và kỹ thuật quản lý cache có thể giảm mạnh cường độ sử dụng bộ nhớ khi suy luận. 52
55
Tuy vậy, điều này không chứng minh tổng nhu cầu bộ nhớ sẽ giảm. Các mức cắt giảm được công bố áp dụng cho KV cache trong giai đoạn suy luận, khi so với kiến trúc liền trước của DeepSeek. Đây không phải tuyên bố rằng toàn bộ mô hình hay trung tâm dữ liệu dùng ít hơn 75% HBM và 87,5% SSD; cũng không loại bỏ bộ nhớ dành cho trọng số mô hình hoặc giai đoạn huấn luyện. 25
Chi phí phục vụ thấp hơn còn có thể tạo hiệu ứng ngược: suy luận rẻ hơn có thể mở rộng số người dùng, độ dài ngữ cảnh và số vòng lặp tác tử. Kết quả nhu cầu cuối cùng phụ thuộc vào lực nào mạnh hơn: hiệu quả trên mỗi yêu cầu, hay sự gia tăng về số lượng lẫn độ phức tạp của yêu cầu.
DeepSeek V4.1-Flash không phủ định triển vọng dài hạn của HBM, NAND hay hạ tầng AI. Nhưng nó khiến triển vọng đó trở nên có điều kiện hơn: nhà đầu tư không thể mặc định rằng AI được dùng nhiều hơn sẽ chuyển hóa một đổi một thành mức tiêu thụ bộ nhớ cao hơn cho mỗi khối lượng công việc.
Câu hỏi thiết thực hơn là liệu mức tăng hiệu quả có vượt tốc độ mở rộng triển khai AI hay không. DeepSeek đưa ra bằng chứng rằng suy luận có thể trở nên gọn nhẹ hơn rất nhiều, nhưng chưa thể trả lời quy mô sử dụng AI toàn cầu, mức độ huấn luyện mô hình và nhu cầu phần cứng sau đó sẽ tăng nhanh đến đâu.
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
DeepSeek cho biết V4.1 Flash chỉ cần 1/4 HBM và 1/8 dung lượng SSD cho KV cache so với thế hệ trước.
DeepSeek cho biết V4.1 Flash chỉ cần 1/4 HBM và 1/8 dung lượng SSD cho KV cache so với thế hệ trước. Tin tức này khiến thị trường xem xét lại giả định rằng AI càng phát triển thì lượng bộ nhớ tiêu thụ trên mỗi tác vụ sẽ tăng tương ứng; Samsung Electronics và SK Hynix đều có lúc giảm hơn 3% trong phiên tại Hàn Quốc.
Lời kêu gọi làm chậm tốc độ nâng cao năng lực AI tiên phong của CEO Anthropic Dario Amodei tạo thêm lo ngại rằng chi tiêu hạ tầng AI có thể tăng chậm hơn dự kiến.