Bốn GEEKOM A9 Mega được trình diễn chạy DeepSeek V4 Flash mà không cần suy luận trên đám mây, với tổng cộng 64 nhân CPU, 128 luồng, 160 Compute Unit Radeon 8060S và 512 GB bộ nhớ hợp nhất LPDDR5X 8000. Các node kết nối qua USB4, sử dụng Ubuntu, AMD ROCm và DwarfStar để phân phối mô hình, sau đó cung cấp một endpoint...
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: How did GEEKOM demonstrate running the roughly 284-billion-parameter DeepSeek V4 Flash Mixture-of-Experts model locally and without cloud in. Article summary: GEEKOM’s demonstration was a four-node, local distributed-inference setup: it linked four A9 Mega mini PCs over USB4, then used Ubuntu, AMD ROCm, and DwarfStar software to partition an optimized DeepSeek V4 Flash model a. Topic tags: general, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
GEEKOM cho biết họ đã sử dụng bốn mini PC A9 Mega để tạo thành một cụm suy luận AI phân tán, triển khai DeepSeek V4 Flash ngay tại chỗ thay vì gửi prompt và tài liệu lên hạ tầng đám mây. Bốn hệ thống được kết nối qua USB4; Ubuntu, nền tảng ROCm của AMD và phần mềm DwarfStar đảm nhiệm việc triển khai cục bộ, đồng thời cung cấp kết quả thông qua API tương thích với OpenAI.
Điểm đáng chú ý nằm ở quy mô của mô hình. DeepSeek V4 Flash được mô tả là mô hình mixture-of-experts (MoE) có khoảng 284 tỷ tham số, trong đó khoảng 13 tỷ tham số được kích hoạt ở mỗi token. Mô hình cũng được thiết kế để hỗ trợ cửa sổ ngữ cảnh lên tới một triệu token.
Mỗi A9 Mega sử dụng bộ xử lý AMD Ryzen AI Max+ 395 với 16 nhân và 32 luồng, kết hợp đồ họa Radeon 8060S. Khi cộng cả bốn máy, cấu hình trên lý thuyết gồm:
Bộ nhớ hợp nhất là yếu tố cốt lõi của thiết kế này. Thay vì phụ thuộc vào một GPU rời có đủ bộ nhớ để chứa mô hình, hệ thống phân phối khối lượng xử lý trên tài nguyên bộ nhớ và đồ họa của nhiều máy.
Tuy nhiên, không nên đồng nhất con số 512 GB với dung lượng chắc chắn có thể dùng cho trọng số mô hình. Dung lượng thực tế còn phải chia cho runtime, bộ nhớ đệm và hệ điều hành, đồng thời phụ thuộc vào độ chính xác, phương thức lượng tử hóa và cấu hình phần mềm.
Theo GEEKOM, bốn máy giao tiếp với nhau qua USB4 và sử dụng bộ phần mềm gồm Ubuntu, ROCm cùng DwarfStar. Phiên bản DeepSeek V4 Flash đã được tối ưu hóa sẽ được phân chia giữa các node, sau đó phục vụ yêu cầu thông qua endpoint tương thích OpenAI.
Khả năng tương thích API có ý nghĩa thực tế đối với doanh nghiệp. Những ứng dụng nội bộ, AI agent hoặc công cụ dành cho nhà phát triển vốn đã hỗ trợ endpoint kiểu OpenAI có thể kết nối với mô hình cục bộ mà không phải thiết kế lại toàn bộ lớp tích hợp.
Vì vậy, mục tiêu của cấu hình này không chỉ là chạy chatbot trên một máy tính cá nhân. GEEKOM đang hướng đến một dịch vụ AI riêng tư đặt trong môi trường của tổ chức, nơi prompt, tài liệu nội bộ và kết quả sinh ra có thể được xử lý trong mạng riêng.
Dù vậy, màn trình diễn không có nghĩa cụm máy này hoạt động giống một máy chủ trung tâm dữ liệu chuyên dụng. Thông báo hiện chưa nêu rõ topology, băng thông và độ trễ thực tế, chiến lược sharding, độ chính xác của mô hình, định dạng lượng tử hóa, cấu hình điều phối hay cơ chế khôi phục khi một node gặp lỗi. Những yếu tố này có thể ảnh hưởng đáng kể đến hiệu năng, đặc biệt khi mô hình song song phải liên tục trao đổi dữ liệu giữa các máy.
Mỗi A9 Mega có hai khe M.2 PCIe 4.0 và được công bố hỗ trợ tối đa 8 TB SSD. Nếu cả bốn máy đều được trang bị đến mức tối đa, toàn bộ cụm về lý thuyết có thể đạt 32 TB dung lượng lưu trữ.
Con số này độc lập với 512 GB bộ nhớ hợp nhất của hệ thống và không cho biết riêng bản triển khai DeepSeek cần bao nhiêu dung lượng đĩa.
Kết nối giữa các node được báo cáo là USB4. Tài liệu sản phẩm của GEEKOM cũng liệt kê các cổng USB4 tốc độ tối đa 40 Gbps trên A9 Mega. Tuy nhiên, tốc độ giao tiếp danh nghĩa không đồng nghĩa với hiệu năng cụm. Băng thông hữu dụng và độ trễ khi suy luận phân tán còn phụ thuộc vào chi phí giao thức, topology và cách phần mềm trao đổi dữ liệu.
GEEKOM định vị hệ thống như một thiết bị AI riêng tư on-premises. Về nguyên tắc, doanh nghiệp có thể giữ prompt, tài liệu nội bộ và đầu ra trong mạng của mình, đồng thời cho phép các ứng dụng hoặc agent sử dụng mô hình thông qua API cục bộ. ROCm cung cấp lớp phần mềm cho phần cứng đồ họa AMD, nên thiết kế này không bắt buộc phải dựa trên hệ thống NVIDIA/CUDA.
Cách tiếp cận này có thể phù hợp với các tổ chức có yêu cầu về nơi lưu trữ dữ liệu, quyền riêng tư hoặc cô lập mạng. Đổi lại, doanh nghiệp phải tự chịu trách nhiệm về tính sẵn sàng của phần cứng, cập nhật hệ thống, tệp mô hình, kiểm soát truy cập, giám sát, tản nhiệt, điện năng và độ ổn định của phần mềm.
GEEKOM niêm yết A9 Mega ở mức 3.999 USD. Như vậy, bốn node có giá khoảng 15.996 USD, trước khi tính thêm chi phí nâng cấp lưu trữ, cáp, thiết bị mạng, lắp đặt, điện, bảo trì và hỗ trợ.
Đây là khoản đầu tư đáng kể cho một hệ thống mà đặc tính vận hành trong môi trường production vẫn chưa được xác lập độc lập. Phép so sánh phù hợp không chỉ là giá mua bốn mini PC, mà còn phải tính toàn bộ chi phí vận hành một dịch vụ suy luận phân tán và khối lượng công việc mà nó có thể xử lý ổn định.
Thông báo của GEEKOM cho thấy công ty đã triển khai DeepSeek V4 Flash trên bốn A9 Mega, nhưng chưa cung cấp kết quả độc lập, được chuẩn hóa cho đúng cấu hình này. Hiện chưa có số liệu về tốc độ sinh token duy trì, thời gian phát sinh token đầu tiên, số người dùng đồng thời, độ trễ khi chạy ngữ cảnh dài, mức tiêu thụ điện hay hành vi của hệ thống khi có lỗi.
Do đó, màn trình diễn nên được xem là bằng chứng về khả năng triển khai, chưa phải benchmark production đã được xác thực. Việc DeepSeek V4 Flash hỗ trợ ngữ cảnh một triệu token là một thông số quan trọng, nhưng không chứng minh cụm bốn A9 Mega có thể xử lý yêu cầu dài một triệu token nhanh hoặc tiết kiệm.
Hiệu năng thực tế sẽ phụ thuộc vào bản mô hình, độ chính xác, phương thức lượng tử hóa, cách phân bổ bộ nhớ, độ dài prompt, số yêu cầu đồng thời và chi phí giao tiếp giữa các node.
Nền tảng Ryzen AI Max+ 395 không phải độc quyền của GEEKOM. Một số nhà sản xuất khác cũng bán mini PC dùng cùng bộ xử lý, thậm chí có cấu hình 128 GB bộ nhớ hợp nhất.
Minisforum N5 Max là một thiết kế tương đương. Tuy nhiên, ServeTheHome cho biết phiên bản bán lẻ của N5 Max được xuất xưởng với 64 GB LPDDR5X bộ nhớ hợp nhất hàn trên bo mạch, thay vì cấu hình 128 GB từng xuất hiện ở mẫu thử trước đó.
Điều này cho thấy điểm khác biệt đáng kể hơn của GEEKOM nằm ở màn trình diễn phần mềm với bốn node, chứ không chỉ ở bộ xử lý. Để đánh giá giá trị thực tế của giải pháp, công ty cần công bố hướng dẫn thiết lập có thể tái lập, benchmark tiêu chuẩn, số liệu mạng, mức tiêu thụ điện và bằng chứng về khả năng vận hành ổn định với tải thực tế.
Cụm bốn A9 Mega cho thấy một cách tương đối nhỏ gọn để xây dựng nền tảng suy luận AMD có dung lượng bộ nhớ lớn: 64 nhân CPU, 128 luồng, 160 Compute Unit Radeon 8060S và 512 GB bộ nhớ hợp nhất, kết nối qua USB4 và được quản lý bằng Ubuntu, ROCm cùng DwarfStar.
Lời hứa hấp dẫn nhất là khả năng truy cập cục bộ, riêng tư vào một mô hình MoE rất lớn thông qua API quen thuộc. Nhưng bằng chứng hiện có mới xác nhận hệ thống đã được triển khai, chưa đủ để kết luận về tốc độ, hiệu quả hay mức độ sẵn sàng cho production.
Cho đến khi GEEKOM công bố benchmark có thể tái lập và các chi tiết triển khai cần thiết, cụm máy này nên được xem là một màn trình diễn on-premises đáng chú ý hơn là sản phẩm đã chứng minh được khả năng thay thế hạ tầng AI chuyên dụng.
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Bốn GEEKOM A9 Mega được trình diễn chạy DeepSeek V4 Flash mà không cần suy luận trên đám mây, với tổng cộng 64 nhân CPU, 128 luồng, 160 Compute Unit Radeon 8060S và 512 GB bộ nhớ hợp nhất LPDDR5X 8000.
Bốn GEEKOM A9 Mega được trình diễn chạy DeepSeek V4 Flash mà không cần suy luận trên đám mây, với tổng cộng 64 nhân CPU, 128 luồng, 160 Compute Unit Radeon 8060S và 512 GB bộ nhớ hợp nhất LPDDR5X 8000. Các node kết nối qua USB4, sử dụng Ubuntu, AMD ROCm và DwarfStar để phân phối mô hình, sau đó cung cấp một endpoint tương thích OpenAI cho ứng dụng nội bộ.
Với giá niêm yết 3.999 USD cho mỗi A9 Mega, riêng bốn hệ thống đã có giá khoảng 15.996 USD, chưa tính SSD, kết nối, triển khai, điện năng và hỗ trợ.