GMKtec và Acemagic đang đưa một cấu hình trước đây gần như chỉ thấy ở máy trạm lớn xuống kích thước mini PC: 192GB bộ nhớ hợp nhất. EVO-X5 Pro và F9A đều xoay quanh AMD Ryzen AI Max+ PRO 495, tên mã cũ Gorgon Halo. Điểm đáng chú ý không phải GPU rời, mà là một vùng bộ nhớ LPDDR5X tốc độ cao được CPU và GPU tích hợp dùng chung — phù hợp với nhu cầu nạp các mô hình ngôn ngữ lớn (LLM) đã lượng tử hóa và chạy ngay trên máy, không cần gửi tài liệu hoặc câu lệnh lên dịch vụ đám mây.
1
8
43
Phần cứng mới tại IFA 2026
Ryzen AI Max+ PRO 495 có 16 nhân Zen 5, 32 luồng, xung boost tối đa 5,2GHz và đồ họa tích hợp Radeon 8065S với 40 Compute Unit. AMD công bố chip hỗ trợ tối đa 192GB LPDDR5X-8533 trên giao tiếp 256-bit. NPU đạt tối đa 55 TOPS; theo tài liệu của các hãng, tổng năng lực AI toàn nền tảng lên tới 131 TOPS.
1
3
43
Không có sự tách biệt cứng giữa RAM hệ thống và VRAM của card đồ họa rời. Với cấu hình được hỗ trợ, tối đa 160GB trong tổng 192GB có thể được cấp phát cho Radeon iGPU. Bộ nhớ LPDDR5X-8533 trên bus 256-bit mang lại băng thông lý thuyết khoảng 273GB/giây.
3
35
43
Hai mẫu máy được giới thiệu gồm:
- GMKtec EVO-X5 Pro: GMKtec xác nhận mini PC dùng Ryzen AI Max+ PRO 495, tối đa 192GB bộ nhớ và tối đa 160GB có thể cấp cho GPU. Hãng cho biết máy sẽ mở bán từ tháng 10/2026.
8
- Acemagic F9A: Acemagic trưng bày F9A PRO 495 tại IFA với cùng dòng xử lý, bộ nhớ hợp nhất tối đa 192GB và Radeon 8065S. Một báo cáo cho biết máy có thể tích khoảng 2 lít, kích thước 158,5 × 158,5 × 81,5mm.
1
29
Thông tin công bố hiện chưa đồng đều về cổng kết nối, mức điện năng, hệ thống tản nhiệt hoặc cấu hình theo từng thị trường của hai máy. Đây không phải chi tiết phụ: hiệu năng AI duy trì lâu dài trên mini PC phụ thuộc lớn vào tản nhiệt và mức điện năng nhà sản xuất thiết lập, không chỉ vào tên con chip.
Vì sao 192GB có thể nhắm đến LLM 300 tỷ tham số?
Số tham số không tự quyết định một mô hình có vừa bộ nhớ hay không; định dạng lượng tử hóa và phần bộ nhớ phụ trợ của phần mềm chạy mô hình cũng rất quan trọng. Chỉ tính riêng trọng số, một mô hình 300 tỷ tham số cần xấp xỉ:
| Định dạng trọng số |
Dung lượng trọng số thô ước tính |
Có thể vừa vùng GPU 160GB? |
| FP16 |
600GB |
Không |
| INT8 |
300GB |
Không |
| INT4 |
150GB theo hệ thập phân |
Có thể, nhưng rất ít khoảng trống |
Ở mức 4 bit mỗi tham số, 300 tỷ trọng số chiếm khoảng 150GB trước khi tính metadata lượng tử hóa, bộ đệm lúc chạy và KV cache phục vụ cửa sổ ngữ cảnh. Vì vậy, tuyên bố về nhóm mô hình cỡ 300B của AMD phụ thuộc vào lượng tử hóa mạnh, kiến trúc mô hình và cách cấu hình tác vụ. AMD cũng nêu điều kiện tương tự trong thông điệp nền tảng của mình.
15
31
Nói ngắn gọn, các máy này có thể nạp và chạy một số mô hình cỡ 300B ở INT4 trên máy; điều đó không đồng nghĩa chạy mô hình 300B ở FP16 hay INT8, cũng không bảo đảm tốc độ sinh token cao. Khi dành tới 160GB cho GPU, phần bộ nhớ còn lại cho hệ điều hành và tác vụ CPU cũng trở nên hạn chế.
Các nguồn được dẫn chưa cung cấp bằng chứng sơ cấp đáng tin cậy cho một mô hình hoặc màn trình diễn có tên “Qwen3.8-Flash-Next”. Vì thế, không nên xem đây là benchmark hay demo đã được xác minh độc lập.
Bước nhảy thật sự là dung lượng, không phải kiến trúc tính toán mới
So với dòng Ryzen AI Max 300 trước đó, vốn dừng ở 128GB LPDDR5X-8000 hợp nhất, nền tảng PRO 400 nâng trần lên 192GB — tăng 50%. Theo các báo cáo về công bố nền tảng của AMD, mức cấp phát bộ nhớ đồ họa tối đa cũng tăng từ 96GB lên 160GB.
11
Băng thông tăng ít hơn: LPDDR5X-8000 trên bus 256-bit cho khoảng 256GB/giây theo lý thuyết, trong khi LPDDR5X-8533 đạt khoảng 273GB/giây, cao hơn khoảng 6,6%. CPU vẫn là thiết kế Zen 5 16 nhân và mẫu cao nhất vẫn dùng Radeon 8065S. Do đó, đây chủ yếu là bản làm mới về dung lượng bộ nhớ, thay vì thay đổi toàn diện về kiến trúc tính toán.
9
33
36
Đây là khác biệt cần lưu ý khi mua máy: thêm bộ nhớ giúp nhiều mô hình lớn hơn có thể thường trú tại máy, nhưng không biến iGPU dùng RAM chung thành bộ tăng tốc trung tâm dữ liệu với bộ nhớ HBM và băng thông rất cao.
Những hệ thống khác cùng nền tảng 192GB
Dòng PRO 400 còn có Ryzen AI Max PRO 485 và 490 bên cạnh Max+ PRO 495. Bản 495 là cấu hình cao nhất, gồm 16 nhân và Radeon 8065S; các bản 485 và 490 dùng Radeon 8050S.
16
32
Một số hệ thống khác đã được công bố quanh nền tảng này gồm:
- Minisforum MS-S1 MAX P495, mini workstation quảng bá bộ nhớ LPDDR5X hợp nhất tối đa 192GB, trong đó tối đa 160GB có thể phân bổ làm VRAM.
3
4
- Framework Desktop, desktop nhỏ gọn dùng PRO 495, 192GB bộ nhớ, băng thông công bố 273GB/giây và tối đa 160GB dành cho iGPU.
14
33
- Lenovo ThinkCentre X Ultra, được đưa tin là hỗ trợ tới PRO 495 nhưng giới hạn bộ nhớ thấp hơn ở 128GB và tối đa 96GB bộ nhớ đồ họa. Máy dự kiến khởi điểm từ 3.669 USD và giao hàng vào tháng 11/2026.
34
Ai nên cân nhắc một mini workstation 192GB?
Hãy xem các hệ thống Gorgon Halo 192GB là máy dành cho suy luận AI cục bộ và phát triển, nơi dung lượng mô hình cùng việc giữ dữ liệu tại chỗ quan trọng hơn tốc độ cao nhất. Chúng có thể phù hợp với nhóm thử nghiệm LLM đã lượng tử hóa, quy trình làm việc với tài liệu riêng tư hoặc phát triển AI ngoại tuyến — những việc nếu không có thể phải thuê tài nguyên đám mây hay dùng máy trạm đa GPU cồng kềnh hơn.
Tuy nhiên, giới hạn là rõ ràng. Radeon iGPU dùng bộ nhớ chung với băng thông khoảng 273GB/giây rất khác một bộ tăng tốc cao cấp dùng HBM có băng thông lớn hơn nhiều. Con số 55 TOPS của NPU cũng không phải thước đo trực tiếp cho tốc độ sinh token của LLM: phần mềm, đường chạy trên GPU, định dạng mô hình, độ dài ngữ cảnh và mức điện năng ổn định đều ảnh hưởng đến kết quả thực tế.
1
35
Giá cũng là rào cản. Acemagic được đưa tin có kế hoạch bán F9A bản 192GB/2TB qua cửa hàng của hãng và Amazon trong tháng 9/2026 với giá 8.000 euro. Đây nên được hiểu là giá niêm yết dự kiến được báo cáo, không phải giá giao dịch bán lẻ đã xác nhận.
6
Dù vậy, EVO-X5 Pro và F9A cho thấy hướng đi của máy trạm AI nhỏ gọn: trang bị đủ bộ nhớ hợp nhất để giữ các mô hình lượng tử hóa lớn hơn trong một cỗ máy đặt trên bàn. Câu hỏi hữu ích nhất với người mua không phải là máy có gắn nhãn “hỗ trợ 300B” hay không, mà là: mô hình lượng tử hóa cụ thể nào, với cửa sổ ngữ cảnh bao nhiêu, sẽ chạy được ở tốc độ chấp nhận được?