PAIR cung cấp một điểm cuối cục bộ duy nhất và tự phân phối các yêu cầu suy luận Ollama hoặc LM Studio độc lập tới máy phù hợp trong mạng gia đình. Công cụ này không gộp GPU hay bộ nhớ của nhiều máy để chạy một yêu cầu duy nhất; mỗi yêu cầu vẫn do một thiết bị được chọn xử lý.
Đăng bởiHình ảnh được tạo bằng GPT Image 2
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: How did Nvidia’s IFA 2026 announcements advance its local AI strategy, including the free open source Personal AI Router (PAIR) tool that di. Article summary: Nvidia’s IFA 2026 announcements turned its local AI strategy into a fuller stack: simpler agent deployment, faster single device inference, coordinated use of several household machines, and a new Windows hardware tier d. Topic tags: general web, openai, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wi
Các thông báo của Nvidia tại IFA 2026 cho thấy hãng đang xây dựng một hệ sinh thái AI chạy tại chỗ hoàn chỉnh hơn: cài agent đơn giản hơn, suy luận nhanh hơn trên một thiết bị, tận dụng được nhiều máy trong nhà và bổ sung một dòng PC Windows đủ bộ nhớ để chạy mô hình lớn. Mục tiêu xuyên suốt là giữ prompt, tệp, mô hình và ngữ cảnh của agent trong môi trường cục bộ, nhưng vẫn khiến AI tại chỗ trở nên thiết thực hơn với người dùng phổ thông. 12
15
NVIDIA Personal AI Router (PAIR) là công cụ miễn phí, mã nguồn mở, cung cấp một địa chỉ cục bộ duy nhất cho ứng dụng AI. Sau khi phát hiện và ghép nối các hệ thống tương thích trong cùng mạng gia đình, PAIR sẽ chuyển từng yêu cầu suy luận độc lập kiểu Ollama hoặc LM Studio đến máy đang sẵn sàng xử lý. Điều này đặc biệt phù hợp với agent có nhiều tác vụ con chạy song song, đồng thời giúp khai thác các máy tính nhàn rỗi. 1
2
16
Điểm cần hiểu rõ: PAIR không gộp VRAM, RAM hay sức mạnh GPU của nhiều máy thành một bộ tăng tốc phân tán cho một lần chạy mô hình. Mỗi yêu cầu sẽ do một hệ thống được PAIR chọn phục vụ. Vì thế, lợi ích chính là tăng lượng tác vụ đồng thời và giảm thời gian chờ đối với công việc có thể tách thành nhiều yêu cầu riêng biệt — chứ không phải giúp một mô hình quá lớn, vốn không vừa trên bất kỳ máy đơn lẻ nào, có thể chạy nhờ chia sang nhiều PC. 1
2
PAIR hỗ trợ các máy Windows có RTX, DGX Spark và thiết bị macOS; khả năng tương thích chi tiết cùng các ngưỡng phần cứng cụ thể phụ thuộc vào tài liệu hỗ trợ của Nvidia. 4
12
Nvidia cho biết Hermes Agent, OpenClaw và Perplexity Portable Computer sẽ có quy trình triển khai mô hình cục bộ đơn giản hơn trên GPU Nvidia. Thay vì người dùng phải tự chọn mô hình, back end suy luận và cấu hình phù hợp, phần mềm sẽ hỗ trợ tự động hóa nhiều bước này. 7
14
Đây là điểm quan trọng trong chiến lược AI cục bộ: với nhiều người dùng, trở ngại lớn không chỉ là thiếu GPU mà còn là việc cài đặt, chọn mô hình và tinh chỉnh cấu hình quá phức tạp.
Ở lớp phần mềm, Nvidia nói các tối ưu mới cho llama.cpp và vLLM có thể nâng tốc độ suy luận cục bộ lên tới 1,9 lần. Các cải tiến này có thể được dùng trực tiếp hoặc thông qua LM Studio và Ollama; Nvidia cũng cho biết các bản cập nhật Ollama tiếp theo đang được lên kế hoạch. 7
14
Về phần cứng, các PC Windows RTX Spark dựa trên nền tảng N1X kiến trúc ARM của Nvidia dự kiến lên kệ vào tháng 10. Cấu hình cao nhất có thể gồm CPU Grace 20 nhân, GPU Blackwell RTX, tối đa 128 GB bộ nhớ hợp nhất và hiệu năng AI tới 1 petaflop. 12
15
Tùy chọn bộ nhớ hợp nhất dung lượng lớn đặc biệt đáng chú ý với mô hình AI cục bộ lớn và các luồng công việc agent vốn có thể vượt quá giới hạn bộ nhớ thực tế của GPU tiêu dùng thông thường.
Nvidia cho biết các thiết kế từ đối tác như Lenovo và Acer sẽ xuất hiện, đồng thời định vị RTX Spark cho cả AI lẫn nhu cầu PC thông thường, gồm cả hỗ trợ chơi game. 12 Các mô hình tối ưu cho RTX có thể triển khai cục bộ cùng cách cài agent một chạm được kỳ vọng biến thông số phần cứng thành ứng dụng riêng tư dễ sử dụng, thay vì chỉ là năng lực trên bảng benchmark.
7
14
Dù vậy, PAIR và các mức tăng tốc độ hiện vẫn là tuyên bố của nhà cung cấp hoặc năng lực phần mềm ở giai đoạn đầu. Hiệu quả thực tế sẽ phụ thuộc vào kích thước mô hình, độ trễ mạng, tổ hợp thiết bị và việc tải công việc của agent có thể chia thành các yêu cầu độc lập hay không. Các nguồn được xem xét cũng chưa đưa ra danh sách đầy đủ, có thẩm quyền về mọi trò chơi hoặc mọi mô hình tối ưu cho RTX có mặt lúc ra mắt.
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
PAIR cung cấp một điểm cuối cục bộ duy nhất và tự phân phối các yêu cầu suy luận Ollama hoặc LM Studio độc lập tới máy phù hợp trong mạng gia đình.
PAIR cung cấp một điểm cuối cục bộ duy nhất và tự phân phối các yêu cầu suy luận Ollama hoặc LM Studio độc lập tới máy phù hợp trong mạng gia đình. Công cụ này không gộp GPU hay bộ nhớ của nhiều máy để chạy một yêu cầu duy nhất; mỗi yêu cầu vẫn do một thiết bị được chọn xử lý.
Nvidia cũng hướng tới giảm khó khăn khi triển khai agent, tăng tốc suy luận cục bộ tới 1,9 lần và đưa RTX Spark chạy Windows ra thị trường vào tháng 10.