Far Labs và Evolving Edge muốn gom các PC gaming, máy chủ gia đình nhàn rỗi để chạy tác vụ AI inference, chủ yếu với những mô hình mã nguồn mở nhỏ hơn. Mô hình này có thể tận dụng phần cứng sẵn có và giảm phụ thuộc vào trung tâm dữ liệu, nhưng chủ máy phải tính cả tiền điện, làm mát, hao mòn phần cứng, bảo mật và th...
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: How are startups such as Abu Dhabi-based Far Labs and Austin-based Evolving Edge attempting to turn idle gaming PCs and home servers into a. Article summary: Far Labs and Evolving Edge are pursuing an “Airbnb for inference” model: recruit owners of idle gaming PCs and home servers, pay them to supply GPU capacity, and use that capacity mainly for smaller open-source models ra. Topic tags: general, academic, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wa
Một chiếc PC gaming thường chỉ được xem là tài sản cá nhân, phục vụ chơi game hoặc làm việc. Far Labs và Evolving Edge lại muốn biến phần GPU, CPU đang bỏ trống trong những chiếc máy này thành một dạng hạ tầng AI phân tán: kết nối chủ máy, giao tác vụ đến phần cứng phù hợp và trả tiền cho năng lực tính toán đã được xác minh.
Mục tiêu chính của mô hình là AI inference—quá trình dùng mô hình đã được huấn luyện để trả lời yêu cầu—chứ không phải huấn luyện các mô hình AI tiên phong quy mô lớn. 2
6
Ý tưởng này hấp dẫn vì có thể tận dụng năng lực tính toán đã tồn tại thay vì chỉ mở thêm các cụm máy chủ tập trung. Tuy nhiên, câu hỏi khó không phải là một GPU gia đình có chạy được mô hình mã nguồn mở hay không. Vấn đề là liệu hàng nghìn máy tính khác nhau, thường xuyên bật tắt và có chất lượng kết nối không đồng đều, có thể cùng cung cấp dịch vụ nhanh, an toàn, ổn định với mức giá đủ tốt cho cả khách hàng lẫn chủ máy hay không.
Một hệ thống điển hình có ba phần: yêu cầu từ khách hàng, lớp điều phối quyết định nơi xử lý và phần mềm cài trên máy chủ để thực thi tác vụ. Bộ điều phối phải ghép công việc với phần cứng đang sẵn sàng, đồng thời cân nhắc kích thước mô hình, dung lượng bộ nhớ, độ trễ, thời gian hoạt động và giới hạn tài nguyên của từng máy.
FAR AI, sản phẩm được FAR Labs mô tả, là một lớp inference phân tán kết nối các GPU phổ thông và định tuyến yêu cầu tới những nút phù hợp theo thời gian thực. Công ty hướng tới các tác vụ tương tác mà không phải phụ thuộc hoàn toàn vào cụm máy chủ tập trung. 11
12
Theo phần thông tin được cung cấp, bộ lập lịch của Far Labs có thể chia công việc của một mô hình cho nhiều máy khi một máy không đủ bộ nhớ để chứa toàn bộ mô hình. Cách làm này mở rộng danh sách phần cứng có thể tham gia, nhưng cũng tạo thêm nhu cầu phối hợp và trao đổi dữ liệu giữa các nút. Mỗi lần chuyển tiếp đều có thể ảnh hưởng đến thời gian phản hồi và độ ổn định.
Far Labs từng nêu mục tiêu độ trễ dưới 100 mili giây cho inference tương tác trong tương lai. Đây là mục tiêu được công bố, chưa phải bằng chứng cho thấy hiệu năng đầu-cuối đã đạt mức đó. Độ trễ thực tế còn bao gồm thời gian định tuyến yêu cầu, xếp hàng, nạp mô hình, trao đổi giữa các nút và gửi kết quả về cho người dùng.
Evolving Edge được mô tả là sử dụng Ray, một framework điện toán phân tán, để phân bổ các tác vụ phục vụ mô hình cho những máy tính tham gia mạng. Trong Ray, các tiến trình có thể được biểu diễn dưới dạng actor được quản lý và lập lịch trên nhiều máy trong cùng một cụm. 5
6
Ray cung cấp các khối xây dựng hữu ích cho việc thực thi phân tán, nhưng bản thân việc dùng Ray không tự động giải quyết những bài toán khó hơn của một marketplace. Nhà vận hành vẫn phải phát hiện nút bị lỗi hoặc quá tải, đặt mô hình hiệu quả, xử lý các cấu hình phần cứng khác nhau và quyết định khi nào cần thử lại hoặc nhân bản một tác vụ.
Cho phép mã hoặc dữ liệu của bên thứ ba chạy trên máy tính cá nhân tạo ra rủi ro lớn hơn nhiều so với việc cài một trò chơi hay ứng dụng thông thường. Một hệ thống dành cho chủ máy cần giới hạn rõ ràng những gì workload được truy cập và lượng tài nguyên mà nó được phép tiêu thụ.
Các biện pháp có thể bao gồm:
Kiến trúc sandbox được Ray ghi nhận sử dụng các môi trường nhẹ, cô lập ở cấp kernel để chạy mã không đáng tin cậy và workload của các tác tử AI. Bản triển khai thử nghiệm dùng gVisor cùng môi trường container OCI, trong khi actor do Ray quản lý có thể lập lịch và kiểm soát tài nguyên của sandbox. 17
18
20
21
Những tính năng này cho thấy hệ sinh thái phần mềm nói chung đã có các cơ chế bảo mật liên quan. Tuy nhiên, chúng không chứng minh rằng Far Labs hay Evolving Edge đang triển khai đúng các lớp bảo vệ đó trong môi trường production, rằng cấu hình sẽ an toàn trên hệ điều hành của người dùng phổ thông, hoặc rằng nút đang hoạt động thực sự chạy đúng phiên bản mã mà chủ máy đã kiểm tra.
Phần mềm node mã nguồn mở có thể giúp tăng tính minh bạch, vì chủ máy có thể xem cách chương trình giới hạn tài nguyên và truy cập dữ liệu. Nhưng mã nguồn mở không phải bảo đảm an ninh tuyệt đối. Nhà vận hành vẫn cần quy trình build có thể tái lập, bản cập nhật được ký, hệ thống quyền rõ ràng, quy trình phản ứng khi phát hiện lỗ hổng và bằng chứng cho thấy phiên bản đang chạy khớp với mã đã công bố.
Salad là phép so sánh rõ ràng nhất vì nền tảng này đã vận hành marketplace kết nối GPU của người dùng với các tổ chức cần năng lực tính toán. Mô hình của Salad không dựa vào blockchain hay lớp phối hợp bằng token. 13
Far Labs nhấn mạnh việc định tuyến theo thời gian thực và inference phân tán, trong đó có khả năng chia công việc của mô hình cho nhiều nút. Evolving Edge được mô tả là tập trung vào runtime phân tán dựa trên Ray và một chương trình beta mở. Trong khi Salad có lợi thế về kinh nghiệm vận hành marketplace GPU tiêu dùng, các đối thủ mới phải chứng minh kiến trúc của họ có thể mang lại mức độ sẵn sàng, hỗ trợ, nhu cầu và hiệu quả kinh tế tương đương.
Điểm cần phân biệt là: phi tập trung là một lựa chọn kiến trúc, không phải kết quả hiệu năng. Một mạng có thể gồm rất nhiều máy tính nhưng vẫn được vận hành tập trung, thiếu ổn định hoặc không có lợi nhuận.
Khoản tiền mà chủ máy nhận được chỉ là điểm bắt đầu khi tính lợi nhuận. Họ còn phải gánh toàn bộ hoặc một phần chi phí điện, nhiệt, làm mát, đường truyền internet, bảo trì, khấu hao phần cứng và việc không thể sử dụng máy cho mục đích cá nhân trong cùng thời gian.
Có tên trong mạng không đồng nghĩa với có nhiều việc được trả tiền. Một GPU luôn kết nối nhưng hiếm khi nhận workload có thể kiếm được rất ít, trong khi vẫn tiêu thụ điện và tạo thêm chi phí quản trị, nhiệt lượng hoặc hao mòn. Nếu không công bố rõ mức trả, tỷ lệ sử dụng, thời lượng tác vụ và mức tiêu thụ điện, chủ máy gần như không thể tính được lợi tức đầu tư đáng tin cậy.
Inference liên tục cũng có thể làm tăng nhiệt độ, thời gian hoạt động của quạt và mức sử dụng bộ nhớ. Việc này có đáng về mặt kinh tế hay không phụ thuộc vào từng mẫu GPU, giá điện tại nơi người dùng sinh sống, thời gian máy online, cường độ workload và giá trị bán lại. Tài liệu hiện có chưa chứng minh rằng việc tham gia sẽ tạo ra thu nhập thụ động hoặc có lãi với phần lớn chủ máy.
Phần cứng tiêu dùng có một lợi thế tiềm năng về chi phí: máy đã tồn tại, và một số chủ sở hữu có thể muốn kiếm tiền từ năng lực nhàn rỗi. Dù vậy, mạng lưới vẫn phải chi trả cho việc điều phối, băng thông, giám sát, tác vụ thất bại, nhân bản workload, hỗ trợ kỹ thuật, bảo mật và tiền công cho chủ máy.
Độ trễ cũng tương tự. Việc sandbox khởi động nhanh trong một cấu hình Kubernetes cụ thể không đồng nghĩa với inference đầu-cuối dưới 100 mili giây qua các đường truyền internet gia đình. Con số dưới 100 mili giây trong tài liệu Ray nói về thời gian khởi động sandbox ở một thiết lập nhất định, không phải cam kết cho mạng inference gồm các nút tiêu dùng trên internet. 17
Các hệ thống AI phân tán nói chung cũng vẫn dựa vào tính toán ngoài chuỗi. Blockchain đa dụng không phù hợp để trực tiếp xử lý khối lượng tính toán và dữ liệu lớn của workload machine learning, nên thường chỉ đóng vai trò lớp điều phối hoặc thanh toán thay vì chạy mô hình trực tiếp trên chuỗi. 1
Một mạng phân tán có thể bền bỉ hơn một máy đơn lẻ nếu sở hữu đủ năng lực dự phòng và có thể chuyển workload nhanh khi nút biến mất. Nghiên cứu liên quan đến Ray mô tả khả năng tái dựng các dependency của tác vụ bị mất khi nút bị loại khỏi mạng, sau đó khôi phục thông lượng khi các nút quay lại. 30
Tuy nhiên, lợi thế này không tự động xuất hiện. Một mạng inference production cần đủ dự phòng, nhân bản mô hình, cơ chế đặt workload thông minh và phát hiện lỗi nhanh. Các sự cố có tính tương quan—chẳng hạn mất điện theo khu vực, sự cố nhà cung cấp internet, bản cập nhật phần mềm lỗi hoặc động lực tài chính dành cho chủ máy suy giảm—có thể khiến nhiều nút biến mất cùng lúc.
Việc chia mô hình cho nhiều máy cũng tạo ra một đánh đổi. Nó có thể giúp tận dụng những phần cứng trước đây không đủ mạnh để chạy toàn bộ mô hình, nhưng đồng thời làm tăng lưu lượng mạng và số điểm có thể phát sinh lỗi. Cân bằng thực tế sẽ phụ thuộc vào loại workload và chiến lược lập lịch của nhà vận hành.
Cho đến khi các mạng này công bố bằng chứng mạnh hơn, chủ máy nên xem đây là dịch vụ thử nghiệm có lợi nhuận biến động. Trước khi cài phần mềm node, họ nên tìm hiểu:
Far Labs và Evolving Edge đang thử nghiệm một ý tưởng có cơ sở: dùng phần cứng tiêu dùng phân tán để bổ sung cho năng lực AI tập trung. Công nghệ này có thể phù hợp với một số mô hình nhỏ và workload nhất định. Nhưng bài toán kinh doanh rộng hơn vẫn bỏ ngỏ cho đến khi các công ty chứng minh được rằng mạng vừa an toàn, phản hồi nhanh, chống chịu tốt, vừa có tỷ lệ sử dụng đủ cao để bù đắp chi phí thực tế cho chủ máy.
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Far Labs và Evolving Edge muốn gom các PC gaming, máy chủ gia đình nhàn rỗi để chạy tác vụ AI inference, chủ yếu với những mô hình mã nguồn mở nhỏ hơn.
Far Labs và Evolving Edge muốn gom các PC gaming, máy chủ gia đình nhàn rỗi để chạy tác vụ AI inference, chủ yếu với những mô hình mã nguồn mở nhỏ hơn. Mô hình này có thể tận dụng phần cứng sẵn có và giảm phụ thuộc vào trung tâm dữ liệu, nhưng chủ máy phải tính cả tiền điện, làm mát, hao mòn phần cứng, bảo mật và thời gian máy được sử dụng thực tế.
Salad là đối thủ tham chiếu rõ ràng nhất khi đã vận hành một marketplace kết nối GPU của người dùng với khách hàng cần năng lực tính toán.