平時打機用嘅電腦,大部分時間可能都係閒置。Far Labs 同美國奧斯汀初創公司 Evolving Edge,就想將呢批分散喺屋企嘅 GPU、CPU 同伺服器,變成一個可出租嘅 AI 基礎設施網絡:機主提供剩餘算力,平台負責接單、分派工作,再按經驗證嘅運算量付款。兩家公司瞄準嘅主要係 AI 推理——即係用已經訓練好嘅模型回答請求——而唔係訓練最前沿大型模型。
2
6
概念聽落似「AI 版 Airbnb」:善用現成硬件,亦可以減少對大型集中式數據中心嘅依賴。不過,真正嘅考驗唔係一部屋企 GPU 跑唔跑到開源模型,而係幾千部規格各異、隨時上下線嘅電腦,能唔能夠提供夠快、夠安全、夠穩定,而且客戶同機主都覺得抵用嘅服務。
呢種分散式推理網絡點樣運作?
一般會有三個部分:客戶發出請求;協調層判斷邊部機最適合處理;主機端軟件喺機主部電腦執行工作。平台要同時考慮模型大小、顯存、延遲、在線時間、節點負載,以及機主設定嘅資源上限。
Far Labs:即時路由同模型拆分
FAR AI 將自己定位為分散式推理層,連接日常使用嘅 GPU,再即時將請求轉送到合適節點。公司聲稱,目標係支援互動式 AI 工作,唔使完全依賴集中式集群。
11
12
現有報道形容,Far Labs 嘅調度器可以喺單一節點放唔晒完整模型時,將模型工作拆開,分派到多部電腦。咁樣有機會令更多普通硬件都用得着,但代價係節點之間要有更多協調同通訊。每多一次交接,都可能拖慢回應速度,亦增加出錯機會。
Far Labs 曾經討論過未來將互動式推理延遲壓到 100 毫秒以下。不過,呢個係目標,唔代表已經有實際端到端數據證明做到。真實延遲仲要包括請求路由、排隊、載入模型、節點間通訊,以及將結果傳返畀用戶嘅時間。
Evolving Edge:用 Ray 分派推理工作
Evolving Edge 被形容為採用 Ray——一個分散式運算框架——喺參與計算機之間分配模型服務工作。Ray 可以將工作表示成受管理嘅 actors,再安排佢哋喺集群不同節點執行。
5
6
但用 Ray 唔等於所有市場同營運難題已經解決。平台仍然要識別失效或者過載節點、有效放置模型、處理不同硬件配置,並決定工作失敗時應該重試,定係複製到另一部機同步執行。
將第三方工作放入屋企電腦,安全嗎?
容許外來程式或者數據喺消費者電腦上運行,安全風險遠高於普通安裝遊戲或桌面程式。可信嘅主機系統至少要限制工作可以接觸嘅資料,同埋佔用幾多電腦資源。
可能用到嘅控制包括:
- 隔離或者沙盒執行環境;
- 傳輸途中加密數據;
- 限制 CPU、GPU、記憶體、儲存空間同網絡用量;
- 限制工作時長,必要時自動終止;以及
- 可供檢視、亦方便更新嘅主機端客戶端軟件。
Ray 嘅文件介紹過一套用於不受信任程式同 AI agent 工作嘅沙盒架構,以輕量、核心隔離嘅環境執行程式。其實驗性方案使用 gVisor 同 OCI container 環境,而 Ray 管理嘅 actors 就可以負責安排同控制沙盒資源。
17
18
20
21
呢啲資料證明相關安全機制喺軟件生態入面確實存在,但唔代表 Far Labs 或 Evolving Edge 已經喺生產環境採用同一套保護措施;亦唔代表喺一般消費級作業系統上配置一定安全,更加唔能夠證明在線節點執行緊機主曾經檢查過嘅版本。
如果節點軟件開源,機主就可以自行檢查資源限制同數據存取方式,透明度會高啲。不過,開源唔係萬能護身符。營運方仍然要提供可重現建置、簽名更新、清晰權限、漏洞處理流程,以及證明實際部署版本同公開源碼一致。
同 Salad 有咩分別?
Salad 係最直接嘅比較對象,因為佢已經營運緊一個連接消費級 GPU 同算力需求企業嘅市場。Salad 並唔依賴區塊鏈或者代幣作協調。
13
Far Labs 強調即時路由同分散式推理,亦包括將模型工作拆分到多個節點嘅可能性;Evolving Edge 就較着重以 Ray 為基礎嘅分散式運行環境,以及公開測試階段。Salad 嘅優勢係已經有消費級 GPU 市場嘅營運經驗;新加入者就要證明自己嘅架構可以提供相近嘅在線率、客戶需求、支援同機主收入。
要留意,分散式係架構選擇,唔係性能保證。一個網絡就算有大量參與電腦,仍然可以由單一機構集中營運,亦可以不穩定或者唔賺錢。
最大問號:機主到底賺唔賺到?
平台畀機主嘅毛收入,只係計數嘅起點。機主仲要承擔或者分擔電費、發熱、散熱、網絡服務費、維護、硬件折舊,以及部機唔能夠完全留畀自己使用嘅機會成本。
「部機加入咗網絡」亦唔等於「部機有穩定工作」。一張連線但少有付費任務嘅 GPU,可能收入好低,卻仍然消耗電力,亦有管理同損耗成本。如果平台唔公開分成率、實際使用率、每次工作時長同耗電估算,準機主就無法計出可信嘅投資回報。
長時間做推理,亦可能令電腦更加發熱、風扇轉得更多,顯存長期處於高負載。值唔值得做,要視乎 GPU 型號、當地電價、在線時間、工作強度同日後轉售價值。現有資料未能證明,參與呢類網絡一定係被動收入,或者對一般機主一定有利可圖。
延遲同成本,點解要等生產環境數據?
消費級硬件嘅潛在成本優勢係:部機本身已經存在,而部分機主亦可能願意將閒置時間變現。但網絡仍然要支付協調、頻寬、監察、失敗任務、複製執行、客戶支援、安全措施同機主分成等成本。
延遲亦一樣。某個特定 Kubernetes 部署做到快速啟動沙盒,唔等於經住宅網絡完成一次端到端推理可以低過 100 毫秒。Ray 文件提到嘅低於 100 毫秒,係特定環境下嘅沙盒啟動時間,唔係互聯網規模消費者節點網絡嘅推理保證。
17
另外,分散式 AI 系統一般仍然依賴鏈下運算。由於機器學習工作嘅運算量同數據量太大,一般用途區塊鏈唔適合直接喺鏈上執行模型;區塊鏈通常只負責協調或者付款,而唔係親自運行 AI。
1
如果大量節點同時失效,網絡捱唔捱得住?
只要有足夠備用容量,而且可以快速將工作轉移,分散式網絡理論上可以比單一伺服器更有韌性。關於 Ray 嘅研究亦描述過,當節點被移除時,系統可以重建遺失嘅任務依賴;節點重新加入後,吞吐量亦可以恢復。
30
但呢個好處唔係自動出現。真正上線嘅推理網絡需要足夠冗餘、模型複製、智能放置同快速故障偵測。如果出現互聯網服務商故障、地區停電、錯誤軟件更新,或者機主因收入太低而集體退出,相關性故障可能一次過令大量節點消失。
模型拆分亦有取捨。將一個模型分散到幾部電腦,可能令原本單機跑唔到嘅硬件都有用;但同時會增加網絡流量,亦多咗幾個可能失效嘅位置。最終效果要睇工作類型同平台嘅調度策略。
GPU 機主參與前,應該先查清楚咩?
喺平台未公開更多實測證據之前,機主最好將呢類服務當成實驗性、收入浮動嘅算力出租,而唔係「坐喺度收錢」嘅被動收入。安裝節點軟件之前,至少應該查清楚:
- 清晰嘅分成公式同實際付款紀錄;
- 真實使用率,而唔係單純登記咗幾多部機;
- 包括電費同散熱嘅合理成本估算;
- 詳細權限設定同資源限制;
- 獨立安全測試或者審計結果;
- 實測延遲、在線率同失敗工作比例;以及
- 可以隨時暫停或者移除節點嘅簡單流程。
Far Labs 同 Evolving Edge 正在測試一個有吸引力嘅方向:用分散喺各處嘅消費級硬件,補充集中式 AI 算力。對部分較細模型同工作而言,技術上可能行得通;但要證明佢係一門可持續生意,仍然要交出實際數據,證明網絡夠安全、反應夠快、抵禦故障能力夠強,而且使用率高到足以令機主扣除真實成本後仍然有合理回報。