機密金融文件 RAG 聊天機器人:
針對醫療使用案例,這項結果已獲得多家媒體獨立驗證,確認了 93% 的反應速度提升、45% 的記憶體節省以及 21% 的功耗降低 。Multiverse Computing 指出,若直接在新一代的 Dragonfly AI200/AI250 加速器上運行,預期能獲得更優異的表現 。
Multiverse Computing 在 AI 模型部署前進行優化,縮小每個模型所需的運算與記憶體空間。這能在現有硬體上釋放更多餘裕,讓資料中心營運商無需添購新加速器或擴充基礎設施,即可服務更多推論請求或同時運行更多模型 。
這項合作反映了資料中心產業正經歷一場根本性的轉變,朝向 效率優先的 AI 基礎設施 邁進。以下是此轉變的幾個關鍵信號:
這項合作是業界從「更多 GPU」思維,轉向 每瓦效能 與 總體擁有成本(TCO) 導向的具體實例,軟硬體共同優化已成為可持續 AI 擴展的主要手段。