机密金融文档 RAG 聊天机器人:
针对医疗用例,多家独立媒体验证了结果,确认了 93% 的响应速度提升、45% 的内存节省以及 21% 的功耗降低 。Multiverse Computing 指出,若直接在更新的 Dragonfly AI200/AI250 加速器上运行,预期可获得更佳效果 。
Multiverse Computing 在部署前对 AI 模型进行优化,压缩每个模型所需的计算和内存资源。这释放了现有硬件上的“余量”,使数据中心运营商可以在不添加新加速器或扩展基础设施的情况下,服务更多推理请求或同时运行更多模型 。
此次合作反映了数据中心行业向 效率优先的 AI 基础设施 的根本性转变。以下是这一趋势的关键信号:
此次合作是行业从“堆更多 GPU”的思维模式,转向 性能-功耗比 和 总拥有成本(TCO) 导向的具体体现,软硬件协同优化已成为可持续 AI 扩展的主要杠杆。