目前多數 AI 基礎設施都是為 模型訓練(training) 最佳化。像 Nvidia GPU 這類加速器在大量平行數學運算方面非常強大,因此非常適合訓練大型語言模型。
但當模型部署到產品中後,它們就進入 推論模式:不斷根據使用者輸入逐字生成 token(文字片段)。
在這個過程中,真正的限制往往不是算力,而是:
大型模型在生成每個 token 時,都必須反覆讀取大量權重與中間資料。如果硬體無法快速移動這些資料,即使計算核心再快,也無法有效提升速度。
而新一代 AI 模型又讓這個問題更加嚴重,例如:
一些新型工作負載甚至可能需要 數千萬個 token 才能完成任務,讓推論速度與記憶體效率成為關鍵限制。
Fractile 的看法是:未來 AI 發展的真正瓶頸,很可能是推論延遲,而不是模型能力本身。
為了解決這個問題,Fractile 正在開發一種稱為 in‑memory compute(記憶體內運算) 的晶片架構。
在傳統 AI 加速器中:
通常是分離的。資料需要在兩者之間頻繁來回傳輸,這會消耗大量時間與能源。
Fractile 的設計理念則是:讓運算盡可能在資料所在的位置進行。
其架構的關鍵包括:
減少資料搬移有望同時改善三件事:
這些都是大型 AI 系統商業化時最重要的指標。
Fractile 表示,其系統目標是讓前沿模型推論 最高可快 25 倍,成本約為現有方案的十分之一。更早期的技術目標甚至曾提出 100 倍速度提升與 10 倍成本降低,但這些仍屬公司宣稱,尚未有獨立基準測試驗證。
Fractile 的 2.2 億美元 B 輪 由 Accel、Factorial Funds 與 Founders Fund 領投,其他投資者包括 Conviction、Gigascale Capital、O1A Ventures、Felicis、Buckley Ventures 與 8VC。
公司計畫將資金用於:
Fractile 成立於 2022 年,創辦人 Walter Goodwin 為牛津大學背景的工程師,公司目標是在本十年後期將系統交付客戶。
外界也曾報導 Anthropic 等 AI 公司對該技術表現出早期興趣,但目前仍屬初步討論,尚未宣布正式商業合作。
如果 Fractile 或類似架構真的能顯著提升推論效率,AI 系統可能會出現新的能力與應用場景。
現代推理模型往往需要:
更快的推論速度意味著模型可以在執行時投入更多算力,也就是所謂的 test‑time compute。
對聊天型 AI 或互動式應用而言,回應延遲非常重要。推論速度提升可以讓 AI 助手更接近真人對話的即時感。
自主 AI agent 可能需要:
這些流程可能消耗 數百萬到數千萬 token,因此推論效率會直接決定系統是否可行。
企業若要運行客服 AI、企業 Copilot 或大型 API 服務,必須處理巨量請求。專用推論硬體有機會大幅降低 每個 token 的生成成本。
Fractile 的理念反映出一個正在發生的產業轉變:
當 AI 從研究走向大規模部署,推論效率的重要性正快速追上模型訓練能力。
但現實也很殘酷——打造一種能挑戰成熟 GPU 生態系的新晶片架構非常困難。
目前 Fractile 提出的速度與成本優勢仍是 目標或公司宣稱,尚未有公開、獨立的性能驗證。
儘管如此,這筆大額融資與市場關注度顯示,越來越多投資人相信:
下一波 AI 硬體突破,可能不只是更大的模型,而是更快、更便宜地運行它們的方法。