当前的大多数AI基础设施主要是为训练阶段优化的。像Nvidia GPU这样的加速器非常擅长并行计算,因此在训练大型模型时效率极高。
但当模型部署到产品中后,它们会进入推理模式——不断根据用户输入生成新的token(文本片段)。
在这一阶段,系统面临的挑战不再只是计算能力,而是:
大型模型在生成每一个token时,都需要频繁读取巨量权重参数和中间数据。如果硬件无法快速移动这些数据,即使计算单元再快,也会被拖慢整体速度。
随着AI模型不断升级,这个问题变得更加突出:
一些先进AI任务甚至需要数千万个token的计算量,这使得生成速度和内存访问成为关键限制。
Fractile认为,AI行业正接近一个阶段:推理延迟,而不是模型能力,将成为实际应用中的主要瓶颈。
为了减少数据移动带来的开销,Fractile正在开发一种基于**“内存内计算”(in‑memory compute)**的芯片架构。
在传统AI加速器中,处理器核心和内存(例如HBM高带宽内存)是分开的。模型数据需要在两者之间不断传输,这会消耗大量时间和能量。
Fractile的方案则是:让计算在数据所在的位置完成。
核心设计包括:
这种设计理论上可以显著改善:
这些都是大规模部署AI系统时最关键的指标。
Fractile表示,其系统目标是在前沿模型推理任务中实现最高约25倍速度提升,并将成本降至当前方案的约十分之一。更早期的技术目标甚至提出某些场景下最高100倍速度提升和10倍成本下降,但这些仍属于公司预期,尚未经过独立基准测试验证。
Fractile的 2.2亿美元B轮融资 由 Accel、Factorial Funds 和 Founders Fund 领投,其他投资者包括 Conviction、Gigascale Capital、O1A Ventures、Felicis、Buckley Ventures 和 8VC。
这笔资金将主要用于:
Fractile成立于 2022年,创始人是拥有牛津大学背景的芯片工程师 Walter Goodwin。
据报道,该公司已与部分AI公司(例如 Anthropic)进行过早期技术交流,讨论未来使用其推理芯片的可能性,不过目前尚未宣布正式商业合作。
如果像Fractile这样的架构能够显著提高推理效率,可能会推动几类新的AI应用场景。
新一代AI系统在生成答案前会进行多轮内部推理、验证不同路径、比较多个解法。更快的推理速度意味着模型可以在运行时使用更多计算资源,也就是所谓的 “测试时计算”(test‑time compute)。
对话式AI体验很大程度取决于延迟。更快的token生成速度能让AI回复更接近实时交流,从而提升用户体验。
未来的AI代理可能需要执行复杂工作流程,例如调用工具、写代码、执行多轮推理。这类任务往往需要极高的token预算,推理效率成为关键。
对于提供AI API或企业Copilot服务的公司来说,最重要的指标之一是每个生成token的成本。专用推理芯片有潜力显著降低运营成本并提高吞吐量。
Fractile的技术路线反映了AI行业正在发生的变化:随着AI从研究阶段走向大规模商业应用,推理效率的重要性正在迅速提升,与训练能力同样关键。
不过,这家公司的性能与成本优势目前仍主要来自公司自身的目标或预测,尚未在商业级产品中得到独立验证。要在成熟的GPU生态之外建立新的芯片平台,本身就是一项极具挑战的任务。
即便如此,2.2亿美元的大额融资也说明资本市场正在押注一个趋势:
下一波AI突破,可能不只来自更大的模型,而来自更快、更便宜的推理能力。