오늘날 대부분의 AI 인프라는 모델 학습에 최적화돼 있다. GPU는 대규모 병렬 연산을 처리하는 데 뛰어나기 때문에 대형 언어 모델을 학습하는 데 매우 효율적이다.
하지만 모델이 완성되어 서비스에 배포되면 상황이 달라진다. 이 단계에서는 사용자의 질문에 대해 토큰(token)을 하나씩 생성하며 답을 만들어내는 추론 과정이 계속 반복된다.
이때 중요한 것은 단순한 연산 성능만이 아니다. 오히려 더 큰 문제가 되는 것은 **메모리 대역폭과 지연(latency)**이다. 모델이 답을 생성할 때마다 수많은 가중치와 중간 데이터를 계속 읽어야 하기 때문이다. 하드웨어가 이 데이터를 충분히 빠르게 이동시키지 못하면, 아무리 연산 유닛이 빠르더라도 성능이 제한된다.
이 문제는 최신 AI 모델의 구조 때문에 더 커지고 있다.
이런 작업은 한 번의 작업에 수천만 개의 토큰을 요구하기도 한다. 이 때문에 실제 서비스에서의 응답 속도와 메모리 접근 효율이 점점 더 중요한 요소가 되고 있다.
프랙타일은 앞으로 AI 시스템의 현실적인 한계가 모델 능력 자체가 아니라 추론 지연 시간이 될 가능성이 높다고 보고 있다.
프랙타일이 제안하는 해결책은 인메모리 컴퓨팅(in‑memory compute) 또는 메모리 근접 연산 구조다.
기존 AI 가속기(예: Nvidia GPU)는 보통 **연산 코어와 메모리(HBM)**가 분리된 구조다. 이 경우 데이터는 메모리와 연산 장치 사이를 계속 왕복해야 한다. 이 과정이 시간과 전력을 많이 소모한다.
프랙타일의 접근 방식은 다르다. 모델 데이터가 저장된 메모리 안에서 직접 연산을 수행하도록 설계한다. 이렇게 하면 데이터 이동 자체가 크게 줄어든다.
핵심 설계 아이디어는 다음과 같다.
이 구조가 제대로 작동한다면 지연 시간, 전력 효율, 운영 비용 모두에서 큰 개선이 가능하다는 것이 회사의 주장이다.
프랙타일은 자사의 시스템이 현재 하드웨어 대비 최대 25배 빠른 추론 속도와 약 10분의 1 수준의 비용을 목표로 한다고 말한다. 초기 연구 단계에서는 일부 시나리오에서 100배 빠른 속도 가능성도 언급된 바 있지만, 이러한 수치는 아직 독립적인 벤치마크로 검증된 결과는 아니다.
이번 **시리즈 B 투자 라운드(2억2000만 달러)**는 Accel, Factorial Funds, Founders Fund가 주도했고, Conviction, Gigascale Capital, O1A Ventures, Felicis, Buckley Ventures, 8VC 등이 참여했다.
프랙타일은 이 자금을 다음과 같은 목적에 사용할 계획이다.
회사는 **2022년 옥스퍼드 출신 엔지니어 월터 굿윈(Walter Goodwin)**이 설립했다. 현재 목표는 이 칩을 향후 몇 년 내 실제 고객에게 제공하는 것이다.
또 일부 보도에 따르면 AI 기업 Anthropic과 같은 업체가 향후 해당 칩을 사용할 가능성에 대해 초기 논의를 진행했다는 이야기도 있지만, 공식적인 상업 계약은 아직 발표되지 않았다.
만약 프랙타일 같은 접근이 실제로 성공한다면, AI 활용 방식 자체가 바뀔 수 있다.
최근 AI 모델은 답을 바로 생성하기보다 중간 추론 과정을 거쳐 여러 해결책을 탐색하고 검증하기도 한다. 이를 ‘테스트 타임 컴퓨트(test‑time compute)’라고 부르는데, 추론 속도가 빨라질수록 이런 방식이 훨씬 현실적인 전략이 된다.
대화형 AI에서 가장 중요한 요소 중 하나는 응답 지연이다. 토큰 생성 속도가 빨라지면 AI 비서는 사람과 더 자연스럽게 대화하는 수준에 가까워질 수 있다.
자율 AI 에이전트는 도구 호출, 코드 생성, 반복적인 추론 등 여러 단계를 수행한다. 이런 작업은 매우 많은 토큰 계산을 필요로 하며, 추론 속도가 핵심 제약 요소가 된다.
기업이 AI 코파일럿이나 고객 지원 챗봇, 모델 API를 대규모로 운영하려면 토큰당 비용과 처리량이 중요하다. 전용 추론 하드웨어는 운영 비용을 크게 낮출 가능성이 있다.
프랙타일의 전략은 AI 산업의 더 큰 흐름을 반영한다. 연구 단계 중심의 AI에서 실제 서비스 운영 중심의 AI로 전환되면서 추론 효율이 핵심 경쟁력이 되고 있다는 것이다.
다만 현실적인 문제도 있다. 새로운 칩 아키텍처가 이미 성숙한 GPU 생태계와 경쟁하는 것은 매우 어려운 일이다.
또한 프랙타일이 제시한 성능 수치는 대부분 목표치 또는 회사 주장이며, 대규모 데이터센터 환경에서 검증된 결과는 아직 없다.
그럼에도 불구하고 대형 투자와 시장 관심이 커지고 있다는 사실은 분명하다. 업계에서는 앞으로 AI의 다음 혁신이 더 큰 모델이 아니라 더 빠르게 실행되는 모델에서 나올 수 있다고 보기 시작했다.