MS의 자체 AI 칩 개발 여정은 2023년 11월부터 본격화되었습니다. 세대별 주요 특징은 다음과 같습니다.
Maia 프로젝트는 2세대인 'Maia 200(Braga)' 개발 단계에서 큰 난관에 봉착했습니다. 당초 2025년으로 계획됐던 양산 일정이 최소 6개월 늦춰져 2026년으로 밀린 것입니다 . 주요 원인으로는 다음이 꼽힙니다.
이러한 차질로 인해 MS는 당초 2028년 이후로 계획했던 더 야심찬 'Braga-R' 설계와 'Cleato' 칩의 로드맵도 전면 재조정해야 했습니다 .
Maia 300은 내부 실험 단계를 넘어 외부 고객에게 개방하는 중요한 전환점이 될 전망입니다. 주요 전략은 다음과 같습니다.
MS는 현재 경쟁에서 뒤쳐져 있는 상황입니다. 경쟁사인 구글과 아마존은 이미 훨씬 성숙된 자체 칩 프로그램을 갖추고 있습니다.
구글 (TPU) — 가장 성숙한 프로그램입니다. TPU Trillium(v6e)은 구글 클라우드에서 널리 사용 가능하며, 최신 세대는 TPU v7 'Ironwood'입니다. 구글의 TPU v5p는 최대 8,960개의 칩으로 구성된 대규모 팟(Pod)으로 Gemini 훈련에 사용됩니다 . 구글은 LLM 워크로드에서 H100 인스턴스 대비 약 4배의 가격 대비 성능을 달성했으며, 칩 효율성을 통해 클라우드 마진을 36%까지 끌어올린 것으로 알려졌습니다 .
아마존 (Trainium/Inferentia) — Trainium2와 Trainium3는 AWS의 EC2 Trn 인스턴스를 통해 이미 프로덕션 환경에서 사용 가능합니다. Trainium3는 2025년 12월 re:Invent에서 정식 출시되었습니다. 아마존의 강점은 유통에 있습니다. Anthropic과 OpenAI 모두에 Trainium 용량을 임대하며 AWS 성장률 37%를 견인하고 있습니다 .
MS의 차별점: 구글과 아마존의 맞춤형 칩은 이미 클라우드 고객이 직접 임대하여 사용할 수 있습니다. 반면, MS의 Maia 100과 200은 주로 MS 자체 내부 워크로드에만 사용되는 '캡티브(Captive)' 상태였습니다 . Maia 300의 목표는 이러한 격차를 좁혀, 공개적으로 제공되는 Azure 상품으로 만드는 것입니다 .
Maia 300은 순탄치 않은 시작을 딛고 나옵니다. Maia 200의 지연은 설계, 인력, 실행력의 취약점을 그대로 드러냈습니다. MS의 도박은 3세대 칩이 마침내 구글의 TPU, 아마존의 Trainium과 같은 규모와 개방성을 갖출 수 있느냐에 달려 있습니다. 30만 개 이상의 생산 목표를 달성하고 주장된 효율성 향상을 입증한다면 MS의 AI 인프라 경제성을 획기적으로 바꾸고 Azure 고객에게 진정한 엔비디아 대안을 제시할 수 있습니다. 하지만 여전히 검증된 맞춤형 칩 프로그램을 가진 구글과 아마존에 비해 후발주자라는 점을 극복해야 하는 과제를 안고 있습니다.