마이크로소프트는 2026년 10월 7일 샌프란시스코에서 열린 윈도우·서피스 행사에서 PC와 클라우드가 AI 작업을 나눠 맡는 구상을 공개했다. 윈도우 책임자 파반 다불루리는 이를 ‘하이브리드 인텔리전스’라고 부르며, 상황에 맞춰 에이전트가 PC에서 작동하거나 클라우드를 이용하고, 윈도우의 보안·관리 체계 안에서 움직이도록 하겠다고 설명했다.
19
핵심은 모든 AI 작업을 노트북으로 옮기겠다는 선언이 아니다. 마이크로소프트는 로컬 모델과 클라우드 모델을 윈도우라는 하나의 플랫폼에서 함께 관리하려는 것이다.
윈도우의 ‘하이브리드 인텔리전스’란
PC에서 처리하기 알맞은 작업은 로컬 모델이 맡고, 더 많은 연산이나 다른 기능이 필요한 경우에는 클라우드 모델을 이용하는 방식이다. 마이크로소프트는 이를 윈도우 에이전트와 AI 기능의 기반으로 소개했다. 클라우드 서비스를 대체한다는 의미는 아니다.
19
로컬 모델을 더 쉽게 활용하도록 Windows ML에 오픈소스 모델 실행 도구인 llama.cpp 지원도 추가한다고 밝혔다. 개발자는 이를 통해 윈도우가 지원하는 하드웨어 환경에서 더 다양한 오픈소스 모델을 실행할 수 있을 전망이다.
39
43
딥시크·네모트론·마이크로소프트 코딩 모델
마이크로소프트는 PC에서 실행할 모델로 DeepSeek V4 Flash, 엔비디아의 출시 예정 Nemotron 모델, 자체 코딩 모델 MAI Code 1.1 Flash 등을 소개했다.
33
공개된 설명에 따르면 DeepSeek V4 Flash는 전체 매개변수가 2,840억 개이며, 1.6비트 양자화를 적용해 약 60GB 메모리에서 실행되도록 구성됐다. 마이크로소프트는 성능을 “최첨단에 가까운 수준(near-frontier)”이라고 표현했지만, 이는 회사 측 설명이다. 여기서 확인할 수 있는 자료만으로는 독립적인 벤치마크 결과가 검증됐다고 보기 어렵다.
26
엔비디아의 차기 Nemotron은 매개변수 700억 개 이상에 2비트 양자화를 적용해 20GB를 조금 넘는 메모리를 사용하는 모델로 소개됐다. 관련 보도는 10월 15일을 목표 출시일로 언급했다. 다만 이는 예정 일정이지, 모델 출시가 확인됐다는 뜻은 아니다.
26
33
이 사례는 모델 압축이 중요한 이유도 보여준다. 매개변수 2,840억 개를 각각 4비트로 저장하면 가중치만 약 142GB가 필요하며, 실제 실행에는 추가 메모리도 든다. 약 60GB에 담으려면 훨씬 강한 양자화를 적용해야 한다. 자료만으로는 해당 압축 모델의 성능이 독립적인 시험에서 어떻게 나오는지 확인되지 않으므로, 품질에 관한 회사의 설명은 검증이 필요하다.
26
작업에 맞는 모델 선택과 에이전트 접근 제한
마이크로소프트는 작업별로 모델을 연결하는 기능도 소개했다. GitHub의 HydraFusion은 적절한 모델에 작업을 배정하는 방식으로, 선택지에 PC에서 실행되는 로컬 모델도 포함할 수 있다.
39
PC와 상호작용하는 AI 에이전트에 대해서는 Execution Containers를 발표했다. 에이전트가 접근하거나 실행할 수 있는 범위를 제한하기 위한 격리 기능이다. 로컬 AI의 활용 범위가 넓어질수록 에이전트가 어떤 정보와 기능에 접근할 수 있는지 통제하는 일도 중요해진다.
34
RTX Spark PC, 로컬 AI의 비용을 보여주다
마이크로소프트는 엔비디아 RTX Spark 기반의 Surface Laptop Ultra 사전 주문을 시작했다. 가격은 2,599달러부터이며, 메모리 구성은 최대 128GB까지 제공된다고 밝혔다.
18
31
이 하드웨어는 큰 모델을 PC에서 실행하는 데 필요한 성능을 제공하려는 제품이다. 동시에 가격과 메모리 사양은 로컬 AI의 현실적인 장벽도 드러낸다. 상당한 규모의 모델을 개인용 컴퓨터에서 돌리려면 메모리가 넉넉한 고가 시스템이 필요할 수 있다. 엔비디아의 별도 DGX Spark 가격도 비용 부담을 보여준다. 보도에 따르면 128GB 모델은 6,950달러, 새로 나온 64GB 버전은 4,999달러다.
3
이번 발표가 보여준 것, 아직 보여주지 못한 것
마이크로소프트의 방향은 분명하다. 윈도우가 로컬 AI와 클라우드 AI를 조율하고, 더 많은 오픈 모델을 실행할 길을 마련하며, 에이전트의 접근 범위를 통제하겠다는 것이다.
하지만 이번 발표만으로 로컬 모델이 모든 작업에서 클라우드 서비스를 따라잡았다고 결론 내릴 수는 없다. 발표된 성능이 독립적인 시험으로 확인된 것도 아니며, PC 내 AI가 클라우드 연산을 불필요하게 만들었다고 볼 근거도 없다. 실제 활용성은 모델과 소프트웨어의 출시 상황, 그리고 사용자가 보유한 하드웨어에 달려 있다.
따라서 ‘하이브리드 인텔리전스’는 당장 클라우드를 걷어내겠다는 약속이라기보다, 적합한 작업은 PC에서 처리하면서 클라우드 모델도 계속 활용하려는 윈도우의 플랫폼 전략으로 보는 편이 정확하다.