컴퓨텍스 2026에서 공개된 Perplexity의 신규 하이브리드 추론 오케스트레이터는 사용자의 모든 AI 하위 작업을 실시간으로 평가, 개인정보 보호를 위해 PC에서 로컬로 실행할지, 아니면 고성능 연산을 위해 클라우드로 보낼지를 자동으로 결정한다 [4][7]. 인텔 코어 울트라 시리즈 3 노트북에 최초 탑재되었지만 칩 종속적이지 않도록 설계되었으며, 급증하는 추론 비용을 관리하기 위해 AI 작업을 분산하려는 광범위한 업계 변화의 핵심적인 부분이다 [12][15].

Create a landscape editorial hero image for this Studio Global article: What is Perplexity AI's new "hybrid local/server agentic inference orchestrator" announced at Computex 2026, how does it dynamically split A. Article summary: Here is the full picture based on the announcements from Computex 2026.. Topic tags: general, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "# Perplexity’s new Computer is another bet that users need many AI models. The tool is available now, only on the company’s highest subscription tier, the $200/month Perplexity Max" source context "Perplexity's new Computer is another bet that users need many AI ..." Reference image 2: visual subject "# Perplexity AI unveils hybrid local-cloud inference system at Computex 2026. Perplexity AI, the fast-growing search startup now valued at $20 billion, unveiled
컴퓨텍스 2026에서 퍼플렉시티(Perplexity) CEO 아라빈드 스리니바스(Aravind Srinivas)와 인텔(Intel) CEO 립부 탄(Lip-Bu Tan)이 무대에 올라 AI 구동의 새로운 접근 방식을 시연했습니다. 바로 ‘하이브리드 로컬/서버 에이전틱 추론 오케스트레이터’입니다. 이 소프트웨어 계층은 사용자가 성능이 부족한 온디바이스 AI와 개인정보 침해 우려가 있는 클라우드 처리 사이에서 선택하도록 강요하는 대신, 복잡한 작업을 자동으로 해부합니다. 민감한 부분은 사용자의 기기에 단단히 가두고, 연산 집약적인 부분만 클라우드로 보내는 것입니다. 그 결과, 두 세계에서 각각 처리된 결과가 하나의 매끄러운 출력물로 통합됩니다. 초기 생태계 분석에 따르면 이를 통해 추론 비용을 30~50% 절감할 수 있다고 합니다 .
퍼플렉시티는 이 오케스트레이터를 AI 작업을 위한 "항공 관제사"라고 표현하는데, 이 비유는 매우 적절합니다 . 예를 들어 기밀 투자 건을 분석하라고 시스템에 요청할 때, 여러분의 모든 데이터를 멀리 떨어진 데이터센터의 최첨단 모델에 맹목적으로 전송하지 않습니다.
이 프로세스는 네 가지 뚜렷한 단계를 따릅니다.
이는 파일 크기나 작업 유형에 따른 단순한 의사 결정 트리가 아닙니다. 스리니바스가 설명했듯이, 오케스트레이터가 실시간으로 "어떤 작업을 기기에서 실행하고 어떤 작업을 클라우드의 에이전트로 보낼지 추론"하는 것입니다 .
컴퓨텍스 발표는 기업 사용을 위한 이 오케스트레이터의 몇 가지 핵심 기능을 강조했습니다.
설계 단계부터 칩 독립적
무대 데모는 인텔 하드웨어만 사용했지만, 퍼플렉시티는 이 오케스트레이터가 인텔 생태계에 종속되지 않는다는 점을 강조했습니다. 기조연설 후 인터뷰에서 스리니바스 CEO는 이 플랫폼이 "칩 독립적(chip agnostic)"이며, 다양한 벤더의 실리콘에서 작동하도록 설계되었다고 명시적으로 밝혔습니다 . 인텔 기반 윈도우 PC에 최초 출시되는 것은 파트너십의 이정표일 뿐, 영구적인 종속은 아닙니다
.
대규모 멀티 모델 오케스트레이션
이 오케스트레이터는 한 번에 최대 20개의 서로 다른 AI 모델을 조정할 수 있는 퍼플렉시티의 광범위한 "컴퓨터" AI 운영 체제 내에서 작동합니다. 주어진 하위 작업에 대해 시스템은 성능, 속도, 비용을 기준으로 최적의 모델을 선택합니다. 마치 닭 잡는 데 소 잡는 칼을 쓰지 않도록 보장하는 셈입니다 .
진정한 개인정보 보호 방화벽
금융 및 의료와 같이 규제가 심한 산업에서는 민감한 데이터를 타사 클라우드 서버에 보관하지 않는 것이 필수입니다. 이 오케스트레이터는 개인정보 보호 게이트키퍼 역할을 하여, 컴플라이언스 관련 문서를 로컬에서 먼저 분석한 후 비민감성 맥락만 클라우드로 보내 정보를 풍부하게 합니다 .
획기적인 비용 절감
모든 기업 AI 쿼리를 클라우드 기반 최첨단 모델을 통해 실행하는 것은 점점 엄청난 비용이 들고 있습니다. 간단하거나 비공개 작업을 온디바이스 NPU에 지능적으로 오프로드함으로써, 하이브리드 접근 방식은 추론 비용을 30~50% 절감할 것으로 추정됩니다 .
컴퓨텍스 라이브 데모에서는 인텔의 첨단 18A 공정 노드를 기반으로 구축된 신규 코어 울트라 시리즈 3(Core Ultra Series 3) 프로세서를 탑재한 노트북을 선보였습니다 . 이 시연은 사모펀드 애널리스트가 NDA, 재무 모델, 기밀 대본 등이 포함된 "프로젝트 팔콘(Project Falcon)"이라는 코드명의 프로젝트를 로드할 때 어떻게 로컬 인텔 실리콘이 민감한 문서 분석을 처리하는 동안 클라우드 에이전트가 동시에 외부 시장 조사를 가져와 개인 데이터를 노출하지 않는지 보여주었습니다
.
인텔은 이번 협업을 온디바이스 추론이 더 이상 참신한 것이 아니라는 검증으로 프레임을 잡았습니다. 코어 울트라 시리즈 3의 통합 GPU와 NPU는 이전에는 데이터센터 전용이었던 의미 있는 AI 작업을 처리할 수 있어, "와트당 토큰 가치를 극대화"하는 진정한 분업을 가능하게 합니다 . 출시 당시 이 하이브리드 추론 기능은 인텔 기반 윈도우 PC용 퍼플렉시티 앱에만 독점 제공되지만, 오케스트레이터의 기본 아키텍처는 앞으로 훨씬 더 광범위한 하드웨어를 지원하도록 설계되었습니다
.
퍼플렉시티-인텔 데모는 고립된 실험이 아니었습니다. 이는 컴퓨텍스 2026을 지배한 주제인 ‘에지와 클라우드 전반에 걸친 AI 작업 부하 분산’을 상징하는 대표적인 발표였습니다.
인텔은 컴퓨텍스 기조연설 전체를 이 분산된 미래를 강화하는 데 사용했으며, 비용 효율적인 추론을 위해 SambaNova, Vista Equity, Cambium과의 보완적인 파트너십을 발표하고, 하이브리드 컴퓨팅을 다가오는 "에이전틱 AI" 시대의 아키텍처 기반으로 프레임을 잡았습니다 .
메시지는 분명합니다. 데이터센터가 사라지는 것은 아니지만, 더 이상 인텔리전스가 일어나는 유일한 장소는 아닙니다. 퍼플렉시티와 인텔이 베팅하고 있는 하이브리드 모델에서, AI의 미래는 당신의 기기와 클라우드 사이의 대화이며, 이는 자동으로, 지능적으로, 그리고 비공개적으로 오케스트레이션됩니다.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
컴퓨텍스 2026에서 공개된 Perplexity의 신규 하이브리드 추론 오케스트레이터는 사용자의 모든 AI 하위 작업을 실시간으로 평가, 개인정보 보호를 위해 PC에서 로컬로 실행할지, 아니면 고성능 연산을 위해 클라우드로 보낼지를 자동으로 결정한다 [4][7].
컴퓨텍스 2026에서 공개된 Perplexity의 신규 하이브리드 추론 오케스트레이터는 사용자의 모든 AI 하위 작업을 실시간으로 평가, 개인정보 보호를 위해 PC에서 로컬로 실행할지, 아니면 고성능 연산을 위해 클라우드로 보낼지를 자동으로 결정한다 [4][7]. 인텔 코어 울트라 시리즈 3 노트북에 최초 탑재되었지만 칩 종속적이지 않도록 설계되었으며, 급증하는 추론 비용을 관리하기 위해 AI 작업을 분산하려는 광범위한 업계 변화의 핵심적인 부분이다 [12][15].