샤오웨이는 위챗 밖으로 사용자를 이동시키는 독립형 챗봇이 아니라, 위챗 안에서 텍스트와 음성으로 사람·서비스·미니프로그램을 연결하는 네이티브 AI 에이전트로 테스트되고 있습니다. WeLM 80B는 총 800억 개의 파라미터를 갖지만 토큰당 약 30억 개만 활성화하는 희소 MoE 모델이며, 샤오웨이의 대화·검색·위챗 기능 호출·미니프로그램 실행을 구동하는 모델로 알려졌습니다.
연구 답변

Create a landscape editorial hero image for this Studio Global article: How has WeChat’s gray tested Xiaowei assistant evolved from a native text and voice based agent embedded in WeChat—distinct from standalone. Article summary: Xiaowei’s significance is less that it is another chatbot than that it is being positioned as an in context agent inside WeChat: users can invoke it by text or voice, communicate with contacts, and launch mini programs r. Topic tags: general web, llm, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts
샤오웨이(小微)를 단순히 ‘위챗에 추가된 또 하나의 챗봇’으로 보면 핵심을 놓치기 쉽습니다. 현재 제한적으로 테스트되는 샤오웨이는 위챗 안에 직접 eingebedded된 네이티브 AI 비서로, 사용자가 텍스트나 음성으로 요청하면 연락처와 소통하고 위챗의 기본 기능이나 미니프로그램 서비스를 호출하는 형태를 지향합니다. 15
17
19
즉, 위안바오(Yuanbao) 같은 독립형 AI 앱으로 이동해 대화를 시작하는 방식과 달리, 샤오웨이의 무대는 처음부터 위챗의 기존 관계망과 서비스망입니다. 전략적으로 중요한 지점은 ‘더 나은 답변을 제공하는 앱’이라기보다, 위챗에 이미 존재하는 사람·결제·서비스·미니프로그램을 자연어로 조작하는 인터페이스가 될 수 있다는 데 있습니다.
WeLM(WeChat Language Model)의 출발점으로는 2022년 공개된 100억 파라미터 규모의 중국어 사전학습 모델이 거론됩니다. 당시 18개 과제에서 강한 성능을 보였다는 보고가 모델 계보를 설명하는 배경이 되지만, 해당 벤치마크의 정확한 세부 수치는 이번에 확인된 자료만으로는 독립적으로 검증하기 어렵습니다.
현재 위챗 생태계와 직접 연결된 공개 정보에서 가장 중요한 모델은 WeLM-80B입니다. 이 모델은 총 800억 개의 파라미터를 보유하면서도 토큰 하나를 처리할 때 실제로 활성화되는 파라미터는 약 30억 개입니다. 14조 개보다 적은 토큰으로 학습됐으며, 추론·다국어 이해·128K 컨텍스트를 지원하는 것으로 소개됐습니다. 7
11
WeLM-80B는 샤오웨이의 대화와 검색뿐 아니라 위챗 기본 기능 호출, 미니프로그램 서비스 실행을 담당하는 모델로 배치된 것으로 전해졌습니다. 8
9 사용자가 메뉴를 일일이 찾아 들어가는 대신 “친구에게 메시지를 보내줘”, “차량 호출 서비스를 찾아줘”처럼 의도를 말하면, 모델이 적절한 기능이나 서비스를 선택해 연결하는 구조입니다.
더 큰 WeLM-617B는 총 6170억 개의 파라미터와 토큰당 약 230억 개의 활성 파라미터를 갖는 희소 혼합 전문가(MoE) 모델입니다. 다만 이 모델은 아직 개발 중이며, 샤오웨이에 완전히 배포된 모델로 봐서는 안 됩니다. 공개된 방향은 더 강한 일반 이해와 논리적 추론, 지능형 미니프로그램 개발, 샤오웨이용 도구 자동 생성 등 위챗 생태계의 고난도 작업입니다. 8
9
12
MoE 모델은 하나의 거대한 신경망을 모든 입력에 전부 사용하는 대신, 여러 ‘전문가’ 네트워크를 두고 라우터가 토큰마다 일부만 선택하는 방식입니다. 따라서 WeLM-80B는 전체적으로는 800억 개의 파라미터를 갖지만, 매 토큰 처리에서 수행하는 계산은 약 30억 개가 활성화되는 경로에 가까워집니다. WeLM-617B 역시 6170억 개 전체를 매번 모두 계산하는 구조는 아닙니다.
위챗처럼 검색, 메시지 작성, 서비스 탐색, 도구 호출 같은 요청이 매우 빈번하게 발생할 수 있는 플랫폼에서는 이 차이가 특히 중요합니다. 각각의 요청은 개별적으로는 비교적 단순하더라도, 이용자가 많아지면 추론 요청이 막대한 규모로 누적됩니다. 토큰당 활성 계산량을 낮추면 같은 인프라에서 더 많은 요청을 처리하고, 응답 지연과 서비스 비용을 줄일 가능성이 커집니다. 동시에 전체 전문가 풀을 크게 유지해 다양한 작업에 대응할 여지도 남길 수 있습니다. 7
8
다만 ‘30억 개 활성화’가 곧 ‘밀집형 30B 모델과 비용이 같다’는 뜻은 아닙니다. 전체 전문가 가중치를 메모리에 배치해야 하고, 라우팅과 장치 간 통신에도 비용이 듭니다. 희소성의 핵심 이점은 모든 파라미터를 매 토큰마다 산술 연산에 동원하지 않는 데 있으며, 대규모 서비스에서 추론을 더 현실적으로 만드는 것이지 비용을 없애는 것은 아닙니다.
WeLM 팀이 제시한 Hidden Decoding은 기존의 전형적인 확장 방식과 다른 접근입니다. 일반적으로 모델 성능을 높이려면 트랜스포머의 층을 더 깊게 하거나 은닉 차원을 넓혀야 합니다. 하지만 이런 방식은 메모리와 계산 부담을 크게 키울 수 있습니다.
Hidden Decoding은 입력 토큰 하나를 여러 개의 내부 스트림으로 확장합니다. 각 스트림은 별도의 임베딩을 사용하고, 중간 스트림의 키·값(KV) 상태를 이후 문맥으로 유지합니다. 외부에 출력되는 토큰 수를 단순히 늘리지 않으면서도, 각 토큰이 모델 내부에서 더 많은 잠재적 계산을 수행하도록 만드는 방식입니다. 핵심 트랜스포머 백본의 층 수나 폭을 추가로 키우지 않는다는 점이 특징입니다. 2
13
팀의 비교 실험에서는 동일한 기반 모델에서 Hidden Decoding을 적용한 HD4-80B와 HD4-617B가 각각의 비-HD 기준 모델보다 향상된 결과를 보였다고 보고됐습니다. 1
12 이는 모델의 총 규모를 무작정 키우는 대신, 토큰이 내부적으로 거치는 계산 경로를 확장해 성능을 높일 수 있다는 가능성을 보여줍니다.
토큰마다 여러 스트림을 만들면 문제가 하나 생깁니다. 모든 스트림이 서로를 자유롭게 참조하도록 하면 스트림 수가 늘어날수록 교차 어텐션 비용이 대략 제곱에 가깝게 증가할 수 있습니다. 스트림 수를 (n)이라고 할 때, 단순한 설계에서는 추가 비용이 (n^2)에 가까워질 수 있는 셈입니다.
Stream-Factorized Attention은 대부분의 층에서 각 스트림 내부의 어텐션만 수행하고, 일부 층에서만 스트림 간 정보를 섞습니다. 이를 통해 추가 어텐션 비용 증가를 스트림 수에 대해 보다 선형적인 수준으로 낮추는 것이 목표입니다. 위챗 측은 이 설계가 Hidden Decoding을 100B급 이상 MoE 모델에서 학습하고 서비스할 수 있게 하는 핵심 시스템 아이디어라고 설명합니다. 5
이 구조가 중요한 이유는 단순히 연구실에서 더 높은 점수를 얻는 데 있지 않습니다. 실제 서비스에서는 긴 문맥, 동시 접속자 수, GPU 메모리, 응답 지연, 장치 간 통신 비용을 함께 고려해야 합니다. 내부 계산을 늘리면서도 그 비용이 폭발하지 않도록 관리해야 샤오웨이처럼 대규모 이용자가 반복적으로 사용하는 에이전트에 적용할 가능성이 생깁니다.
희소 MoE와 Hidden Decoding을 함께 보면, 위챗이 작업의 난도에 따라 서로 다른 계산 경로를 활용하는 계층형 운영 방식을 구상할 가능성이 보입니다. 일상적인 검색·대화·서비스 탐색에는 효율적인 WeLM-80B 계열을 사용하고, 복잡한 계획 수립과 도구 선택, 여러 단계의 업무에는 더 큰 모델이나 추가적인 내부 계산을 배정하는 방식입니다.
이 구상에서 샤오웨이는 답변을 생성하는 창에 머물지 않습니다. 사용자의 자연어 의도를 받아 적절한 서비스를 찾고, 필요한 결정을 내리고, 위챗 기능이나 미니프로그램을 호출한 뒤, 실제 작업을 끝내는 명령 계층이 될 수 있습니다. 다시 말해 ‘검색 → 판단 → 호출 → 완료’가 하나의 대화 흐름 안에서 이어지는 것입니다.
물론 이를 위해서는 권한 관리, 사용자 동의, 계정과 신원 확인, 결제 안전성, 미니프로그램 API, 오작동 방지와 신뢰성 통제가 함께 설계돼야 합니다. 이런 조건이 충족된다면 텐센트는 별도의 AI 슈퍼앱으로 사용자를 옮기기보다, 이미 사람들이 사용하는 위챗 자체를 AI의 실행 환경으로 만들 수 있습니다.
다만 여기까지는 공개된 모델 방향과 제품 기능을 바탕으로 한 전략적 해석입니다. WeLM-617B의 실제 배포 시점이나 샤오웨이의 전체 출시 범위, 향후 기능 로드맵이 확정됐다는 의미는 아닙니다. 현재 확인되는 사실은 WeLM-80B가 샤오웨이에 적용됐고, WeLM-617B와 Hidden Decoding이 더 복잡한 에이전트 작업을 위한 확장 경로로 제시되고 있다는 점입니다. 8
9
12
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
샤오웨이는 위챗 밖으로 사용자를 이동시키는 독립형 챗봇이 아니라, 위챗 안에서 텍스트와 음성으로 사람·서비스·미니프로그램을 연결하는 네이티브 AI 에이전트로 테스트되고 있습니다.
샤오웨이는 위챗 밖으로 사용자를 이동시키는 독립형 챗봇이 아니라, 위챗 안에서 텍스트와 음성으로 사람·서비스·미니프로그램을 연결하는 네이티브 AI 에이전트로 테스트되고 있습니다. WeLM 80B는 총 800억 개의 파라미터를 갖지만 토큰당 약 30억 개만 활성화하는 희소 MoE 모델이며, 샤오웨이의 대화·검색·위챗 기능 호출·미니프로그램 실행을 구동하는 모델로 알려졌습니다.
WeLM 617B는 총 6170억 개, 토큰당 약 230억 개의 파라미터를 활성화하는 모델이지만 아직 개발 단계로, 복잡한 추론과 미니프로그램 개발·도구 생성에 초점을 맞춥니다.