Ling 3.0 flash는 총 124B 파라미터를 갖지만 토큰당 약 5.1B만 활성화하는 MoE 모델로, 대규모 용량과 낮은 추론 연산량을 함께 노린다. 256K 네이티브 컨텍스트와 코딩·도구 호출 중심의 평가 대상은 대화형 만능 모델의 일괄 대체보다, 토큰 사용량이 큰 에이전트 실행 업무에 적합한지 시험해 볼 근거가 된다.
연구 답변

Create a landscape editorial hero image for this Studio Global article: How did Ant Group Bailing’s July 30, 2026 release of the open-source Ling-3.0-flash execution model—coinciding with Jensen Huang’s first X p. Article summary: The release is evidence for a “sparse execution-model” strategy, not proof that parameter count has ceased to matter. Ling-3.0-flash concentrates computation on roughly 5.1B parameters per token while retaining 124B para. Topic tags: general, general web, user generated, documentation, education. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text,
대규모 AI 모델을 고를 때 ‘파라미터가 가장 많은가’만으로 판단하기는 갈수록 어려워지고 있다. 코딩 보조, 도구 호출, 검색 결과 정리, 반복 실행 같은 에이전트 업무에서는 허용 가능한 품질을 얼마나 낮은 지연 시간과 추론 비용으로 내는가가 더 중요한 기준이 될 수 있다.
앤트그룹의 Ling-3.0-flash는 이 흐름을 보여주는 사례다. 총 파라미터는 **124B(1,240억 개)**지만, 토큰 하나를 처리할 때 활성화되는 파라미터는 약 **5.1B(51억 개)**다. 앤트는 이를 고빈도 업무용 비용 효율형 하이브리드 추론 모델로 소개하며, 네이티브 컨텍스트 길이는 256K 토큰이고 최대 1M 토큰까지 확장할 수 있다고 설명한다.
Ling-3.0-flash는 전문가 혼합(MoE·Mixture-of-Experts) 구조를 쓴다. 모든 토큰에 대해 모델 전체 파라미터를 일제히 계산하는 대신, 입력에 맞춰 일부 전문가만 선택해 동작시키는 방식이다.
이런 설계에서는 많은 파라미터가 담고 있는 학습 용량을 활용하면서도, 실제 생성 단계의 연산은 훨씬 작은 활성 파라미터 집합에 집중할 수 있다. 앤트에 따르면 Ling-3.0-flash의 총 파라미터 수는 자사 1T급 Ring-2.6-1T의 약 12.4%, 활성 파라미터 수는 약 **8.1%**다. 또한 KDA와 MLA 레이어를 교차 배치한 하이브리드 선형 어텐션과 희소 MoE 라우팅을 적용했다고 밝혔다.
물론 총 파라미터 수가 무의미해지는 것은 아니다. 모델이 무엇을 표현하고 학습할 수 있는지는 전체 용량의 영향을 받고, 어떤 전문가를 고르느냐에 따라 MoE의 실제 성능도 크게 달라진다. 다만 서비스 비용과 속도는 모델에 저장된 전체 파라미터보다 토큰마다 실제로 활성화되는 파라미터와 어텐션 계산량의 영향을 더 직접적으로 받는다. 희소 활성화가 경제성을 바꾸는 지점이다.
앤트는 자사가 공개한 비교에서 Ling-3.0-flash가 대부분의 벤치마크에서 Ring-2.6-1T와 동급이거나 더 나은 성과를 냈다고 주장했다. 앤트의 Ling 계정도 총 파라미터는 약 8분의 1, 활성 파라미터는 약 12분의 1 수준이면서 1T급 플래그십을 대부분의 공개 벤치마크에서 따라잡거나 앞섰다고 소개했다.
이는 생산 환경의 에이전트 업무를 겨냥한 모델이라는 점에서 주목할 만한 내부 비교다. 그러나 이를 곧바로 “모든 대형 범용 모델보다 항상 우수하다”는 뜻으로 받아들여서는 안 된다.
특히 다음의 한계는 분명하다.
따라서 도입 검증은 실제 환경에서 해야 한다. 자사 리포지터리와 도구 스키마, 응답 지연 요구사항, 실패 후 재시도 패턴, 그리고 잘못된 결과가 낳는 비용을 넣어 평가하는 편이 적절하다.
모델 카드에는 SWE-Bench Pro, SWE-Bench Multilingual, Tau3-banking-AA, MCP-Atlas, SkillsBench 등의 평가가 언급된다. Claude Code, Kilo Code, Qwen Code, Hermes Agent, OpenClaw 같은 에이전트 지향 환경에서의 사용도 제시됐다. 1
이 분야가 중요한 이유는 에이전트가 소비하는 토큰 규모가 빠르게 커질 수 있기 때문이다. 파일을 읽고, 도구를 호출하고, 결과를 받은 뒤 계획을 수정하고, 실패 시 다시 시도하는 흐름은 한 번의 챗봇 응답보다 훨씬 많은 토큰을 쓴다. 이때 일상적인 실행 단계를 안정적으로 처리하는 저비용 모델은, 모든 턴에 고가의 범용 모델을 쓰는 방식보다 실용적일 수 있다.
현실적인 구성은 계층형에 가깝다.
앤트 문서상 Ling-3.0-flash는 256K 토큰 네이티브 컨텍스트를 지원하며, 최대 1M 토큰까지 확장할 수 있다. 긴 코드베이스, 누적된 도구 실행 기록, 장기 작업 상태를 다룰 때 유용할 수 있는 사양이다.
OpenRouter에서 제공되는 컨텍스트 윈도도 262,144토큰으로 표기된다. 6
다만 긴 컨텍스트 자체를 검증된 다중 에이전트 성능으로 혼동해서는 안 된다. 긴 문맥은 워크플로 전반에 정보를 유지하기 쉽게 만들 수 있지만, 신뢰할 수 있는 다중 에이전트 시스템은 오케스트레이션, 메모리 설계, 도구 권한, 역할 인계, 평가 체계까지 갖춰야 한다. 현재 자료는 긴 컨텍스트 사양과 에이전트 지향 포지셔닝을 뒷받침할 뿐, 다중 에이전트 배포에서 경쟁 모델을 정량적으로 앞선다는 근거는 제공하지 않는다.
Ling-3.0-flash는 2026년 7월 24일 공개됐다. 앤트의 발표에 따르면 OpenRouter와 앤트 플랫폼에서 8월 3일까지 기간 한정 무료 API를 제공했다. 모델은 Hugging Face에서도 이용할 수 있으며, 프로젝트 측은 벤치마크와 에이전트 프레임워크 활용을 강조한다. 1
OpenRouter에 기재된 가격은 입력 100만 토큰당 0.021달러, 출력 100만 토큰당 0.063달러이며, 컨텍스트 윈도는 262,144토큰이다. 6 고빈도 워크플로에서 실험해 볼 만한 가격대지만, 실제 비용·지연 시간·가용성·출력 품질은 제공 사업자와 배포 조건에 따라 달라질 수 있다.
OpenRouter의 모델 탐색 페이지는 Ling-3.0-flash에 대해 지능·코딩·에이전트 퍼센타일을 각각 49·56·54로 표시한다. 이는 실행 중심 모델을 평가할 때 단일 헤드라인 순위만으로 결론을 내리기 어려운 이유이기도 하다. 12
공개 시점은 엔비디아 CEO 젠슨 황이 첫 X 게시물에서 오픈 모델의 필요성을 강조한 날과 겹쳤다. 그는 오픈 모델이 안전성과 사이버보안을 강화하고, 혁신과 확산을 가속하며, 기술 주권을 뒷받침한다고 주장했다. 또한 최첨단 폐쇄형 모델과 최첨단 오픈 모델이 모두 필요하다고 밝혔다.
이 동시성은 오픈 웨이트 AI 논쟁을 떠올리게 한다. 가중치가 공개되면 개발자는 모델을 더 직접적으로 검토하고, 자체 호스팅·튜닝·통합할 수 있다. 그러나 두 사건이 같은 날 발생했다는 사실만으로 엔비디아와 앤트그룹 사이의 제휴나 기술적 연결고리가 입증되는 것은 아니다.
Ling-3.0-flash가 가장 설득력 있게 보여주는 것은 비용 조정형 실행 모델 전략이다. 희소 MoE는 넓은 저장 용량과 작은 토큰당 활성 연산량을 결합해, 반복적인 에이전트 루프를 더 빠르고 저렴하게 만들 가능성이 있다. 그렇다고 초대형 범용 모델의 역할을 대체한다는 의미는 아니다.
성능 주장은 독립적 재현과 실제 업무 검증이 필요하다. 그럼에도 124B 대 5.1B의 활성화 구조, 에이전트 중심 평가 대상, 긴 컨텍스트, 낮은 API 표기 가격은 추론 비용과 지연 시간이 핵심 제약인 곳에서 이런 유형의 특화 모델을 시험해 볼 충분한 이유가 된다. 1
6
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
Ling 3.0 flash는 총 124B 파라미터를 갖지만 토큰당 약 5.1B만 활성화하는 MoE 모델로, 대규모 용량과 낮은 추론 연산량을 함께 노린다.
Ling 3.0 flash는 총 124B 파라미터를 갖지만 토큰당 약 5.1B만 활성화하는 MoE 모델로, 대규모 용량과 낮은 추론 연산량을 함께 노린다. 256K 네이티브 컨텍스트와 코딩·도구 호출 중심의 평가 대상은 대화형 만능 모델의 일괄 대체보다, 토큰 사용량이 큰 에이전트 실행 업무에 적합한지 시험해 볼 근거가 된다.
앤트그룹의 1T급 모델 비교 성과는 개발사 발표에 기반한다. 실제 도입 전에는 자체 코드베이스, 도구 스키마, 재시도율, 지연 시간, 오류 비용으로 검증해야 한다.