긴 회의 녹화본에서 누가 어떤 일을 맡았는지 찾거나, 긴 영상에서 필요한 장면만 골라 작업하려면 AI가 말과 화면을 따로 처리하는 데서 그쳐서는 안 된다. Qwen3.8-Omni-Flash는 알리바바가 2026년 9월 Qwen AI 플랫폼에 선보인 모델이다. 텍스트·이미지·음성·영상을 한 작업 흐름에서 입력받고, 최대 100만 토큰의 문맥 창을 지원한다. 여기서 토큰은 모델이 입력을 처리할 때 쓰는 단위다. 핵심은 여러 매체를 함께 이해한 뒤 작업을 계획하고 도구를 사용해 결과까지 내는 에이전트를 뒷받침하는 데 있다.
1
2
5
52
긴 영상은 전부 훑기보다 필요한 부분부터
알리바바는 Qwen3.8-Omni-Flash가 이전 모델인 Qwen3.5-Omni-Plus보다 29개 평가에서 평균 점수가 25% 넘게 높았다고 발표했다. 긴 영상 처리에서는 모든 프레임을 계속 분석하는 대신, 질문과 관련된 시점이나 장면을 선택해 살피는 방식을 강조한다. 알리바바가 제시한 OmniVideoBench 결과에서는 이런 선택적 처리에 사용된 토큰이 정적인 영상 이해 방식보다 51.8% 적었다. 다만 이는 발표된 평가 결과이며, 모든 영상이나 서비스에서 같은 절감률이 나온다는 뜻은 아니다.
12
16
1시간 회의에서 기록을 넘어 후속 작업으로
큰 문맥 창은 긴 녹화물과 여러 형태의 자료를 이어서 다루는 데 유용하다. Qwen3.8-Omni-Flash는 최대 1시간 분량의 회의 음성과 영상을 함께 입력받아 발언자를 구분하고, 발언을 전사하며, 목소리와 화면 속 인물을 연결하는 작업을 지원한다. 이후 필요한 발언을 찾아 회의 내용을 정리하고 도구를 활용하는 흐름으로 이어갈 수 있다. 단순히 녹화본을 설명하는 것보다, 관련 근거를 찾아 실제 결과물을 만드는 데 초점을 맞춘 구성이다.
2
6
52
모델만으로 끝나지 않는 운영 도구
알리바바가 확장한 오픈소스 Qwen-MM-Plugins는 에이전트 실행 환경에서 음성·영상 기능과 긴 작업 흐름을 활용하도록 돕는다. 별도로 공개한 오픈소스 Qwen-Live Harness는 지속적인 실시간 상호작용을 위한 실행 환경이다. 또한 Qwen3.8-Omni-Flash-Realtime 변형은 실시간 음성·영상 입력을 받으며 텍스트와 음성으로 응답하고, 다채널 오디오·영상 통합·원격 MCP 도구를 지원한다. MCP는 AI가 외부 도구와 연결될 때 사용하는 규약이다. 기본 모델의 멀티모달 입력 기능과 Realtime 변형의 음성 출력 기능은 구분해서 볼 필요가 있다.
1
2
5
52
비용 인하가 중요한 이유
알리바바에 따르면 API 기준 시간당 음성 입력 비용은 98% 이상, 음성·영상 결합 입력 비용은 93% 이상 낮아졌다. 필요한 영상 구간만 살피는 방식까지 더하면, 녹화물 분석을 반복하거나 도구를 호출하는 에이전트를 운영할 때 입력 비용 부담을 줄일 여지가 있다. 다만 이 수치는 알리바바가 제시한 비교치다. 실제 청구액은 처리하는 매체의 양, 소비 토큰, 출력량, 사용하는 도구에 따라 달라진다.
12
16