Qwen3.8-Omni-Flash係阿里巴巴旗下Qwen推出、以雲端API提供嘅原生全模態模型。佢可以一齊理解文字、圖片、音訊同影片,但文件列明輸出係文字。換句話講,佢唔係主打生成語音或影片,而係一個用嚟做媒體理解、分析、摘要同工具協作嘅模型。
17
最實際嘅用途:將長篇混合素材放入同一個工作流
如果一個任務唔只係讀一份文件,而係要處理會議錄音、簡報、螢幕截圖、影片片段同文字指示,Qwen3.8-Omni-Flash就係針對呢類場景而設。阿里巴巴文件列出嘅用途包括音視訊理解、會議紀要、字幕同內容分析;應用程式亦可按需要叫模型提出工具調用。
17
佢最大嘅規格焦點係100萬Token上下文窗口。理論上,團隊可以將極長嘅文件、影片內容或多輪工作紀錄放入同一請求。不過,「裝得落」唔代表必然「搵得準」:長上下文任務仍然要用自家素材測試資料召回、跨模態事實依據、回應時間同實際成本。
16
17
所謂AI Agent能力,其實做到邊?
阿里巴巴表示,Qwen3.8-Omni-Flash支援思考模式、Function Calling同網絡搜尋。即係話,應用程式可以叫模型先分析錄音或影片,再判斷係咪需要外部資料或動作,然後提出工具調用。
17
但呢個唔等於模型可以「自己話事」。工具有邊啲、可以攞到咩憑證、調用前點驗證、出錯點處理,以及涉及金錢、資料或其他重要後果時需唔需要人手批准,全部仍然由開發同營運團隊控制。模型只係安全工作流其中一層。
輸入、輸出同API:可聽、可睇,但主要用文字答你
Qwen3.8-Omni-Flash接受文字、圖片、音訊同影片輸入,文件所述輸出則係文字。阿里巴巴建議將佢用於非即時音視訊分析同文字生成;如果需要即時互動或語音輸出,則應考慮Qwen其他產品。
17
模型可經Alibaba Cloud Model Studio使用,支援北京、新加坡、香港、東京、法蘭克福及美國維珍尼亞等地區;使用指定地區服務時,要配對該區API Key。
17
對慣用OpenAI風格介面嘅開發者,阿里巴巴嘅Responses API特別為qwen3.8-omni-flash支援用戶訊息入面嘅input_audio同input_video內容類型。模型資料亦列明支援思考及非思考模式、Function Calling、網絡搜尋同Context Caching。
比起Qwen3.5-Omni-Plus,升級咗乜?
由Qwen3.5-Omni-Plus升上嚟,重點唔單止係理解多媒體,而係將多模態理解、超長上下文同較明確嘅Agent工具能力結合。阿里巴巴稱,Qwen3.8-Omni-Flash喺29項評測嘅平均分,比前代高逾25%;當中WildClawBench-MM增加36.5分、AgenticVBench增加22.3分,兩者均針對多模態工具使用或Agent任務。
16
阿里巴巴亦稱,按每小時計,音訊輸入API成本較Qwen3.5-Omni-Plus低逾98%,音視訊輸入則低逾93%。對大規模處理訪談、培訓片、客服錄音或會議影片嘅團隊,呢個差距有實際吸引力;不過,呢啲屬廠商數字,正式上線前仍要按實際媒體格式、Token計法同API路線做完整成本測試。
16
定價可作參考,唔應該直接當預算
第三方公開資料列出,無伺服器路線價格約為:每100萬輸入Token 0.15美元、每100萬輸出Token 0.47美元,而每100萬快取輸入Token約 0.016美元。
5
9
不過,實際收費可以受地區、API路線、輸入模態及當時價目表影響。做採購或用量預測之前,應以Model Studio最新價格表為準。
基準成績值得留意,但未足以排全球第一
阿里巴巴公布嘅結果顯示,新模型喺長音訊、影片理解、工具使用同長步驟任務上較前代進步,亦提到LongAudioSpan同OmniVideoBench嘅提升。
16
但基準表現唔等於所有實戰都會贏。100萬Token窗口同亮眼分數,唔足以證明佢喺每種語言、影片類型、工具鏈、延遲要求或安全規範下,都一定勝過Gemini、OpenAI、Anthropic或其他中國模型。真正應該問嘅係:對某一個指定工作負載,佢可唔可以交到所需準確度、速度、管治能力同總成本?
模型本身唔開源,但有開源配套工具
Qwen3.8-Omni-Flash本身係託管服務,唔係可下載權重嘅開放權重模型。阿里巴巴另外公開咗Qwen3.8-Flash-Next權重;呢個係另一個多模態Mixture-of-Experts(MoE,混合專家)模型,並被描述為Qwen4架構嘅早期預覽。
19
20
同期推出嘅Qwen-MM-Plugins同Qwen-Live Harness,就係開源配套:前者協助建構多模態應用及長影音工作流,後者面向持續、即時嘅多模態互動。佢哋可以減少整合工作,但唔代表Omni-Flash模型權重已經開源。
19
22
點解市場會關注?
Qwen3.8-Omni-Flash將三種以往部署成本較高嘅能力放埋一齊:多媒體理解、極長上下文,同埋適合Agent嘅工具調用。對要大量處理會議、錄音、影片或混合媒體知識庫,而且十分著重輸入成本嘅團隊,阿里巴巴嘅定位尤其有吸引力。
16
17
呢次推出亦反映中國AI市場喺價格效能方面競爭升溫。路透社報道,阿里巴巴較廣泛嘅Qwen3.8-Flash發布,同時強調降低訓練成本,以及提升編程與辦公任務能力。
1
所以,較合理嘅結論唔係「一個新模型已經分出中西AI公司高下」,而係:做多模態Agent評估時,尤其係高用量音視訊分析,Qwen3.8-Omni-Flash已經值得放入候選名單,同時按地區供應、合規、語言支援同整合需求,對比最適合自己嘅其他供應商。
總結
Qwen3.8-Omni-Flash最準確嘅定位,係一層多模態分析同工作流編排能力:佢可接收文字、圖片、音訊及影片,保留最長100萬Token上下文,參與工具調用工作流,最後以文字輸出結果。
17
佢最強嘅賣點唔係「全模態生成」,而係兼顧成本嘅長上下文媒體理解加Agent能力。阿里巴巴公布嘅基準同成本數據具參考價值,但要唔要用作取代其他前沿模型,仍然應該先以代表性工作負載做實測。