Disponibile sulla piattaforma Qwen AI da settembre 2026, il modello accetta nativamente testo, immagini, audio e video e offre una finestra di contesto fino a un milione di token. Alibaba dichiara un miglioramento medio superiore al 25% rispetto a Qwen3.5 Omni Plus in 29 valutazioni; nei video lunghi, l’analisi sele...
Pubblicato daModificato con GPT-6 SolImmagini generate con GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s Qwen3.8 Omni Flash, launched on the Qwen AI platform in September 2026, and how do its native text, image, audio, and vide. Article summary: Alibaba’s Qwen3.8 Omni Flash is a September 2026 model available on the Qwen AI platform that accepts text, images, audio, and video natively in one workflow, with a context window of up to 1 million tokens.. Topic tags: general web, agents, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake
Qwen3.8-Omni-Flash è un modello di Alibaba reso disponibile sulla piattaforma Qwen AI nel settembre 2026. Può ricevere testo, immagini, audio e video nello stesso flusso di lavoro e dispone di una finestra di contesto fino a un milione di token: in altre parole, può tenere conto di una grande quantità di materiale durante un’attività. Il modello standard restituisce testo; la variante Realtime offre anche risposte audio. 1
2
5
L’interesse non sta solo nel descrivere un filmato o trascrivere una registrazione. Alibaba presenta Qwen3.8-Omni-Flash come base per agenti IA capaci di individuare le informazioni utili nei contenuti, ragionare sul compito richiesto e usare strumenti per arrivare a un risultato. È un’impostazione pensata per ridurre il ricorso a modelli separati per ciascun tipo di input. 16
52
Su un video esteso, l’elaborazione selettiva permette all’agente di concentrarsi sui momenti pertinenti alla richiesta, anziché analizzare continuamente ogni fotogramma. Alibaba riferisce un impiego di token inferiore del 51,8% rispetto all’analisi statica nel test OmniVideoBench. È un risultato di benchmark: il risparmio effettivo dipende dal video e dal compito. 16
Per le riunioni, il modello supporta nativamente fino a un’ora di input audio-video e può collegare voci e persone inquadrate, distinguere gli interventi e trascrivere i contenuti. Questo può alimentare flussi di lavoro che producono, per esempio, un resoconto della riunione anziché una semplice descrizione della registrazione. 52
10
Secondo Alibaba, il punteggio medio supera quello di Qwen3.5-Omni-Plus di oltre il 25% su 29 valutazioni. Il dato riassume test diversi e non significa che ogni singola applicazione migliorerà nella stessa misura. 12
Per integrare queste capacità negli agenti, Alibaba ha ampliato gli open source Qwen-MM-Plugins, destinati ai flussi di lavoro audio-video di lunga durata. Ha inoltre pubblicato l’open source Qwen-Live Harness per le interazioni continue in tempo reale. La variante Qwen3.8-Omni-Flash-Realtime supporta interazioni audio-video dal vivo con output testuale e audio, audio multicanale, aggregazione video e strumenti MCP remoti, cioè strumenti richiamabili tramite il protocollo Model Context Protocol. 1
52
Infine c’è la sostenibilità economica. Alibaba dichiara che il costo API per ora di input audio è diminuito di oltre il 98% e quello dell’input audio-video di oltre il 93%. Assieme all’elaborazione selettiva, questi tagli possono rendere più praticabili agenti che consultano ripetutamente registrazioni e usano strumenti. Il conto in produzione, però, dipende anche dai contenuti elaborati, dai token consumati, dagli output e dagli strumenti impiegati: le percentuali dichiarate non equivalgono a un identico risparmio sull’intero servizio. 12
16
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Disponibile sulla piattaforma Qwen AI da settembre 2026, il modello accetta nativamente testo, immagini, audio e video e offre una finestra di contesto fino a un milione di token.
Disponibile sulla piattaforma Qwen AI da settembre 2026, il modello accetta nativamente testo, immagini, audio e video e offre una finestra di contesto fino a un milione di token. Alibaba dichiara un miglioramento medio superiore al 25% rispetto a Qwen3.5 Omni Plus in 29 valutazioni; nei video lunghi, l’analisi selettiva punta a esaminare i passaggi pertinenti senza trattare continuamente ogni...
Secondo Alibaba, il costo API per ora di input è sceso di oltre il 98% per l’audio e di oltre il 93% per audio e video insieme.