Pinterest ha realizzato con Nvidia una base AI multimodale condivisa, riutilizzabile da più prodotti che devono comprendere insieme immagini e linguaggio. Lo stack unisce GPU Nvidia Blackwell B200, software di serving Nvidia Dynamo ed embedding visivi di Pinterest, evitando di rielaborare ogni volta le immagini orig...
Pubblicato daModificato con GPT-5.6 TerraImmagini generate con GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Pinterest announce about its new multimodal AI infrastructure layer developed with Nvidia—including the Blackwell GPU, Nvidia Dynam. Article summary: Pinterest announced a shared multimodal AI infrastructure layer with Nvidia designed to make image-and-language AI products faster, more scalable, and reusable across its platform—rather than requiring custom infrastruct. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Pinterest non ha annunciato una singola nuova funzione per gli utenti, ma una base tecnica AI condivisa. L’obiettivo è permettere ai diversi team di creare prodotti che capiscano immagini e testo senza dover progettare ogni volta un’infrastruttura separata per il serving dei modelli. 4
6
La piattaforma poggia su tre elementi principali:
In pratica, Pinterest vuole passare da sistemi AI costruiti prodotto per prodotto a un’infrastruttura comune. Ricerca visiva, assistente conversazionale e strumenti di sicurezza possono così poggiare sulla stessa base tecnologica. 6
Pinterest indica tra gli impieghi della nuova fondazione la ricerca visiva, la comprensione dei contenuti, la scoperta e lo shopping assistiti dall’AI, il Pinterest Assistant conversazionale, il reranking multimodale, i sistemi di sicurezza dei contenuti e la generazione di segnali. 4
6
Il vantaggio della multimodalità è che il sistema può mettere in relazione ciò che una persona scrive con ciò che è presente nelle immagini. Per una piattaforma incentrata sulla scoperta visiva, questo può aiutare a interpretare l’intento di ricerca, individuare contenuti pertinenti e affinare i suggerimenti.
Pinterest afferma di usare oltre 80 miliardi di ricerche al mese per ricavare segnali destinati alla scoperta e allo shopping basati sull’AI. La nuova infrastruttura serve a rendere questi segnali più sfruttabili in esperienze sempre più visive e conversazionali. 6
I modelli che combinano visione e linguaggio sono onerosi da eseguire: devono gestire immagini di grandi dimensioni insieme al testo e conservare uno stato consistente nella cache del modello. L’approccio di Pinterest include projection embeddings, descritti nella documentazione tecnica come embedding PinCLIP, che collocano le informazioni visive nello spazio dei token del modello. 2
10
In sostanza, invece di trasmettere e codificare ripetutamente l’immagine originale, una richiesta può usare una rappresentazione visiva già pronta. Pinterest ha riportato tre risultati legati a questa architettura e alle ottimizzazioni di Dynamo:
Sono dati di benchmark comunicati dall’azienda: descrivono questa architettura e questa configurazione di carico, non garantiscono che ogni ricerca o ogni conversazione su Pinterest migliori nella stessa misura.
Pinterest e Nvidia descrivono il progetto come l’estensione di una collaborazione che dura da quasi cinque anni, tra sistemi di raccomandazione e AI generativa. Pinterest dichiara di disporre di una flotta di 14.000 GPU Nvidia. 4
La scala chiarisce l’obiettivo strategico: una singola piattaforma di serving può facilitare l’espansione di funzioni visive e conversazionali mantenendo coerente l’infrastruttura sottostante. Il caso di studio di Nvidia presenta il sistema come una base per Pinterest Assistant, reranking, sicurezza dei contenuti e generazione di segnali. 4
Dopo l’annuncio, le azioni Pinterest sono salite di circa l’1,8% nelle contrattazioni di lunedì, secondo Investing.com. 1
7
Pinterest sta centralizzando la propria tecnologia AI multimodale. Le GPU Blackwell mettono a disposizione il calcolo, Dynamo gestisce il serving e l’instradamento dei modelli, mentre gli embedding visivi riducono la necessità di rielaborare le immagini. L’insieme è progettato per rendere più sostenibili e scalabili ricerca visiva, shopping e assistenza conversazionale sulla piattaforma. 2
4
6
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Pinterest ha realizzato con Nvidia una base AI multimodale condivisa, riutilizzabile da più prodotti che devono comprendere insieme immagini e linguaggio.
Pinterest ha realizzato con Nvidia una base AI multimodale condivisa, riutilizzabile da più prodotti che devono comprendere insieme immagini e linguaggio. Lo stack unisce GPU Nvidia Blackwell B200, software di serving Nvidia Dynamo ed embedding visivi di Pinterest, evitando di rielaborare ogni volta le immagini originali.
Secondo i benchmark comunicati dall’azienda, Pinterest Assistant può gestire 25 volte più contesto visivo per richiesta, con avvio della risposta circa 85 volte più rapido e latenza complessiva 7,3 volte inferiore.