Pinterest har byggt en gemensam multimodal AI grund med Nvidia, så att produktteam kan återanvända samma infrastruktur för tjänster som använder både bilder och språk. Plattformen kombinerar Nvidia Blackwell B200 GPU:er och Dynamo med Pinterests egna visuella inbäddningar, där bildinformation förbereds i förväg i st...
Publicerad avRedigerad med GPT-5.6 TerraBilder genererade med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Pinterest announce about its new multimodal AI infrastructure layer developed with Nvidia—including the Blackwell GPU, Nvidia Dynam. Article summary: Pinterest announced a shared multimodal AI infrastructure layer with Nvidia designed to make image-and-language AI products faster, more scalable, and reusable across its platform—rather than requiring custom infrastruct. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Pinterest lanserar inte i första hand en enskild ny funktion för användarna. I stället har bolaget byggt ett gemensamt AI-lager tillsammans med Nvidia, avsett för produkter som måste kunna tolka bilder och text i samma förfrågan. Tanken är att Pinterests olika produktteam ska kunna använda en gemensam teknisk grund, i stället för att bygga egna system för varje ny AI-funktion. 4
6
Den nya infrastrukturen består av tre centrala komponenter:
Det innebär att funktioner som visuell sökning, en konversationsassistent och innehållssäkerhet kan byggas ovanpå samma tekniska plattform, snarare än som separata infrastrukturprojekt. 6
Pinterest säger att lagret ska stödja en växande uppsättning funktioner där bild och språk samverkar. Dit hör visuell sökning, innehållsförståelse, AI-driven upptäckt och shopping, den konversationsbaserade Pinterest Assistant, multimodal omrankning av innehåll, säkerhetssystem och generering av signaler för rekommendationer. 4
6
För Pinterest är detta centralt eftersom många frågor inte bara handlar om vad en användare skriver, utan också om vad som syns i en bild. Det kan till exempel hjälpa tjänsten att tolka vilken stil, produkt eller inspiration någon söker efter och sedan förfina resultaten.
Bolaget använder mer än 80 miljarder sökningar i månaden för att skapa signaler till AI-baserad upptäckt och shopping. Den nya grunden är tänkt att göra dessa signaler mer användbara i upplevelser som blir allt mer visuella och konversationsdrivna. 6
Bild- och språkmodeller är resurskrävande. De måste hantera stora bildfiler tillsammans med text och hålla mycket modellinformation i minnet under bearbetningen. Pinterests lösning använder så kallade projektionsinbäddningar, i teknisk dokumentation beskrivna som PinCLIP-inbäddningar. De översätter bildinformation till modellens tokenutrymme, så att en förfrågan kan använda en redan beräknad bildrepresentation i stället för att skicka och koda om originalbilden varje gång. 2
10
Pinterest redovisar följande resultat från arbetet med denna arkitektur och optimeringar i Dynamo:
Siffrorna är bolagets egna benchmarkresultat. De beskriver alltså denna specifika arkitektur och testkonfiguration, inte en garanti för att varje sökning eller varje fråga till assistenten blir lika mycket snabbare.
Pinterest och Nvidia beskriver satsningen som en fortsättning på ett samarbete som pågått i nära fem år och omfattat både rekommendationssystem och generativ AI. Pinterest uppger att bolagets flotta består av 14 000 Nvidia-GPU:er. 4
Storleken på infrastrukturen förklarar ambitionen: ett gemensamt lager ska göra det enklare att skala ut nya visuella och konversationsbaserade AI-tjänster, samtidigt som den underliggande tekniken hålls mer enhetlig. Nvidia lyfter bland annat Pinterest Assistant, omrankning av innehåll, innehållssäkerhet och signalgenerering som användningsområden. 4
Efter beskedet steg Pinterest-aktien med omkring 1,8 procent i måndagshandeln, enligt Investing.com. 1
7
Pinterest flyttar från AI-system byggda produkt för produkt till en central multimodal grund. Blackwell-hårdvaran står för beräkningskraften, Dynamo hjälper till att driva och styra modellerna, och Pinterests visuella inbäddningar minskar behovet av att behandla samma bilder upprepade gånger. Målet är snabbare drift och enklare skalning för visuell sökning, shopping och assistentliknande funktioner på plattformen. 2
4
6
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Pinterest har byggt en gemensam multimodal AI grund med Nvidia, så att produktteam kan återanvända samma infrastruktur för tjänster som använder både bilder och språk.
Pinterest har byggt en gemensam multimodal AI grund med Nvidia, så att produktteam kan återanvända samma infrastruktur för tjänster som använder både bilder och språk. Plattformen kombinerar Nvidia Blackwell B200 GPU:er och Dynamo med Pinterests egna visuella inbäddningar, där bildinformation förbereds i förväg i stället för att råbilder behandlas om och om igen.
Pinterest uppger att Pinterest Assistant kan använda 25 gånger mer visuellt sammanhang per förfrågan, medan tester visade omkring 85 gånger snabbare svarsstart och 7,3 gånger snabbare total svarstid.