Pinterest bündelt seine Bild und Sprach KI in einer gemeinsamen Infrastruktur, die mehrere Produkte ohne jeweils eigene technische Basis unterstützen soll. Die Plattform kombiniert Nvidia Blackwell B200 GPUs und Dynamo mit Pinterests visuellen Embeddings, damit Bildinformationen vorbereitet und wiederverwendet werde...
Veröffentlicht vonBearbeitet mit GPT-5.6 TerraBilder erstellt mit GPT Image 2
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: What did Pinterest announce about its new multimodal AI infrastructure layer developed with Nvidia—including the Blackwell GPU, Nvidia Dynam. Article summary: Pinterest announced a shared multimodal AI infrastructure layer with Nvidia designed to make image-and-language AI products faster, more scalable, and reusable across its platform—rather than requiring custom infrastruct. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Pinterest stellt keine einzelne neue Endkundenfunktion vor, sondern eine gemeinsame KI-Infrastruktur. Sie soll Teams im Unternehmen ermöglichen, Produkte zu entwickeln, die Bilder und Sprache gemeinsam verstehen, ohne für jede Funktion ein separates System für den KI-Betrieb aufbauen zu müssen. 4
6
Die technische Basis setzt sich aus drei Komponenten zusammen:
Damit schafft Pinterest eine einheitliche Grundlage für mehrere Anwendungen. Visuelle Suche, Assistentenfunktionen oder Sicherheitssysteme sollen also nicht länger als voneinander getrennte Infrastrukturprojekte betrieben werden, sondern auf derselben technischen Schicht aufsetzen. 6
Pinterest nennt als Einsatzfelder unter anderem die visuelle Suche, das Verstehen von Inhalten, KI-gestützte Entdeckung und Shopping, den dialogorientierten Pinterest Assistant, multimodales Reranking, Systeme für Inhaltssicherheit sowie die Generierung von Signalen. 4
6
Entscheidend ist dabei die Multimodalität: Die Systeme beziehen sowohl Texteingaben als auch den Bildinhalt ein. Das kann etwa helfen, eine Suchabsicht präziser zu deuten, passende Pins zu erkennen oder Empfehlungen weiter einzugrenzen.
Pinterest verarbeitet nach eigenen Angaben mehr als 80 Milliarden Suchanfragen pro Monat und nutzt diese, um Signale für KI-gestützte Entdeckung und Shopping zu gewinnen. Die neue Infrastruktur soll diese Signale für stärker visuelle und dialogbasierte Funktionen besser nutzbar machen. 6
Bild-Sprach-Modelle sind aufwendig, weil sie große Bilddaten zusammen mit Text verarbeiten und umfangreiche Modellzwischenspeicher verwalten müssen. Pinterest nutzt daher sogenannte Projektions-Embeddings, in technischer Berichterstattung als PinCLIP-Embeddings beschrieben. Sie übertragen Bildinformationen in den Token-Raum des Modells. So kann eine Anfrage auf eine bereits vorbereitete visuelle Repräsentation zugreifen, statt wiederholt ein Rohbild zu übertragen und zu kodieren. 2
10
Pinterest meldet für diesen Ansatz und weitere Dynamo-Optimierungen drei Leistungswerte:
Diese Zahlen stammen aus von Pinterest berichteten Benchmarks. Sie beschreiben somit die getestete Architektur und Arbeitslast, nicht zwingend eine identische Beschleunigung bei jeder Suche oder jeder Unterhaltung im Assistant.
Pinterest und Nvidia sehen das Projekt als Fortsetzung einer Zusammenarbeit, die seit fast fünf Jahren läuft und Empfehlungsmodelle ebenso wie generative KI umfasst. Pinterest betreibt nach eigenen Angaben eine Flotte von 14.000 Nvidia-GPUs. 4
Die Größenordnung verdeutlicht das strategische Ziel: Eine gemeinsame Serving-Schicht kann neue visuelle und dialogorientierte KI-Funktionen schneller ausrollen lassen, während die technische Basis konsistent bleibt. Nvidia ordnet die Plattform als Fundament für den Pinterest Assistant, Reranking, Inhaltssicherheit und Signalgewinnung ein. 4
Nach der Ankündigung stieg die Pinterest-Aktie laut Investing.com im Montagshandel um rund 1,8 Prozent. 1
7
Pinterest zentralisiert seine Bild- und Sprach-KI: Blackwell-Hardware liefert die Rechenkapazität, Dynamo steuert den KI-Betrieb, und visuelle Embeddings vermeiden wiederholte Bildverarbeitung. Das soll Suche, Shopping und Assistentenfunktionen auf Pinterest effizienter und leichter skalierbar machen. 2
4
6
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
Pinterest bündelt seine Bild und Sprach KI in einer gemeinsamen Infrastruktur, die mehrere Produkte ohne jeweils eigene technische Basis unterstützen soll.
Pinterest bündelt seine Bild und Sprach KI in einer gemeinsamen Infrastruktur, die mehrere Produkte ohne jeweils eigene technische Basis unterstützen soll. Die Plattform kombiniert Nvidia Blackwell B200 GPUs und Dynamo mit Pinterests visuellen Embeddings, damit Bildinformationen vorbereitet und wiederverwendet werden können.
Pinterest meldet 25 mal mehr visuellen Kontext pro Anfrage im Assistant, einen rund 85 mal schnelleren Antwortstart und eine 7,3 mal geringere Ende zu Ende Latenz in Benchmarks.