Pinterest stworzył z Nvidią wspólną bazę dla produktów AI, które analizują równocześnie obraz i tekst, zamiast budować osobną infrastrukturę dla każdej funkcji. Stos łączy procesory Nvidia Blackwell B200, oprogramowanie Nvidia Dynamo oraz własne embeddingi wizualne Pinterest, czyli przygotowane wcześniej numeryczne...
Opublikowane przezEdytowane za pomocą GPT-5.6 TerraObrazy wygenerowane za pomocą GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Pinterest announce about its new multimodal AI infrastructure layer developed with Nvidia—including the Blackwell GPU, Nvidia Dynam. Article summary: Pinterest announced a shared multimodal AI infrastructure layer with Nvidia designed to make image-and-language AI products faster, more scalable, and reusable across its platform—rather than requiring custom infrastruct. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Pinterest nie ogłosił jednej, nowej funkcji dla użytkowników. Najważniejsza jest wspólna warstwa infrastruktury AI, z której mogą korzystać różne zespoły produktowe. Ma ona ograniczyć potrzebę tworzenia odrębnego systemu obsługi modeli dla każdego rozwiązania wykorzystującego jednocześnie obrazy i język. 4
6
Platforma opiera się na trzech głównych elementach:
W praktyce ma to stworzyć wspólny fundament dla wyszukiwania wizualnego, asystenta, systemów bezpieczeństwa oraz innych usług. Zamiast rozwijać każdą z nich jako osobny projekt infrastrukturalny, Pinterest może budować je na tej samej bazie technicznej. 6
Pinterest wskazuje, że warstwa ma wspierać rosnącą grupę funkcji wykorzystujących obraz i język: wyszukiwanie wizualne, rozumienie treści, odkrywanie produktów i zakupy wspierane przez AI, konwersacyjnego Pinterest Assistant, multimodalne ponowne porządkowanie wyników, systemy bezpieczeństwa treści oraz generowanie sygnałów. 4
6
To istotne, ponieważ serwis nie musi interpretować wyłącznie wpisanego hasła. Może zestawić słowa użytkownika z tym, co znajduje się na obrazach — co jest szczególnie przydatne w usłudze opartej na inspiracjach wizualnych, rekomendacjach i odkrywaniu produktów.
Pinterest podaje, że wykorzystuje ponad 80 miliardów wyszukiwań miesięcznie do tworzenia sygnałów dla odkrywania treści i zakupów wspieranych przez AI. Nowa infrastruktura ma ułatwić wykorzystanie tych sygnałów w coraz bardziej wizualnych i konwersacyjnych doświadczeniach. 6
Modele obrazowo-językowe są kosztowne w obsłudze: muszą pracować zarówno z dużymi danymi obrazowymi, jak i tekstem, a przy tym utrzymywać znaczną ilość stanu w pamięci podręcznej modelu. Podejście Pinterest obejmuje embeddingi projekcyjne, opisywane jako embeddingi PinCLIP. Odwzorowują one informacje wizualne w przestrzeni tokenów modelu. Dzięki temu zapytanie może korzystać z wcześniej przygotowanej reprezentacji obrazu, zamiast wielokrotnie przesyłać i kodować jego surową wersję. 2
10
Pinterest podał trzy wyniki związane z takim podejściem i optymalizacjami Dynamo:
Są to wyniki benchmarków raportowane przez firmę. Należy je więc odczytywać jako pomiar tej konkretnej architektury i konfiguracji obciążeń, a nie jako gwarancję identycznej poprawy dla każdego wyszukiwania czy każdej rozmowy z asystentem.
Pinterest i Nvidia przedstawiają projekt jako rozwinięcie współpracy trwającej niemal pięć lat, obejmującej systemy rekomendacji i generatywną AI. Pinterest informuje, że jego środowisko obejmuje 14 tys. procesorów GPU Nvidia. 4
Skala wyjaśnia strategiczny cel przedsięwzięcia: wspólna warstwa obsługi modeli ma ułatwić rozszerzanie funkcji AI związanych z obrazem i rozmową przy zachowaniu spójnego zaplecza technicznego. Studium przypadku Nvidii opisuje tę platformę jako bazę m.in. dla Pinterest Assistant, ponownego porządkowania wyników, bezpieczeństwa treści i generowania sygnałów. 4
Po ogłoszeniu infrastruktury akcje Pinterest wzrosły w poniedziałkowym handlu o około 1,8 proc., według Investing.com. 1
7
Pinterest przechodzi od systemów AI tworzonych osobno dla poszczególnych produktów do scentralizowanej, multimodalnej podstawy. Sprzęt Blackwell dostarcza moc obliczeniową, Dynamo pomaga obsługiwać i kierować pracą modeli, a embeddingi wizualne ograniczają wielokrotne przetwarzanie tych samych obrazów. Razem mają sprawić, że funkcje odkrywania treści, zakupów i asystenta będą łatwiejsze do skalowania w całej usłudze. 2
4
6
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Pinterest stworzył z Nvidią wspólną bazę dla produktów AI, które analizują równocześnie obraz i tekst, zamiast budować osobną infrastrukturę dla każdej funkcji.
Pinterest stworzył z Nvidią wspólną bazę dla produktów AI, które analizują równocześnie obraz i tekst, zamiast budować osobną infrastrukturę dla każdej funkcji. Stos łączy procesory Nvidia Blackwell B200, oprogramowanie Nvidia Dynamo oraz własne embeddingi wizualne Pinterest, czyli przygotowane wcześniej numeryczne reprezentacje obrazów.
Według benchmarków firmy rozwiązanie umożliwiło 25 razy więcej kontekstu wizualnego na żądanie w Pinterest Assistant, około 85 razy szybszy start odpowiedzi i 7,3 razy krótsze opóźnienie całościowe.