Pinterest створив із Nvidia спільну мультимодальну ШІ основу, щоб команди могли повторно використовувати інфраструктуру для продуктів, що працюють і з текстом, і зображеннями. Стек поєднує GPU Nvidia Blackwell B200, програмне забезпечення Nvidia Dynamo та візуальні вбудовані представлення Pinterest, які дають змогу...
ОпублікувавВідредаговано за допомогою GPT-5.6 TerraЗображення створено за допомогою GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Pinterest announce about its new multimodal AI infrastructure layer developed with Nvidia—including the Blackwell GPU, Nvidia Dynam. Article summary: Pinterest announced a shared multimodal AI infrastructure layer with Nvidia designed to make image-and-language AI products faster, more scalable, and reusable across its platform—rather than requiring custom infrastruct. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Pinterest представив не одну нову функцію для користувачів, а спільний інфраструктурний рівень ШІ, створений із Nvidia. Його задум — дати різним командам Pinterest єдину технічну основу для сервісів, які одночасно розуміють зображення й текст, замість побудови окремої системи для кожного нового продукту. 4
6
В основі системи — три ключові компоненти:
Такий підхід має спростити масштабування мультимодальних функцій у Pinterest. Візуальний пошук, помічник, системи безпеки та ранжування більше не мусять розвиватися як цілком відокремлені інфраструктурні проєкти: вони можуть спиратися на спільний технічний фундамент. 6
Pinterest повідомляє, що новий рівень призначений для дедалі ширшого набору продуктів, які поєднують аналіз зображень і тексту. Серед них — візуальний пошук, розуміння контенту, ШІ-функції для відкриття товарів і покупок, розмовний Pinterest Assistant, мультимодальне повторне ранжування результатів, системи безпеки контенту та формування сигналів для рекомендацій. 4
6
Для сервісу візуального відкриття це важливо: система може враховувати не лише слова в запиті користувача, а й те, що зображено на картинці. Це потенційно допомагає точніше визначати намір, добирати релевантний контент і уточнювати рекомендації.
Pinterest також заявляє, що використовує понад 80 млрд пошукових запитів на місяць для створення сигналів, які живлять ШІ-відкриття контенту та покупки. Нова інфраструктура має зробити ці сигнали придатнішими для дедалі більш візуальних і діалогових сценаріїв. 6
Моделі «зображення + мова» потребують значних ресурсів: їм доводиться працювати з великими масивами даних зображень, текстом і значним кешем моделі. Pinterest застосовує проєкційні вбудовані представлення, які в технічних матеріалах названо PinCLIP embeddings. Вони переносять візуальну інформацію у простір токенів моделі. 2
10
Простіше кажучи, система може передати моделі вже підготовлений цифровий опис зображення, а не щоразу надсилати й кодувати оригінальну картинку. Це має зменшити повторювані обчислення.
Pinterest повідомив про такі результати оптимізацій і тестування цієї архітектури:
Це показники, наведені компанією для конкретної архітектури та конфігурації навантаження. Їх не варто тлумачити як обіцянку, що кожен пошук або взаємодія з помічником у Pinterest прискориться рівно настільки ж.
Pinterest і Nvidia називають цю роботу продовженням співпраці, що триває майже п’ять років і охоплює системи рекомендацій та генеративний ШІ. За даними Pinterest, її обчислювальний парк налічує 14 000 GPU Nvidia. 4
Саме цей масштаб пояснює мету проєкту: єдиний рівень обслуговування моделей може полегшити розширення візуальних і розмовних ШІ-функцій, не змушуючи щоразу перебудовувати базову інфраструктуру. Nvidia описує систему як платформу для Pinterest Assistant, повторного ранжування, безпеки контенту та генерації сигналів. 4
Після оголошення акції Pinterest у понеділок зросли приблизно на 1,8%, повідомляв Investing.com. 1
7
Pinterest переходить від окремих ШІ-систем для кожного продукту до централізованої мультимодальної основи. Blackwell забезпечує обчислювальні ресурси, Dynamo допомагає запускати та маршрутизувати моделі, а візуальні представлення Pinterest скорочують потребу в повторній обробці зображень.
У сукупності це має зробити візуальний пошук, відкриття товарів, покупки й взаємодію з помічником швидшими в роботі та простішими для масштабування на всій платформі. 2
4
6
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Pinterest створив із Nvidia спільну мультимодальну ШІ основу, щоб команди могли повторно використовувати інфраструктуру для продуктів, що працюють і з текстом, і зображеннями.
Pinterest створив із Nvidia спільну мультимодальну ШІ основу, щоб команди могли повторно використовувати інфраструктуру для продуктів, що працюють і з текстом, і зображеннями. Стек поєднує GPU Nvidia Blackwell B200, програмне забезпечення Nvidia Dynamo та візуальні вбудовані представлення Pinterest, які дають змогу не обробляти одне й те саме зображення заново для кожного запиту.
За даними Pinterest, Pinterest Assistant може опрацьовувати у 25 разів більше візуального контексту на запит; у тестах старт відповіді прискорився приблизно у 85 разів, а загальна затримка зменшилася у 7,3 раза.