Pinterest ha creado con Nvidia una base de IA multimodal compartida, pensada para que sus equipos reutilicen infraestructura en productos que entienden imágenes y texto. La arquitectura combina GPU Nvidia Blackwell B200, el software de servicio Nvidia Dynamo y embeddings visuales de Pinterest que evitan procesar rep...
Publicado porEditado con GPT-5.6 TerraImágenes generadas con GPT Image 2
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What did Pinterest announce about its new multimodal AI infrastructure layer developed with Nvidia—including the Blackwell GPU, Nvidia Dynam. Article summary: Pinterest announced a shared multimodal AI infrastructure layer with Nvidia designed to make image-and-language AI products faster, more scalable, and reusable across its platform—rather than requiring custom infrastruct. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Pinterest no ha anunciado una única función nueva para el usuario, sino una capa de infraestructura de IA reutilizable. La ha desarrollado con Nvidia para que los equipos de la plataforma puedan crear productos que entiendan imágenes y lenguaje sin tener que montar un sistema técnico independiente para cada uno. 4
6
La base técnica reúne tres elementos principales:
La idea es que funciones como la búsqueda visual, un asistente conversacional o las herramientas de seguridad de contenidos dejen de ser proyectos de infraestructura aislados y compartan una misma base tecnológica. 6
Pinterest indica que esta capa compartida habilita un conjunto creciente de funciones basadas en imágenes y lenguaje: búsqueda visual, comprensión de contenidos, descubrimiento y compras impulsados por IA, Pinterest Assistant, reordenación multimodal de resultados, sistemas de seguridad y generación de señales. 4
6
La clave es que estos productos pueden interpretar a la vez lo que escribe una persona y lo que aparece en una imagen. En un servicio centrado en descubrir ideas visuales, esa combinación puede servir para entender mejor una intención de búsqueda, localizar contenido relevante y afinar las recomendaciones.
La empresa afirma que utiliza más de 80.000 millones de búsquedas mensuales para generar señales destinadas al descubrimiento y las compras con IA. La nueva infraestructura busca que esas señales se aprovechen mejor en experiencias cada vez más visuales y conversacionales. 6
Los modelos de visión y lenguaje pueden resultar costosos de ejecutar porque deben trabajar con imágenes de gran tamaño junto con texto y mantener una cantidad considerable de datos temporales del modelo. El enfoque de Pinterest incluye projection embeddings, descritos en cobertura técnica como embeddings PinCLIP, que trasladan la información visual al espacio de tokens del modelo. 2
10
En términos prácticos, una petición puede usar una representación visual ya preparada en vez de enviar y codificar de nuevo una imagen sin procesar. Pinterest comunicó tres resultados de rendimiento asociados a este enfoque y a las optimizaciones de Dynamo:
Son métricas de benchmark comunicadas por la compañía. Por tanto, describen esta arquitectura y su configuración de carga de trabajo, y no garantizan que cada búsqueda o conversación con el asistente vaya a mejorar en la misma proporción.
Pinterest y Nvidia presentan el proyecto como una extensión de una colaboración de casi cinco años en sistemas de recomendación e IA generativa. Pinterest señala que su flota incluye 14.000 GPU de Nvidia. 4
Esa escala ayuda a entender el objetivo estratégico: disponer de una capa de servicio común puede facilitar la expansión de productos visuales y conversacionales de IA manteniendo una infraestructura coherente por debajo. El caso de estudio de Nvidia sitúa el sistema como plataforma para Pinterest Assistant, la reordenación de resultados, la seguridad de contenidos y la generación de señales. 4
Tras el anuncio de la infraestructura, las acciones de Pinterest subieron cerca de un 1,8 % en la sesión del lunes, según Investing.com. 1
7
Pinterest está pasando de sistemas de IA construidos producto a producto a una base multimodal centralizada. El hardware Blackwell proporciona la capacidad de cómputo; Dynamo ayuda a ejecutar y dirigir los modelos; y los embeddings visuales reducen el procesamiento repetido de imágenes. En conjunto, el objetivo es hacer más rápidas de operar y más sencillas de escalar las experiencias de descubrimiento visual, compras y asistencia dentro de Pinterest. 2
4
6
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Pinterest ha creado con Nvidia una base de IA multimodal compartida, pensada para que sus equipos reutilicen infraestructura en productos que entienden imágenes y texto.
Pinterest ha creado con Nvidia una base de IA multimodal compartida, pensada para que sus equipos reutilicen infraestructura en productos que entienden imágenes y texto. La arquitectura combina GPU Nvidia Blackwell B200, el software de servicio Nvidia Dynamo y embeddings visuales de Pinterest que evitan procesar repetidamente las imágenes originales.
Según benchmarks comunicados por la compañía, Pinterest Assistant puede manejar 25 veces más contexto visual por petición, con un inicio de respuesta cerca de 85 veces más rápido y una latencia total 7,3 veces menor.