El problema no es que un sistema mencione la seguridad personal. Si alguien afirma sentirse amenazado, una advertencia general puede ser razonable. La preocupación surge cuando esa advertencia cambia según la identidad mencionada en una frase prácticamente idéntica. En ese caso, una política de seguridad aparentemente neutral puede transmitir la idea de que algunos grupos son intrínsecamente más peligrosos que otros.
Usuarios de Reddit señalaron las respuestas como un doble rasero, mientras que Futurism describió el lenguaje relacionado con emergencias como una forma de reforzar estereotipos raciales. Activistas en internet se centraron especialmente en el contraste entre las consultas sobre musulmanes e israelíes y lo calificaron de sesgo antimusulmán.
El imán Omar Suleiman compartió una respuesta para rechazar la premisa de que una persona musulmana deba ser considerada peligrosa por su fe. En una captura posterior atribuida a su cuenta, la respuesta describía como normal estar a solas con una persona musulmana y señalaba que compartir una religión no determina el carácter individual ni el nivel de amenaza de alguien.
Esa formulación posterior demuestra que se mostró una respuesta diferente, pero el material disponible no establece exactamente cuándo cambió, si la modificación se aplicó a todos los usuarios ni si Google la introdujo específicamente después de la publicación de Suleiman.
Los informes disponibles indican que Google reconoció que los resultados de esta categoría “no son como deberían ser” y afirmó que estaba trabajando para mejorarlos. La respuesta coincide con el procedimiento habitual de la compañía para que los usuarios informen de resúmenes de AI Overview que sean inexactos, sesgados o problemáticos mediante los controles de valoración que aparecen debajo de cada respuesta.
Las pruebas reunidas no incluyen una explicación técnica detallada de Google sobre el origen de las respuestas desiguales. Por tanto, no permiten determinar si el comportamiento se debió principalmente al modelo, al contenido recuperado de la web, a los sistemas de seguridad o a una combinación de estos factores.
La polémica importa porque AI Overview aparece en un lugar especialmente visible: la parte superior de Google Search. Esa posición puede hacer que una respuesta generada parezca una conclusión fiable, incluso cuando carece de respaldo o es incorrecta.
La función ya había sido criticada por recomendaciones absurdas, como sugerir poner pegamento a la pizza o comer piedras, y por repetir la afirmación falsa de que Barack Obama era musulmán.
Otros informes han advertido de información sanitaria inexacta en resúmenes generados por IA. Además, un análisis citado por Futurism calculó que estos resúmenes eran correctos aproximadamente el 91 % de las veces. Aunque la cifra pueda parecer elevada, incluso ese margen dejaría una cantidad considerable de respuestas erróneas a la escala de búsquedas de Google.
El material disponible aquí no documenta los detalles específicos de las supuestas generaciones inexactas de imágenes raciales por parte de Gemini, por lo que esas afirmaciones no deben presentarse como hechos probados. Sí aporta, en cambio, indicios de un problema más amplio: los sistemas que resumen información pueden producir respuestas seguras de sí mismas, socialmente dañinas o directamente falsas, y depender de que los usuarios las detecten para corregirlas.
Un resumen de AI Overview debería considerarse un punto de partida, no una autoridad definitiva, sobre todo cuando hace afirmaciones relacionadas con la seguridad, la identidad, la religión o la nacionalidad de una persona. Conviene comparar consultas equivalentes, revisar los enlaces en los que se basa la respuesta y utilizar las herramientas de comentarios de Google para informar de resultados sesgados o incorrectos.
La seguridad personal debe evaluarse a partir de las conductas y las circunstancias concretas, no de la nacionalidad, la raza o la religión de alguien. Este episodio muestra por qué esa distinción debe estar incorporada tanto en las reglas de seguridad del modelo como en las pruebas que se realizan antes de que sus respuestas lleguen al público.