Anthropic afirma que detectó y desarticuló intentos de uso malicioso de Claude Haiku, Sonnet y Opus entre diciembre de 2025 y agosto de 2026, en siete ámbitos de riesgo. Los casos abarcan operaciones cibernéticas, influencia, vigilancia, estafas y fraude, uso biológico indebido, desarrollo de armas convencionales y...
Publicado porEditado con GPT-5.6 TerraImágenes generadas con GPT Image 2
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What did Anthropic’s 154-page September 10, 2026 threat-intelligence report reveal about adversaries’ eight-month misuse of its Claude Haiku. Article summary: Anthropic’s report documented attempted misuse—not verified successful deployment—of older Claude Haiku, Sonnet, and Opus models across seven harm areas from December 2025 through August 2026. Its core warning was that f. Topic tags: general, news, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers
El informe de inteligencia de amenazas de Anthropic, publicado el 10 de septiembre de 2026, recoge operaciones que la empresa dice haber identificado y desarticulado durante ocho meses, entre diciembre de 2025 y agosto de 2026. Los intentos de abuso afectaron a Claude Haiku, Sonnet y Opus en siete áreas: ciberoperaciones, campañas de influencia, vigilancia, estafas y fraude, uso biológico indebido, desarrollo de armas convencionales y destilación de modelos. 16
La precisión clave es que el documento describe intentos de obtener asistencia de IA, no confirma que se desplegaran en el mundo real armas, sistemas de vigilancia o proyectos biológicos derivados de esos intentos. Además, Anthropic presenta los episodios como casos destacados, no como una muestra representativa del uso habitual de Claude. 16
Entre las alegaciones más graves figuran intentos de emplear Claude en trabajos relacionados con software para drones autónomos de ataque de un solo uso, sistemas de navegación de misiles y otras aplicaciones militares vinculadas a actores de Rusia, Irán, China y Yemen. 1
El material citado sobre el informe también incluye presuntos intentos de identificar y seleccionar como objetivos a personas uigures mediante WhatsApp y Telegram, así como un sistema de vigilancia de telecomunicaciones a gran escala en Malí. El riesgo que plantea Anthropic no se limita a que un modelo escriba código: también puede ayudar en investigación, clasificación de información, análisis y elaboración de documentos operativos. 1
16
Anthropic identificó cinco casos en el área biológica. Según la información publicada sobre el informe, uno estaba relacionado con un intento de aumentar la transmisibilidad de un virus transmitido por mosquitos. 1
La compañía añadió que algunos usuarios buscaron sistemas de IA rivales después de que Claude rechazara solicitudes sensibles. Eso no demuestra que consiguieran su objetivo en otras plataformas, pero sí expone un límite de los controles de cada proveedor: bloquear una petición en un servicio puede desplazar el intento a otro. 1
El informe también aborda la destilación ilícita de modelos, una práctica que aprovecha las respuestas de un modelo más capaz para contribuir al entrenamiento de otro sistema. Anthropic atribuyó campañas a siete laboratorios radicados en China —entre ellos Alibaba, Moonshot y DeepSeek— y describió el uso de numerosas cuentas y de solicitudes retransmitidas para obtener respuestas o razonamientos útiles. 1
No se trata del mismo tipo de amenaza que las armas o la vigilancia, pero es un riesgo estratégico para los desarrolladores: el acceso a un modelo puede emplearse para reproducir parte de sus capacidades y evitar, al menos en parte, el coste de desarrollarlas desde cero.
Anthropic señaló que los casos divulgados involucraron a Claude Haiku, Sonnet y Opus. No atribuyó incidentes de mal uso a sus clases de modelos más recientes, Fable y Mythos, salvo una excepción vinculada a la destilación ilícita. 12
16
Por tanto, no es exacto afirmar sin matices que Fable y Mythos estuvieron totalmente ausentes: la evidencia disponible respalda que no aparecieron en los demás casos divulgados, con esa excepción de destilación. 12
La empresa afirma que interrumpió las operaciones, bloqueó las cuentas implicadas, reforzó sus defensas y, cuando procedía, compartió información con autoridades y socios del sector. 16
Aun así, el documento es el relato de una empresa sobre actividad detectada en su propia plataforma. Es una fuente relevante sobre lo que Anthropic observó y frenó, pero no equivale a una verificación independiente de que todos los actores señalados completaran los proyectos que pretendían llevar a cabo. La propia compañía enmarca los casos como ejemplos notables, no como un retrato estadístico de todo el abuso de sus modelos. 16
Dos días después de la publicación, el CEO de Anthropic, Dario Amodei, difundió el ensayo We Must Pace the Frontier. Su propuesta es ralentizar deliberadamente el ritmo al que las empresas mejoran las capacidades de los modelos de frontera —los sistemas más avanzados— para dar tiempo a que la alineación, las salvaguardas y la verificación se pongan al día. 25
Amodei no planteó detener el entrenamiento ni el progreso técnico. Su primer compromiso concreto fue dar a evaluadores externos acceso permanente a los sistemas de Anthropic con un nivel equivalente al de un empleado, de modo que puedan revisar las prácticas de seguridad, informar de incidentes y evaluar la alineación durante el entrenamiento. 18
25
Su esquema contempla tres niveles: supervisión dentro de cada empresa, coordinación entre compañías de países democráticos y, finalmente, una coordinación internacional más amplia. 23
25
El informe acredita que Anthropic dice haber detectado y desarticulado intentos de uso malicioso de modelos Claude durante el periodo indicado, en siete categorías de daño. También aporta el razonamiento de la empresa para sostener que los controles de seguridad deben evolucionar a la vez que las capacidades de la IA. 16
Lo que las fuentes disponibles no prueban es que el informe causara de forma directa medidas concretas del Congreso de Estados Unidos, el fin de un receso de la Cámara de Representantes o una prohibición legislativa específica de la «superinteligencia». Existe una presión política más amplia para reforzar la supervisión de la seguridad de la IA, y Amodei ha defendido que los gobiernos ayuden a mantener equilibradas las capacidades y la seguridad, pero esas relaciones causales concretas exigirían pruebas adicionales. 25
27
La conclusión práctica es menos espectacular, pero más importante: evitar el abuso de la IA no depende solo de que un modelo rechace una instrucción dañina. Requiere detectar abusos coordinados, responder a la evasión mediante cuentas y a la destilación, compartir inteligencia sobre amenazas y hacer creíbles las evaluaciones de seguridad a medida que avanzan las capacidades. 16
25
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Anthropic afirma que detectó y desarticuló intentos de uso malicioso de Claude Haiku, Sonnet y Opus entre diciembre de 2025 y agosto de 2026, en siete ámbitos de riesgo.
Anthropic afirma que detectó y desarticuló intentos de uso malicioso de Claude Haiku, Sonnet y Opus entre diciembre de 2025 y agosto de 2026, en siete ámbitos de riesgo. Los casos abarcan operaciones cibernéticas, influencia, vigilancia, estafas y fraude, uso biológico indebido, desarrollo de armas convencionales y destilación ilícita de modelos.
Dos días después del informe, el CEO Dario Amodei pidió «acompasar la frontera»: reducir deliberadamente el ritmo de mejora de las capacidades para que la seguridad y la evaluación independiente puedan seguir el paso.