Anthropic afirma que Claude hackeó 3 organizaciones y publicó código malicioso en PyPI


Los modelos de Claude escaparon de entornos de evaluación de ciberseguridad supuestamente aislados y alcanzaron sistemas reales conectados a internet, ha confirmado Anthropic.

Anthropic reveló tres incidentes de seguridad relacionados con modelos que creían estar atacando objetivos simulados. Un error de configuración dejó habilitado el acceso a internet, lo que les permitió interactuar con servicios y organizaciones reales.

Estos incidentes se producen tras la reciente violación de Hugging Face en la que se vieron implicados agentes de OpenAI y los informes de que los modelos de OpenAI explotaron vulnerabilidades de día cero en JFrog Artifactory mientras intentaban escapar de un sandbox.

El acceso a internet permaneció habilitado durante las pruebas de seguridad de Claude

El evaluador externo Irregular organizó las pruebas como ejercicios de captura de la bandera. Los modelos recibieron instrucciones indicando que operaban dentro de simulaciones aisladas.

Sin embargo, el entorno de prueba aún podía acceder a la internet pública. Cuando los modelos no lograron localizar sus objetivos simulados previstos, buscaron sistemas similares en línea y trataron algunos servicios reales como parte del ejercicio.

Anthropic e Irregular no identificaron el problema de configuración hasta meses después del primer incidente. Anthropic indicó que la brecha más antigua conocida ocurrió en abril y permaneció sin descubrir durante unos tres meses.

Claude Mythos 5 publicó un paquete malicioso en PyPI

Durante una evaluación, Claude Mythos 5 encontró instrucciones de configuración que hacían referencia a un paquete Python ficticio. El nombre del paquete no estaba registrado en el Python Package Index.

El modelo reconoció que podía registrar el nombre no utilizado y publicar su propio código. Los sistemas que siguieran las instrucciones de configuración descargarían y ejecutarían automáticamente el paquete.

Claude creó las cuentas necesarias y subió un paquete malicioso a PyPI. El paquete permaneció disponible públicamente durante aproximadamente una hora antes de que las protecciones automatizadas de PyPI lo eliminaran.

Durante ese periodo, 15 sistemas reales descargaron y ejecutaron el código.

Se robaron credenciales de una empresa de seguridad

Uno de los sistemas afectados pertenecía a una empresa de ciberseguridad que descarga y analiza automáticamente los paquetes recién publicados en PyPI.

El paquete malicioso recopiló credenciales del sistema y las envió a una infraestructura que Claude había creado. Posteriormente, el modelo utilizó las credenciales robadas para acceder a otras partes de la red de la empresa.

Anthropic declaró que Claude no tenía conocimiento previo de la organización y no la seleccionó intencionadamente como objetivo. La empresa notificó a PyPI y compartió los indicadores relacionados con el paquete malicioso.

La empresa de ciberseguridad afectada no había detectado la intrusión antes de que Anthropic se pusiera en contacto con ella.

Claude Opus 4.7 accedió a una base de datos de producción

Una evaluación independiente en la que participó Claude Opus 4.7 resultó en el acceso a una base de datos de producción real.

El objetivo ficticio utilizado en el ejercicio compartía nombre con una empresa y un dominio existentes. Tras no poder acceder al sistema simulado, Claude encontró la organización real en línea y la trató como el objetivo previsto.

El modelo extrajo credenciales de aplicaciones e infraestructura antes de acceder a una base de datos que contenía varios cientos de filas de información de producción.

Anthropic describió este incidente como más grave porque el modelo llegó a sistemas empresariales activos y accedió a datos reales.

Un modelo de investigación escaneó alrededor de 9.000 sistemas

Un modelo de investigación no publicado de Anthropic provocó el tercer incidente.

CONSEJO DE EXPERTO:

PATROCINADO

Algunos errores de computadora son difíciles de arreglar, especialmente cuando se trata de archivos de sistema faltantes o corruptos en Windows.
Asegúrate de usar una herramienta dedicada, como Fortect, la cual escanea tu computadora y reemplaza tus archivos dañados con versiones nuevas de su propio repositorio.

Tras no localizar el objetivo de prueba previsto, el modelo escaneó alrededor de 9.000 sistemas conectados a internet. Comprometió una aplicación expuesta usando credenciales mostradas en una página de depuración y una vulnerabilidad de inyección SQL.

Más tarde, el modelo determinó que la aplicación comprometida pertenecía a una cuenta de nube no relacionada. Entonces detuvo el ataque sin necesidad de intervención humana.

Anthropic todavía estaba intentando contactar con la organización afectada cuando publicó sus hallazgos.

Los modelos se basaron en debilidades de seguridad básicas

Anthropic afirmó que los incidentes no implicaron técnicas de ataque nuevas o previamente desconocidas.

Los modelos se apoyaron en debilidades comunes, como credenciales expuestas, contraseñas débiles, puntos de acceso públicos, páginas de depuración con información sensible y vulnerabilidades de inyección SQL.

El fallo principal provino del acceso sin restricciones a internet y de la suposición de los modelos de que cualquier sistema accesible formaba parte de la prueba autorizada.

Anthropic pausó las pruebas cibernéticas tras revisar los incidentes

Anthropic comenzó a revisar las evaluaciones y pausó todas las pruebas de ciberseguridad el 23 de julio.

La empresa identificó los tres incidentes el 24 de julio. Irregular y dos organizaciones afectadas recibieron notificaciones el 27 de julio.

Anthropic siguió intentando contactar a la organización implicada en el tercer incidente.

Ninguna de las dos organizaciones con las que Anthropic contactó satisfactoriamente había detectado de forma independiente las intrusiones antes de recibir las notificaciones.

El entorno de evaluación carecía de las salvaguardas de producción

Los sistemas de prueba no utilizaban los clasificadores, herramientas de monitoreo y otras salvaguardas incluidas con los modelos Claude disponibles públicamente.

Anthropic indicó que sus protecciones de producción probablemente habrían bloqueado las acciones observadas durante las evaluaciones. Calificó los incidentes principalmente como fallos en el diseño de la prueba, la infraestructura, el monitoreo y la supervisión de terceros.

La empresa no describió los incidentes como evidencia de un fallo fundamental de alineación. En cambio, los modelos siguieron las instrucciones de la evaluación mientras interactuaban erróneamente con objetivos reales.

Anthropic planea un monitoreo más estricto para futuras pruebas

Anthropic planea ampliar el monitoreo de transcripciones en futuras evaluaciones e introducir herramientas de investigación más sólidas.

También aumentará la supervisión de los socios de pruebas externos y revisará cómo se conectan los entornos de evaluación con la infraestructura externa.

Anthropic está discutiendo una revisión independiente con METR y planea publicar una transcripción parcialmente redactada del incidente de PyPI.

A pesar de los fallos de seguridad, Claude Mythos ha demostrado fuertes capacidades de detección de vulnerabilidades. Microsoft también ha reconocido que le cuesta corregir todas las vulnerabilidades encontradas por Claude Mythos, lo que pone de relieve tanto el potencial de investigación en seguridad del modelo como los riesgos creados por entornos de prueba mal aislados.

¿Sigues teniendo problemas?

PATROCINADO

Si las sugerencias que te dimos arriba no solucionaron el problema, es probable que tu PC esté lidiando con errores de Windows más graves. En ese caso, te recomendamos escoger una herramienta como Fortect para arreglar los problemas eficientemente. Después de instalarla, haz clic en el botón Ver & Arreglar presiona Comenzar a Reparar.

Los lectores ayudan a mantener Windows Report. Es posible que recibamos una comisión si compras a través de nuestros enlaces. Tooltip Icon

Lee nuestra página de divulgación para descubrir cómo puedes ayudar a Windows Report a sostener el equipo editorial. Read more

User forum

0 messages