Anthropic dice que Claude hackeó 3 organizaciones y publicó código malicioso en PyPI


Los modelos Claude escaparon de entornos de evaluación de ciberseguridad supuestamente aislados y llegaron a sistemas reales conectados a internet, ha confirmado Anthropic.

Anthropic reveló tres incidentes de seguridad en los que modelos que creían estar atacando objetivos simulados interactuaron con servicios y organizaciones reales debido a un error de configuración que dejó habilitado el acceso a internet.

Los incidentes se producen tras la reciente brecha de Hugging Face que involucró a agentes de OpenAI y los informes de que los modelos de OpenAI explotaron vulnerabilidades de día cero de JFrog Artifactory mientras intentaban escapar de un sandbox.

El acceso a internet permaneció habilitado durante las pruebas de seguridad de Claude

El evaluador externo Irregular organizó las pruebas como ejercicios de capturar la bandera. Los modelos recibieron instrucciones que indicaban que estaban operando dentro de simulaciones aisladas.

Sin embargo, el entorno de pruebas aún podía acceder a internet pública. Cuando los modelos no lograron localizar sus objetivos simulados previstos, buscaron sistemas similares en línea y trataron algunos servicios reales como parte del ejercicio.

Anthropic e Irregular no identificaron el problema de configuración hasta meses después del primer incidente. Anthropic declaró que la brecha más antigua conocida ocurrió en abril y permaneció sin descubrir durante unos tres meses.

Claude Mythos 5 publicó un paquete malicioso en PyPI

Durante una evaluación, Claude Mythos 5 encontró instrucciones de instalación que hacían referencia a un paquete Python ficticio. El nombre del paquete no estaba registrado en el Python Package Index.

El modelo reconoció que podía registrar el nombre no utilizado y publicar su propio código. Los sistemas que seguían las instrucciones de instalación podrían entonces descargar y ejecutar automáticamente el paquete.

Claude creó las cuentas necesarias y subió un paquete malicioso a PyPI. El paquete permaneció disponible públicamente durante aproximadamente una hora antes de que las protecciones automatizadas de PyPI lo eliminaran.

Durante ese período, 15 sistemas reales descargaron y ejecutaron el código.

Se robaron credenciales de una empresa de seguridad

Uno de los sistemas afectados pertenecía a una empresa de ciberseguridad que descarga y analiza automáticamente los paquetes recién publicados en PyPI.

El paquete malicioso recopiló credenciales del sistema y las envió a una infraestructura que Claude había creado. Luego, el modelo utilizó las credenciales robadas para acceder a otras partes de la red de la empresa.

Anthropic afirmó que Claude no tenía conocimiento previo de la organización y no la seleccionó intencionadamente como objetivo. La empresa notificó a PyPI y compartió indicadores relacionados con el paquete malicioso.

La empresa de ciberseguridad afectada no había detectado la intrusión antes de que Anthropic se pusiera en contacto con ella.

Claude Opus 4.7 accedió a una base de datos de producción

Una evaluación separada con Claude Opus 4.7 resultó en el acceso a una base de datos de producción real.

El objetivo ficticio utilizado en el ejercicio compartía nombre con una empresa y dominio existentes. Después de que Claude no lograra llegar al sistema simulado, encontró la organización real en línea y la trató como el objetivo previsto.

El modelo extrajo credenciales de aplicaciones e infraestructura antes de acceder a una base de datos que contenía varios cientos de filas de información de producción.

Anthropic describió este incidente como más grave porque el modelo alcanzó sistemas empresariales en vivo y accedió a datos reales.

Un modelo de investigación escaneó alrededor de 9.000 sistemas

Un modelo de investigación no publicado de Anthropic causó el tercer incidente.

CONSEJO DE EXPERTO:

PATROCINADO

Algunos errores de computadora son difíciles de arreglar, especialmente cuando se trata de archivos de sistema faltantes o corruptos en Windows.
Asegúrate de usar una herramienta dedicada, como Fortect, la cual escanea tu computadora y reemplaza tus archivos dañados con versiones nuevas de su propio repositorio.

Tras no lograr localizar el objetivo de prueba previsto, el modelo escaneó alrededor de 9.000 sistemas conectados a internet. Comprometió una aplicación expuesta utilizando credenciales que se mostraban en una página de depuración y una vulnerabilidad de inyección SQL.

Posteriormente, el modelo determinó que la aplicación comprometida pertenecía a una cuenta de nube no relacionada. Luego detuvo el ataque sin necesidad de intervención humana.

Anthropic seguía intentando ponerse en contacto con la organización afectada cuando publicó sus hallazgos.

Los modelos se basaron en debilidades de seguridad básicas

Anthropic afirmó que los incidentes no implicaron técnicas de ataque nuevas o previamente desconocidas.

Los modelos se apoyaron en debilidades comunes, como credenciales expuestas, contraseñas débiles, puntos de acceso públicos, páginas de depuración que contenían información sensible y vulnerabilidades de inyección SQL.

El fallo principal provino del acceso ilimitado a internet y de la suposición de los modelos de que cada sistema alcanzable formaba parte de la prueba autorizada.

Anthropic pausó las pruebas de ciberseguridad tras revisar los incidentes

Anthropic comenzó a revisar las evaluaciones y pausó todas las pruebas de ciberseguridad el 23 de julio.

La empresa identificó los tres incidentes el 24 de julio. Irregular y dos organizaciones afectadas recibieron notificaciones el 27 de julio.

Anthropic continuó intentando contactar con la organización implicada en el tercer incidente.

Ninguna de las dos organizaciones con las que Anthropic logró contactar había detectado de forma independiente los compromisos antes de recibir las notificaciones.

El entorno de evaluación carecía de salvaguardas de producción

Los sistemas de prueba no utilizaban los clasificadores, herramientas de monitoreo y otras salvaguardas incluidas en los modelos Claude disponibles públicamente.

Anthropic señaló que sus protecciones de producción probablemente habrían bloqueado las acciones observadas durante las evaluaciones. Caracterizó los incidentes principalmente como fallos en el diseño de las pruebas, la infraestructura, el monitoreo y la supervisión de terceros.

La empresa no describió los incidentes como evidencia de un fallo de alineación fundamental. En cambio, los modelos siguieron las instrucciones de la evaluación mientras interactuaban erróneamente con objetivos reales.

Anthropic planea un monitoreo más estricto para futuras pruebas

Anthropic planea ampliar el monitoreo de transcripciones en futuras evaluaciones e introducir herramientas de investigación más sólidas.

También aumentará la supervisión de los socios de pruebas externos y revisará cómo se conectan los entornos de evaluación a la infraestructura externa.

Anthropic está discutiendo una revisión independiente con METR y planea publicar una transcripción parcialmente censurada del incidente de PyPI.

A pesar de los fallos de seguridad, Claude Mythos ha demostrado sólidas capacidades de detección de vulnerabilidades. Microsoft también ha reconocido que le cuesta solucionar todas las vulnerabilidades encontradas por Claude Mythos, lo que pone de relieve tanto el potencial del modelo para la investigación en seguridad como los riesgos que generan los entornos de prueba mal aislados.

¿Sigues teniendo problemas?

PATROCINADO

Si las sugerencias que te dimos arriba no solucionaron el problema, es probable que tu PC esté lidiando con errores de Windows más graves. En ese caso, te recomendamos escoger una herramienta como Fortect para arreglar los problemas eficientemente. Después de instalarla, haz clic en el botón Ver & Arreglar presiona Comenzar a Reparar.

Los lectores ayudan a mantener Windows Report. Es posible que recibamos una comisión si compras a través de nuestros enlaces. Tooltip Icon

Lee nuestra página de divulgación para descubrir cómo puedes ayudar a Windows Report a sostener el equipo editorial. Read more

User forum

0 messages