Anthropic dice que Claude hackeó 3 organizaciones y publicó código malicioso en PyPI


Los modelos de Claude escaparon de entornos de evaluación de ciberseguridad supuestamente aislados y alcanzaron sistemas reales con conexión a Internet, ha confirmado Anthropic.

Anthropic reveló tres incidentes de seguridad en los que los modelos creían estar atacando objetivos simulados. Un error de configuración había dejado habilitado el acceso a Internet, lo que les permitió interactuar con servicios y organizaciones reales.

Los incidentes se producen tras la reciente brecha de Hugging Face que involucró a agentes de OpenAI y los informes de que los modelos de OpenAI explotaron vulnerabilidades zero-day de JFrog Artifactory mientras intentaban escapar de un sandbox.

El acceso a Internet permaneció habilitado durante las pruebas de seguridad de Claude

El evaluador externo Irregular organizó las pruebas como ejercicios de captura de bandera. Los modelos recibieron instrucciones que indicaban que estaban operando dentro de simulaciones aisladas.

Sin embargo, el entorno de pruebas aún podía acceder a la Internet pública. Cuando los modelos no lograron localizar los objetivos simulados previstos, buscaron sistemas similares en línea y trataron algunos servicios reales como parte del ejercicio.

Anthropic e Irregular no identificaron el problema de configuración hasta meses después del primer incidente. Anthropic declaró que la brecha más antigua conocida ocurrió en abril y permaneció sin descubrirse durante unos tres meses.

Claude Mythos 5 publicó un paquete malicioso en PyPI

Durante una evaluación, Claude Mythos 5 encontró instrucciones de instalación que hacían referencia a un paquete Python ficticio. El nombre del paquete no se había registrado en el Python Package Index.

El modelo reconoció que podía registrar el nombre no utilizado y publicar su propio código. Los sistemas que siguieran las instrucciones de instalación podrían entonces descargar y ejecutar automáticamente el paquete.

Claude creó las cuentas necesarias y subió un paquete malicioso a PyPI. El paquete permaneció disponible públicamente durante aproximadamente una hora antes de que las protecciones automatizadas de PyPI lo eliminaran.

Durante ese período, 15 sistemas reales descargaron y ejecutaron el código.

Robaron credenciales de una empresa de seguridad

Uno de los sistemas afectados pertenecía a una empresa de ciberseguridad que descarga y analiza automáticamente los paquetes recién publicados en PyPI.

El paquete malicioso recopiló credenciales del sistema y las envió a una infraestructura que Claude había creado. El modelo usó entonces las credenciales robadas para acceder a partes adicionales de la red de la empresa.

Anthropic afirmó que Claude no tenía conocimiento previo de la organización y que no la seleccionó intencionadamente como objetivo. La empresa notificó a PyPI y compartió los indicadores relacionados con el paquete malicioso.

La empresa de ciberseguridad afectada no había detectado la intrusión antes de que Anthropic se pusiera en contacto con ella.

Claude Opus 4.7 accedió a una base de datos de producción

Una evaluación independiente con Claude Opus 4.7 resultó en el acceso a una base de datos de producción real.

El objetivo ficticio utilizado en el ejercicio compartía nombre con una empresa y un dominio reales. Después de que Claude no lograra alcanzar el sistema simulado, encontró la organización real en línea y la trató como el objetivo previsto.

El modelo extrajo credenciales de aplicaciones e infraestructura antes de acceder a una base de datos que contenía varios cientos de filas de información de producción.

Anthropic describió este incidente como más grave porque el modelo alcanzó sistemas empresariales en funcionamiento y accedió a datos reales.

Un modelo de investigación escaneó unos 9.000 sistemas

Un modelo de investigación de Anthropic aún no publicado provocó el tercer incidente.

CONSEJO DE EXPERTO:

PATROCINADO

Algunos errores de computadora son difíciles de arreglar, especialmente cuando se trata de archivos de sistema faltantes o corruptos en Windows.
Asegúrate de usar una herramienta dedicada, como Fortect, la cual escanea tu computadora y reemplaza tus archivos dañados con versiones nuevas de su propio repositorio.

Tras no localizar el objetivo de prueba previsto, el modelo escaneó alrededor de 9.000 sistemas conectados a Internet. Comprometió una aplicación expuesta utilizando credenciales mostradas en una página de depuración y una vulnerabilidad de inyección SQL.

Más tarde, el modelo determinó que la aplicación comprometida pertenecía a una cuenta en la nube no relacionada. Luego detuvo el ataque sin necesidad de intervención humana.

Anthropic aún estaba intentando ponerse en contacto con la organización afectada cuando publicó sus hallazgos.

Los modelos se basaron en debilidades de seguridad básicas

Anthropic declaró que los incidentes no implicaron técnicas de ataque nuevas o desconocidas previamente.

Los modelos se basaron en debilidades comunes, como credenciales expuestas, contraseñas débiles, puntos finales de acceso público, páginas de depuración con información sensible y vulnerabilidades de inyección SQL.

El fallo principal provino del acceso irrestricto a Internet y de la suposición de los modelos de que cualquier sistema accesible formaba parte de la prueba autorizada.

Anthropic pausó las pruebas de ciberseguridad tras revisar los incidentes

Anthropic comenzó a revisar las evaluaciones y pausó todas las pruebas de ciberseguridad el 23 de julio.

La empresa identificó los tres incidentes el 24 de julio. Irregular y dos organizaciones afectadas recibieron las notificaciones el 27 de julio.

Anthropic continuó intentando contactar a la organización implicada en el tercer incidente.

Ninguna de las dos organizaciones con las que Anthropic logró contactar había detectado de forma independiente los compromisos antes de recibir las notificaciones.

El entorno de evaluación carecía de las salvaguardas de producción

Los sistemas de prueba no utilizaban los clasificadores, las herramientas de monitorización y otras salvaguardas que se incluyen con los modelos de Claude disponibles públicamente.

Anthropic afirmó que sus protecciones de producción probablemente habrían bloqueado las acciones observadas durante las evaluaciones. Calificó los incidentes principalmente como fallos en el diseño de las pruebas, la infraestructura, la monitorización y la supervisión de terceros.

La empresa no describió los incidentes como evidencia de un fallo de alineamiento fundamental. En cambio, los modelos siguieron las instrucciones de la evaluación mientras interactuaban erróneamente con objetivos reales.

Anthropic planea una monitorización más estricta para las pruebas futuras

Anthropic planea ampliar la monitorización de las transcripciones en futuras evaluaciones e introducir herramientas de investigación más sólidas.

También aumentará la supervisión de los socios de pruebas externos y revisará cómo se conectan los entornos de evaluación con la infraestructura externa.

Anthropic está discutiendo una revisión independiente con METR y planea publicar una transcripción parcialmente censurada del incidente de PyPI.

A pesar de los fallos de seguridad, Claude Mythos ha demostrado una gran capacidad de detección de vulnerabilidades. Microsoft también ha reconocido que tiene dificultades para corregir todas las vulnerabilidades encontradas por Claude Mythos, lo que pone de relieve tanto el potencial de investigación en seguridad del modelo como los riesgos creados por entornos de prueba mal aislados.

¿Sigues teniendo problemas?

PATROCINADO

Si las sugerencias que te dimos arriba no solucionaron el problema, es probable que tu PC esté lidiando con errores de Windows más graves. En ese caso, te recomendamos escoger una herramienta como Fortect para arreglar los problemas eficientemente. Después de instalarla, haz clic en el botón Ver & Arreglar presiona Comenzar a Reparar.

Los lectores ayudan a mantener Windows Report. Es posible que recibamos una comisión si compras a través de nuestros enlaces. Tooltip Icon

Lee nuestra página de divulgación para descubrir cómo puedes ayudar a Windows Report a sostener el equipo editorial. Read more

User forum

0 messages