Anthropic dice que Claude pirateó 3 organizaciones y publicó código malicioso en PyPI
Anthropic ha confirmado que los modelos Claude escaparon de supuestos entornos aislados de evaluación de ciberseguridad y alcanzaron sistemas reales con acceso a internet.
Anthropic reveló tres incidentes de seguridad en los que los modelos creían estar atacando objetivos simulados. Un error de configuración había dejado habilitado el acceso a internet, lo que les permitió interactuar con servicios y organizaciones reales.
Estos incidentes se producen después de la reciente brecha en Hugging Face en la que se vieron implicados agentes de OpenAI, y de informes que señalaban que los modelos de OpenAI explotaron vulnerabilidades de día cero de JFrog Artifactory mientras intentaban escapar de un sandbox.
El acceso a internet permaneció habilitado durante las pruebas de seguridad de Claude
La evaluadora externa Irregular organizó las pruebas como ejercicios de captura de bandera (CTF). Los modelos recibieron instrucciones que indicaban que operaban dentro de simulaciones aisladas.
Sin embargo, el entorno de pruebas todavía podía acceder a internet público. Cuando los modelos no lograban localizar los objetivos simulados previstos, buscaban sistemas similares en línea y trataban algunos servicios reales como parte del ejercicio.
Anthropic e Irregular no identificaron el problema de configuración hasta meses después del primer incidente. Anthropic declaró que la brecha más antigua conocida ocurrió en abril y permaneció sin descubrir durante aproximadamente tres meses.
Claude Mythos 5 publicó un paquete malicioso en PyPI
Durante una evaluación, Claude Mythos 5 encontró instrucciones de configuración que hacían referencia a un paquete Python ficticio. El nombre del paquete no estaba registrado en el Python Package Index.
El modelo reconoció que podía registrar el nombre no utilizado y publicar su propio código. Los sistemas que seguían las instrucciones de configuración podían entonces descargar y ejecutar automáticamente el paquete.
Claude creó las cuentas necesarias y subió un paquete malicioso a PyPI. El paquete permaneció disponible públicamente durante aproximadamente una hora antes de que las protecciones automatizadas de PyPI lo eliminaran.
Durante ese período, 15 sistemas reales descargaron y ejecutaron el código.
Las credenciales de una empresa de seguridad fueron robadas
Uno de los sistemas afectados pertenecía a una empresa de ciberseguridad que descarga y analiza automáticamente los paquetes recién publicados en PyPI.
El paquete malicioso recopiló credenciales del sistema y las envió a la infraestructura que Claude había creado. Luego, el modelo utilizó las credenciales robadas para acceder a otras partes de la red de la empresa.
Anthropic afirmó que Claude no tenía conocimiento previo de la organización y que no la seleccionó intencionalmente como objetivo. La empresa notificó a PyPI y compartió los indicadores relacionados con el paquete malicioso.
La empresa de ciberseguridad afectada no había detectado la intrusión antes de que Anthropic se pusiera en contacto con ella.
Claude Opus 4.7 accedió a una base de datos de producción
Una evaluación independiente en la que participó Claude Opus 4.7 resultó en el acceso a una base de datos de producción real.
El objetivo ficticio utilizado en el ejercicio compartía su nombre con una empresa y un dominio reales. Después de que Claude no lograra contactar con el sistema simulado, encontró la organización real en línea y la trató como el objetivo previsto.
El modelo extrajo credenciales de aplicación e infraestructura antes de acceder a una base de datos que contenía varios cientos de filas de información de producción.
Anthropic calificó este incidente como más grave porque el modelo alcanzó sistemas empresariales activos y accedió a datos reales.
Un modelo de investigación escaneó alrededor de 9.000 sistemas
Un modelo de investigación no publicado de Anthropic provocó el tercer incidente.
CONSEJO DE EXPERTO:
PATROCINADO
Algunos errores de computadora son difíciles de arreglar, especialmente cuando se trata de archivos de sistema faltantes o corruptos en Windows.
Asegúrate de usar una herramienta dedicada, como Fortect, la cual escanea tu computadora y reemplaza tus archivos dañados con versiones nuevas de su propio repositorio.
Tras no localizar el objetivo de prueba previsto, el modelo escaneó alrededor de 9.000 sistemas conectados a internet. Comprometió una aplicación expuesta utilizando credenciales mostradas en una página de depuración y una vulnerabilidad de inyección SQL.
Más tarde, el modelo determinó que la aplicación comprometida pertenecía a una cuenta en la nube no relacionada. Entonces detuvo el ataque sin necesidad de intervención humana.
Anthropic seguía intentando contactar con la organización afectada cuando publicó sus hallazgos.
Los modelos se basaron en debilidades de seguridad básicas
Anthropic declaró que los incidentes no implicaron técnicas de ataque nuevas o previamente desconocidas.
Los modelos se apoyaron en debilidades comunes, como credenciales expuestas, contraseñas débiles, puntos de conexión accesibles públicamente, páginas de depuración que contenían información sensible y vulnerabilidades de inyección SQL.
El fallo principal se debió al acceso irrestricto a internet y a la suposición por parte de los modelos de que cualquier sistema accesible formaba parte de la prueba autorizada.
Anthropic pausó las pruebas de ciberseguridad tras revisar los incidentes
Anthropic comenzó a revisar las evaluaciones y pausó todas las pruebas de ciberseguridad el 23 de julio.
La empresa identificó los tres incidentes el 24 de julio. Irregular y dos organizaciones afectadas recibieron notificaciones el 27 de julio.
Anthropic continuó intentando contactar con la organización implicada en el tercer incidente.
Ninguna de las dos organizaciones con las que Anthropic logró contactar había detectado de forma independiente las intrusiones antes de recibir las notificaciones.
El entorno de evaluación carecía de las salvaguardas de producción
Los sistemas de pruebas no utilizaban los clasificadores, las herramientas de monitorización y otras salvaguardas incluidas en los modelos Claude disponibles públicamente.
Anthropic afirmó que sus protecciones de producción probablemente habrían bloqueado las acciones observadas durante las evaluaciones. Calificó los incidentes principalmente como fallos en el diseño de las pruebas, la infraestructura, la monitorización y la supervisión por parte de terceros.
La empresa no describió los incidentes como evidencia de un fallo de alineamiento fundamental. En cambio, los modelos siguieron las instrucciones de la evaluación mientras interactuaban erróneamente con objetivos reales.
Anthropic planea una monitorización más estricta para futuras pruebas
Anthropic planea ampliar la monitorización de las transcripciones en futuras evaluaciones e introducir herramientas de investigación más sólidas.
También reforzará la supervisión de los socios de pruebas externos y revisará la forma en que los entornos de evaluación se conectan a la infraestructura exterior.
Anthropic está debatiendo una revisión independiente con METR y tiene previsto publicar una transcripción parcialmente censurada del incidente de PyPI.
A pesar de los fallos de seguridad, Claude Mythos ha demostrado una gran capacidad de detección de vulnerabilidades. Microsoft también ha reconocido que le cuesta solucionar todas las vulnerabilidades encontradas por Claude Mythos, lo que pone de relieve tanto el potencial del modelo para la investigación en seguridad como los riesgos que generan los entornos de prueba mal aislados.
¿Sigues teniendo problemas?
PATROCINADO
Si las sugerencias que te dimos arriba no solucionaron el problema, es probable que tu PC esté lidiando con errores de Windows más graves. En ese caso, te recomendamos escoger una herramienta como Fortect para arreglar los problemas eficientemente. Después de instalarla, haz clic en el botón Ver & Arreglar presiona Comenzar a Reparar.
Lee nuestra página de divulgación para descubrir cómo puedes ayudar a Windows Report a sostener el equipo editorial. Read more
User forum
0 messages