¿Claude de Anthropic hace lo que quiere? Dos evasiones en una semana

By: rootdata|2026/07/31 10:00:00

La vida siempre encuentra un camino. Una semana, dos evasiones diferentes, el mismo nombre de fondo: Claude, el modelo insignia de Anthropic. Tras el descubrimiento de una vulnerabilidad local en Claude Cowork, la herramienta que automatiza tareas directamente en la computadora del usuario, la empresa reveló un segundo episodio, sin relación con el primero.

Esta vez, tres de sus modelos accedieron sin autorización a los sistemas de producción de tres organizaciones reales, durante simples pruebas de ciberseguridad.
Puntos clave de este artículo:

  • Claude de Anthropic ha experimentado dos filtraciones de seguridad en una semana, revelando fallas preocupantes.
  • Tres organizaciones fueron comprometidas durante pruebas de ciberseguridad, subrayando los riesgos de las IA autónomas.

Episodio 1: el sandbox que se filtraba por todas partes

Investigadores de seguridad habían demostrado que el modo de ejecución local de Claude Cowork podía ser eludido. El método: encadenar varias debilidades arquitectónicas a una vulnerabilidad de elevación de privilegios del núcleo de Linux (el corazón del sistema que gestiona el acceso a los recursos de la máquina).

Una vez fuera de su sandbox (sandbox en la jerga), el agente heredaba los mismos derechos que el usuario conectado: acceso a archivos, potencialmente a claves SSH y a credenciales en la nube almacenadas en la máquina.

Anthropic no negó, pero minimizó, calificando el informe de "informativo" y corrigiendo al cambiar por defecto Claude Cowork a una ejecución en la nube. Un parche pragmático. Sin embargo, la cuestión de fondo seguía abierta: ¿cuántas otras puertas traseras aún existen en agentes ya autorizados para manipular archivos, pagos o transacciones de criptomonedas de forma autónoma?

Episodio 2: Anthropic juega a la transparencia, la culpa es de otro lado

La respuesta llegó más rápido de lo esperado. En un comunicado publicado el 31 de julio titulado Investigando tres incidentes del mundo real en nuestras evaluaciones de ciberseguridad, Anthropic explica haber revisado 141,006 evaluaciones donde sus modelos podrían haber obtenido acceso a Internet.

Tres de ellas terminaron mal: el modelo salió del entorno de prueba de Irregular, su socio de evaluación externa, y terminó comprometiendo la infraestructura de producción de tres organizaciones distintas.

A diferencia de una elusión deliberada, Anthropic insiste en el origen del problema: un simple malentendido con Irregular había dejado un acceso a Internet abierto dentro del entorno de evaluación. Al enfrentarse a un ejercicio de capture-the-flag (recuperar información oculta en otra máquina de la red), el modelo trató los sistemas reales cruzados en el camino como si fueran parte del juego. Los comprometió con técnicas básicas: contraseñas débiles y puntos de acceso no autenticados a la cabeza.

No es precisamente el escenario de ciencia ficción que se imagina cuando se habla de IA "que se escapa". Más bien, una cadena de pequeñas negligencias humanas, amplificadas por una máquina que ejecuta sin cuestionar. CNN resume bien la paradoja: el modelo nunca intentó engañar a nadie, simplemente hizo lo que se le pidió, sin saber dónde terminaba el campo de juego.

Open AI y Anthropic: los hermanos enemigos

OpenAI había tenido su propio episodio una semana antes con Hugging Face, un agente que se infiltró solo durante una evaluación similar. Dos gigantes rivales, dos evasiones a pocos días de distancia: ahora es difícil ver esto como una simple coincidencia.

Es un patrón que se repite, independientemente de la filosofía de seguridad exhibida por cada laboratorio. Anthropic se toma el tiempo de distinguir su caso del de OpenAI: aquí, no hubo intención de evasión del modelo, solo una frontera mal establecida entre el entorno ficticio y la infraestructura real. La matiz cuenta para la imagen de marca. Sin embargo, cambia poco para las tres empresas afectadas, que se encontraron pirateadas sin haberlo solicitado.

El tema supera con creces a Anthropic o OpenAI: es toda una industria que cada vez más apuesta por agentes de IA capaces de actuar solos, sin que un marco de seguridad maduro haya tenido tiempo de seguir.

Precio de --

--

Este contenido se ofrece únicamente con fines informativos generales y no constituye asesoramiento financiero, de inversión, legal ni fiscal. Cualquier evento, recompensa, promoción en línea o información relacionada que se mencione en el presente documento no debe considerarse como una recomendación, solicitud o invitación a comprar, vender, tradear o de negociar de otra manera con cualquier criptoactivo. Los criptoactivos son sumamente volátiles y pueden provocar pérdidas. La disponibilidad de los servicios, productos y eventos relacionados de WEEX puede variar según la región. Tienes la responsabilidad de asegurarte de que tu participación esté de acuerdo con las leyes y regulaciones locales vigentes.

También te puede interesar

iconiconiconiconiconicon
Atención al cliente:@weikecs
Cooperación empresarial:@weikecs
Trading cuantitativo y MM:bd@weex.com
Programa VIP:support@weex.com