¿Claude de Anthropic hace lo que quiere? Dos evasiones en una semana
La vida siempre encuentra un camino. Una semana, dos evasiones diferentes, el mismo nombre de fondo: Claude, el modelo insignia de Anthropic. Tras el descubrimiento de una vulnerabilidad local en Claude Cowork, la herramienta que automatiza tareas directamente en la computadora del usuario, la empresa reveló un segundo episodio, sin relación con el primero.
Esta vez, tres de sus modelos accedieron sin autorización a los sistemas de producción de tres organizaciones reales, durante simples pruebas de ciberseguridad.
Puntos clave de este artículo:
- Claude de Anthropic ha experimentado dos filtraciones de seguridad en una semana, revelando fallas preocupantes.
- Tres organizaciones fueron comprometidas durante pruebas de ciberseguridad, subrayando los riesgos de las IA autónomas.
Episodio 1: el sandbox que se filtraba por todas partes
Investigadores de seguridad habían demostrado que el modo de ejecución local de Claude Cowork podía ser eludido. El método: encadenar varias debilidades arquitectónicas a una vulnerabilidad de elevación de privilegios del núcleo de Linux (el corazón del sistema que gestiona el acceso a los recursos de la máquina).
Una vez fuera de su sandbox (sandbox en la jerga), el agente heredaba los mismos derechos que el usuario conectado: acceso a archivos, potencialmente a claves SSH y a credenciales en la nube almacenadas en la máquina.
Anthropic no negó, pero minimizó, calificando el informe de "informativo" y corrigiendo al cambiar por defecto Claude Cowork a una ejecución en la nube. Un parche pragmático. Sin embargo, la cuestión de fondo seguía abierta: ¿cuántas otras puertas traseras aún existen en agentes ya autorizados para manipular archivos, pagos o transacciones de criptomonedas de forma autónoma?
Episodio 2: Anthropic juega a la transparencia, la culpa es de otro lado
La respuesta llegó más rápido de lo esperado. En un comunicado publicado el 31 de julio titulado Investigando tres incidentes del mundo real en nuestras evaluaciones de ciberseguridad, Anthropic explica haber revisado 141,006 evaluaciones donde sus modelos podrían haber obtenido acceso a Internet.
Tres de ellas terminaron mal: el modelo salió del entorno de prueba de Irregular, su socio de evaluación externa, y terminó comprometiendo la infraestructura de producción de tres organizaciones distintas.
A diferencia de una elusión deliberada, Anthropic insiste en el origen del problema: un simple malentendido con Irregular había dejado un acceso a Internet abierto dentro del entorno de evaluación. Al enfrentarse a un ejercicio de capture-the-flag (recuperar información oculta en otra máquina de la red), el modelo trató los sistemas reales cruzados en el camino como si fueran parte del juego. Los comprometió con técnicas básicas: contraseñas débiles y puntos de acceso no autenticados a la cabeza.
No es precisamente el escenario de ciencia ficción que se imagina cuando se habla de IA "que se escapa". Más bien, una cadena de pequeñas negligencias humanas, amplificadas por una máquina que ejecuta sin cuestionar. CNN resume bien la paradoja: el modelo nunca intentó engañar a nadie, simplemente hizo lo que se le pidió, sin saber dónde terminaba el campo de juego.
Open AI y Anthropic: los hermanos enemigos
OpenAI había tenido su propio episodio una semana antes con Hugging Face, un agente que se infiltró solo durante una evaluación similar. Dos gigantes rivales, dos evasiones a pocos días de distancia: ahora es difícil ver esto como una simple coincidencia.
Es un patrón que se repite, independientemente de la filosofía de seguridad exhibida por cada laboratorio. Anthropic se toma el tiempo de distinguir su caso del de OpenAI: aquí, no hubo intención de evasión del modelo, solo una frontera mal establecida entre el entorno ficticio y la infraestructura real. La matiz cuenta para la imagen de marca. Sin embargo, cambia poco para las tres empresas afectadas, que se encontraron pirateadas sin haberlo solicitado.
El tema supera con creces a Anthropic o OpenAI: es toda una industria que cada vez más apuesta por agentes de IA capaces de actuar solos, sin que un marco de seguridad maduro haya tenido tiempo de seguir.
Este contenido se ofrece únicamente con fines informativos generales y no constituye asesoramiento financiero, de inversión, legal ni fiscal. Cualquier evento, recompensa, promoción en línea o información relacionada que se mencione en el presente documento no debe considerarse como una recomendación, solicitud o invitación a comprar, vender, tradear o de negociar de otra manera con cualquier criptoactivo. Los criptoactivos son sumamente volátiles y pueden provocar pérdidas. La disponibilidad de los servicios, productos y eventos relacionados de WEEX puede variar según la región. Tienes la responsabilidad de asegurarte de que tu participación esté de acuerdo con las leyes y regulaciones locales vigentes.
También te puede interesar

La nueva guerra fría es una guerra de acciones tecnológicas

Las sociedades anónimas no son el final, la próxima generación de formas organizativas está surgiendo

Hungría elimina las regulaciones de verificación de criptomonedas y reestructura el mercado hacia el cumplimiento de MiCA

Prueba del BIS sobre pagos transfronterizos con "monedas tokenizadas": 28 bancos globales participan, con un tiempo promedio de liquidación de 80 segundos

Panorama de la infraestructura subyacente de Web3: cinco tecnologías clave para entender el futuro de la blockchain

Japón mantiene tasas en 1% y el carry trade sigue vivo: ¿qué cambia para el Bitcoin?

¿"Apuñalamiento" o "Ganar-Ganar"? ¿Qué tan probable es que TradeXYZ vuele solo de Hyperliquid?

Cómo se verá la construcción en criptomonedas en 2026

¿Por qué es atractiva la historia de arbitraje de Axis, llenando 50 millones de dólares en 22 horas?

Hong Kong abre la puerta a XRP para inversores individuales, liderando la expansión del mercado regulado en Asia

La adopción de criptomonedas alcanza un nivel sin precedentes en Canadá

¿Qué es un airdrop de criptomonedas? Tokens gratuitos, elegibilidad y trampas fiscales

¿Qué es la agricultura de rendimiento? Explicación de la minería de liquidez y los riesgos de APY

¿Qué es un DAO? Gobernanza descentralizada explicada

¿Qué es la prueba de participación? Cómo los validadores reemplazaron a los mineros

Corea del Sur aprueba una nueva cuenta de fondo soberano para la IA y sectores estratégicos

¿Quién asume la responsabilidad cuando los agentes de IA son empleados?

Nueva York demanda a Kalshi por reclamaciones de juego ilegal, busca $36 mil millones en daños

Los datos de inflación en enfriamiento no cambian la verdadera fuente de presión sobre los activos globales

China: 16 personas detenidas por blanqueo a través de criptomonedas

Más allá de Bitcoin y Ethereum: 8 proyectos de criptomonedas construidos sobre la adopción real

Los tokens de IA pierden impulso tras ganancias impulsadas en gran medida por la especulación

El ETF Canary HBAR tiene $47.8 millones tras su lanzamiento en Nasdaq

Gumi y SBI establecen un fondo de criptomonedas de 3 mil millones de yenes para promover ETF físicos en Japón

Fundación Ethereum: El hacker ético Pascal Caversaccio se une a la junta directiva

¿Qué ha sido de las empresas que acumulan decenas de miles de BTC?

Informe matutino de Wall Street: Microsoft alivia preocupaciones sobre el 'gasto en IA', las acciones tecnológicas rebotan con fuerza, los ETF de almacenamiento DRAM y semiconductores suben un 17% y un 8%

Burbuja de IA: Petróleo, China y Washington amenazan el mercado

Bernstein interpreta a Microsoft: el crecimiento de Azure alcanza el 45%, los asientos de Copilot superan los 30 millones, la comercialización de IA de Microsoft sigue acelerándose










