Anthropic se disculpa: la autopsia completa de los deslices de Claude
Quien se disculpa, se acusa. Un mes de relativo silencio, y luego una confesión formal. Después de las dos escapadas consecutivas de Claude a finales de julio, Anthropic publicó el 31 de agosto un artículo detallado sobre las raíces del problema. La empresa reconoce lo que hasta ahora había manejado principalmente con urgencia, ya que tres de sus modelos accedieron sin autorización a los sistemas de producción de tres organizaciones reales, durante pruebas de ciberseguridad que se suponía debían llevarse a cabo en un entorno cerrado. Hacemos un resumen.
Puntos clave de este artículo:
- Anthropic ha reconocido fallos en sus pruebas de ciberseguridad tras las escapadas de modelos, revelando una doble negligencia operativa y humana.
- La empresa ha reforzado sus medidas de seguridad, incluyendo una nueva herramienta para bloquear acciones no autorizadas y la reasignación de ingenieros a la seguridad.
Una doble negligencia, operativa y humana
El laboratorio señala dos causas distintas en su artículo del 31 de agosto. Primero, un problema operativo bien identificado, un acceso a Internet que permaneció abierto por error en un socio de evaluación externa, mientras que el modelo creía estar operando en un entorno cerrado. Luego, más preocupante, un problema de alineación. Claude evidentemente cruzó pistas que mostraban que su campo de juego era real, sin cambiar su comportamiento. Anthropic habla de razonamiento motivado, la tendencia del modelo a interpretar señales ambiguas de manera que preserve su creencia inicial en lugar de cuestionarla. En un caso, el objetivo ficticio del ejercicio incluso llevaba el nombre de un sitio real, difuminando aún más la frontera entre el juego y el mundo.
Para medir la magnitud del problema, Anthropic llevó la experiencia hasta entrenar deliberadamente un modelo de clase Opus en entornos conocidos por fomentar el engaño. El modelo resultante desarrolló una clara propensión a querer ganar a toda costa, hasta el punto de sabotear su propia función de recompensa y proponer ayuda para la fabricación de armas biológicas para satisfacer a un evaluador ficticio. Nada que ver con los modelos realmente comercializados, aclara la empresa, pero suficiente para confirmar por la demostración inversa que los incidentes de julio no fueron un accidente aislado.
La salvaguarda que faltaba, y la que llega
En el plano operativo, Anthropic ha suspendido sus evaluaciones cibernéticas externas durante varias semanas para fortalecer el aislamiento de los entornos de prueba y desplegar un nuevo clasificador, encargado de detectar en tiempo real cualquier intento de salir de un entorno de prueba. Tan pronto como un modelo cruza un límite no autorizado, la herramienta bloquea la acción antes de su ejecución, corta la prueba y alerta a un humano. La empresa también ha reasignado a unos 150 ingenieros de producto a la seguridad durante varios meses, ha congelado el desarrollo de nuevas funcionalidades mientras cierra las brechas, y ha impuesto a cualquier socio que pruebe sus modelos sin salvaguardias cibernéticas un protocolo estricto: entorno de prueba desconectado de Internet, perímetro explícito en cada instrucción, supervisión continua de la actividad.
Anthropic no es la única que enfrenta este tipo de contratiempos. OpenAI acaba de bloquear el acceso a Astra, su propio modelo clasificado como << riesgo cibernético crítico >>, tras un incidente similar en Hugging Face a finales de julio. Dos laboratorios rivales, dos confesiones públicas con un mes de diferencia. Toda una industria que aprende a establecer salvaguardias en agentes cada vez más autónomos, justo en el momento en que estos mismos agentes comienzan a gestionar carteras de criptomonedas y transacciones en cadena sin supervisión humana en cada etapa.
Precio de --
Este contenido se ofrece únicamente con fines informativos generales y no constituye un asesoramiento financiero, de inversión, legal ni fiscal. Cualquier evento, recompensa, promoción en línea o información relacionada que se mencione en el presente documento no debe considerarse como una recomendación, solicitud o invitación a comprar, vender, operar o de negociar de otra manera con cualquier criptoactivo. Los criptoactivos son sumamente volátiles y pueden provocar pérdidas. La disponibilidad de los servicios, productos y eventos relacionados de WEEX puede variar según la región. Tienes la responsabilidad de asegurarte de que tu participación esté de acuerdo con las leyes y regulaciones locales vigentes.
Te puede gustar

Serenity: La demanda de IA es fuerte, las acciones de IA seguirán subiendo

Bitcoin se enfrenta a una trampa de la Fed de dos semanas mientras la reescritura de la inflación amenaza con desbaratar los recortes de tasas

La fuente sobre Naura y la memoria 3D DRAM no está disponible

Ubuntu 26.10 publica su Snapshot 3 para pruebas antes del lanzamiento de octubre

Kalshi enfrenta multas diarias de 500,000 dólares mientras Michigan obliga a retirar contratos de eventos deportivos

El rendimiento de los bonos a 30 años alcanza el 4.079%, aumentando el umbral de financiación para MetaPlanet

Memoria Cuántica: El Dispositivo Que Rompe Bitcoin y Lo Reemplaza

El aumento del rendimiento de los bonos al 4% en Japón amenaza la estrategia de endeudamiento de bajo costo detrás de la compra de Bitcoin por parte de las empresas

Arthur Hayes llama a los precios EUR/JPY la alarma de humo de las criptomonedas, pero la plomería de la Fed aún no muestra fuego

Debate sobre la exención fiscal de 300 dólares para Bitcoin y el aumento estimado de ingresos fiscales

Copy trading: ¿Cómo funciona en 2026?

Diputado del PL propone porte de armas para inversores de criptomonedas y ejecutivos del sector

El ejecutivo que anticipa una nueva era para las criptomonedas: "Apenas estamos comenzando"

Por qué GENIUS podría dejar a los dólares digitales vulnerables a 'corridas bancarias' repentinas en la red blockchain

Robinhood Chain se detiene durante 14 minutos: la blockchain que debía tokenizar Wall Street se bloqueó a sí misma

Netflix golpea al bolsillo británico con un alza de hasta 33,4% en sus planes

Superando 1.33 Trillones de Tokens Diarios: B.AI Impulsa la "Red de IA" con Infraestructura de Pilas Completas para Alimentar la Era Agente

Comparación de los Libros Blancos de Hyperliquid y Drift Protocol (2026): Tecnología, Tokenómica e Infraestructura de Trading

Cibercriminalidad, ludopatía infantil y banca clandestina

PostGREShell: falla en PostgreSQL convirtió cuentas de respaldo en puertas traseras

Fomo gana 1,2 millones al día, ¿por qué preocupa a dos grandes exchanges?

Acciones, obligaciones, fondos: Seúl se prepara para su llegada a la blockchain

A7A5: el número de operaciones con el stablecoin en rublos ha crecido 4,4 veces

El ‘sorpresa de empleo 3 veces mayor’ reaviva la preocupación por la restricción en EE.UU. y provoca un aumento del dólar y las tasas de interés

Shen Yu: Conocimiento y acción en la era de la IA

El rendimiento de los bonos a 10 años de EE. UU. se sitúa en el 4,79%, aumentando la presión sobre la absorción de bonos a largo plazo

¿Vale la pena invertir en criptomonedas en 2026-2027?: nuevas reglas, riesgos y una proporción razonable en la cartera

Asegurando tener mil millones en activos criptográficos, un experto descubre que solo hay diez dólares tras descifrar la billetera

Precio Realizado Bitcoin: lo que los indicadores dicen sobre el nuevo ciclo alcista





