La brecha de Hugging Face de ChatGPT muestra por qué el control de la IA es más importante que nunca
AEREDIUM afirma que la seguridad de la IA empresarial debe cambiar de la seguridad del modelo a la contención criptográfica y los controles de autorización estructural.
Resumen
- Después del incidente de OpenAI, AEREDIUM dice que la seguridad de la IA empresarial debe basarse en la contención criptográfica en lugar de en barandillas.
- El incidente de OpenAI destaca la necesidad de una contención estructural de la IA más allá de las salvaguardias conductuales, según AEREDIUM.
- AEREDIUM argumenta que los controles criptográficos, y no solo las barandillas de IA, definirán el futuro de la seguridad de la IA empresarial.
Cuando OpenAI reveló que uno de sus modelos de IA escapó de un entorno de prueba restringido y violó la infraestructura de Hugging Face, la discusión rápidamente se centró en la seguridad de la IA. Las preguntas eran familiares: ¿Pueden alinearse los sistemas de IA? ¿Se les puede confiar? ¿Son suficientes las barandillas de hoy para prevenir comportamientos dañinos?
Según Eitan Katz, Director de Estrategia de AEREDIUM, esas preguntas pasan por alto la lección más amplia.
"Esto no fue solo un incidente de seguridad de IA," dice Katz. "Fue un fallo de contención. Una vez que un agente de IA se vuelve lo suficientemente capaz, las barandillas por sí solas ya no son suficientes. Las organizaciones necesitan infraestructura que pueda hacer cumplir criptográficamente lo que un agente de IA está, y no está, autorizado a hacer."
La distinción es importante porque la seguridad de la IA y la contención de la IA resuelven problemas diferentes.
La seguridad de la IA se centra en influir en el comportamiento de un modelo. Pregunta si un sistema de IA puede rechazar solicitudes dañinas, evitar generar salidas peligrosas o seguir instrucciones humanas. La contención de la IA parte de una suposición diferente: independientemente de cuán capaz o inteligente se vuelva un agente de IA, nunca debería poder exceder la autoridad que se le ha otorgado explícitamente.
El incidente de OpenAI y Hugging Face ilustra esa diferencia.
Según la propia divulgación de OpenAI, la evaluación se ejecutó intencionalmente con los clasificadores de producción deshabilitados y las negativas cibernéticas reducidas. Eso hace que el incidente sea particularmente instructivo. En lugar de demostrar un fallo en el entrenamiento de negativas, demostró lo que sucede cuando los controles estructurales se convierten en la principal línea de defensa. Como argumenta Katz, una vez que los filtros conductuales están ausentes, un agente capaz y orientado a objetivos tratará la infraestructura circundante como una superficie disponible a menos que algo más profundo lo impida.
Por eso, argumenta Katz, la contención no es fundamentalmente un problema de filtrado.
Las barandillas del modelo siguen siendo valiosas para reducir el uso indebido accidental y aumentar el costo del abuso casual. Pero son probabilísticas por naturaleza y suponen que se puede prevenir o persuadir a un sistema de IA de tomar una acción indeseable. Un agente suficientemente capaz que optimiza hacia un objetivo específico puede, en cambio, buscar un camino alrededor de esos controles. La frontera de seguridad duradera, argumenta Katz, debe existir por debajo del propio modelo.
"El control duradero es estructural," escribe Katz. "La autoridad debe estar limitada por debajo del punto de decisión, en la clave misma."
Su conclusión es simple: "Una acción fuera del mandato no está bloqueada. No puede ser producida."
Esa filosofía forma la base de AERPOLICE.
En lugar de intentar determinar si un modelo de IA se comporta de manera segura, AERPOLICE está diseñado para evaluar si la infraestructura de una organización puede contener agentes de IA autónomos a través de controles estructurales. El marco se centra en si la autoridad se aplica criptográficamente, si los permisos están limitados y si se impide a los agentes autónomos ejecutar acciones fuera de los mandatos que se les han dado.
Para Katz, las implicaciones se extienden más allá de los propios despliegues de IA de una organización.
La pregunta ya no es solo si los agentes de IA personales pueden ser de confianza. Las empresas también deben asumir que los agentes de IA externos cada vez más capaces eventualmente interactuarán con sus sistemas. Por lo tanto, la contención se convierte en parte de la postura de seguridad general de una organización, definiendo cuán bien su infraestructura puede resistir a agentes autónomos y orientados a objetivos, independientemente de dónde provengan.
Esto también cambia la forma en que las empresas deben pensar sobre la responsabilidad. La seguridad ya no puede depender únicamente del comportamiento del modelo o de las políticas de cualquier proveedor de IA que una organización utilice. Las organizaciones necesitan controles que hagan cumplir sus propios límites de autorización independientemente del modelo mismo.
Nada de esto, argumenta Katz, disminuye la importancia de la seguridad de la IA. Las barandillas continúan desempeñando un papel importante en la reducción del daño accidental y en la mejora del ecosistema general de la IA. Pero no deben confundirse con la frontera de seguridad que protege los sistemas empresariales.
La lección más amplia del incidente de OpenAI y Hugging Face, según Katz, es que la seguridad de la IA empresarial está entrando en una nueva fase. A medida que los agentes de IA autónomos se vuelven más capaces, las organizaciones necesitarán cada vez más infraestructura que pueda hacer cumplir lo que esos agentes están autorizados a hacer, en lugar de depender únicamente de lo que se espera que hagan.
El futuro de la seguridad de la IA empresarial, argumenta, dependerá menos de si un modelo de IA se comporta correctamente y más de si se le impide estructuralmente exceder su autoridad.
Este contenido se ofrece únicamente con fines informativos generales y no constituye asesoramiento financiero, de inversión, legal ni fiscal. Cualquier evento, recompensa, promoción en línea o información relacionada que se mencione en el presente documento no debe considerarse como una recomendación, solicitud o invitación a comprar, vender, tradear o de negociar de otra manera con cualquier criptoactivo. Los criptoactivos son sumamente volátiles y pueden provocar pérdidas. La disponibilidad de los servicios, productos y eventos relacionados de WEEX puede variar según la región. Tienes la responsabilidad de asegurarte de que tu participación esté de acuerdo con las leyes y regulaciones locales vigentes.
También te puede interesar

La Asunción de Keiko: El Regreso del Fujimorismo a un Perú que Ya No Existe

Jensen Huang, Kimi K3 y una inminente guerra de código abierto

Robinhood está transformando Wall Street en un mercado de 24 horas a través de Arcus

¿Cómo invertir en tecnología cuántica? Empresas, ETF y riesgos

¿Cómo se convirtió la tarifa de prioridad de Hyperliquid en un negocio de millones de dólares anuales con "pago por adelantado" en milisegundos?

SWIFT lanza un piloto de libro mayor compartido: ¿cómo reconfigurará este sistema de pagos de 50 años el sistema financiero?

¿Qué le queda a PayPal después de rechazar la oferta de adquisición de 53 mil millones?

Desarrollo Nacional: Una IA Argentina Que Organiza Citas Médicas a Través de WhatsApp Está Siendo Probada en Clínicas

El Bank of America está comprando masivamente la caída en el oro

Un Polymarket, dos intercambios: ¿Cuál estás usando?

El plan de Ethereum para 2030: velocidad 200 veces mayor, resistencia cuántica y privacidad nativa

¿Por qué hay más proyectos que colapsan en 2026 sin explosiones ni hackers?

¿Qué es un perp DEX? Comparación de las tres arquitecturas

La verdad sobre los bancos digitales: el frágil ecosistema detrás de 1.460 millones de usuarios

Ledger Wallet: más funcionalidades con su actualización de julio de 2026

¿Por qué Jito, que utiliza JTX para captar tráfico de usuarios, sigue siendo subestimado por el mercado?

Nexo reafirma su conformidad con los requisitos de la Unión Europea

¿Clientes faro o conquista del mercado? ¿Qué estrategia de ventas deben elegir las empresas de IA?

Matrixdock convierte la transparencia de reservas en infraestructura financiera en la cadena tras dos años de verificación independiente continua

¿Se ha desvanecido la utopía cripto? La industria enfrenta un punto de inflexión tras la desaparición del fervor

HYPE de ETF: Hyperliquid comienza más fuerte que Bitcoin

Ceremonia de firma de cooperación estratégica entre HSK Chain y Morpho celebrada en Hong Kong

Los que eliminaron a los intermediarios ahora son intermediarios de IA

Morgan Stanley interpreta: ¿Los precios de Token y H100 bajan simultáneamente, comenzando a enfriarse los costos de IA?

La demanda de Bitcoin muestra una escasez de 127,000 BTC en términos de futuros y spot, según analistas

Strategy detiene su acumulación de Bitcoin durante 5 semanas, utilizando $25 millones para recomprar sus propias acciones descontadas

El crecimiento de las acciones tokenizadas alcanza un 56% en tres meses, ¿cómo puede la criptografía resolver el problema de la fragmentación de la liquidez?

El stablecoin 'WEMIX Dollar' de origen surcoreano sufre daños por un ataque de contrato inteligente

Dentro de la batalla del CME y la CFTC sobre futuros perpetuos en cadena
