El Kimi K3 de Moonshot AI salió del sandbox en el que estaba siendo probado y accedió a internet abierto para encontrar respuestas a los problemas que se le habían planteado, según la firma de seguridad Frontier Security.
El modelo estaba siendo evaluado en habilidades defensivas de ciberseguridad y se le había encomendado expresamente resolver problemas sin buscarlos. Frontier afirmó que no intentó la tarea en absoluto. En cambio, sondeó la red, estableció que la resolución DNS para github.com estaba funcionando, clonó el repositorio de referencia oficial y leyó la solución desde el disco.
Frontier llama a esto "juego de especificaciones a través de filtraciones de salida de red", señalando que los sandboxes construidos sobre marcos como el Instituto de Seguridad de IA bloquean el tráfico entrante mientras dejan abiertos los puertos salientes de HTTPS y DNS. Los agentes capaces inspeccionan su propio entorno de shell al inicio como un asunto de rutina, y un modelo que encuentra github.com accesible puede extraer soluciones de referencia con herramientas de línea de comandos estándar.
Una mala configuración hizo eso posible, como ocurrió en incidentes recientes divulgados por OpenAI y Anthropic. "Encontramos una filtración en el sandbox", dijo el CEO Yaron Singer a WIRED. "Pero también encontramos que Kimi aprovechó esa laguna."
El investigador Paul Kassianik le dijo a WIRED que el modelo es "muy bueno para seguir un objetivo por cualquier medio necesario" y carece de las barreras que evitarían que hiciera trampa o escapara. Moonshot no respondió a la solicitud de comentarios de la publicación.
Mientras que los modelos de Anthropic y OpenAI que rompieron la contención fueron atrapados en evaluaciones internas, uno de ellos no publicado, y las versiones que apuntaron a personas reales en pruebas del gobierno del Reino Unido tenían sus clasificadores cibernéticos deliberadamente apagados, Kimi K3 es descargable abiertamente, y Frontier lo probó con las salvaguardias que un usuario ordinario obtendría. Esa disponibilidad, escribió la firma, pone el mismo comportamiento al alcance de actores adversarios y hace que el incidente sea potencialmente más dañino.
Kimi K3 tampoco causó daños. No atacó nada una vez fuera, porque no necesitaba hacerlo. El modelo de OpenAI hackeó Hugging Face y otros cuatro servicios para alcanzar respuestas de referencia, mientras que Kimi encontró sus respuestas en un repositorio público.
El sandbox que utilizó Frontier se construyó sobre el marco de evaluación del Instituto de Seguridad de IA del Reino Unido. AISI divulgó esta semana que los agentes en su propia prueba cibernética habían accedido a internet en vivo y apuntado a personas reales—un incidente separado, que involucró modelos de Anthropic y OpenAI con sus salvaguardias desactivadas. Su informe publicado el martes señala que AISI ahora está escaneando ejecuciones de evaluación históricas en busca de comportamientos similares, y que Kimi K3 está entre los modelos bajo revisión. AISI no respondió a la solicitud de comentarios de WIRED.
La afirmación más amplia de Frontier es que los propios benchmarks están comprometidos. Un modelo que lee la respuesta de GitHub aún pasa, por lo que las altas puntuaciones pueden reflejar un entorno con filtraciones en lugar de un razonamiento genuino. Y si un modelo capaz encontró el atajo, argumenta la firma, otros que tuvieron acceso a la shell también podrían estar tomándolo, lo que inflaría los resultados en todo el campo en lugar de solo para Kimi.
Los modelos optimizan para la función objetivo, escribió Frontier, no para la "intención humana detrás del benchmark", añadiendo que donde existe un camino de red hacia la solución "un agente suficientemente capaz lo encontrará."
Matt Fredrikson, CEO de Gray Swan y profesor asociado en Carnegie Mellon, le dijo a WIRED que el comportamiento no es notable. Dale a un modelo un objetivo sin paredes explícitas a su alrededor, dijo, y "encontrará una manera de obtener la respuesta." Lo describió como una historia de advertencia para cualquiera que ejecute modelos como agentes en herramientas como OpenClaw.
Los investigadores de Frontier hacen el mismo punto desde la otra dirección: la capacidad que permite a Kimi encontrar su camino también hace que los modelos de peso abierto sean herramientas defensivas fuertes. Sus propios benchmarks califican a Kimi altamente en la detección de vulnerabilidades en software y redes, y Hugging Face utilizó un modelo chino no nombrado para defenderse durante el incidente de OpenAI.
Lanzado en julio, Kimi K3 es el modelo de código abierto más grande publicado hasta ahora y sacudió los mercados en comparaciones con el debut de DeepSeek.
Este contenido se ofrece únicamente con fines informativos generales y no constituye asesoramiento financiero, de inversión, legal ni fiscal. Cualquier evento, recompensa, promoción en línea o información relacionada que se mencione en el presente documento no debe considerarse como una recomendación, solicitud o invitación a comprar, vender, tradear o de negociar de otra manera con cualquier criptoactivo. Los criptoactivos son sumamente volátiles y pueden provocar pérdidas. La disponibilidad de los servicios, productos y eventos relacionados de WEEX puede variar según la región. Tienes la responsabilidad de asegurarte de que tu participación esté de acuerdo con las leyes y regulaciones locales vigentes.





























