El prompt de IA con peor apariencia acaba de superar meses de ingeniería de prompts de diseño de juegos

By: rootdata|2026/07/28 18:04:00

Justo dos días después del lanzamiento de Claude Opus 5, el inversor en IA y ex CEO de HyperWrite, Matt Shumer, publicó un video de un juego de disparos en primera persona completamente jugable que el modelo había construido por sí solo.

"Claude Opus 5 creó este juego de un solo tiro", escribió, añadiendo que no se utilizó ningún activo externo en la construcción.

Ahora, podrías pensar que un resultado de tan buena calidad requería un prompt largo, detallado y cuidadoso para guiar a los modelos de IA a través de las complejidades de construir un juego de disparos en primera persona pulido.

Piensa de nuevo.

El prompt detrás de esto consistió en tres párrafos cortos, publicados en su totalidad en GitHub. Le dijo a Opus 5 que construyera un shooter al nivel de los juegos más recientes de Call of Duty, que desplegara subagentes—trabajadores que cada uno tiene su propia memoria separada y un trabajo específico—para abordar las piezas individualmente, y que siguiera iterando sobre cada pieza con un crítico separado y severo hasta que se mantuviera frente a imágenes reales de Call of Duty en una comparación ciega lado a lado. El resultado, según el prompt, debería ser "totalmente perfecto".

Eso es un cambio respecto a cómo los ingenieros de prompts han enseñado a las personas a trabajar. El consejo durante el auge de la codificación de vibraciones era especificar criterios en lugar de adjetivos: decir lo que significa "bueno" en lugar de simplemente pedirlo. Qué debería considerar el código en lugar de decir "AAA".

La versión de Shumer hace casi lo opuesto, pidiendo a sus propios subagentes que estén "totalmente impresionados", y dejando la definición real a un crítico que Opus 5 construyó para sí mismo.

Dos características del Claude Code llevan ese bucle. Los subagentes se activan en ventanas de contexto aisladas con sus propias instrucciones y acceso a herramientas, por lo que un crítico que califica el modelo de arma no hereda las excusas del constructor sobre por qué se ve de la manera en que lo hace. Ultracode es una configuración de Claude Code que empuja al modelo a su máximo esfuerzo de razonamiento y le permite escribir su propio plan de orquestación, distribuyendo el trabajo entre hasta 16 agentes a la vez, con un límite de 1,000 por ejecución.

La habilidad /loop incorporada de Anthropic, diseñada para ciclos repetidos de prueba-ajuste, es lo que evitó que la ejecución se detuviera en el momento en que el juego se veía decente. Shumer nunca especificó un número de rondas. Dejó que el crítico siguiera nombrando una nueva brecha y mantuvo al constructor persiguiéndola durante horas antes de cerrar la sesión él mismo.

La construcción final se ejecuta en Three.js y WebGL2 puro, con aproximadamente 55,000 líneas de código distribuidas en 11 subsistemas. Cada textura, malla, animación y sonido se genera dentro del navegador en el momento de la carga—sin modelos descargados, HDRIs, archivos de imagen o archivos de audio. El propio registro de críticos publicado por Shumer muestra la puntuación subiendo de 3.59 sobre 10 hacia poco más de 5, aún detrás del juego real en cada ronda.

Los escépticos asumieron horas de codificación manual oculta, así que Shumer publicó todo el prompt y la base de código. Fue entonces cuando comenzaron los imitadores.

James Altucher, el ex gerente de fondos de cobertura y podcaster, ejecutó el mismo prompt e informó haber gastado "un poco más de diez horas" y aproximadamente 1.3 millones de tokens en Opus 5 para llegar allí. Su construcción, Operation Blackout, se juega gratis en el navegador y se ve impresionante.

El desarrollador de Prompt Silo, dirigió la misma solicitud a la rival insignia de OpenAI, publicando "Sol 5.6 Ultra con el mismo prompt"—Sol siendo el nivel superior de la familia de modelos GPT-5.6 que OpenAI hizo generalmente disponible el 9 de julio junto con versiones más baratas de Terra y Luna.

El desarrollador Leon Lin intentó el movimiento opuesto, optando por el habitual prompt detallado. En lugar de copiar la versión corta de Shumer, se propuso "ingeniar un prompt para este juego", produciendo un documento que abarca unas 20 secciones que detallan todo, desde la física de ragdoll hasta los mapas de sombras en cascada. Alimentó eso en Cursor usando Opus 5 puro con alto esfuerzo, sin subagentes y sin ultracode, y el resultado—un shooter de calle llamado Dust Corridor—también se juega en el navegador y se ve genial.

Ninguna de las construcciones posteriores ha enfrentado la prueba ciega que Shumer realizó en su propio proyecto. Su registro de críticos aún muestra a Call of Duty real ganando cada ronda que registró—la barra que Altucher y Atom Tan Studio están persiguiendo con su exacto prompt de tres párrafos, y la que Leon Lin está persiguiendo con aproximadamente 20 secciones de las suyas.

¿Cuánto de esto es realmente nuevo?

Las herramientas de codificación agentivas como Claude Code escriben software de la manera en que podría hacerlo un ingeniero junior supervisado: leen archivos, ejecutan código, miran las capturas de pantalla que generan y entregan partes del trabajo a subagentes y críticos que verifican el resultado contra un objetivo declarado. Ese bucle es real, y el Gauntlet Loop de Shumer es una forma genuina de estructurarlo. Nada de eso, por sí solo, prueba que el modelo diseñó un juego desde la imaginación en lugar de recombinar patrones de código que ya había absorbido.

Eso no hace que Claude of Duty sea falso, pero hace que "construido desde cero" sea una afirmación más difícil de acreditar completamente, así que toma esos resultados con un grano de sal.

Los investigadores que estudian modelos generadores de código tienen un nombre para el problema más amplio: contaminación de datos, cuando un modelo tiene éxito en una tarea principalmente porque ejemplos casi idénticos ya estaban en sus datos de entrenamiento, no porque razonara algo nuevo.

Ninguna de las construcciones de disparos en primera persona publicadas realizó una verificación de ese tipo de contaminación. El propio repositorio de Shumer contiene la propia creatividad de Claude, si es justo llamarlo así. Esa es una razón para leer "un tiro a un juego AAA" como un agente capaz trabajando dentro de uno de los géneros más documentados en programación, no como prueba de que una IA diseñó un shooter sin arte previo en que apoyarse.

Precio de --

--

Este contenido se ofrece únicamente con fines informativos generales y no constituye asesoramiento financiero, de inversión, legal ni fiscal. Cualquier evento, recompensa, promoción en línea o información relacionada que se mencione en el presente documento no debe considerarse como una recomendación, solicitud o invitación a comprar, vender, tradear o de negociar de otra manera con cualquier criptoactivo. Los criptoactivos son sumamente volátiles y pueden provocar pérdidas. La disponibilidad de los servicios, productos y eventos relacionados de WEEX puede variar según la región. Tienes la responsabilidad de asegurarte de que tu participación esté de acuerdo con las leyes y regulaciones locales vigentes.

También te puede interesar

Préstamos Hipotecarios y Garantías: El Gobierno Prepara un Nuevo Sistema para Ampliar el Acceso a la Vivienda

Después del fuerte crecimiento mostrado por los préstamos UVA hasta mediados de 2025, el ritmo comenzó a desacelerarse debido a la reducción de la liquidez bancaria. La iniciativa oficial busca ampliar la financiación, reducir riesgos y facilitar el acceso a la financiación para la compra de propied...

Vacaciones de Invierno: Promociones, Cuotas y Nieve No Son Suficientes para Llenar Destinos

Los destinos de nieve muestran la mayor demanda. Las reservas de última hora sostienen la actividad.

OpenAI y Anthropic impulsan una revisión de 30 días para modelos de IA de frontera

Escaneé toda la blockchain de Bitcoin en busca de imágenes. Lo que encontré te sorprenderá

Después de tres días de validación y medio día de escaneo profundo, los hallazgos obligan a una dura reflexión sobre lo que realmente significa "contenido en la blockchain" para los operadores de nodos ordinarios.

¿Dejó su Tesla Cybertruck conectado durante dos semanas y no encendió? ¿Qué pasó realmente?

Un propietario creía que el calor había dañado la batería de su camioneta, pero el diagnóstico técnico reveló una causa muy diferente.

Qué es y cómo funciona "Apple Upgrade", el plan de alquiler oficial para iPhones, iPads y MacBooks

El nuevo programa fue lanzado en colaboración con el banco Klarna. Al final del plazo del contrato, los clientes pueden actualizar su dispositivo a la última generación, comprarlo en un solo pago o salir del programa.
...
iconiconiconiconiconicon
Atención al cliente:@weikecs
Cooperación empresarial:@weikecs
Trading cuantitativo y MM:bd@weex.com
Programa VIP:support@weex.com