Der dümmste aussehende KI-Prompt hat monatelange sorgfältige Spiel-Design-Prompt-Engineering übertroffen

By: rootdata|2026/07/28 18:04:00

Nur zwei Tage nach der Veröffentlichung von Claude Opus 5 postete der KI-Investor und ehemalige HyperWrite-CEO Matt Shumer ein Video von einem vollständig spielbaren Ego-Shooter, den das Modell ganz allein erstellt hatte.

"Claude Opus 5 hat dieses Spiel im Alleingang erstellt", schrieb er und fügte hinzu, dass kein einziges externes Asset in den Build eingeflossen sei.

Jetzt könnte man denken, dass eine so gute Qualität ein langes, detailliertes und sorgfältiges Prompt erforderte, um die KI-Modelle durch die Komplexität des Aufbaus eines polierten Ego-Shooters zu führen.

Denken Sie nochmal nach.

Das zugrunde liegende Prompt bestand aus drei kurzen Absätzen, die vollständig auf GitHub veröffentlicht wurden. Es sagte Opus 5, dass es einen Shooter auf dem Niveau der neuesten Call of Duty-Spiele erstellen soll, Subagenten zu fächern - Arbeiter, die jeweils ihr eigenes Gedächtnis und eine enge Aufgabe erhalten - um Teile einzeln zu bearbeiten, und um in jedem Teil mit einem separaten, strengen Kritiker zu wiederholen, bis es sich gegen echtes Call of Duty-Material in einem blinden Seitenvergleich behaupten konnte. Das Ergebnis sollte laut Prompt "völlig perfekt" sein.

Das ist eine Umkehrung dessen, wie Prompt-Ingenieure den Menschen beigebracht haben, zu arbeiten. Der Rat während des Boom des Vibe-Codings war, Kriterien anstelle von Adjektiven zu spezifizieren: sagen, was "gut" bedeutet, anstatt einfach danach zu fragen. Was sollte der Code berücksichtigen, anstatt zu sagen "AAA".

Shumers Version macht fast das Gegenteil, indem sie ihre eigenen Subagenten auffordert, "völlig begeistert" zu sein, und die tatsächliche Definition einem Kritiker überlässt, den Opus 5 für sich selbst erstellt hat.

Zwei Funktionen von Claude Code tragen diese Schleife. Subagenten werden in isolierten Kontextfenstern mit ihren eigenen Anweisungen und Werkzeugzugängen erstellt, sodass ein Kritiker, der das Waffenmodell bewertet, nicht die Ausreden des Erstellers erbt, warum es so aussieht, wie es aussieht. Ultracode ist eine Claude Code-Einstellung, die das Modell zu seiner besten Denkleistung anregt und es ihm ermöglicht, seinen eigenen Orchestrierungsplan zu schreiben, der die Arbeit auf bis zu 16 Agenten gleichzeitig verteilt, begrenzt auf 1.000 pro Durchlauf.

Anthropics integrierte /loop-Fähigkeit, die für wiederholte Fix-Test-Anpassungszyklen entwickelt wurde, verhinderte, dass der Durchlauf sofort gestoppt wurde, als das Spiel anständig aussah. Shumer gab nie eine Anzahl von Runden an. Er ließ den Kritiker weiterhin eine neue Lücke benennen und hielt den Ersteller stundenlang auf der Jagd, bevor er die Sitzung selbst schloss.

Der fertige Build läuft auf Three.js und einfachem WebGL2, mit ungefähr 55.000 Codezeilen, die sich über 11 Subsysteme verteilen. Jede Textur, jedes Mesh, jede Animation und jeder Sound wird beim Laden im Browser generiert - keine heruntergeladenen Modelle, HDRIs, Bilddateien oder Audiodateien. Shumers eigener veröffentlichter Kritikerbericht zeigt, dass die Punktzahl von 3,59 von 10 auf etwas über 5 ansteigt, wobei er in jeder einzelnen Runde hinter dem echten Spiel zurückbleibt.

Skeptiker gingen von Stunden verstecktem manuellem Codieren aus, also veröffentlichte Shumer das gesamte Prompt und die Codebasis. Das war der Moment, als die Nachahmer anfingen.

James Altucher, der ehemalige Hedgefonds-Manager und Podcaster, führte das identische Prompt aus und berichtete, dass er "etwas über zehn Stunden" und ungefähr 1,3 Millionen Tokens auf Opus 5 verwendet hat, um dorthin zu gelangen. Sein Build, Operation Blackout, spielt kostenlos im Browser und sieht großartig aus.

Der Entwickler von Prompt Silo richtete die gleiche Anfrage stattdessen an OpenAIs rivalisierendes Flaggschiff und postete "Sol 5.6 Ultra mit demselben Prompt" - Sol ist die oberste Stufe der drei-Modelle GPT-5.6-Familie, die OpenAI am 9. Juli zusammen mit günstigeren Terra- und Luna-Versionen allgemein verfügbar machte.

Entwickler Leon Lin versuchte den gegenteiligen Ansatz und ging für das übliche detaillierte Prompt. Anstatt Shumers kurze Version zu kopieren, machte er sich daran, "ein Prompt für dieses Spiel rückzuentwickeln", und produzierte ein Dokument, das etwa 20 Abschnitte tief ist und alles von Ragdoll-Physik bis hin zu kaskadierten Schattenkarten beschreibt. Er speiste das in Cursor ein, indem er einfach Opus 5 mit hohem Aufwand verwendete, ohne Subagenten und ohne Ultracode, und das Ergebnis - ein Marktszenario-Shooter namens Dust Corridor - spielt ebenfalls im Browser und sieht ebenfalls großartig aus.

Keiner der nachfolgenden Builds hat den blinden Test durchlaufen, den Shumer an seinem eigenen Projekt durchgeführt hat. Sein Kritikerprotokoll zeigt weiterhin, dass echtes Call of Duty jede Runde gewinnt, die er protokolliert hat - die Messlatte, die Altucher und Atom Tan Studio mit seinem genauen drei-Absatz-Prompt anstreben, und die Leon Lin mit ungefähr 20 Abschnitten seines eigenen anstrebt.

Wie viel davon ist tatsächlich neu?

Agentische Codierungswerkzeuge wie Claude Code schreiben Software so, wie es ein beaufsichtigter Junior-Ingenieur tun könnte: Sie lesen Dateien, führen Code aus, schauen sich die Screenshots an, die sie generieren, und übergeben Teile der Arbeit an Subagenten und Kritiker, die das Ergebnis mit einem festgelegten Ziel abgleichen. Diese Schleife ist real, und Shumers Gauntlet Loop ist eine echte Möglichkeit, sie zu strukturieren. Nichts davon beweist für sich allein, dass das Modell ein Spiel aus der Vorstellungskraft entworfen hat, anstatt Code-Muster zu kombinieren, die es bereits aufgenommen hat.

Das macht Claude of Duty nicht falsch, aber es macht die Behauptung "von Grund auf neu gebaut" schwieriger, vollständig zu bestätigen, also nehmen Sie diese Ergebnisse mit Vorsicht.

Forscher, die Modelle zur Code-Generierung untersuchen, haben einen Namen für das breitere Problem: Datenkontamination, wenn ein Modell bei einer Aufgabe gut abschneidet, hauptsächlich weil nahezu identische Beispiele bereits in seinen Trainingsdaten vorhanden sind, nicht weil es etwas Neues herausgearbeitet hat.

Keiner der veröffentlichten Ego-Shooter-Bauten hat einen Test auf diese Art von Kontamination durchgeführt. Shumers eigenes Repository enthält Claudes eigene Kreativität, wenn es fair ist, das so zu nennen. Das ist ein Grund, "ein AAA-Spiel im Alleingang erstellt" als fähigen Agenten zu lesen, der innerhalb eines der am besten dokumentierten Genres in der Programmierung arbeitet, nicht als Beweis, dass eine KI einen Shooter ohne vorherige Kunst entworfen hat.

---Preis

--

Dieser Inhalt wird nur zu allgemeinen Informationszwecken bereitgestellt und stellt keine finanzielle, Anlage-, Rechts- oder Steuerberatung dar. Alle erwähnten Ereignisse, Prämien, Online-Aktionen oder zugehörige Informationen sollten nicht als Empfehlung, Aufforderung oder Einladung zum Kauf, Verkauf, Handel oder anderweitigem Umgang mit Krypto-Assets betrachtet werden. Krypto-Assets sind sehr volatil und können zu Verlusten führen. Die Verfügbarkeit von WEEX Services, Produkten und zugehörigen Aktionen kann je nach Region unterschiedlich sein. Sie sind dafür verantwortlich sicherzustellen, dass Ihre Teilnahme mit geltenden lokalen Gesetzen und Vorschriften übereinstimmt.

Das könnte Ihnen auch gefallen

iconiconiconiconiconiconicon
Kundenservice:@weikecs
Geschäftliche Zusammenarbeit:@weikecs
Quant-Trading & MM:bd@weex.com
VIP-Programm:support@weex.com