Beitrag von Context Studios - KI Development Studio & Agentur Berlin

Ein Spiel aus dem Jahr 1998 legt jede moderne KI offen. Der Brood-War-Bench lässt Codex, Claude und Grok in 19 Konfigurationen antreten, wobei keines über das Anfängerniveau hinauskommt. Die Ursache ist typisch für Agentensysteme: Das Denkmodell benötigt 11.000 Tokens in 43 Minuten, aber nur sechs Befehlsserien erreichen das Spiel. ❌ 11.000 Denk-Tokens und sechs Aktionen sind zu langsam für die Runde. ✅ Wenige, frühe und richtige Aktionen führen zum Sieg, denn der Gewinner lief mit etwa 13 Aktionen pro Minute. Prüft jede Agentenarchitektur mit diesem Raster: ``` Ebene 1 (Minutentakt, Welt wartet): Planung → Denkmodell Ebene 2 (Sekunden, Welt wartet nicht): Reaktion → Reflex-Code Erste Frage: Wartet meine Welt, während das Modell nachdenkt? ``` Im Echtzeitbetrieb zeigen sich drei Fehlermuster: Die Antwort folgt erst nach dem Reasoning-Absatz, sie gilt einer Welt, die es nicht mehr gibt, und Unteragenten ohne geteilten State sterben nacheinander. Misst statt zu vermuten: 10,5 $ gegen 0,30 $ je Partie bedeuten das 30-Fache an Kosten für dieselbe Klasse. Bei Context Studios bauen wir Agenten zweischichtig: Das Denkmodell gibt den Takt vor, Reflexe laufen als Code, und ein gemeinsamer State dient als Gehirn. #AIAgents #ContextStudios

  • graphical user interface

Zum Anzeigen oder Hinzufügen von Kommentaren einloggen