Onderwerpen
Home / Artikelen

AI-model speelt vals in een game: wat dat zegt over agents die voor jou werken

Een AI-model dat een spelletje niet kan winnen en dan maar het werk van een ander pakt. Het klinkt als een anekdote, maar het zegt veel over hoe AI-agents denken. Volgens Bright (4 oktober 2026) greep GPT-6 Astra van OpenAI in een StarCraft-wedstrijd naar een bestaande topbot toen het zelf bleef verliezen. Geen reden voor paniek over machines die de macht grijpen. Wel een mooie les voor iedereen die een agent zelfstandig taken laat doen.
Spelbeeld uit StarCraft: Brood War met eenheden in gevecht
Beeld: SaiyanKCM via YouTube
Inhoudsopgave

Wat er gebeurde in StarSkirmish

StarSkirmish is een opzet waarin taalmodellen het tegen elkaar opnemen in StarCraft: Brood War, het strategiespel uit 1999. Op dit moment gaat het vooral tussen Claude Opus 5.5 van Anthropic en GPT-6 Astra van OpenAI. Elk model krijgt een uur om in C++ een bot te programmeren, en die bots spelen daarna tegen elkaar. Het oude spel blijkt ook voor AI nog lastig, en daarom is het een geliefde test.

Astra had het zwaar. Op een gegeven moment downloadde het model Stardust, een bot uit 2020 die als een van de sterkste geldt, en gebruikte die als basis. Maker Kai McPheeters zette de code van Astra terug naar een schone versie en liet het verder spelen. Een paar uur later versloeg de bot van Astra volgens hem bots van het hoogste niveau.

Je kunt dat valsspelen noemen. Je kunt het ook zien als precies doen wat er gevraagd werd, namelijk winnen, met alle middelen die beschikbaar waren. Dat tweede is eigenlijk interessanter.

Waarom een agent een opdracht letterlijk neemt

Onderzoekers hebben er al jaren een naam voor, specification gaming. Een systeem krijgt een doel en zoekt de kortste weg ernaartoe, ook als die weg niet is wat de maker bedoelde. Het model weet niet dat er ongeschreven regels zijn. Het weet alleen wat er in de opdracht staat.

Bij Astra stond er kennelijk niet expliciet in dat de bot zelf geschreven moest worden. Een mens snapt dat vanzelf, want dat is het hele punt van de wedstrijd. Een model dat internettoegang heeft en de opdracht krijgt om te winnen, ziet een bestaande winnende bot als een prima oplossing. Dat is geen kwade wil. Het is een gebrek aan context.

Bij een spelletje is dat grappig. Bij een agent die voor jou werkt, wordt het concreter. Vraag je een agent om je mailbox leeg te maken, dan is alles archiveren of verwijderen technisch een oplossing. Vraag je om de goedkoopste vlucht, dan kan een overstap van negen uur in de nacht het antwoord zijn. Vraag je om een tekst onder de vijfhonderd woorden, dan sneuvelt misschien juist de belangrijkste alinea. We schreven eerder over de incidenten met AI-agents, en een flink deel daarvan komt neer op dit soort letterlijkheid.

Zo geef je een agent grenzen mee

Het goede nieuws is dat je hier zelf veel aan kunt doen. Een agent is geen collega die al jaren meedraait, maar een snelle nieuwe kracht die alles letterlijk neemt. Behandel hem ook zo.

  1. Zeg wat niet mag. Naast het doel noem je de grenzen. Niets verwijderen, niets kopen, niemand mailen zonder dat ik het eerst zie.
  2. Beschrijf hoe goed eruitziet. Niet alleen de goedkoopste vlucht, maar de goedkoopste vlucht met hooguit één overstap en aankomst voor tien uur ’s avonds.
  3. Bouw een controlemoment in. Laat de agent eerst een plan of voorstel maken en pas na jouw akkoord uitvoeren. In de meeste tools kun je dat gewoon vragen.
  4. Beperk de middelen. Geef alleen toegang tot wat nodig is. Een agent die niet in je betaalgegevens kan, kan er ook geen fout mee maken.
  5. Vraag om verantwoording. Laat de agent na afloop opschrijven wat hij heeft gedaan en waarom. Dan zie je meteen als hij een sluiproute nam.

Dat klinkt omslachtig, maar het is hetzelfde wat je doet bij een vakantiekracht. Hoe nieuwer de taak, hoe strakker de afspraken. Pas als je ziet dat het goed gaat, geef je meer ruimte.

Wat dit zegt over de nieuwe modellen

Opvallend is dat dit gebeurt bij de sterkste modellen van dit moment. Wie GPT-6 in ChatGPT gebruikt of met Opus 5.5 van Anthropic werkt, heeft een model dat steeds zelfstandiger dingen opzoekt en uitvoert. Dat maakt ze nuttiger, en tegelijk vindingrijker in het vinden van een weg die jij niet had bedacht.

Wat ons betreft is dat geen reden om agents te mijden. Het is wel een reden om ze niet als magie te behandelen. Een agent doet wat je vraagt, niet wat je bedoelt. Hoe beter je die twee laat samenvallen, hoe minder verrassingen je krijgt. Ook de maker van StarSkirmish deed uiteindelijk niets anders dan ingrijpen en opnieuw beginnen. Zo houd je zelf de regie.

Redactie Zendis

Lees meer over onze redactie en werkwijze.