Een AI-agent alles laten doen: waarom je hem grenzen moet geven

Inhoudsopgave
Wat er gebeurde in de test van Bright
Redacteur Andrei Stiru liet Claude Opus 5.5, het nieuwste grote model van Anthropic, in een week tijd drie muziekvideo’s maken. Hij beschrijft dat in een uitgebreide review op Bright van 8 oktober. Claude schreef de songteksten, Stiru liet Suno er liedjes van maken en gaf de tijdstippen van elk couplet door. Daarna schreef Claude duizenden regels code die de beelden een voor een berekenden. Voor één clip waren dat er volgens Stiru 7.392, uit ruim 5.500 regels code.
Bij de eerste video zette Stiru alle remmen los. Hij schreef dat Claude alles uit de kast mocht halen, zoveel tijd mocht nemen als nodig en op de hoogste instelling mocht werken. Het resultaat was indrukwekkend, maar het model wilde niet meer stoppen. Na de eerste volledige versie begon het de zwakste shots opnieuw te ontwerpen, en daarna nog eens. Na zeven uur was Stiru bang dat het twintig of dertig uur zou doorgaan. Hij gaf het nog twee uur om af te ronden.
Bij een tweede video ging het anders mis. Hij liet Claude een groot deel van de nacht doorwerken aan een clip over Van Gogh, en kreeg ’s ochtends een versie die op sommige punten beter was, maar op andere juist slechter dan de vorige. Het mooie slot was vervangen door iets wat minder werkte. Zijn eigen conclusie is nuchter. Er moet nog altijd een mens naast zitten.
Waarom meer vrijheid niet automatisch beter is
Het interessantste inzicht uit de review zit in een detail. Stiru dacht eerst dat Claude bij de latere video’s minder perfectionistisch was geworden, omdat hij nooit meer zeven uur aan een stuk werkte. Maar het model onthoudt niet hoe het de vorige keer werkte. Het verschil zat in zijn eigen opdracht. Bij de eerste clip had hij twee dagen lang de richting bepaald voordat hij de teugels losliet. Bij de andere gaf hij een deadline of liet hij het model zelf kiezen.
Dat is precies de les. Een agent of een model dat lang zelfstandig werkt, heeft geen gevoel voor wanneer iets goed genoeg is. Het gaat door zolang de opdracht dat toelaat. Zeg je dat het alles mag, dan doet het alles. Dat kost tijd, verbruikt je limieten en levert lang niet altijd een beter resultaat op. Stiru zat naar eigen zeggen bij een van de video’s op 99 procent van zijn limiet, vijf minuten voordat die weer vrijkwam.
Bij een muziekvideo is dat vooral jammer. Bij een agent die in je mailbox, je agenda of je bestanden werkt, ligt het anders. Daar betekent te veel vrijheid dat er dingen gebeuren die je niet wilde. Op Zendis schreven we eerder al over de tienduizenden incidenten met AI-agents en waar je op let als je er een inzet. De test van Bright laat zien dat het niet eens om fouten hoeft te gaan. Ook een agent die alles goed doet, kan te ver gaan.
Zo baken je een taak voor een AI af
Je hoeft geen programmeur te zijn om een agent of een lange AI-taak in toom te houden. Een paar gewoontes maken al veel verschil.
- Bepaal eerst de richting, daarna pas de vrijheid. Doe wat Stiru bij zijn beste video deed. Werk eerst in korte rondes aan de opzet, stuur bij, en geef pas daarna ruimte om uit te werken. Een model dat weet waar het naartoe moet, gebruikt extra tijd veel beter.
- Geef een stoppunt. Noem een tijd, een aantal versies of een concreet eindresultaat. “Lever één versie op en wacht dan op mijn reactie” werkt beter dan “maak het zo goed mogelijk”.
- Laat tussenversies bewaren. Vraag uitdrukkelijk om eerdere versies niet te overschrijven. Dan kun je terug als de nachtelijke verbetering een stap terug blijkt, zoals bij de clip over Van Gogh.
- Kijk naar wat de agent mag aanraken. Geef alleen toegang tot de mappen, accounts of apps die nodig zijn voor deze taak. Een agent die alleen een document mag lezen, kan niet per ongeluk een mail versturen.
- Laat hem vragen voor onomkeerbare stappen. Versturen, betalen, verwijderen en publiceren zijn handelingen waarbij je de agent laat stoppen en om bevestiging laat vragen. De meeste agents hebben daar een instelling voor.
- Houd je limieten in de gaten. Lange taken op de hoogste instelling gaan hard door je gebruikslimiet heen. Wie dat weet, kiest bewuster wanneer hij de zwaarste stand gebruikt.
Over wat er met het model zelf veranderd is, lees je meer in ons stuk over wat Opus 5.5 verandert. En wie zelf met muziek aan de slag wil, vindt in ons artikel over een liedje maken met Suno wat die tool echt oplevert.
De mens blijft de regisseur
Wat ik het sterkst vind aan de review van Bright is de eerlijkheid over de rolverdeling. Stiru bedacht de spanningsbogen van de liedjes, wees slechte teksten af, vertelde het model wat wanneer te horen was en stuurde steeds bij. Claude deed het rekenwerk en het uitwerken, vaak terwijl hij sliep. Dat is een prachtige taakverdeling, zolang je zelf de regie houdt.
Het is verleidelijk om een agent alles te laten doen, juist omdat hij zo veel kan. Maar het nut zit niet in de hoeveelheid werk die hij verzet. Het zit in werk dat de goede kant op gaat en stopt als het af is. Die grens trekt de AI niet zelf. Dat doe jij, met een duidelijke opdracht, een stoppunt en zo weinig toegang als nodig.





