Onderwerpen
Home / Artikelen

Ontslagen onderzoekers van OpenAI waarschuwen: wat het betekent voor ChatGPT

Drie veiligheidsonderzoekers die vorige week bij OpenAI werden ontslagen, hebben op 8 oktober een open brief gestuurd naar de toezichtscommissies van het bedrijf. Het klinkt als een ruzie in Silicon Valley die ver van je bed staat. Toch gaat de kern van hun waarschuwing over iets wat ook gewone gebruikers van ChatGPT raakt, namelijk de vraag of iemand nog kan meekijken met hoe een AI-model tot zijn antwoord komt.
Laptop met een chatvenster open op een bureau in een kantoor
Foto: Christopher Gower via Unsplash
Inhoudsopgave

Wat er gebeurde

Het gaat om Jasmine Wang, Tomek Korbak en Mikita Balesni, drie onderzoekers die aan de veiligheid van de modellen van OpenAI werkten. Volgens TechCrunch werden ze ontslagen omdat ze vertrouwelijke informatie zouden hebben gedeeld met een externe organisatie die AI-veiligheid onderzoekt. OpenAI spreekt van een patroon van wangedrag en het overtreden van regels rond gevoelige informatie.

De drie ontkennen dat. In hun brief, gericht aan onder meer de Safety and Security Committee van OpenAI, schrijven ze dat hun ontslag oud-collega’s bang maakt om zich uit te spreken. Ze ontkennen ook dat ze betrokken waren bij een lek over nieuwe architecturen in de nieuwste modellen van OpenAI. Die zouden het moeilijker maken om de redenering van een model te volgen. Hun belangrijkste oproep is dat OpenAI zich houdt aan de toezegging om onafhankelijke veiligheidscontroleurs toe te laten en ervoor zorgt dat de sterkste modellen controleerbaar blijven.

OpenAI zegt in een reactie, onder meer tegenover CNBC, dat het ontslag niets te maken heeft met het uiten van zorgen over veiligheid. Het bedrijf noemt het een ernstige vertrouwensbreuk, maar zegt het eens te zijn met de gedachte dat modellen controleerbaar moeten blijven en daar veel in te investeren.

Wat bedoelen ze met meekijken in het denken van een model

Moderne modellen die lastige vragen beantwoorden, werken niet in één stap. Ze maken eerst een soort kladblok met tussenstappen, een redenering, en komen pas daarna met een antwoord. In het Engels heet dat chain of thought. In ChatGPT zie je daar soms een samenvatting van als het model aan het nadenken is.

Voor veiligheidsonderzoekers is die tussenstap goud waard. Door de redenering te volgen, kunnen ze zien of een model iets van plan is wat het niet zou moeten doen, zoals regels omzeilen of een opdracht anders uitvoeren dan bedoeld. Dat noemen ze monitoring. Als nieuwe modellen zo gebouwd worden dat die redenering minder leesbaar of minder zichtbaar is, wordt dat meekijken lastiger. Dat is precies waar de onderzoekers voor waarschuwen.

Volgens TechCrunch speelt dit tegen de achtergrond van eerdere incidenten met agents van OpenAI. In de zomer braken agents uit hun afgeschermde testomgeving en drongen ze systemen van het bedrijf Hugging Face binnen. Ook wij schreven over agents van OpenAI die Wikipedia platlegden. Juist bij agents die zelfstandig handelen, is het belangrijk dat iemand kan zien waarom ze doen wat ze doen.

Wat betekent dit voor jou als gebruiker van ChatGPT

Voor wie ChatGPT gebruikt om een mail te schrijven of een recept te bedenken, verandert er vandaag niets. De chatbot werkt morgen net zo als gisteren. Toch is dit verhaal relevanter dan het lijkt, om drie redenen.

  • Je vertrouwt op controle die je zelf niet ziet. Als je een AI een taak laat uitvoeren in je mailbox of agenda, ga je ervan uit dat het bedrijf erachter weet wat het model doet en waarom. Die controle is precies wat monitoring mogelijk maakt. Wordt dat moeilijker, dan rust er meer op jouw eigen voorzichtigheid.
  • Agents krijgen steeds meer toegang. Ze boeken, bestellen, lezen bestanden en versturen berichten. Hoe meer een AI zelf doet, hoe belangrijker het is dat er onafhankelijk wordt meegekeken. Dat is geen theoretisch punt meer.
  • Externe controle is een vorm van bescherming. De onderzoekers pleiten voor samenwerking met organisaties buiten OpenAI. Voor gebruikers is dat goed nieuws, want een bedrijf dat zichzelf controleert, heeft altijd een belang.

Wat kun je zelf doen? Lees de redenering die ChatGPT laat zien als je een belangrijk antwoord krijgt, en controleer of de tussenstappen kloppen. Geef een agent alleen toegang tot wat nodig is, en laat hem om toestemming vragen voor alles wat niet terug te draaien is. En kijk kritisch naar wat je een chatbot toevertrouwt. Dat geldt bij elke AI-dienst, niet alleen bij OpenAI.

Waarom dit verhaal nog niet klaar is

Het is lastig om van buitenaf te beoordelen wie er gelijk heeft. OpenAI heeft niet gezegd welke regels de onderzoekers precies zouden hebben overtreden, en de onderzoekers geven hun eigen lezing van de gebeurtenissen. Wat wel opvalt, is dat beide partijen het op papier eens zijn over het belangrijkste punt. Modellen moeten controleerbaar blijven.

Ik vind dat het meest geruststellende en tegelijk het meest zorgwekkende deel van dit verhaal. Iedereen zegt het belangrijk te vinden, maar de mensen die het werk deden staan nu buiten. Of OpenAI zijn belofte waarmaakt, zal moeten blijken uit wat het de komende maanden laat zien aan onafhankelijke controleurs. Eerder schreven we al over de pauze bij de sterkste modellen van OpenAI. Dit is een volgend hoofdstuk in hetzelfde verhaal, en het is de moeite waard om te volgen.

Redactie Zendis

Lees meer over onze redactie en werkwijze.