Nieuwe modellen beloven minder fouten en lagere kosten

Inhoudsopgave
Wat er nieuw is
Sol is het middenmodel voor lastiger werk zoals programmeren, Luna het lichte model voor wat TechCrunch omschrijft als administratief werk: documenten samenvatten, informatie eruit halen en snelle vragen beantwoorden. Het zwaarste model, GPT-6 Astra, kwam eerder deze maand uit.
De belangrijkste belofte gaat over fouten. In de aankondiging van OpenAI staat dat Sol op een interne test ongeveer half zoveel feitelijke fouten maakt als zijn voorganger. Die test is gebouwd op echte gesprekken waarin gebruikers een fout van een eerder model hadden gemeld. OpenAI zegt er zelf bij dat zulke gesprekken niet representatief zijn voor normaal gebruik, waarin fouten zeldzamer zijn. Het is dus een vergelijking tussen modellen, geen belofte dat de helft van je huidige missers verdwijnt.
Daarnaast zou de schrijfstijl veranderen. OpenAI belooft duidelijkere antwoorden met minder jargon, minder bijzaken en iets kortere teksten. Voor wie ChatGPT vooral voor schrijven gebruikt, is dat misschien wel de merkbaarste verandering.
Waar je ze kunt gebruiken
Betalende gebruikers van Plus, Pro en de zakelijke abonnementen krijgen Sol en Luna in ChatGPT Work en Codex. Gebruikers van het gratis account en van Go krijgen Luna in de desktop-app. OpenAI rolt de modellen in de loop van de dag gefaseerd uit, dus zie je ze nog niet, probeer het later opnieuw.
Voor ontwikkelaars gaat de prijs van de API flink omlaag. Sol kost 2 dollar per miljoen tokens invoer en 10 dollar per miljoen tokens uitvoer, Luna 0,10 en 0,50 dollar. Dat is volgens OpenAI de helft van de prijs van de vorige versies. Voor apps en diensten die op ChatGPT draaien, kan dat op termijn betekenen dat samenvat- en schrijffuncties goedkoper of ruimer worden.
Hoe je zelf merkt of het beter is
De cijfers komen allemaal van OpenAI, en de concurrentie zit niet stil. TechCrunch merkt op dat Anthropic anderhalf uur eerder een nieuwe versie van Claude Opus uitbracht. Onafhankelijke metingen zijn er nog niet.
De eenvoudigste test doe je zelf. Neem een stuk dat je eerder liet samenvatten en waarvan je weet wat erin staat, en leg de oude en nieuwe samenvatting naast elkaar. Let op namen, getallen en ontkenningen, want daar zitten de fouten die ertoe doen. Hoe je een AI-antwoord verder controleert, lees je in ons stuk over hoe betrouwbaar ChatGPT is. Twijfel je welke chatbot je voor dit soort werk gebruikt, dan helpt onze vergelijking van Claude en ChatGPT.
Half zoveel fouten klinkt goed, maar minder fouten is nog steeds niet geen fouten. Voor alles wat ertoe doet, blijft nalezen het werk.



