ChatGPT in het Nederlands
ChatGPT Nederland Community

AI-model o3 blinkt uit

OpenAI’s nieuwste AI-model, o3, heeft in een studie aan de University of Maryland Francis King Carey School of Law cijfers van A+ tot B behaald voor acht tentamens. De resultaten tonen een sprong voorwaarts ten opzichte van eerdere versies van ChatGPT en roepen nieuwe vragen op over de rol van generatieve AI in juridisch onderwijs en toetsing.
AI-model o3 blinkt uit

Studieopzet

Zeven hoogleraren lieten o3 dezelfde voorjaars­tentamens maken als hun studenten. Het model draaide in een ‘reasoning’-modus die eerst mogelijke antwoorden genereert en intern herziet voordat het één definitief antwoord presenteert. Die aanpak verschilt wezenlijk van de directe tekstuitvoer van klassieke chatbots. Daardoor konden de onderzoekers nauwkeurig vergelijken hoe dicht de AI bij menselijke denkprocessen komt.

Van chatbot naar denker

Omdat o3 meerdere oplossingsroutes evalueert, kan het dieper redeneren en beter structureren. Dat verklaart waarom het model niet alleen meerkeuzevragen, maar ook essayvragen op hoog niveau wist te beantwoorden—een gebied waarop eerdere ChatGPT-versies vaak tekortschoten. Dit markeert een overgang van generatieve teksttool naar analytisch instrument.

Opmerkelijke resultaten

Het model scoorde A+ voor Constitutioneel Recht, Beroepsethiek en Goederenrecht, een A voor Inkomstenbelasting en een A- voor Strafprocesrecht. Met B+’s voor Zekerheidsrechten en Onrechtmatige Daad en een B voor Bestuursrecht haalde o3 in alle vakken minimaal een ruime voldoende. Daarmee evenaart of overtreft het de prestaties van de beste studenten. Zo’n spreiding onderstreept dat het systeem breed inzetbaar is in uiteenlopende rechtsdomeinen.

Beperkingen

Het enige relatief lagere cijfer, in Bestuursrecht, kwam doordat o3 de belangrijke uitspraak Loper Bright Enterprises v. Raimondo (2024) miste; die viel buiten de kennisgrens van het model. Op een ander examen zakte de score toen het programma extra docent­notities kreeg: de overvloed aan context bleek eerder afleidend dan behulpzaam. Dit toont dat actuele data en slim contextbeheer cruciaal blijven voor optimale prestaties.

Gevolgen voor onderwijs

Dat een AI-systeem nu tentamens op vlag- en wimpelniveau haalt, dwingt juridische faculteiten na te denken over nieuwe toetsvormen, ethische richtlijnen en manieren om academische integriteit te waarborgen. Traditionele openboek- of huiswerkopdrachten lopen het risico betekenis te verliezen als generatieve AI zulke prestaties kan leveren. Instellingen zullen waarschijnlijk investeren in proctoringsoftware en aangepaste evaluatiemethoden.

Vervolgonderzoek

De onderzoekers overwegen een nieuwe ronde waarbij o3 expres kleine spelfouten en stijlvariaties introduceert om te testen hoe moeilijk het is AI-werk van menselijk werk te onderscheiden. Zij hopen zo beter in kaart te brengen of en hoe AI als potentieel fraudemiddel kan worden ingezet. Daarmee willen zij praktische handvatten bieden voor docenten die AI-gebruik willen detecteren.

Reactie van OpenAI

OpenAI heeft vooralsnog geen officiële reactie gegeven op de studie. Het bedrijf benadrukt wel vaker dat o3 ontworpen is om redeneer­processen transparant te maken, wat in de toekomst extra mogelijkheden zou kunnen bieden om AI-antwoorden te verklaren en te controleren, vergelijkbaar met de ambitie achter chat gpt in nederlands. Een formele verklaring wordt later deze maand verwacht.