Sluiten

Onderzoek: ChatGPT en kritisch denken versterken elkaar op verschillende manieren

OpenAI beschrijft een nieuw gerandomiseerd experiment waarin ChatGPT en training in causaal redeneren verschillende verbeteringen in studentenwerk opleverden. ChatGPT maakte antwoorden samenhangender en meer expertachtig; de training hielp studenten vooral om gevarieerdere ideeën en explicietere redeneringen te ontwikkelen.

Voor onderwijsprofessionals in Nederland en België is dat relevant omdat het onderzoek een veelbesproken tegenstelling nuanceert. De vraag is niet alleen of studenten AI mogen gebruiken, maar ook welke denkvaardigheden onderwijs en beoordeling zichtbaar moeten maken wanneer een taalmodel een deel van het werk ondersteunt.

Wat er nieuw is

OpenAI publiceerde de resultaten op 27 augustus 2026. De onderliggende preprint beschrijft een vooraf geregistreerde 2×2-gerandomiseerde studie met 1.053 eerstejaarsstudenten economie, management en finance aan Bocconi University. Studenten werden per klas toegewezen aan ChatGPT Edu met GPT-4o, een korte training in causaal redeneren, beide interventies of geen van beide.

Daarna schreven zij in 45 minuten maximaal 180 woorden met marketingadvies voor de universiteitswinkel. Getrainde menselijke beoordelaars gebruikten een vijfpuntsschaal; daarnaast vergeleken onderzoekers ideeën, redeneringen en overeenkomst met aanbevelingen van drie domeinexperts. De studie is een preprint van de onderzoekers van Bocconi University en OpenAI, geen onafhankelijk bewijs dat ChatGPT in iedere onderwijscontext leerwinst oplevert.

Twee verschillende effecten

Studenten met toegang tot ChatGPT scoorden gemiddeld ongeveer 0,86 punt hoger op de vijfpuntsschaal dan de controlegroep, waarvan de geschatte score 2,09 was. Hun teksten bevatten meer ideeën, vertoonden meer samenhangende logica en leken sterker op aanbevelingen van experts. Volgens de onderzoekers kwam ongeveer de helft van het ChatGPT-effect niet alleen door stijlkenmerken zoals samenhang of het aantal ideeën.

De training in causaal redeneren werkte anders. Studenten legden vaker mechanismen uit, benoemden beter onder welke omstandigheden een idee niet zou werken en produceerden meer uiteenlopende ideeën. Die kwaliteiten verhoogden in deze studie de standaardbeoordeling van het marketingadvies niet. De rubric beloonde vooral conventionele, goed aansluitende oplossingen en maakte originaliteit minder zichtbaar.

De combinatie was niet simpelweg een optelsom in de eindscore. ChatGPT bleef vooral samenhang en het aantal ideeën ondersteunen, terwijl de training de variatie en het expliciet onderzoeken van aannames versterkte. De onderzoekers concluderen dat toegang tot een taalmodel en het ontwikkelen van menselijke denkvaardigheden elkaar kunnen aanvullen.

Wat dit betekent voor onderwijs

Voor docenten en opleidingen zit de belangrijkste les bij de opdracht en de beoordeling. Een gepolijst eindantwoord zegt minder over wat een student zelfstandig begrijpt wanneer AI toegang heeft tot goed beschreven, bekende taken. Laat daarom waar passend niet alleen het eindproduct beoordelen, maar ook de gekozen aanpak, tussenstappen, bronnen, aannames en mondelinge toelichting.

De studie laat ook zien dat een rubric een deel van het leren kan missen. Wie alleen helderheid en aansluiting op een standaardantwoord beloont, ziet niet vanzelf of een leerling meerdere verklaringen onderzoekt, een grensgeval herkent of met een onverwachte oplossing komt. Teams kunnen daarom naast juistheid en structuur ook argumentatie, falsifieerbaarheid, originaliteit en het kunnen weerleggen van een eigen idee expliciet maken.

In het hoger onderwijs sluit de onderzochte populatie direct aan bij eerstejaarsstudenten, maar de taak was een afgebakend marketingprobleem. Voor PO, VO en MBO is dit geen rechtstreeks effectbewijs. Wel biedt het een bruikbaar ontwerpprincipe: train denkvaardigheden los van een tool en ontwerp daarna opdrachten waarin leerlingen moeten laten zien hoe zij AI-uitvoer beoordelen en verbeteren.

Risico's en grenzen

ChatGPT maakte studentenwerk in deze taak professioneler, maar dat betekent niet dat studenten de onderliggende vakkennis of het vermogen om fouten te herkennen automatisch opbouwen. Een taalmodel kan een overtuigende aanbeveling geven die niet past bij de lokale context, de doelgroep of het leerdoel. Menselijke vakinhoudelijke controle blijft nodig.

Voor toetsing is het risico groter wanneer alleen een thuis ingeleverd eindproduct telt. AI-gebruik kan verschillen in toegang, ervaring en ondersteuning versterken. Spreek daarom vooraf af welke AI-hulp is toegestaan, welke gegevens niet in een tool mogen worden ingevoerd en welk deel van het redeneren zichtbaar of zelfstandig moet gebeuren. Gebruik geen herleidbare leerling- of studentinformatie in een onbeoordeelde persoonlijke omgeving.

De bron komt van OpenAI, dat betrokken was bij het onderzoek. De studie is bovendien uitgevoerd onder eerstejaarsstudenten aan één universiteit, met één marketingtaak en een rubric die conventionele oplossingen relatief zwaar liet meetellen. De uitkomsten zijn dus interessant voor curriculum- en toetsontwerp, maar geen algemene ranglijst van menselijk denken versus AI.

Wat teams nu kunnen afspreken

  • Laat leerlingen eerst zelf een probleemstructuur, hypothese of oplossingsrichting maken voordat AI beschikbaar komt.
  • Vraag bij toegestaan AI-gebruik om een korte verantwoording: welke suggesties zijn overgenomen, verworpen of gecontroleerd?
  • Beoordeel niet alleen een glad eindantwoord, maar ook aannames, tegenvoorbeelden, bewijs en alternatieve routes.
  • Gebruik mondelinge of procesgerichte momenten wanneer het leerdoel zelfstandig redeneren is.
  • Test een nieuwe rubric eerst met werk mét en zonder AI en kijk welke vormen van originaliteit of denkfouten zij mist.
  • Beperk invoer tot noodzakelijke, niet-herleidbare informatie en leg vast welke tool en welk accounttype is toegestaan.

De kern

In een gerandomiseerd experiment met 1.053 eerstejaarsstudenten verbeterde ChatGPT vooral de samenhang, het aantal ideeën en de overeenkomst met expertachtige antwoorden. Training in causaal redeneren maakte ideeën gevarieerder en verklaringen kritischer, maar die kwaliteiten werden niet vanzelf beloond door de standaardrubric.

Voor scholen en opleidingen is de praktische conclusie daarom dubbel: laat studenten AI leren gebruiken én blijf expliciet trainen in redeneren, aannames en originaliteit. Als onderwijs alleen het gepolijste eindantwoord beoordeelt, blijft een belangrijk deel van het leren buiten beeld.