AI-bewaakt toelatingsexamen moet massaal over
Een van de grootste openbare universiteiten van Latijns-Amerika moet een toelatingsexamen op grote schaal overdoen. De Nationale Autonome Universiteit van Mexico (UNAM) roept ongeveer 58.000 kandidaten op voor een nieuwe, fysieke toets nadat de resultaten van haar eerste volledig online toelatingsexamen uitzonderlijk sterk afweken van eerdere jaren.
Dat gebeurde ondanks een afgesloten browser, identiteitscontrole, camera- en microfoontoezicht en AI die afwijkend gedrag moest signaleren. Het nieuws is daarom ook relevant voor Nederland en België: toezichtstechnologie kan een online toets streng laten ogen, maar is nog geen bewijs dat de toets werkelijk betrouwbaar, eerlijk en fraudebestendig is.
Van toegankelijk examen naar fysieke hertoets
Meer dan 158.000 kandidaten maakten in mei en juni vanuit huis een toelatingstoets van 120 meerkeuzevragen. UNAM koos voor de online vorm om deelname toegankelijker te maken voor jongeren buiten Mexico-Stad en uit het buitenland. Zij hoefden niet naar een fysieke toetslocatie te reizen, terwijl de universiteit minder mensen, locaties en vervoer hoefde te organiseren.
De digitale beveiliging was uitgebreid. Kandidaten moesten hun identiteit laten controleren en tijdens het examen hun camera en microfoon aanhouden. Een speciale browser blokkeerde andere programma's, internettoegang, kopiëren, plakken en schermafbeeldingen. AI maakte meldingen van mogelijk afwijkend gedrag; medewerkers van de universiteit beoordeelden die signalen voordat een besluit werd genomen. Daarnaast hield ongeveer één menselijke toezichthouder toezicht op 150 kandidaten.
Tijdens de afname werden ongeveer 3.000 examens ongeldig verklaard wegens gedrag dat tegen de regels inging. Toch ontstond na de uitslag een veel groter probleem. Volgens de nieuwe reconstructie van El País behaalde in de voorgaande jaren ongeveer 3 procent van de kandidaten ten minste 100 goede antwoorden. Bij het online examen steeg dat aandeel naar 16 procent. Het percentage kandidaten met minstens 110 goede antwoorden nam toe van 0,9 naar 5,5 procent.
Een commissie van zestien deskundigen adviseerde daarom een nieuwe toets op locatie. De oproep geldt voor kandidaten die een plaats behaalden en voor andere kandidaten die ten minste de historische toelatingsgrens van hun opleiding bereikten. Voor minder dan de helft van de ongeveer 58.000 deelnemers is uiteindelijk een studieplaats beschikbaar.
Opvallende scores zijn geen individueel fraudebewijs
De statistische afwijking is groot en rechtvaardigt onderzoek, maar vertelt nog niet wie precies fraudeerde of hoe dat gebeurde. De verdenking richt zich onder meer op generatieve AI, maar ook verboden aantekeningen, hulp van iemand buiten beeld, een tweede apparaat, internetgebruik of vooraf gelekte antwoorden worden als mogelijke verklaringen genoemd.
Daarom is het belangrijk om niet iedere hoge score automatisch aan ChatGPT of een andere AI-tool toe te schrijven. Ook een kandidaat die eerlijk en uitzonderlijk goed presteerde, moet nu opnieuw examen doen. De hertoets probeert de betrouwbaarheid van het selectieproces te herstellen, maar legt de last ook bij kandidaten die mogelijk niets verkeerd hebben gedaan.
UNAM heeft nog niet vastgesteld waar de beveiliging precies faalde. De AI-signalen konden gedrag binnen het zicht en gehoor van de gebruikte apparaten markeren, maar zij konden kennelijk niet garanderen dat iedere vorm van verboden hulp werd ontdekt. Dat verschil tussen toezicht houden en betrouwbaarheid garanderen is de kern van dit nieuws.
De kans van online toetsing blijft bestaan
Online toetsen kunnen drempels verlagen. Reizen, verblijf, fysieke beperkingen en de beschikbaarheid van toetslocaties spelen minder zwaar mee. Bij grote aantallen kandidaten kan digitale afname bovendien sneller en goedkoper te organiseren zijn. Voor formatieve toetsen en examens met beperkte gevolgen kan een online vorm goed passen, zeker wanneer studenten vanuit verschillende landen deelnemen.
AI kan daarbij een ondersteunende rol hebben. Een systeem kan grote aantallen videobeelden of technische gebeurtenissen voorselecteren en een menselijke toezichthouder wijzen op momenten die nader onderzoek verdienen. Logbestanden kunnen helpen om een incident te reconstrueren. Het is ook positief dat UNAM volgens de eigen uitleg over de afname geen examens automatisch door AI liet annuleren: medewerkers namen de uiteindelijke beslissing.
Maar die kansen gelden alleen wanneer de toetsvorm, de beveiliging en de gevolgen bij fouten in verhouding zijn. Hoe groter de impact van de uitslag, hoe sterker het bewijs moet zijn dat de afname meet wat zij moet meten en dat kandidaten onder vergelijkbare omstandigheden worden beoordeeld.
De risico's zijn breder dan spieken
Proctoring verwerkt potentieel gevoelige informatie. Camera en microfoon brengen niet alleen de kandidaat in beeld, maar ook de woning, huisgenoten, achtergrondgeluiden, hulpmiddelen en mogelijk gegevens over een beperking. Identiteitscontrole kan gezichtsgegevens verwerken. Scholen en instellingen moeten daarom vooraf weten welke gegevens worden verzameld, hoe lang ze worden bewaard, wie ze kan bekijken en hoe een kandidaat bezwaar kan maken.
Er is ook een toegankelijkheidsrisico. Niet iedere student beschikt over een stille kamer, stabiel internet, geschikte apparatuur of de mogelijkheid om voortdurend op dezelfde manier in beeld te blijven. Gedrag dat voor de ene kandidaat verdacht lijkt, kan bij een andere kandidaat samenhangen met een beperking, stress, zorgtaken of de thuissituatie.
Daarnaast kan intensief toezicht schijnzekerheid geven. Een afgesloten browser beschermt alleen het gebruikte apparaat. Een camera toont slechts een deel van de ruimte. Een AI-alarm kan legitiem gedrag markeren en tegelijk verboden hulp missen. Wanneer bestuurders vooral een lange lijst beveiligingsfuncties zien, kan de vraag naar empirische validatie en een noodscenario te weinig aandacht krijgen.
Direct relevant voor Nederland en België
De casus gaat over Mexico, maar de ontwerpvragen zijn hetzelfde bij Nederlandse en Belgische toelatingstoetsen, examens, certificering en grootschalige digitale selecties. Instellingen moeten niet alleen vragen welke proctoringsoftware beschikbaar is, maar aantonen welke dreigingen het systeem werkelijk afdekt en welke niet.
Onder de Europese AI-verordening geldt AI die verboden gedrag tijdens toetsen monitort of detecteert als een hoog-risicotoepassing. De zwaarste nieuwe verplichtingen voor zulke zelfstandige systemen zijn onlangs [uitgesteld tot 2 december 2027](/post/eu-stelt-regels-hoog-risico-ai-onderwijs-uit), maar dat uitstel maakt een onzorgvuldig examen vandaag niet verantwoord. De AVG, onderwijs- en examenregels en de verantwoordelijkheid voor een eerlijke beoordeling gelden al.
Voor examencommissies, toetsdeskundigen en bestuurders zijn daarom enkele lessen direct bruikbaar:
- valideer de volledige toetsketen voordat een hoog-impacttoets op grote schaal online gaat;
- beschrijf expliciet wat AI-proctoring wel en niet kan waarnemen;
- behandel een AI-signaal of opvallende score als aanleiding voor onderzoek, niet als zelfstandig fraudebewijs;
- bied kandidaten vooraf duidelijke informatie, een werkbare oefenomgeving en passende ondersteuning;
- beperk camera-, audio-, identiteits- en loggegevens tot wat aantoonbaar noodzakelijk is;
- organiseer menselijke beoordeling, bezwaar en een herstelroute voor onterechte signalen;
- maak vooraf een noodscenario voor technische uitval, een datalek, vermoedelijke antwoordlekkage of statistisch onwaarschijnlijke uitslagen;
- overweeg bij zeer belangrijke beslissingen een combinatie van bewijs, zoals een fysieke of mondelinge verificatie, in plaats van volledig te vertrouwen op toezicht op afstand.
De kern
UNAM wilde haar toelatingsexamen toegankelijker en schaalbaarder maken en combineerde daarvoor online afname met menselijke en AI-ondersteunde controle. De beveiliging ontdekte duizenden overtredingen, maar kon niet voorkomen dat de totale uitslag zo sterk afweek dat ongeveer 58.000 kandidaten opnieuw moeten toetsen.
De precieze oorzaak is nog niet vastgesteld. Juist dat maakt de les belangrijk: AI-proctoring is geen garantie tegen fraude en een statistische afwijking is geen individueel bewijs. Betrouwbare toetsing vraagt om valide toetsontwerpen, proportionele gegevensverwerking, menselijke controle, transparantie en een herstelplan wanneer technologie of aannames tekortschieten.