Hoe accuraat zijn door AI geschreven tentamenvragen? Wat echte opdrachten laten zien
Every question this site writes is checked before a student sees it, and the checks keep a count. This is what the 10 days since of real jobs on medical textbooks, lecture decks and notes show: how many questions a model writes that cannot be traced to the page, that a second model answers differently, or that repeat one already written.
De cijfers, geteld uit het logboek
| What the checks counted | Share of questions written |
|---|---|
| Questions the models wrote | 6,183 in 2,459 calls |
| Kept, every check passed | 44.0% |
| Thrown out, all reasons | 56.0% |
| Citaat niet gevonden op de aangehaalde pagina | 6.5% |
| Second model answered differently | 5.4% |
| Repeat of a question already written | 11.2% |
| Structural flaw (all of the above, a vague stem, an option that gives itself away) | 30.9% |
Counted from the call log over September 14, 2026 to September 24, 2026, refreshed twice an hour. The same report, split by model family and with a CSV, is on the rejection rates page.
Wat elke afwijzing betekent
Citaat niet gevonden op de genoemde pagina. Elke vraag moet een of twee zinnen dragen die letterlijk uit het document zijn overgenomen, met de pagina waarop ze staan. De server zoekt de zin op in de opgeslagen tekst van die pagina. Staat hij er niet, dan heeft het model een vraag geschreven over iets wat het materiaal niet zegt, of de formulering verkeerd onthouden, en vervalt de vraag. Dit is de controle die een verzonnen feit vangt.
Tweede model antwoordde anders. Een model uit een andere familie krijgt de vraag en de citaten, en verder niets: geen antwoordsleutel, geen document. Kan het uit de citaten alleen niet bij het gekozen antwoord komen, dan bewijzen de citaten het antwoord niet en vervalt de vraag. Dit is de controle die een goed klinkende vraag met de verkeerde antwoordsleutel vangt, of een sleutel die het citaat niet ondersteunt.
Herhaling van een vraag die al geschreven is. Elke nieuwe vraag wordt vergeleken met alles wat al uit het document is gegenereerd. Een bijna-herhaling vervalt, zodat een lange reeks verschillende vragen geeft in plaats van dezelfde feiten opnieuw verwoord.
Structurele fout. "Alle bovenstaande", "geen van de bovenstaande", een vraagstam die vraagt welke uitspraak waar is, een optie die opvallend langer is dan de andere, een vraag die verwijst naar "de tekst". Dit zijn de signalen die examinatoren leren weg te halen, en hier worden ze per regel weggehaald voordat de andere controles draaien. De MCQ-foutencheck past dezelfde regels toe op elke vraag die je plakt.
Waarom een generator die geen citaat toont, je zijn accuratesse niet kan noemen
Een hulpmiddel dat je een toets geeft zonder de zin waaruit elke vraag komt, kan niet tellen hoeveel van zijn vragen niet werden ondersteund, omdat niets in zijn proces heeft gekeken. De accuratesse ervan is wat je vindt als je de vragen zelf controleert, en dat is precies het werk dat je wilde uitbesteden. De eigen helppagina van een concurrerend hulpmiddel vraagt gebruikers een gegenereerde toets na te kijken voordat ze erop vertrouwen, wat het eerlijke antwoord is als er niets is gecontroleerd. De cijfers hierboven bestaan omdat de controle gebeurt voordat de student iets ziet, en omdat wat werd verworpen is geteld in plaats van stilletjes weggelaten.
Hoe je zelf in twintig seconden een AI-vraag controleert
- Zoek de zin. Laat de vraag niet zien waar ze vandaan komt, zoek dan in het document naar de kernzin. Staat die er niet, dan komt de vraag niet uit jouw materiaal.
- Dek de antwoordsleutel af en beantwoord de vraag uit het citaat. Lees alleen de geciteerde zin en kies een optie. Als het citaat het niet beslist, toetst de vraag iets wat het citaat niet zegt.
- Kijk naar de opties. Eén optie die veel langer is dan de rest, een optie die de vraagstam herhaalt, "alle bovenstaande": het zijn allemaal signalen, en elk is een reden om de vraag te wantrouwen in plaats van er iets van te leren.
Wat het betekent voor tentamenvoorbereiding
Een set vragen die deze controles heeft doorstaan, is een set waarop je kunt oefenen zonder het hoofdstuk opnieuw te lezen om te controleren of elke vraag echt is. Het afgewezen deel is geen verspilde moeite; het is het deel van elke door AI gegenereerde vragenbank waaruit een student met een ongecontroleerd hulpmiddel zou hebben geleerd. Het gratis plan op deze site draait dezelfde controles op elke vraag die het schrijft, en de voorbeeldpagina toont er drie die het hebben doorstaan, met de pagina die elke vraag citeert.
Vragen die studenten stellen
Betekent een hoog afwijzingspercentage een slecht model?
Niet op zichzelf. Een model dat ambitieuze klinische casussen schrijft, verliest er meer aan het tweede model dan een model dat reproductievragen schrijft, en een lange reeks uit een kort hoofdstuk verliest vragen aan de duplicaatcontrole omdat het hoofdstuk maar een beperkt aantal feiten bevat. Het percentage is een eigenschap van het model, het materiaal en de reeks samen, en daarom wordt het rapport gepubliceerd met het aantal waaruit het is geteld.
Zijn de vragen die slagen gegarandeerd juist?
Nee. De controles vangen een vraag waarvan het citaat niet op de genoemde pagina staat, een vraag die een tweede model anders beantwoordt dan de sleutel, een vraag die een eerdere herhaalt, en een reeks structurele fouten. Ze kunnen de geneeskunde niet beoordelen. Daarom wordt elke behouden vraag getoond met haar citaat en paginanummer, zodat de student de regel kan lezen waaruit de vraag komt.
Waarom telt een herhaalde vraag als afwijzing?
Omdat een generator die om veertig vragen uit een handout van twaalf pagina’s wordt gevraagd, dezelfde twaalf feiten in andere woorden herhaalt als niets dat tegenhoudt. Elke nieuwe vraag wordt vergeleken met alles wat al uit het document is geschreven, en een bijna-herhaling vervalt in plaats van als nieuwe oefening aan de student te worden gegeven.
Waar zijn de ruwe gegevens?
De pagina met afwijzingspercentages publiceert het rapport per modelfamilie en per baan met een CSV-download, en de cijfers op deze pagina komen uit hetzelfde rapport. Het logboek wordt bijgehouden sinds 14 september 2026.
Bekijk de percentages per model
Geen account nodig om het te proberen. Registreren bewaart je bibliotheek, cijfers en herhalingswachtrij op al je apparaten.
Gepubliceerd , bijgewerkt .