Afwijzingspercentages per modelfamilie
Elke vraag die voor deze site wordt geschreven gaat door dezelfde controles, welk model ze ook schreef. Dit is hoeveel er per modelfamilie sneuvelen, over de laatste 30 dagen, met het aantal waaruit de percentages zijn geteld.
Deze percentages worden geteld uit het aanroeplogboek, dat wordt bijgehouden sinds 14 september 2026. De lopende totalen die elders op de site staan tellen elke vraag sinds de site op 11 september 2026 openging, dus de twee sets cijfers beslaan verschillende periodes en horen niet bij elkaar op te tellen.
Geteld van tot : 2.459 generatieaanroepen die 6.183 vragen opleverden. Een familie wordt gepubliceerd zodra ze in de periode 200 vragen heeft opgeleverd; daaronder zegt de pagina dat, in plaats van een percentage uit een handvol aanroepen te tonen.
| Modelfamilie | Geschreven vragen | Citaat niet gevonden op de aangehaalde pagina | Tweede model was het oneens | Dubbel | Gebrek | Niet gevraagd of te laat | Geaccepteerd |
|---|---|---|---|---|---|---|---|
| qwen | 4,583 | 6.2% | 6.1% | 14.0% | 28.9% | 2.1% | 42.7% |
| deepseek | 503 | 14.3% | 3.0% | 2.4% | 11.5% | 2.0% | 66.8% |
| glm | 410 | 2.0% | 7.3% | 5.6% | 51.5% | 2.2% | 31.5% |
| nemotron | 393 | 3.1% | 0.5% | 2.5% | 53.9% | 1.3% | 38.7% |
| gpt-oss | 281 | 7.8% | 1.4% | 1.8% | 38.4% | 1.8% | 48.8% |
| openrouter-primary | 13 | te weinig gegevens | te weinig gegevens | te weinig gegevens | te weinig gegevens | te weinig gegevens | te weinig gegevens |
| gemma | 0 | te weinig gegevens | te weinig gegevens | te weinig gegevens | te weinig gegevens | te weinig gegevens | te weinig gegevens |
Per route
De gratis route draait eerst DeepSeek V4 Flash op Cloudflare Workers AI, met andere open-weight-modellen als reserve. De betaalde route draait de voorrangsmodellen: DeepSeek V4 Pro schrijft en Kimi K2,6 antwoordt blind. Beide routes krijgen dezelfde controles en worden hier allebei geteld, en daarom gaat deze pagina over modelfamilies en niet over routes.
| Baan | Geschreven vragen | Citaat niet gevonden op de aangehaalde pagina | Tweede model was het oneens | Dubbel | Gebrek | Niet gevraagd of te laat | Geaccepteerd |
|---|---|---|---|---|---|---|---|
| gratis | 6,140 | 6.5% | 5.3% | 11.2% | 31.1% | 2.0% | 43.9% |
| betaald | 43 | te weinig gegevens | te weinig gegevens | te weinig gegevens | te weinig gegevens | te weinig gegevens | te weinig gegevens |
Wat elke kolom betekent
- Geschreven vragen: vragen die het model in een leesbaar antwoord teruggaf. Antwoorden die niet als JSON te lezen waren, worden apart geteld in de CSV, per aanroep, omdat ze geen vragen opleverden om te tellen.
- Citaat niet gevonden op de aangehaalde pagina: het letterlijke citaat stond niet in de opgeslagen tekst van de pagina die het model noemde, of het haalde een pagina aan buiten de sectie die het had gekregen. De CSV splitst die twee.
- Tweede model was het oneens: een model uit een andere familie, dat de vraag en de citaten kreeg maar nooit de antwoordsleutel, koos een ander antwoord.
- Duplicaat: de vraag herhaalde een vraag die al uit hetzelfde document was geaccepteerd.
- Gebrek: een structuur- of kwaliteitsregel wees ze af, zoals een set opties met een weggever of een vraagstam zonder één beste antwoord. Dat zijn de regels die de MCQ-foutencontrole in je browser draait.
- Niet gevraagd of te laat: de vraag was deugdelijk maar bereikte toch nooit een student. Of het was een type waar de opdracht niet om vroeg (een open vraag in een meerkeuzeopdracht), of de opdracht raakte vol met andere aanroepen terwijl deze werd geschreven. Beide worden geteld zodat de rij klopt; geen van beide telt tegen het model.
- Geaccepteerd: wat dit alles overleefde en een student bereikte.
Methode
Elk getal hier komt uit productieopdrachten op deze site. Per aanroep bij een aanbieder wordt één rij geschreven, op het moment dat de uitkomst van de aanroep bekend is, met aantallen en niets anders: geen vraagtekst, geen documenttekst en geen gebruiker. De aantallen worden toegeschreven aan het model dat werkelijk antwoordde, wat niet altijd het model is waar de opdracht om vroeg, omdat de pool op een ander model terugvalt wanneer er één wordt afgeknepen of traag is. Een terugval toeschrijven aan het model dat niet draaide zou een getal over het verkeerde model publiceren.
Het venster is de laatste 30 dagen, hooguit twee keer per uur opnieuw geteld, en het is een van drie vaste vensters. Percentages zijn aandelen van de vragen die een familie teruggaf, en elke vraag die een aanroep teruggaf staat in precies een van deze kolommen, dus samen met het geaccepteerde aandeel tellen ze op tot het geheel. Een aanroep die terugkwam bij een opdracht die al klaar was schrijft helemaal geen rij: naar die vragen is nooit gekeken, en een model dat laat antwoordde is geen model dat slecht antwoordde. Een familie met minder dan 200 teruggegeven vragen staat vermeld als onvoldoende gegevens, omdat bij die omvang één slechte sectie een percentage meerdere punten verschuift.
Download dezelfde cijfers als CSV, of lees ze als JSON. De cijfers worden gepubliceerd onder de licentie Creative Commons Attribution 4,0: gebruik ze, citeer ze, en noem MedUni Exam als bron.
Bijgewerkt op 24 september 2026.
Genereer uit je eigen hoofdstuk
Geen account nodig om het te proberen. Registreren bewaart je bibliotheek, cijfers en herhalingswachtrij op al je apparaten.
Gepubliceerd , bijgewerkt .