MedUni Exam

Kassationsrater per modelfamilie

Hvert spørgsmål skrevet til dette site går gennem de samme kontroller, uanset hvilken model der skrev det. Det her er, hvor mange af dem hver modelfamilie mister over de seneste 30 dage, med det tal, raterne er talt ud fra.

Disse rater er talt fra kaldloggen, som er ført siden den 14. september 2026. De løbende totaler, der vises andre steder på sitet, tæller hvert spørgsmål, siden sitet åbnede den 11. september 2026, så de to sæt tal dækker forskellige perioder og er ikke ment til at gå op med hinanden.

Talt fra til : 2.459 genereringskald, der gav 6.183 spørgsmål. En familie offentliggøres, når den har givet 200 spørgsmål i perioden; under det siger siden det i stedet for at vise en andel ud fra en håndfuld kald.

ModelfamilieSkrevne spørgsmålCitatet stod ikke på den angivne sideDen anden model var uenigDubletFejlIkke bestilt eller for sentGodkendt
qwen4,5836.2%6.1%14.0%28.9%2.1%42.7%
deepseek50314.3%3.0%2.4%11.5%2.0%66.8%
glm4102.0%7.3%5.6%51.5%2.2%31.5%
nemotron3933.1%0.5%2.5%53.9%1.3%38.7%
gpt-oss2817.8%1.4%1.8%38.4%1.8%48.8%
openrouter-primary13for få datafor få datafor få datafor få datafor få datafor få data
gemma0for få datafor få datafor få datafor få datafor få datafor få data

Efter spor

Gratissporet kører først DeepSeek V4 Flash på Cloudflare Workers AI, med andre modeller med åbne vægte som reserve. Det betalte spor kører prioritetsmodellerne: DeepSeek V4 Pro skriver, og Kimi K2,6 svarer blindt. Begge spor gennemgår de samme kontroller og tælles begge her, og derfor handler denne side om modelfamilier og ikke om spor.

SporSkrevne spørgsmålCitatet stod ikke på den angivne sideDen anden model var uenigDubletFejlIkke bestilt eller for sentGodkendt
gratis6,1406.5%5.3%11.2%31.1%2.0%43.9%
betalt43for få datafor få datafor få datafor få datafor få datafor få data

Hvad hver kolonne betyder

  • Spørgsmål skrevet: spørgsmål, modellen returnerede i et læsbart svar. Svar, der ikke kunne læses som JSON, tælles separat i CSV-filen, per kald, fordi de ikke returnerede nogen spørgsmål at tælle.
  • Citat ikke fundet på den angivne side: det ordrette citat stod ikke i den gemte tekst fra den side, modellen nævnte, eller den henviste til en side uden for det afsnit, den fik. CSV-filen deler de to op.
  • Anden model var uenig: en model fra en anden familie, som fik spørgsmålet og dets citater, men aldrig facit, valgte et andet svar.
  • Dublet: spørgsmålet gentog et, der allerede var godkendt fra samme dokument.
  • Fejl: en strukturel regel eller kvalitetsregel kasserede det, for eksempel et sæt svarmuligheder med et afslørende spor eller en indledning uden ét bedste svar. Det er de regler, MCQ-fejlkontrollen kører i din browser.
  • Ikke efterspurgt eller for sent: spørgsmålet var i orden, men nåede alligevel aldrig frem til en studerende. Enten var det en type, jobbet ikke bad om (et kortsvarsspørgsmål i et multiple choice-job), eller jobbet blev fyldt op af andre kald, mens dette blev skrevet. Begge dele tælles med, så rækken går op; ingen af dem er en anmærkning mod modellen.
  • Godkendt: det, der overlevede det hele og nåede frem til en studerende.

Metode

Hvert tal her kommer fra produktionsjob på dette site. Der skrives én række per udbyderkald, i det øjeblik kaldets udfald er kendt, med tal og intet andet: ingen spørgsmålstekst, ingen dokumenttekst og ingen bruger. Tallene tilskrives den model, der faktisk svarede, hvilket ikke altid er den model, jobbet bad om, fordi puljen falder tilbage til en anden model, når en er hastighedsbegrænset eller langsom. At tilskrive et sådant skift til den model, der ikke kørte, ville offentliggøre et tal om den forkerte model.

Vinduet er de seneste 30 dage, talt om højst to gange i timen, og det er et af tre faste vinduer. Rater er andele af de spørgsmål, en familie returnerede, og hvert spørgsmål, et kald returnerede, ligger i præcis én af disse kolonner, så de går sammen med den godkendte andel op til helheden. Et kald, der kom tilbage til et job, som allerede var færdigt, skriver slet ingen række: dets spørgsmål blev aldrig set på, og en model, der svarede sent, er ikke en model, der svarede dårligt. En familie med under 200 returnerede spørgsmål står som ikke nok data, for ved den størrelse flytter ét dårligt afsnit en rate med flere point.

Hent de samme tal som CSV, eller læs dem som JSON. Tallene er offentliggjort under licensen Creative Commons Attribution 4,0: brug dem, citer dem, og nævn MedUni Exam som kilde.

Opdateret den 24. september 2026.

Generer ud fra dit eget kapitel

Se priser

Du behøver ingen konto for at prøve det. Med en konto gemmes dit bibliotek, dine karakterer og din gentagelseskø på tværs af enheder.

Udgivet , opdateret .