MedUni Exam

Hvor nøyaktige er eksamensspørsmål skrevet av AI? Hva ekte jobber viser

Every question this site writes is checked before a student sees it, and the checks keep a count. This is what the 10 days since of real jobs on medical textbooks, lecture decks and notes show: how many questions a model writes that cannot be traced to the page, that a second model answers differently, or that repeat one already written.

Tallene, talt fra anropsloggen

What the checks countedShare of questions written
Questions the models wrote6,183 in 2,459 calls
Kept, every check passed44.0%
Thrown out, all reasons56.0%
Sitatet sto ikke på siden det viste til6.5%
Second model answered differently5.4%
Repeat of a question already written11.2%
Structural flaw (all of the above, a vague stem, an option that gives itself away)30.9%

Counted from the call log over September 14, 2026 to September 24, 2026, refreshed twice an hour. The same report, split by model family and with a CSV, is on the rejection rates page.

Hva hver avvisning betyr

Sitatet finnes ikke på siden det viser til. Hvert spørsmål må bære én eller to setninger kopiert ut av dokumentet, med siden de står på. Serveren slår opp setningen i den lagrede teksten på den siden. Er den ikke der, har modellen skrevet et spørsmål om noe materialet ikke sier, eller husket ordlyden feil, og spørsmålet strykes. Dette er kontrollen som fanger et oppdiktet faktum.

Den andre modellen svarte annerledes. En modell fra en annen familie får spørsmålet og sitatene, og ingenting annet: ingen fasit, intet dokument. Kommer den ikke fram til svaret i fasiten ut fra sitatene alene, beviser ikke sitatene svaret, og spørsmålet strykes. Dette er kontrollen som fanger et spørsmål som høres riktig ut, men har feil fasit, eller en fasit sitatet ikke støtter.

Gjentakelse av et spørsmål som alt er skrevet. Hvert nytt spørsmål sammenlignes med alt som allerede er laget fra dokumentet. En nær gjentakelse strykes, slik at en lang kjøring gir forskjellige spørsmål i stedet for de samme faktaene omformulert.

Strukturfeil. "Alle de ovennevnte", "ingen av de ovennevnte", en spørsmålsstamme som spør hvilken påstand som er sann, et alternativ påfallende lengre enn de andre, et spørsmål som viser til "teksten". Dette er tegnene sensorer er lært opp til å fjerne, og her fjernes de etter regel før de andre kontrollene kjøres. MCQ-feilsjekkeren kjører de samme reglene på ethvert spørsmål du limer inn.

Hvorfor en generator som ikke viser sitat, ikke kan fortelle deg hvor nøyaktig den er

Et verktøy som gir deg en prøve uten setningen hvert spørsmål kom fra, har ingen måte å telle hvor mange av spørsmålene sine som var uten dekning, fordi ingenting i kjeden så etter. Nøyaktigheten er det du finner når du kontrollerer spørsmålene selv, og det er arbeidet du prøvde å slippe. Hjelpesiden til et konkurrerende verktøy ber brukerne se gjennom en generert quiz før de stoler på den, og det er det ærlige å si når ingenting er kontrollert. Tallene ovenfor finnes fordi kontrollen skjer før studenten ser noe, og fordi det som ble strøket, ble talt i stedet for stille fjernet.

Slik kontrollerer du et AI-spørsmål selv på tjue sekunder

  1. Finn setningen. Viser ikke spørsmålet hvor det kom fra, søk i dokumentet etter nøkkelfrasen. Er frasen ikke der, er ikke spørsmålet hentet fra materialet ditt.
  2. Dekk til fasiten og svar ut fra sitatet. Les bare den siterte setningen og velg et alternativ. Avgjør ikke sitatet saken, tester spørsmålet noe sitatet ikke sier.
  3. Se på alternativene. Ett alternativ mye lengre enn de andre, et alternativ som gjentar spørsmålsstammen, "alle de ovennevnte": hvert av dem er et tegn, og hvert av dem er en grunn til å mistro spørsmålet, ikke til å lære av det.

Hva det betyr for eksamensforberedelsen

Et sett spørsmål som har overlevd disse kontrollene, er et sett du kan øve på uten å lese kapittelet på nytt for å forsikre deg om at hvert enkelt er ekte. Den avviste andelen er ikke bortkastet arbeid; det er den delen av enhver AI-laget spørsmålsbank som en student med et ukontrollert verktøy ville ha studert fra. Gratisplanen på dette nettstedet kjører de samme kontrollene på hvert spørsmål den skriver, og eksempelsiden viser tre som overlevde, med siden hvert av dem siterer.

Spørsmål studenter stiller

Betyr en høy avvisningsrate at modellen er dårlig?

Ikke i seg selv. En modell som skriver ambisiøse kliniske vignetter, mister flere av dem til den andre modellen enn en som skriver spørsmål om ren gjenkalling, og en lang kjøring fra et kort kapittel mister spørsmål til duplikatkontrollen fordi kapittelet bare har et visst antall fakta. Raten er en egenskap ved modellen, materialet og kjøringen samlet, og derfor publiseres rapporten med tallet den er talt fra.

Er spørsmålene som består garantert riktige?

Nei. Kontrollene fanger et spørsmål der sitatet ikke står på siden det viser til, et som en annen modell svarer annerledes på enn fasiten, et som gjentar et tidligere spørsmål, og en rekke strukturfeil. De kan ikke bedømme medisinen. Derfor vises hvert spørsmål som beholdes, med sitatet og sidetallet sitt, slik at studenten kan lese linjen spørsmålet kom fra.

Hvorfor teller et gjentatt spørsmål som en avvisning?

Fordi en generator som blir bedt om førti spørsmål fra et utdelingsark på tolv sider, vil omformulere de samme tolv faktaene hvis ingenting stopper den. Hvert nytt spørsmål sammenlignes med alt som allerede er skrevet fra dokumentet, og en nær gjentakelse strykes i stedet for å bli gitt til studenten som ny øving.

Hvor er rådataene?

Siden med avvisningsrater publiserer rapporten per modellfamilie og per spor med CSV-nedlasting, og tallene på denne siden leses fra den samme rapporten. Anropsloggen har vært ført siden 14. september 2026.

Prøv det på din egen PDF

Se ratene per modell

Ingen konto trengs for å prøve. Registrering tar vare på biblioteket, karakterene og repetisjonskøen din på alle enheter.

Publisert , oppdatert .