MedUni Exam

Hur korrekta är AI-skrivna tentafrågor? Vad riktiga jobb visar

Every question this site writes is checked before a student sees it, and the checks keep a count. This is what the 10 days since of real jobs on medical textbooks, lecture decks and notes show: how many questions a model writes that cannot be traced to the page, that a second model answers differently, or that repeat one already written.

Siffrorna, räknade ur anropsloggen

What the checks countedShare of questions written
Questions the models wrote6,183 in 2,459 calls
Kept, every check passed44.0%
Thrown out, all reasons56.0%
Citatet fanns inte på den angivna sidan6.5%
Second model answered differently5.4%
Repeat of a question already written11.2%
Structural flaw (all of the above, a vague stem, an option that gives itself away)30.9%

Counted from the call log over September 14, 2026 to September 24, 2026, refreshed twice an hour. The same report, split by model family and with a CSV, is on the rejection rates page.

Vad varje avvisning betyder

Citatet hittades inte på den angivna sidan. Varje fråga måste bära en eller två meningar kopierade ur dokumentet, med sidan de står på. Servern slår upp meningen i den lagrade texten på den sidan. Finns den inte där har modellen skrivit en fråga om något som materialet inte säger, eller mindes formuleringen fel, och frågan stryks. Det är den kontroll som fångar ett påhittat faktum.

Den andra modellen svarade annorlunda. En modell från en annan familj får frågan och citaten, och inget annat: inget facit, inget dokument. Om den inte kan komma fram till facitsvaret enbart utifrån citaten bevisar citaten inte svaret, och frågan stryks. Det är den kontroll som fångar en fråga som låter rätt men har fel facit, eller ett facit som citatet inte stöder.

Upprepning av en fråga som redan skrivits. Varje ny fråga jämförs med allt som redan genererats ur dokumentet. En nästan identisk fråga stryks, så en lång körning ger olika frågor i stället för samma fakta omformulerade.

Strukturellt fel. "Alla ovanstående", "inget av ovanstående", en stam som frågar vilket påstående som är sant, ett alternativ som är påfallande längre än de andra, en fråga som hänvisar till "texten". Det är de tecken examinatorer är tränade att ta bort, och här tas de bort enligt regel innan de andra kontrollerna körs. MCQ-felkontrollen kör samma regler på vilken fråga du än klistrar in.

Varför en generator som inte visar något citat inte kan säga hur korrekt den är

Ett verktyg som räcker dig en quiz utan meningen varje fråga kom från har inget sätt att räkna hur många av dess frågor som saknade stöd, eftersom inget i kedjan tittade efter. Dess korrekthet är vad du själv hittar när du kontrollerar frågorna, vilket är arbetet du försökte lämna ifrån dig. Ett konkurrerande verktygs egen hjälpsida ber sina användare att granska en genererad quiz innan de litar på den, vilket är det ärliga att säga när inget har kontrollerats. Siffrorna ovan finns eftersom kontrollen sker innan studenten ser något, och eftersom det som sorterades bort räknades i stället för att tyst försvinna.

Så kontrollerar du själv en AI-fråga på tjugo sekunder

  1. Hitta meningen. Om frågan inte visar var den kommer ifrån, sök i dokumentet efter dess nyckelfras. Finns frasen inte där kommer frågan inte från ditt material.
  2. Täck över facit och svara utifrån citatet. Läs bara den citerade meningen och välj ett alternativ. Om citatet inte avgör saken testar frågan något som citatet inte säger.
  3. Titta på alternativen. Ett alternativ som är mycket längre än de andra, ett alternativ som upprepar stammen, "alla ovanstående": var och en är ett tecken, och var och en är ett skäl att misstro frågan, inte att lära sig av den.

Vad det betyder för tentapluggandet

En uppsättning frågor som klarat de här kontrollerna är en uppsättning du kan öva på utan att läsa om kapitlet för att kontrollera att varje fråga är äkta. Den avvisade andelen är inte bortkastat arbete; det är den del av en AI-genererad frågebank som en student med ett okontrollerat verktyg hade pluggat på. Gratisplanen på den här webbplatsen kör samma kontroller på varje fråga den skriver, och exempelsidan visar tre som klarade sig, med sidan var och en citerar.

Frågor studenter ställer

Betyder en hög avvisningsfrekvens att modellen är dålig?

Inte i sig. En modell som skriver ambitiösa kliniska vinjetter förlorar fler av dem till den andra modellen än en som skriver rena faktafrågor, och en lång körning ur ett kort kapitel förlorar frågor till dubblettkontrollen eftersom kapitlet bara har ett visst antal fakta. Frekvensen är en egenskap hos modellen, materialet och körningen tillsammans, och därför publiceras rapporten med talet den räknats från.

Är frågorna som klarar sig garanterat korrekta?

Nej. Kontrollerna fångar en fråga vars citat inte finns på den sida den hänvisar till, en som en andra modell svarar annorlunda på än facit, en som upprepar en tidigare fråga, och en rad strukturella fel. De kan inte bedöma medicinen. Därför visas varje behållen fråga med sitt citat och sidnummer, så att studenten kan läsa raden frågan kom från.

Varför räknas en upprepad fråga som en avvisning?

Eftersom en generator som ombeds skriva fyrtio frågor ur ett häfte på tolv sidor kommer att omformulera samma tolv fakta om inget stoppar den. Varje ny fråga jämförs med allt som redan skrivits ur dokumentet, och en nästan identisk fråga sorteras bort i stället för att räckas studenten som ny övning.

Var finns rådata?

Sidan med avvisningsfrekvenser publicerar rapporten per modellfamilj och per bana med en CSV-nedladdning, och siffrorna på den här sidan läses ur samma rapport. Anropsloggen har förts sedan den 14 september 2026.

Testa på din egen PDF

Se frekvenserna per modell

Inget konto behövs för att prova. Registrerar du dig sparas ditt bibliotek, dina betyg och din repetitionskö på alla enheter.

Publicerad , uppdaterad .