MedUni Exam

Avvisningsrater etter modellfamilie

Hvert spørsmål som skrives for dette nettstedet går gjennom de samme kontrollene, uansett hvilken modell som skrev det. Dette er hvor mange av dem hver modellfamilie mister, over de siste 30 dagene, med tallet ratene er regnet ut fra.

Disse ratene er talt fra kalloggen, som har vært ført siden 14. september 2026. De løpende totalene som vises andre steder på nettstedet, teller hvert spørsmål siden nettstedet åpnet 11. september 2026, så de to tallsettene dekker ulike perioder og er ikke ment å gå opp mot hverandre.

Talt fra til : 2 459 genereringskall som ga 6 183 spørsmål. En familie publiseres når den har gitt 200 spørsmål i perioden; under det sier siden det i stedet for å vise en andel fra en håndfull kall.

ModellfamilieSkrevne spørsmålSitatet sto ikke på siden det viste tilDen andre modellen var uenigDuplikatFeilIkke bedt om eller for sentGodtatt
qwen4,5836.2%6.1%14.0%28.9%2.1%42.7%
deepseek50314.3%3.0%2.4%11.5%2.0%66.8%
glm4102.0%7.3%5.6%51.5%2.2%31.5%
nemotron3933.1%0.5%2.5%53.9%1.3%38.7%
gpt-oss2817.8%1.4%1.8%38.4%1.8%48.8%
openrouter-primary13for lite datafor lite datafor lite datafor lite datafor lite datafor lite data
gemma0for lite datafor lite datafor lite datafor lite datafor lite datafor lite data

Etter spor

Gratissporet kjører først DeepSeek V4 Flash på Cloudflare Workers AI, med andre modeller med åpne vekter som reserve. Det betalte sporet kjører prioritetsmodellene: DeepSeek V4 Pro skriver og Kimi K2,6 svarer blindt. Begge sporene går gjennom de samme kontrollene og telles begge her, og derfor handler denne siden om modellfamilier og ikke om spor.

SporSkrevne spørsmålSitatet sto ikke på siden det viste tilDen andre modellen var uenigDuplikatFeilIkke bedt om eller for sentGodtatt
gratis6,1406.5%5.3%11.2%31.1%2.0%43.9%
betalt43for lite datafor lite datafor lite datafor lite datafor lite datafor lite data

Hva hver kolonne betyr

  • Spørsmål skrevet: spørsmål modellen returnerte i et svar som lot seg lese. Svar som ikke kunne leses som JSON, telles separat i CSV-en, per kall, fordi de ikke returnerte noen spørsmål å telle.
  • Sitatet ble ikke funnet på den oppgitte siden: det ordrette sitatet fantes ikke i den lagrede teksten på siden modellen oppga, eller den oppga en side utenfor delen den fikk. CSV-en skiller de to.
  • Den andre modellen var uenig: en modell fra en annen familie, som fikk se spørsmålet og sitatene, men aldri fasiten, valgte et annet svar.
  • Duplikat: spørsmålet gjentok et som alt var godtatt fra samme dokument.
  • Feil: en strukturell regel eller kvalitetsregel avviste det, for eksempel et sett alternativer som røper svaret, eller en oppgavetekst uten ett beste svar. Disse reglene er de samme som MCQ-feilsjekkeren kjører i nettleseren din.
  • Ikke etterspurt eller for sent: spørsmålet var i orden, men nådde likevel aldri en student. Enten var det en type jobben ikke ba om (et kortsvarsspørsmål i en flervalgsjobb), eller så ble jobben fylt opp av andre kall mens dette ble skrevet. Begge telles, slik at raden går opp; ingen av dem er et minus for modellen.
  • Godtatt: det som overlevde alt sammen og nådde en student.

Metode

Alle tall her kommer fra produksjonsjobber på dette nettstedet. Én rad skrives per leverandørkall, i det øyeblikket utfallet av kallet er kjent, og den inneholder tellinger og ingenting annet: ingen spørsmålstekst, ingen dokumenttekst og ingen bruker. Tellingene tilskrives modellen som faktisk svarte, som ikke alltid er modellen jobben ba om, fordi puljen faller tilbake på en annen modell når én er ratebegrenset eller treg. Å tilskrive et tilbakefall til modellen som ikke kjørte, ville publisert et tall om feil modell.

Vinduet er de siste 30 dagene, talt på nytt høyst to ganger i timen, og det er ett av tre faste vinduer. Ratene er andeler av spørsmålene en familie returnerte, og hvert spørsmål et kall returnerte ligger i nøyaktig én av disse kolonnene, så de går opp sammen med den godtatte andelen til helheten. Et kall som kom tilbake til en jobb som alt var ferdig, skriver ingen rad i det hele tatt: spørsmålene ble aldri sett på, og en modell som svarte sent er ikke en modell som svarte dårlig. En familie med under 200 returnerte spørsmål står som ikke nok data, fordi ved den størrelsen flytter én dårlig del en rate med flere prosentpoeng.

Last ned de samme tallene som CSV, eller les dem som JSON. Tallene er publisert under lisensen Creative Commons Attribution 4,0: bruk dem, siter dem, og oppgi MedUni Exam som kilde.

Oppdatert 24. september 2026.

Generer fra ditt eget kapittel

Se priser

Ingen konto trengs for å prøve. Registrering tar vare på biblioteket, karakterene og repetisjonskøen din på alle enheter.

Publisert , oppdatert .