Avvisningsfrekvenser per modellfamilj
Varje fråga som skrivs för den här webbplatsen går genom samma kontroller, oavsett vilken modell som skrev den. Så här många av dem förlorar varje modellfamilj, under de senaste 30 dagarna, med talet andelarna räknas ur.
De här andelarna räknas ur anropsloggen, som har sparats sedan den 14 september 2026. De löpande totalsummorna som skrivs ut på andra ställen på webbplatsen räknar varje fråga sedan webbplatsen öppnade den 11 september 2026, så de två sifferuppsättningarna täcker olika perioder och är inte tänkta att gå ihop med varandra.
Räknat från till : 2 459 genereringsanrop som gav 6 183 frågor. En familj publiceras när den har gett 200 frågor under perioden; under det säger sidan det i stället för att visa en andel från en handfull anrop.
| Modellfamilj | Skrivna frågor | Citatet fanns inte på den angivna sidan | Andra modellen höll inte med | Dubblett | Brist | Inte efterfrågad eller för sen | Godkända |
|---|---|---|---|---|---|---|---|
| qwen | 4,583 | 6.2% | 6.1% | 14.0% | 28.9% | 2.1% | 42.7% |
| deepseek | 503 | 14.3% | 3.0% | 2.4% | 11.5% | 2.0% | 66.8% |
| glm | 410 | 2.0% | 7.3% | 5.6% | 51.5% | 2.2% | 31.5% |
| nemotron | 393 | 3.1% | 0.5% | 2.5% | 53.9% | 1.3% | 38.7% |
| gpt-oss | 281 | 7.8% | 1.4% | 1.8% | 38.4% | 1.8% | 48.8% |
| openrouter-primary | 13 | för lite data | för lite data | för lite data | för lite data | för lite data | för lite data |
| gemma | 0 | för lite data | för lite data | för lite data | för lite data | för lite data | för lite data |
Per spår
Gratisspåret kör först DeepSeek V4 Flash på Cloudflare Workers AI, med andra modeller med öppna vikter som reserv. Det betalda spåret kör prioriteringsmodellerna: DeepSeek V4 Pro skriver och Kimi K2,6 svarar blint. Båda spåren går igenom samma kontroller och båda räknas här, och därför handlar den här sidan om modellfamiljer och inte om spår.
| Bana | Skrivna frågor | Citatet fanns inte på den angivna sidan | Andra modellen höll inte med | Dubblett | Brist | Inte efterfrågad eller för sen | Godkända |
|---|---|---|---|---|---|---|---|
| gratis | 6,140 | 6.5% | 5.3% | 11.2% | 31.1% | 2.0% | 43.9% |
| betalt | 43 | för lite data | för lite data | för lite data | för lite data | för lite data | för lite data |
Vad varje kolumn betyder
- Skrivna frågor: frågor som modellen returnerade i ett läsbart svar. Svar som inte gick att läsa som JSON räknas separat i CSV-filen, per anrop, eftersom de inte returnerade några frågor att räkna.
- Citatet fanns inte på den angivna sidan: det ordagranna citatet fanns inte i den sparade texten på sidan modellen angav, eller så angav den en sida utanför avsnittet den fått. CSV-filen delar upp de två.
- Den andra modellen höll inte med: en modell från en annan familj, som fick se frågan och dess citat men aldrig facit, valde ett annat svar.
- Dubblett: frågan upprepade en som redan godkänts ur samma dokument.
- Formfel: en struktur- eller kvalitetsregel underkände den, till exempel en alternativuppsättning som avslöjar svaret eller en frågestam utan ett enda bästa svar. De reglerna är desamma som MCQ-felkontrollen kör i din webbläsare.
- Inte efterfrågad eller för sen: frågan höll, men nådde ändå aldrig en student. Antingen var den av en typ jobbet inte bad om (en öppen fråga i ett flervalsjobb), eller så blev jobbet fullt av andra anrop medan den här skrevs. Bägge räknas så att raden går ihop; ingendera är en anmärkning mot modellen.
- Godkända: det som klarade alltihop och nådde en student.
Metod
Varje siffra här kommer från skarpa jobb på den här webbplatsen. En rad skrivs per leverantörsanrop, i det ögonblick anropets utfall är känt, och innehåller antal och inget annat: ingen frågetext, ingen dokumenttext och ingen användare. Antalen tillskrivs den modell som faktiskt svarade, vilket inte alltid är den modell jobbet bad om, eftersom poolen faller tillbaka på en annan modell när en är hastighetsbegränsad eller långsam. Att tillskriva ett återfall till modellen som inte kördes vore att publicera en siffra om fel modell.
Fönstret är de senaste 30 dagarna, räknat om högst två gånger i timmen, och det är ett av tre fasta fönster. Andelarna är delar av de frågor en familj returnerade, och varje fråga ett anrop returnerade ligger i exakt en av dessa kolumner, så de summerar tillsammans med den godkända andelen till helheten. Ett anrop som kom tillbaka till ett jobb som redan var klart skriver ingen rad alls: dess frågor tittade ingen på, och en modell som svarade sent är inte en modell som svarade dåligt. En familj med under 200 returnerade frågor anges som otillräckligt underlag, eftersom en dålig sektion vid den storleken flyttar en andel flera procentenheter.
Ladda ner samma siffror som CSV, eller läs dem som JSON. Siffrorna publiceras under licensen Creative Commons Attribution 4,0: använd dem, citera dem och ange MedUni Exam som källa.
Uppdaterad den 24 september 2026.
Inget konto behövs för att prova. Registrerar du dig sparas ditt bibliotek, dina betyg och din repetitionskö på alla enheter.
Publicerad , uppdaterad .