Ablehnungsquoten nach Modellfamilie
Jede Frage, die für diese Seite geschrieben wird, durchläuft dieselben Kontrollen, egal welches Modell sie geschrieben hat. So viele davon verliert jede Modellfamilie in den letzten 30 Tagen, mit der Zahl, aus der die Quoten berechnet sind.
Diese Quoten werden aus dem Aufrufprotokoll gezählt, das seit dem 14. September 2026 geführt wird. Die laufenden Summen an anderer Stelle auf der Seite zählen jede Frage, seit die Seite am 11. September 2026 online ging, die beiden Zahlenreihen decken also verschiedene Zeiträume ab und müssen nicht zusammenpassen.
Gezählt vom bis zum : 2.459 Aufrufe zur Erzeugung, die 6.183 Fragen zurückgegeben haben. Eine Modellfamilie wird veröffentlicht, sobald sie im Zeitraum 200 Fragen zurückgegeben hat; darunter steht das hier, statt eine Quote aus einer Handvoll Aufrufe zu drucken.
| Modellfamilie | Geschriebene Fragen | Zitat nicht auf der angegebenen Seite | Zweites Modell widersprach | Duplikat | Mangel | Nicht angefragt oder zu spät | Angenommen |
|---|---|---|---|---|---|---|---|
| qwen | 4,583 | 6.2% | 6.1% | 14.0% | 28.9% | 2.1% | 42.7% |
| deepseek | 503 | 14.3% | 3.0% | 2.4% | 11.5% | 2.0% | 66.8% |
| glm | 410 | 2.0% | 7.3% | 5.6% | 51.5% | 2.2% | 31.5% |
| nemotron | 393 | 3.1% | 0.5% | 2.5% | 53.9% | 1.3% | 38.7% |
| gpt-oss | 281 | 7.8% | 1.4% | 1.8% | 38.4% | 1.8% | 48.8% |
| openrouter-primary | 13 | zu wenige Daten | zu wenige Daten | zu wenige Daten | zu wenige Daten | zu wenige Daten | zu wenige Daten |
| gemma | 0 | zu wenige Daten | zu wenige Daten | zu wenige Daten | zu wenige Daten | zu wenige Daten | zu wenige Daten |
Nach Spur
Die kostenlose Spur läuft zuerst mit DeepSeek V4 Flash auf Cloudflare Workers AI, mit anderen Open-Weight-Modellen als Ausweichmodellen. Die bezahlte Spur nutzt die Prioritätsmodelle: DeepSeek V4 Pro schreibt, und Kimi K2,6 antwortet blind. Beide Spuren durchlaufen dieselben Kontrollen und werden hier beide gezählt, deshalb geht es auf dieser Seite um Modellfamilien und nicht um Spuren.
| Spur | Geschriebene Fragen | Zitat nicht auf der angegebenen Seite | Zweites Modell widersprach | Duplikat | Mangel | Nicht angefragt oder zu spät | Angenommen |
|---|---|---|---|---|---|---|---|
| kostenlos | 6,140 | 6.5% | 5.3% | 11.2% | 31.1% | 2.0% | 43.9% |
| bezahlt | 43 | zu wenige Daten | zu wenige Daten | zu wenige Daten | zu wenige Daten | zu wenige Daten | zu wenige Daten |
Was jede Spalte bedeutet
- Geschriebene Fragen: Fragen, die das Modell in einer auswertbaren Antwort zurückgegeben hat. Antworten, die sich nicht als JSON lesen ließen, werden in der CSV gesondert je Aufruf gezählt, weil sie keine Fragen zurückgegeben haben, die man zählen könnte.
- Zitat auf der genannten Seite nicht gefunden: Das wörtliche Zitat stand nicht im gespeicherten Text der Seite, die das Modell genannt hat, oder es hat eine Seite außerhalb des ihm gegebenen Abschnitts zitiert. Die CSV trennt diese beiden Fälle.
- Zweites Modell war anderer Meinung: Ein Modell aus einer anderen Familie, dem die Frage und ihre Zitate gezeigt wurden, nie aber der Lösungsschlüssel, hat eine andere Antwort gewählt.
- Duplikat: Die Frage wiederholte eine bereits angenommene aus demselben Dokument.
- Mangel: Eine Struktur- oder Qualitätsregel hat sie abgelehnt, etwa ein Optionssatz mit einem verräterischen Hinweis oder eine Fragestellung ohne eindeutig beste Antwort. Genau diese Regeln lässt der MC-Fragen-Prüfer in deinem Browser laufen.
- Nicht angefordert oder zu spät: Die Frage war in Ordnung, kam aber trotzdem nie bei einem Studierenden an. Entweder war es ein Typ, den der Auftrag nicht angefordert hatte (eine Kurzantwortfrage in einem Multiple-Choice-Auftrag), oder der Auftrag wurde aus anderen Aufrufen voll, während diese hier geschrieben wurde. Beides wird gezählt, damit die Zeile aufgeht; keines ist ein Vorwurf an das Modell.
- Angenommen: was alles überstanden hat und bei einem Studierenden angekommen ist.
Methode
Jede Zahl hier stammt aus produktiven Aufträgen auf dieser Seite. Pro Anbieteraufruf wird eine Zeile geschrieben, sobald das Ergebnis des Aufrufs feststeht, und sie enthält nur Zählwerte: keinen Fragetext, keinen Dokumenttext und keinen Nutzer. Die Zählwerte werden dem Modell zugeordnet, das tatsächlich geantwortet hat, und das ist nicht immer das Modell, das der Auftrag angefordert hat, weil der Pool auf ein anderes Modell ausweicht, wenn eines ratenbegrenzt oder langsam ist. Ein Ausweichen dem Modell zuzurechnen, das gar nicht gelaufen ist, hieße eine Zahl über das falsche Modell zu veröffentlichen.
Das Fenster sind die letzten 30 Tage, höchstens zweimal pro Stunde neu gezählt, und es ist eines von drei festen Fenstern. Die Quoten sind Anteile an den Fragen, die eine Familie zurückgegeben hat, und jede Frage, die ein Aufruf zurückgegeben hat, steht in genau einer dieser Spalten, sodass sie zusammen mit dem angenommenen Anteil das Ganze ergeben. Ein Aufruf, der zu einem bereits beendeten Auftrag zurückkam, schreibt gar keine Zeile: Seine Fragen wurden nie angesehen, und ein Modell, das spät geantwortet hat, ist kein Modell, das schlecht geantwortet hat. Eine Familie mit weniger als 200 zurückgegebenen Fragen wird als nicht genug Daten geführt, weil bei dieser Größe ein einziger schlechter Abschnitt eine Quote um mehrere Punkte verschiebt.
Dieselben Zahlen als CSV herunterladen oder als JSON lesen. Die Zahlen stehen unter der Lizenz Creative Commons Attribution 4,0: nutz sie, zitier sie und nenn MedUni Exam als Quelle.
Aktualisiert am 24. September 2026.
Aus deinem eigenen Kapitel erzeugen
Zum Ausprobieren ist kein Konto nötig. Mit einer Registrierung bleiben deine Bibliothek, deine Noten und deine Wiederholungsliste auf allen Geräten erhalten.
Veröffentlicht am , aktualisiert am .