MedUni Exam

Wie genau sind KI-geschriebene Prüfungsfragen? Was echte Aufträge zeigen

Every question this site writes is checked before a student sees it, and the checks keep a count. This is what the 10 days since of real jobs on medical textbooks, lecture decks and notes show: how many questions a model writes that cannot be traced to the page, that a second model answers differently, or that repeat one already written.

Die Zahlen, gezählt aus dem Aufrufprotokoll

What the checks countedShare of questions written
Questions the models wrote6,183 in 2,459 calls
Kept, every check passed44.0%
Thrown out, all reasons56.0%
Zitat nicht auf der angegebenen Seite6.5%
Second model answered differently5.4%
Repeat of a question already written11.2%
Structural flaw (all of the above, a vague stem, an option that gives itself away)30.9%

Counted from the call log over September 14, 2026 to September 24, 2026, refreshed twice an hour. The same report, split by model family and with a CSV, is on the rejection rates page.

Was jede Ablehnung bedeutet

Zitat nicht auf der genannten Seite gefunden. Jede Frage muss ein oder zwei Sätze tragen, die aus dem Dokument kopiert sind, mit der Seite, auf der sie stehen. Der Server sucht den Satz im gespeicherten Text dieser Seite. Steht er nicht dort, hat das Modell eine Frage über etwas geschrieben, das im Material nicht steht, oder den Wortlaut falsch erinnert, und die Frage fliegt raus. Das ist die Kontrolle, die einen erfundenen Fakt erwischt.

Das zweite Modell hat anders geantwortet. Ein Modell aus einer anderen Familie bekommt die Frage und die Zitate, sonst nichts: keinen Lösungsschlüssel, kein Dokument. Kommt es allein aus den Zitaten nicht auf die hinterlegte Antwort, belegen die Zitate die Antwort nicht, und die Frage fliegt raus. Das ist die Kontrolle, die eine richtig klingende Frage mit falschem Lösungsschlüssel erwischt, oder einen Schlüssel, den das Zitat nicht stützt.

Wiederholung einer schon geschriebenen Frage. Jede neue Frage wird mit allem verglichen, was aus dem Dokument schon erzeugt wurde. Eine Beinahe-Wiederholung fliegt raus, damit ein langer Durchlauf verschiedene Fragen bringt statt derselben Fakten in neuen Worten.

Struktureller Mangel. "Alle der genannten", "keine der genannten", ein Fragenstamm, der fragt, welche Aussage richtig ist, eine Option, die auffällig länger ist als die anderen, eine Frage, die sich auf "den Text" bezieht. Das sind die Zeichen, die Prüfer gelernt haben zu entfernen, und hier werden sie per Regel entfernt, bevor die anderen Kontrollen laufen. Der MC-Fragen-Prüfer wendet dieselben Regeln auf jede Frage an, die du einfügst.

Warum ein Generator ohne Zitat dir seine Genauigkeit nicht nennen kann

Ein Werkzeug, das dir ein Quiz gibt, ohne den Satz zu nennen, aus dem jede Frage stammt, kann nicht zählen, wie viele seiner Fragen unbelegt waren, weil in seiner Verarbeitung nie jemand nachgesehen hat. Seine Genauigkeit ist das, was du findest, wenn du die Fragen selbst prüfst, und genau diese Arbeit wolltest du abgeben. Die Hilfeseite eines konkurrierenden Werkzeugs bittet die eigenen Nutzer, ein erzeugtes Quiz zu prüfen, bevor sie sich darauf verlassen, was die ehrliche Auskunft ist, wenn nichts geprüft wurde. Die Zahlen oben gibt es, weil die Kontrolle stattfindet, bevor der Studierende irgendetwas sieht, und weil gezählt wurde, was aussortiert wurde, statt es still fallen zu lassen.

Wie du eine KI-Frage in zwanzig Sekunden selbst prüfst

  1. Finde den Satz. Zeigt die Frage nicht, woher sie stammt, suche im Dokument nach ihrer zentralen Formulierung. Steht sie nicht dort, stammt die Frage nicht aus deinem Material.
  2. Decke den Lösungsschlüssel ab und antworte nur anhand des Zitats. Lies nur den zitierten Satz und wähle eine Option. Klärt das Zitat die Sache nicht, prüft die Frage etwas, das im Zitat nicht steht.
  3. Sieh dir die Optionen an. Eine Option, die viel länger ist als die anderen, eine Option, die den Fragenstamm wiederholt, "alle der genannten": Jedes davon ist ein verräterisches Zeichen und ein Grund, der Frage zu misstrauen, statt aus ihr zu lernen.

Was das für die Prüfungsvorbereitung bedeutet

Ein Satz Fragen, der diese Kontrollen überstanden hat, ist ein Satz, mit dem du üben kannst, ohne das Kapitel noch einmal zu lesen, um sicherzugehen, dass jede Frage echt ist. Der abgelehnte Anteil ist keine verlorene Mühe; er ist der Teil jeder KI-erzeugten Fragensammlung, aus dem ein Studierender mit einem ungeprüften Werkzeug gelernt hätte. Der kostenlose Tarif auf dieser Seite führt dieselben Kontrollen bei jeder Frage durch, die er schreibt, und die Beispielseite zeigt drei, die das überstanden haben, mit der Seite, die jede von ihnen zitiert.

Fragen, die Studierende stellen

Bedeutet eine hohe Ablehnungsquote ein schlechtes Modell?

Nicht für sich genommen. Ein Modell, das anspruchsvolle klinische Fallvignetten schreibt, verliert mehr davon an das zweite Modell als eines, das Wissensabfragen schreibt, und ein langer Durchlauf aus einem kurzen Kapitel verliert Fragen an die Dublettenprüfung, weil das Kapitel nur so viele Fakten hat. Die Quote ist eine Eigenschaft von Modell, Material und Durchlauf zusammen, deshalb wird der Bericht mit der Zahl veröffentlicht, aus der er gezählt wurde.

Sind die Fragen, die durchkommen, garantiert richtig?

Nein. Die Kontrollen erwischen eine Frage, deren Zitat nicht auf der genannten Seite steht, eine, die ein zweites Modell anders beantwortet als der Lösungsschlüssel, eine, die eine frühere Frage wiederholt, und eine Reihe struktureller Mängel. Die Medizin selbst können sie nicht beurteilen. Deshalb wird jede behaltene Frage mit ihrem Zitat und ihrer Seitenzahl gezeigt, damit der Studierende die Zeile lesen kann, aus der die Frage stammt.

Warum zählt eine wiederholte Frage als Ablehnung?

Weil ein Generator, der aus einem Handout von zwölf Seiten vierzig Fragen schreiben soll, dieselben zwölf Fakten in anderen Worten wiederholt, wenn ihn nichts daran hindert. Jede neue Frage wird mit allem verglichen, was aus dem Dokument schon geschrieben wurde, und eine Beinahe-Wiederholung fliegt raus, statt dem Studierenden als neue Übung gegeben zu werden.

Wo sind die Rohdaten?

Die Seite mit den Ablehnungsquoten veröffentlicht den Bericht nach Modellfamilie und nach Spur mit einem CSV-Download, und die Zahlen auf dieser Seite werden aus demselben Bericht gelesen. Das Aufrufprotokoll wird seit dem 14. September 2026 geführt.

Mit deinem eigenen PDF testen

Die Quoten nach Modell ansehen

Zum Ausprobieren ist kein Konto nötig. Mit einer Registrierung bleiben deine Bibliothek, deine Noten und deine Wiederholungsliste auf allen Geräten erhalten.

Veröffentlicht am , aktualisiert am .