So machst du aus deinen Notizen Übungsfragen, die das Beantworten wert sind
Brauchbare Übungsfragen aus einer Vorlesung zu holen, kostet etwa vierzehn Minuten, bevor du überhaupt etwas beantwortest, und das meiste davon bist du selbst, der drei Fragen von Hand schreibt, um einen Maßstab zu setzen. Das Erzeugen dauert zwei Minuten, und ebenso lange dauert das Prüfen, das entscheidet, ob der Satz das Beantworten wert ist. Der durchgerechnete Durchlauf am Ende dieses Artikels dauert von Anfang bis Ende fünfzig Minuten, denn die Fragen aus dem Stand zu beantworten und die Fehler nachzulesen ist der Teil, der dir etwas beibringt. Lässt du das Prüfen weg, lernst du das, was das Modell geraten hat. Eine im Mai 2026 veröffentlichte systematische Übersichtsarbeit beziffert die Fehlerquote über 71 Studien hinweg auf irgendwo zwischen unter 1 Prozent und 45 Prozent.
Schreib zuerst drei von Hand, danach nie wieder
Öffne den Foliensatz. Finde drei Zeilen, die eine Antwort allein entscheiden könnten: einen Mechanismus, einen Grenzwert, ein Mittel der ersten Wahl, einen charakteristischen Befund. Bau aus jeder eine Frage, fünf Optionen, eine richtig. Zehn Minuten, und mit dem Schreiben von Hand bist du für immer durch.
Diese zehn Minuten kaufen dir einen Maßstab. Wenn du drei geschrieben hast, weißt du, dass ein brauchbarer Fragenstamm etwas fragt, das du mit abgedeckten Optionen beantworten könntest, dass fünf Optionen dieselbe Art Sache in derselben grammatischen Form sein müssen und dass genau ein Satz in deiner Quelle die Antwort entscheiden muss. Du lernst außerdem, wie langsam das geht, und deshalb schreibt niemand vierzig.
Heb die drei auf. Sie werden dein Maßstab für alles, was ein Modell dir später hinlegt, und wenn eine erzeugte Frage falsch aussieht und du nicht sagen kannst, warum, findest du das Problem meist in den Optionen, sobald du sie neben eine von deinen legst.
Was du verlangen sollst, in den Worten, die das Ergebnis ändern
Frag mich das mal ab bringt dir Nebensächlichkeiten über das Dokument statt Fragen zum Fach. Sechs Anweisungen ändern, was zurückkommt. Setz sie über deinen Text und pass die Anzahl und das Fach an.
Nutze nur den Text unten. Schreibe 12 Single-Best-Answer-Fragen zur Herz-Kreislauf-Physiologie im zweiten Studienjahr, jede mit fünf Optionen und genau einer richtigen Antwort. Drucke nach jeder Frage den wörtlichen Satz aus dem Text aus, der die Antwort richtig macht, und die Seiten- oder Foliennummer, auf der er steht. Schreibe keine Frage, wenn dieser eine Satz die Antwort nicht allein entscheidet. Keine Fragenstämme mit Alle der genannten, keine mit Keine der genannten, keine mit Welche der folgenden Aussagen trifft zu. Halte die fünf Optionen gleich lang und in derselben grammatischen Form.
- Nutze nur den Text unten. Fehlt das, antwortet das Modell aus dem, was es ohnehin schon weiß, und du übst an Stoff, den dein Prüfer nie unterrichtet hat.
- Lass den wörtlichen Satz und die Seite mit ausgeben. Diese Anweisung leistet von den sechsen am meisten. Zitate, die du nachschlagen kannst, klären einen Streit mit dem Lösungsschlüssel in zehn Sekunden, und ein Modell, das eines liefern muss, schreibt weniger Behauptungen, die es nicht belegen kann.
- Ein einziger Satz muss es entscheiden. Sonst bekommst du Fragen, die neben der zitierten Zeile noch drei Fakten von woanders brauchen, nicht prüfbar und unfair zu beantworten.
- Benenne das Fragenformat. Sag nur Fragen, und du bekommst Richtig oder falsch, Lückentext und einzeilige Abfragen bunt gemischt.
- Verbiete die zwei Fragenstämme. Alle der genannten und Welche der folgenden Aussagen trifft zu sind die Mängel, die Generatoren am häufigsten produzieren, und beide verschwinden auf Anweisung.
- Gleiche Länge, gleiche Form. Fragenautoren bauen ausgerechnet die Option aus, von der sie wissen, dass sie richtig ist, und ein Modell, das auf ihren Texten trainiert wurde, übernimmt die Angewohnheit.
Fordere eine Anzahl an, die dein Material tragen kann. Der Beitrag über den täglichen Nachschub an Fragen zählt Zeile für Zeile und landet nahe bei der Folienzahl, und das ist eine Zählung prüfbarer Zeilen und nicht der Fragen, die du behältst. In der Praxis gibt ein Foliensatz mit 40 Folien 15 bis 20 her, die du behalten würdest, denn 50 anzufordern bringt vor allem Dubletten, die die Kontrollen dann wieder entfernen.
Was falsch zurückkommt und wie oft: 71 Studien, ausgezählt
Zwei veröffentlichte Zahlen setzen eine faire Erwartung. Eine systematische Übersichtsarbeit im Postgraduate Medical Journal, veröffentlicht am 20. Mai 2026, fasste 71 Studien aus 24 Ländern über KI-geschriebene Multiple-Choice-Fragen in der medizinischen Ausbildung zusammen. Die Fehlerquoten reichten von unter 1 Prozent bis 45 Prozent. Die mittlere Schwierigkeit lag bei 0,67 und die mittlere Trennschärfe bei 0,28, und das beschreibt eine Frage, die Studierende, die den Stoff können, von denen trennt, die ihn nicht können, aber nicht scharf. Die meisten dieser Studien beurteilten die Fragen durch Expertenbegutachtung und nicht dadurch, sie Lernenden vorzulegen, und die Übersichtsarbeit schließt, dass die Belege noch keinen "unsupervised use in summative assessment" tragen.
Älter und schonungsloser: Die Chobanian and Avedisian School of Medicine der Boston University berichtete im Dezember 2023, dass ChatGPT in 32 Prozent der Fälle eine richtige Frage mit richtiger Antwort und Erklärung hervorbrachte, wenn es Fragen für eine Prüfung im Medizinstudium schreiben sollte.
Dritte Zahl, von dieser Seite, die zählt, was ihre Kontrollen aussortieren, und die Zahl veröffentlicht. Gelesen am 20. September 2026: Zwischen dem 14. September, an dem das Aufrufprotokoll beginnt, und diesem Datum schrieben die Modelle 3.564 Fragen in 1.398 Aufrufen. Davon haben 43,1 Prozent alles überstanden. Strukturregeln entfernten 32,8 Prozent, die Dublettenprüfung 13,5 Prozent, ein zweites Modell, das allein aus dem Zitat ohne den Lösungsschlüssel antwortet, 6,7 Prozent, und 2,2 Prozent zitierten entweder einen Satz, den der Prüfer auf der angegebenen Seite nicht finden konnte, oder gaben eine Seite außerhalb des Abschnitts an. Die übrigen 1,7 Prozent kamen an, als der Auftrag schon voll war, oder kamen in einer Form zurück, die der Parser nicht lesen konnte.
Diese Anteile bewegen sich mit jedem Auftrag, und der Anteil der Dubletten bewegt sich am meisten. Der einen Tag früher veröffentlichte Beitrag zählte ihn über ein kürzeres Fenster mit 17,6 Prozent, vom 14. bis zum 19. September 2026; dieser Abruf zählt 13,5 Prozent vom 14. bis zum 20. September 2026. Beides sind richtige Abrufe desselben laufenden Berichts, und deshalb trägt die Seite mit den Ablehnungsquoten die aktuelle Zahl und alles oben ist eine Momentaufnahme davon.
Zusammengenommen sagen diese drei nicht, man solle das Erzeugen von Fragen lassen. Sie sagen, dass fast die Hälfte von dem, was zurückkommt, in den Müll gehört, und deine einzige Entscheidung ist, wer das Wegwerfen übernimmt.
Wann man mit dem Prüfen aufhört, und was eine durchgefallene Frage wert ist
Die drei Kontrollen, die das meiste erwischen, stehen schon auf der Seite hinter diesen Zahlen: Such den zitierten Satz in deinem Dokument, deck den Lösungsschlüssel ab und antworte allein aus dem Zitat, und lies dann die fünf Optionen ohne den Fragenstamm. Lass sie über die ersten fünf Fragen eines Satzes laufen, insgesamt eine Minute, und der Artikel über Genauigkeit arbeitet durch, was jede davon erwischt und warum.
Diese Kontrollen stammen nicht von mir. Sie kommen aus der Systematik des Fragenschreibens, die zwei Quellen aufstellen: die 31 Regeln, die Haladyna, Downing und Rodriguez 2002 in Applied Measurement in Education aufgestellt haben, und die Arbeitsfassung, die Fragenautoren üblicherweise bekommen, den NBME Item-Writing Guide, inzwischen in sechster Auflage und im Februar 2021 online gestellt.
Was diese Seite dir nicht sagt, ist, wann man aufhört. Hier ist die Zahl: Prüfe die ersten fünf Fragen und keine mehr. Bei zwei Fehlschlägen von fünf hörst du mit dem Prüfen auf und gehst zurück zum Prompt. Ein Satz, der so früh zweimal durchfällt, fällt fast immer aus einem einzigen Grund durch, und ein einziger Grund ist meist eine einzige Zeile im Prompt, ihn zu schärfen und neu zu erzeugen kostet also zwei Minuten. Alle fünfzehn zu prüfen kostet zwanzig und lässt denselben Fehler im nächsten Stapel stehen.
Eine Frage, die durchfällt, kommt in den Müll und nicht in die Reparatur. Einen Fragenstamm umzuschreiben, dessen zitierter Satz die Antwort nicht entscheidet, heißt, die Antwort selbst festzulegen, und ab da bist du der Fragenautor und das Modell hat deinen Abend verbraucht. Bei weniger als einem Fehlschlag von fünf wirf diesen einen weg und beantworte den Rest.
Auch die weggeworfene Frage bringt etwas ein. Du hast die Folie geöffnet, um sie zu prüfen, du hast also die Zeile gelesen, auf der die Frage gebaut war, in den Worten der Quelle. Schreib diese Zeile dorthin, wo deine Fehler landen. Eine Frage, die eine Kontrolle nicht bestanden hat, und eine Frage, die du falsch beantwortet hast, enden am selben Ort, und der ist der Anfang von morgen.
Die Fassung für die Pflege, und was eine Vorlesungsfolie dir nicht gibt
Pflegestudierende kommen meist mit einer engeren Aufgabe hierher: Fragen im NCLEX-Stil aus einem Handout der Lehrveranstaltung zu bekommen. Die Situation ist das fehlende Stück. Deine Folie zur Pathophysiologie gibt dir einen Mechanismus, während eine Frage im NCLEX-Stil einen Patienten braucht, einen Rahmen, ein paar Befunde und eine Schlussfrage nach einer Priorität oder einer Maßnahme, dazu vier Optionen, die alle vertretbar sind, und eine, die die beste ist. Nichts davon steht auf der Folie, der Prompt muss es also dorthin bringen.
Ergänze eine Zeile: Schreibe jede Frage als kurze Patientensituation im Krankenhaus, die damit endet, welche Maßnahme die Pflegekraft zuerst ergreifen soll, und mach alle vier Optionen zu sicheren pflegerischen Maßnahmen. Füge dafür eine vierte Kontrolle hinzu: Trägt der Fragenstamm genug Information, um zwischen den vieren zu wählen? Wo jede davon vernünftigerweise die erste sein könnte, ist die Frage nicht schwer, sondern unbeantwortbar, und sie bringt dir das Raten bei.
Aus einem Handout völlig unerreichbar: die Next-Generation-Formate. Case study, Matrix, Bow tie, Highlight und Drop down sind um Patientendaten gebaut, die sich nach und nach entfalten, mit eigenen Bewertungsregeln, und nichts, was aus einem Foliensatz erzeugt wird, bringt sie hervor. Wer dir das aus einer PDF verkauft, verspricht zu viel. Die Seite zu NCLEX-RN hier sagt dasselbe. Dies ist keine NCLEX-Fragensammlung und hat keine Verbindung zur NCSBN; die Fragen werden in diesem Stil aus der Datei geschrieben, die du hochlädst.
Das Ganze in Menge, ohne in Fast-Dubletten zu ertrinken
Fordere 60 Fragen aus einem Handout von 12 Seiten an, und du bekommst dieselben 12 Fakten in 60 Verkleidungen. Nichts in einem Chatfenster hält das auf: Bei Frage 47 hat das Modell Frage 14 schon verloren, und eine Umformulierung von etwas, das du vor zwanzig Minuten beantwortet hast, zu erkennen, ist schwer.
Drei Gewohnheiten halten einen langen Lauf ehrlich. Erzeuge ein Kapitel nach dem anderen statt ein ganzes Modul, denn Dubletten häufen sich innerhalb einer Quelle. Wechsle beim zweiten Durchgang den Fragentyp, so wird aus Single Best Answer eine klinische Vignette und derselbe Fakt wird als Denkaufgabe geprüft. Überflieg die Fragenstämme, bevor du eine davon beantwortest, denn eine früh entdeckte Wiederholung kostet nichts und eine, die dir erst bei Frage 30 auffällt, kostet dich die Einheit.
Bei diesem Teil sind Maschinen besser als du. Ein Generator, der jede neue Frage mit allem vergleicht, was aus demselben Dokument schon geschrieben wurde, wirft eine Fast-Wiederholung weg, bevor du sie je siehst, und genau das sind die oben gezählten Ablehnungen wegen Dubletten: Fragen, die nie einen Leser erreicht haben.
Ein durchgerechneter Durchlauf mit einem Foliensatz von 40 Folien
Dienstagabend, eine Kardiologievorlesung mit 40 Folien, in einem Durchgang. Unten stehen die Zeiten, die es wirklich braucht, nicht die, die einem Plan gefallen würden.
- Die ersten zehn Minuten. Drei Fragen von Hand, aus Folien, bei denen du dich erinnerst, dass der Dozent langsamer wurde.
- Zwei Minuten. Setz den Prompt über den Text des Foliensatzes und fordere 15 Fragen an, nicht 50. Fünfzehn ist ungefähr das, was 40 Folien hergeben, sobald die Wiederholungen heraus sind.
- Noch zwei Minuten. Lass die Kontrollen über die ersten fünf Fragen laufen. Rechne damit, dass eine oder zwei durchfallen. Bei zwei Fehlschlägen besserst du den Prompt nach und erzeugst neu, was zwei Minuten kostet und zwanzig spart.
- Dreiundzwanzig Minuten. Beantworte alle 15 aus dem Stand, etwa 90 Sekunden je Frage, die Optionen abgedeckt, bis du dich festgelegt hast.
- Dreizehn Minuten. Öffne bei jedem Fehler die Folie, die die Frage zitiert, und lies die Zeile, aus der sie stammt. Schreib sie in den Worten der Quelle ab, nicht in deiner Zusammenfassung davon.
- Morgen. Diese Fehler eröffnen die nächste Einheit, noch vor allem Neuen. Wann sie in den folgenden Wochen wiederkommen, ist das Thema von dem Plan für verteilte Wiederholung.
Fünfzig Minuten, 15 Fragen, die du verteidigen kannst, und eine handschriftliche Liste der Fakten, die dich geschlagen haben.
Häufige Fragen
Mit welchem Prompt schreibt ChatGPT gute Prüfungsfragen aus meinen Notizen?
Vier Anweisungen tragen fast den ganzen Nutzen. Sag dem Modell, es soll nur den Text nutzen, den du eingefügt hast, benenne das Format als Single Best Answer mit fünf Optionen und genau einer richtigen Antwort, verlange den wörtlichen Satz und die Seitenzahl, die die Antwort richtig machen, und verbiete Fragenstämme mit Alle der genannten und Welche der folgenden Aussagen trifft zu. Ergänzt du noch, dass der zitierte Satz die Antwort allein entscheiden muss, fällt das meiste vom Rest weg.
Wie genau sind KI-erzeugte Übungsfragen?
Veröffentlichte Studien geben keine einzelne Zahl her. Eine systematische Übersichtsarbeit über 71 Studien im Postgraduate Medical Journal, veröffentlicht am 20. Mai 2026, fand Fehlerquoten von unter 1 Prozent bis 45 Prozent, und die Boston University berichtete im Dezember 2023, dass ChatGPT in 32 Prozent der Fälle eine richtige Frage mit richtiger Antwort und Erklärung hervorbrachte. Über deinen eigenen Satz entscheidet, ob ihn überhaupt etwas geprüft hat. Diese Seite veröffentlicht, was ihre Kontrollen aussortieren: gelesen am 20. September 2026, haben 43,1 Prozent von 3.564 erzeugten Fragen jede Kontrolle überstanden, wobei die Dublettenprüfung 13,5 Prozent des Rests ausmachte. Diese Anteile bewegen sich mit dem Zeitfenster, die Seite mit den Ablehnungsquoten trägt daher die aktuelle Zahl.
Wie viele Übungsfragen sollte ich aus einer Vorlesung machen?
Zählt man prüfbare Zeilen, landet ein Foliensatz mit 40 Folien bei etwa einer pro Folie, denn so viele Zeilen könnten eine Antwort allein entscheiden. Zählt man die Fragen, die du nach dem Prüfen behalten würdest, sind es eher 15 bis 20, weil nicht jede prüfbare Zeile übersteht. 50 anzufordern schafft keine zusätzlichen Fakten, es formuliert dieselben nur neu, und die Dublettenprüfung entfernt sie wieder. Erzeuge eine Vorlesung nach der anderen und hör auf, wenn die neuen Fragen dich nicht mehr überraschen.
Wann sollte ich aufhören, einen erzeugten Satz zu prüfen, und neu anfangen?
Prüfe die ersten fünf Fragen und hör da auf. Bei zwei Fehlschlägen von fünf gehst du zurück zum Prompt, statt den Satz zu reparieren, denn ein Satz, der so früh zweimal durchfällt, fällt meist aus einem einzigen Grund durch, und ein einziger Grund ist meist eine einzige Zeile im Prompt. Neu erzeugen kostet zwei Minuten; fünfzehn Fragen einzeln zu reparieren kostet den Abend.
Kann KI aus meinen Vorlesungsnotizen Fragen im NCLEX-Stil schreiben?
Es kann Szenariofragen in diesem Stil schreiben, wenn du ihm sagst, es soll eine Patientensituation mit einer Frage nach Priorität oder Maßnahme und vier sicheren Optionen bauen, denn eine Vorlesungsfolie liefert die Pathophysiologie, aber nie den Rahmen. Die Next-Generation-Formate, also Case study, Matrix, Bow tie, Highlight und Drop down, lassen sich aus einem Dokument nicht herstellen. Dies ist keine NCLEX-Fragensammlung und hat keine Verbindung zur NCSBN.
Veröffentlicht am .