MedUni Exam

解く価値のある練習問題にノートを変える方法

1つの講義から使える練習問題を得るには、解き始める前におよそ14分かかります。その大半は、基準を決めるために自分で3問を手書きする時間です。生成に2分、そしてそのセットを解く価値があるかを決める確認にも2分かかります。本記事の最後にある実際の流れは、最初から最後まで50分です。問題を下調べなしで解き、間違いを読み返す部分こそが、何かを教えてくれるからです。確認を飛ばせば、モデルが推測したものをそのまま勉強することになります。2026年5月に公表された系統的レビューは、71件の研究にまたがる誤りの割合を、1パーセント未満から45パーセントまでと報告しています。

最初に3問だけ手書きして、あとは二度と書かない

スライドを開きます。それだけで答えを決められる行を3つ探します。仕組み、基準値、第一選択薬、特徴的な所見といったものです。それぞれから問題を1問ずつ作り、選択肢は5つ、正解は1つ。10分で、手書きの作業はこれで終わりです。

その10分が基準を買ってくれます。3問書いたあとなら、使える問題文とは選択肢を隠したままでも答えられることを問うものであり、5つの選択肢は同じ種類のものを同じ文法の形でそろえなければならず、出典のちょうど1つの文で答えが決まらなければならない、ということがわかります。どれだけ遅い作業かもわかるので、誰も40問は書かないのだと納得できます。

その3問は取っておいてください。あとでモデルが返してくるものすべての基準になります。生成された問題がどこかおかしいのに理由を言えないとき、自分の3問の1つと並べてみると、たいていは選択肢に原因が見つかります。

何を求めるか。出力を変える言葉で書く

「これで問題を出して」と頼めば、その分野についての問題ではなく、書類についての雑学が返ってきます。返ってくるものを変えるのは6つの指示です。問題数と分野を書き換えて、自分の本文の上に貼ってください。

以下の本文だけを使うこと。2年次の循環生理学について、単一最良解答の問題を12問書くこと。各問題は選択肢5つ、正解はちょうど1つ。各問題のあとに、その答えを正解にする本文中の一文を原文のまま示し、それが載っているページかスライドの番号も示すこと。その一文だけで答えが決まらない問題は書かないこと。「上記のすべて」「上記のいずれでもない」「次のうち正しいものはどれか」という問い方は使わないこと。5つの選択肢は長さと文法の形をそろえること。

  • 以下の本文だけを使うこと。 これを外すと、モデルはすでに知っていることから答えを書き、試験官が一度も教えていない内容で練習することになります。
  • 原文のままの一文とページを出力させます。 6つの指示のうち、これが最もよく働きます。自分で調べられる引用があれば、解答キーとの言い分の違いは10秒で片づきますし、引用を出すよう求められたモデルは、裏づけのない主張を書く回数が減ります。
  • 1つの文で答えが決まること。 そうでないと、引用された一文に加えて別のところからの事実が3つ必要な問題が返ってきます。確かめようもなく、解く側にも不公平です。
  • 問題の形式を指定します。 ただ「問題」と言えば、正誤問題、穴埋め、一行の暗記問題が混ざって返ってきます。
  • 2つの問い方を禁じます。 「上記のすべて」と「次のうち正しいものはどれか」は、ジェネレーターが最も多く作る欠陥で、どちらも指示すれば消えます。
  • 長さも形もそろえます。 作問者は正解だとわかっている選択肢をつい詳しく書きますし、その出力で学習したモデルは同じ癖を真似します。

自分の教材が支えられる数を求めてください。1日に用意できる問題数についての記事は1行ずつ数えており、その数はスライドの枚数に近くなります。ただしそれは、答えを決めうる行の数であって、手元に残す問題の数ではありません。実際には40枚のスライドから残せるのは15問から20問で、50問を求めても、たいていは重複が増えてチェックに落ちるだけです。

何が間違って返ってくるのか、そしてどれくらいの頻度か。71件の研究を数えた結果

公表された2つの数字が、妥当な期待値を決めてくれます。Postgraduate Medical Journalに2026年5月20日に掲載された系統的レビューは、医学教育におけるAIが書いた多肢選択問題について、24か国の71件の研究をまとめました。誤りの割合は1パーセント未満から45パーセントまででした。問題の難易度の中央値は0.67、識別力の中央値は0.28で、これは教材を理解している学生とそうでない学生を分けてはいるものの、鋭くは分けていない問題を表します。これらの研究の多くは、学習者に解かせるのではなく専門家の査読で問題を判断しており、レビューは、現時点の根拠では「unsupervised use in summative assessment」を支持できないと結論しています。

もっと古く、もっと厳しい数字もあります。Boston UniversityのChobanian and Avedisian School of Medicineは2023年12月に、医学部の試験用の問題を書かせたとき、ChatGPTが正しい問題と正しい解答と解説をそろえられたのは32パーセントの場合だったと報告しました。

3つ目の数字は本サイトのもので、自分のチェックが何を捨てたかを数えて公表しています。2026年9月20日に読んだ時点で、呼び出しの記録が始まる9月14日からその日までに、モデルは1,398回の呼び出しで3,564問を書きました。そのうちすべてを通ったのは43.1パーセントです。構造の規則が32.8パーセント、重複のチェックが13.5パーセント、解答キーなしで引用から答える2つ目のモデルが6.7パーセントを取り除き、2.2パーセントは、引用した文が示されたページに見つからないか、その節の外のページを引いていました。残りの1.7パーセントは、ジョブがすでに満杯になったあとに届いたか、読み取れない形で返ってきたものです。

この割合はジョブごとに動き、最も動くのが重複の割合です。その前日に公開した記事は、もっと短い期間、9月14日から2026年9月19日までで17.6パーセントと数えました。今回の読み取りは、9月14日から2026年9月20日までで13.5パーセントです。どちらも同じ移動集計の正しい読み取りで、だからこそ却下率のページに最新の数字があり、上に書いたものはすべてその一時点の写しです。

3つを合わせても、問題を生成するなという話にはなりません。返ってくるもののおよそ半分は捨てるべきだ、という話です。決めるべきなのは、誰がそれを捨てるかだけです。

確認をやめる時期と、落ちた問題に残る価値

大半を捕まえる3つのチェックは、先ほどの数字の出どころのページにすでに書かれています。引用された文を自分の書類の中で探すこと、解答キーを隠して引用だけから答えること、そして問題文を見ずに5つの選択肢だけを読むことです。セットの最初の5問にこれをかければ全部で1分で済みますし、正確さについての記事が、それぞれ何を捕まえ、なぜそうなるのかを順に説明しています。

そのチェックは私が考えたものではありません。2つの出典が示した作問の分類から来ています。Haladyna、Downing、Rodriguezが2002年にApplied Measurement in Educationで示した31の規則と、作問者が実際に渡される版であるNBME Item-Writing Guideです。後者はいま第6版で、2021年2月に公開されました。

そのページが教えてくれないのは、いつやめるかです。その数字がこれです。最初の5問を確認して、それ以上はしません。5問のうち2問が落ちたら、確認をやめてプロンプトに戻ります。そんなに早い段階で2問落ちるセットは、ほぼ必ず1つの原因で落ちていて、その1つの原因はたいていプロンプトの1行なので、そこを締めて作り直せば2分です。15問すべてを確認すれば20分かかり、同じ欠陥が次の一括生成にも残ります。

チェックに落ちた問題は、直すのではなく捨てます。引用された文で答えが決まらない問題文を書き直すのは、自分で答えを決めるということで、そうなれば作問者は自分になり、モデルは一晩を無駄にさせただけになります。5問に1問に満たない失敗なら、その1問を捨てて残りを解いてください。

捨てた問題にも得るものはあります。確かめるためにスライドを開いたということは、その問題のもとになった行を、出典の言葉のまま読んだということです。その行を、間違えた問題をまとめている場所に書き写してください。チェックに落ちた問題と、自分が間違えた問題は同じ場所に行き着きます。そこが翌日の始まりです。

看護の場合と、講義スライドが与えてくれないもの

看護学生がここへ来るときの用件は、たいていもっと狭いものです。授業の配布資料からNCLEX形式の問題を取り出したい、というものです。欠けているのは場面です。病態生理のスライドは仕組みを渡してくれますが、NCLEX形式の問題には患者、場面、いくつかの所見、そして優先順位か行動を尋ねる導入が要り、4つの選択肢はどれも筋が通っていて、そのうち1つが最善でなければなりません。そのどれもスライドには載っていないので、プロンプトの側で用意する必要があります。

1行足します。各問題は病院を舞台にした短い患者の場面として書き、看護師が最初に取るべき行動を問う形で終えること、そして4つの選択肢はすべて安全な看護行為にすること。こうした問題には4つ目のチェックを足します。問題文には、4つから選ぶのに足りる情報があるか。どれでも最初になりうるなら、その問題は難しいのではなく答えようがなく、勘で選ぶ癖をつけるだけです。

配布資料からはまったく手が届かないものもあります。Next Generationの形式です。ケーススタディ、マトリクス、ボウタイ、ハイライト、ドロップダウンの各問題は、展開していく患者情報と独自の採点規則を軸に組まれており、講義スライドから生成されたもので再現できるものはありません。PDFからそれを作れると売り込む相手は、言い過ぎています。本サイトのNCLEX-RNのページも同じことを書いています。これはNCLEXの問題集ではなく、NCSBNとの関係もありません。問題は、アップロードされたファイルからその形式で書かれます。

ほぼ同じ問題に溺れずに量をこなす

12ページの配布資料から60問を求めれば、同じ12個の事実が60通りの装いで返ってきます。チャットの画面には、それを防ぐものが何もありません。第47問のころにはモデルは第14問を見失っていますし、20分前に解いたものの言い換えに気づくのは難しいことです。

長丁場を正直に保つ習慣が3つあります。モジュール全体ではなく1章ずつ生成すること。重複は1つの出典の中に固まるからです。2周目では問題の型を変え、単一最良解答を臨床症例問題にして、同じ事実を推論として試すこと。そして解き始める前に問題文をざっと眺めること。早く気づいた重複には何の損もありませんが、第30問で気づいた重複はそのセッションを台無しにするからです。

この部分は、人よりも機械のほうが得意です。新しい問題を、同じ書類からすでに書かれたすべてと突き合わせるジェネレーターは、ほぼ同じ問題を目に触れる前に落とします。上で数えた重複による却下とは、まさにそれです。読み手に届かなかった問題のことです。

40枚のスライド1つでたどった実際の流れ

火曜の夜、40枚の循環器の講義を1回で片づけます。以下は実際にかかる時間で、計画が望む時間ではありません。

  1. 最初の10分。 講師が話す速度を落としたのを覚えているスライドから、手書きで3問作ります。
  2. 2分。 スライドの本文の上にプロンプトを貼り、50問ではなく15問を求めます。重複が抜けたあとに40枚のスライドが支えられるのは、だいたい15問です。
  3. さらに2分。 最初の5問にチェックをかけます。1問か2問は落ちると思っておいてください。2問落ちたらプロンプトを直して作り直します。2分かかって、20分が浮きます。
  4. 23分。 15問すべてを下調べなしで解きます。1問およそ90秒、答えを決めるまで選択肢は隠しておきます。
  5. 13分。 間違えた問題ごとに、その問題が引用しているスライドを開き、もとになった一文を読みます。自分の要約ではなく、出典の言葉のまま書き写してください。
  6. 翌日。 間違えた問題から次のセッションを始めます。新しいものはそのあとです。その後の数週間のどこでそれが戻ってくるかは、間隔反復のスケジュールで扱っています。

50分で、根拠を説明できる問題が15問と、自分が負けた事実を手書きで並べた一覧が残ります。

よくある質問

どんなプロンプトなら、ChatGPTは自分のノートから良い試験問題を書きますか。

価値のほとんどは4つの指示が担っています。貼り付けた本文だけを使うように伝え、形式を5つの選択肢に正解が1つの単一最良解答と指定し、答えを正解たらしめる原文のままの一文とページ番号を求め、「上記のすべて」と「次のうち正しいものはどれか」という問い方を禁じます。引用した一文だけで答えが決まらなければならない、と加えれば、残っている問題のほとんども消えます。

AIが生成した練習問題はどれくらい正確ですか。

公表された研究は1つの数字を示しません。Postgraduate Medical Journalに2026年5月20日に掲載された71件の研究の系統的レビューは、誤りの割合が1パーセント未満から45パーセントまでと報告しました。Boston Universityは2023年12月に、ChatGPTが正しい問題と正しい解答と解説をそろえられたのは32パーセントの場合だったと報告しています。自分の手元のセットを決めるのは、それを何かが確認したかどうかです。本サイトは、自分のチェックが何を捨てたかを公表しています。2026年9月20日に読んだ時点で、生成された3,564問のうち43.1パーセントがすべてのチェックを通り、残りのうち13.5パーセントは重複のチェックによるものでした。この割合は集計期間とともに動くので、却下率のページに最新の数字があります。

1つの講義から練習問題を何問作るべきですか。

答えを単独で決められる行を数えると、40枚のスライドでは1枚につき1行ほどになります。確認したうえで残す問題の数で数えると、15問から20問に近づきます。そうした行のすべてが問題として生き残るわけではないからです。50問を求めても事実が増えるわけではなく、同じ事実が別の言い回しで並び直され、重複のチェックがそれを取り除きます。1講義ずつ生成し、新しい問題に驚かされなくなったところで止めてください。

生成されたセットの確認をやめて、作り直すのはいつですか。

最初の5問だけを確認して、そこで止めます。5問のうち2問が落ちたら、セットを手直しするのではなくプロンプトに戻ってください。そんなに早い段階で2問落ちるセットは、たいてい1つの原因で落ちていて、その1つの原因はたいていプロンプトの1行です。作り直しは2分ですが、15問を1問ずつ直せば一晩かかります。

AIは授業のノートからNCLEX形式の問題を書けますか。

患者の状況を、優先順位や行動を問う導入とともに組み立て、安全な選択肢を4つ置くように指示すれば、その形式の問題を書けます。講義スライドは病態生理は与えてくれますが、場面は決して与えてくれないからです。Next Generationの形式、つまりケーススタディ、マトリクス、ボウタイ、ハイライト、ドロップダウンは、文書からは作れません。これはNCLEXの問題集ではなく、NCSBNとの関係もありません。

公開日 .