AIが書いた試験問題はどれくらい正確か。実際のジョブが示すもの
Every question this site writes is checked before a student sees it, and the checks keep a count. This is what the 10 days since of real jobs on medical textbooks, lecture decks and notes show: how many questions a model writes that cannot be traced to the page, that a second model answers differently, or that repeat one already written.
呼び出しログから数えた数字
| What the checks counted | Share of questions written |
|---|---|
| Questions the models wrote | 6,183 in 2,459 calls |
| Kept, every check passed | 44.0% |
| Thrown out, all reasons | 56.0% |
| 引用が示されたページになかった | 6.5% |
| Second model answered differently | 5.4% |
| Repeat of a question already written | 11.2% |
| Structural flaw (all of the above, a vague stem, an option that gives itself away) | 30.9% |
Counted from the call log over September 14, 2026 to September 24, 2026, refreshed twice an hour. The same report, split by model family and with a CSV, is on the rejection rates page.
それぞれの却下が意味するもの
引用が、示されたページに見つからない。 すべての問題は、資料から写した1文か2文を、それがあるページとともに持たなければなりません。サーバーはその文を、そのページの保存済みテキストの中で探します。見つからなければ、モデルは資料に書かれていないことについて問題を書いたか、文言を覚え違えたことになり、その問題は捨てられます。これが、作り出された事実を捕まえるチェックです。
2つ目のモデルの答えが違った。 別の系統のモデルに、問題と引用だけを渡します。正解も資料も渡しません。引用だけから正解にたどり着けないなら、引用はその答えを裏づけていないことになり、その問題は捨てられます。これが、もっともらしいのに正解が誤っている問題や、引用が支えていない正解を捕まえるチェックです。
すでに書かれた問題の繰り返し。 新しい問題は、その資料からすでに生成されたすべての問題と比較されます。ほぼ同じものは捨てられるので、長く回しても、同じ事実の言い換えではなく別の問題が出てきます。
構造上の欠陥。 「上記のすべて」「上記のどれでもない」、正しい記述はどれかと尋ねる問題文、ほかより明らかに長い選択肢、「本文」に言及する問題。試験作成者が取り除くよう訓練されている手がかりであり、ここでは他のチェックが走る前にルールで取り除かれます。MCQ欠陥チェッカーは、貼り付けたどの問題にも同じルールを適用します。
引用を示さないジェネレーターが、自分の正確さを伝えられない理由
各問題のもとになった文を見せずに小テストを渡すツールは、自分の問題のうちいくつが裏づけのないものだったかを数えられません。仕組みの中で誰も見ていないからです。その正確さは、あなたが自分で問題を確かめて初めて分かるものであり、それはあなたが手放そうとしていた作業です。ある競合ツールのヘルプページは、生成された小テストを頼りにする前に利用者が見直すよう求めています。何も検証していないのなら、それは正直な言い方です。上の数字が存在するのは、学生が何かを見る前にチェックが行われ、捨てられたものを黙って消すのではなく数えているからです。
AIの問題を自分で20秒で確かめる方法
- その文を探す。 問題が出どころを示していないなら、資料の中でその鍵になる語句を検索します。語句がなければ、その問題はあなたの資料から作られたものではありません。
- 正解を隠して、引用だけから答える。 引用された文だけを読んで選択肢を選びます。引用で決まらないなら、その問題は引用に書かれていないことを問うています。
- 選択肢を見る。 1つだけ極端に長い選択肢、問題文をそのまま繰り返す選択肢、「上記のすべて」。どれも手がかりであり、その問題から学ぶのではなく、その問題を疑う理由になります。
試験対策にとっての意味
これらのチェックを通った問題の集まりは、1問ずつ本当かどうか章を読み直して確かめなくても練習に使えます。却下された分は無駄な労力ではありません。チェックのないツールを使う学生なら、そのまま勉強してしまっていた部分です。このサイトの無料プランでも、書かれるすべての問題に同じチェックが走ります。サンプルページには、通過した3問を、それぞれが引用するページとともに載せています。
学生からのよくある質問
却下率が高いモデルは、悪いモデルということですか。
それだけでは言えません。手の込んだ臨床症例問題を書くモデルは、単純な想起問題を書くモデルより、2つ目のモデルで多く落ちます。短い章から長く回せば、章にある事実が限られているため重複チェックで問題が落ちます。この割合は、モデル、資料、そしてその実行の組み合わせの性質です。だからこそ報告は、集計のもとになった件数とともに公開しています。
チェックを通った問題は、正しいと保証されますか。
いいえ。チェックが捕まえるのは、引用が示されたページにない問題、2つ目のモデルが正解と違う答えを出した問題、以前の問題の繰り返し、そしていくつかの構造上の欠陥です。医学の内容そのものは判断できません。だからこそ、残ったすべての問題は引用とページ番号とともに表示され、学生はその問題のもとになった行を読めます。
繰り返しの問題が却下に数えられるのはなぜですか。
12ページの配布資料から40問を求められたジェネレーターは、止めるものがなければ、同じ12個の事実を言葉を変えて繰り返すからです。新しい問題はその資料からすでに書かれたすべてと比較され、ほぼ同じものは、新しい練習として学生に渡されるのではなく捨てられます。
元データはどこにありますか。
却下率のページは、モデル系統ごととレーンごとの報告をCSVのダウンロードつきで公開しており、このページの数字も同じ報告から読んでいます。呼び出しログは2026年9月14日から記録しています。
試すだけならアカウントは要りません。登録すると、ライブラリ、成績、復習キューがどの端末でも残ります。
公開日 , 更新 .