# AIが書いた試験問題はどれくらい正確か。実際のジョブが示すもの

> 医学の教科書に対する実際の生成ジョブの却下率です。AIの問題が、引用チェック、ブラインドでの再解答、重複チェックに落ちる頻度を示します。

https://meduniexam.com/ja/blog/how-accurate-are-ai-exam-questions（HTMLページ）のMarkdown版です。MedUni Examが公開しています。 公開日 2026年9月16日. エージェント向けのサイト案内: https://meduniexam.com/llms.txt.

執筆: [Nicholas](https://meduniexam.com/ja/about.md)。2026年9月24日に確認。

Every question this site writes is checked before a student sees it, and the checks keep a count. This is what the 10 days since September 14, 2026 of real jobs on medical textbooks, lecture decks and notes show: how many questions a model writes that cannot be traced to the page, that a second model answers differently, or that repeat one already written.

## 呼び出しログから数えた数字

| What the checks counted | Share of questions written |
| --- | --- |
| Questions the models wrote | 6,183 in 2,459 calls |
| Kept, every check passed | 44.0% |
| Thrown out, all reasons | 56.0% |
| 引用が示されたページになかった | 6.5% |
| Second model answered differently | 5.4% |
| Repeat of a question already written | 11.2% |
| Structural flaw (all of the above, a vague stem, an option that gives itself away) | 30.9% |

Counted from the call log over September 14, 2026 to September 24, 2026, refreshed twice an hour. The same report, split by model family and with a CSV, is on the [rejection rates page](https://meduniexam.com/ja/stats/rejections.md).

## それぞれの却下が意味するもの

**引用が、示されたページに見つからない。** すべての問題は、資料から写した1文か2文を、それがあるページとともに持たなければなりません。サーバーはその文を、そのページの保存済みテキストの中で探します。見つからなければ、モデルは資料に書かれていないことについて問題を書いたか、文言を覚え違えたことになり、その問題は捨てられます。これが、作り出された事実を捕まえるチェックです。

**2つ目のモデルの答えが違った。** 別の系統のモデルに、問題と引用だけを渡します。正解も資料も渡しません。引用だけから正解にたどり着けないなら、引用はその答えを裏づけていないことになり、その問題は捨てられます。これが、もっともらしいのに正解が誤っている問題や、引用が支えていない正解を捕まえるチェックです。

**すでに書かれた問題の繰り返し。** 新しい問題は、その資料からすでに生成されたすべての問題と比較されます。ほぼ同じものは捨てられるので、長く回しても、同じ事実の言い換えではなく別の問題が出てきます。

**構造上の欠陥。** 「上記のすべて」「上記のどれでもない」、正しい記述はどれかと尋ねる問題文、ほかより明らかに長い選択肢、「本文」に言及する問題。試験作成者が取り除くよう訓練されている手がかりであり、ここでは他のチェックが走る前にルールで取り除かれます。[MCQ欠陥チェッカー](https://meduniexam.com/ja/tools/mcq-checker.md)は、貼り付けたどの問題にも同じルールを適用します。

## 引用を示さないジェネレーターが、自分の正確さを伝えられない理由

各問題のもとになった文を見せずに小テストを渡すツールは、自分の問題のうちいくつが裏づけのないものだったかを数えられません。仕組みの中で誰も見ていないからです。その正確さは、あなたが自分で問題を確かめて初めて分かるものであり、それはあなたが手放そうとしていた作業です。ある競合ツールのヘルプページは、生成された小テストを頼りにする前に利用者が見直すよう求めています。何も検証していないのなら、それは正直な言い方です。上の数字が存在するのは、学生が何かを見る前にチェックが行われ、捨てられたものを黙って消すのではなく数えているからです。

## AIの問題を自分で20秒で確かめる方法

1. **その文を探す。** 問題が出どころを示していないなら、資料の中でその鍵になる語句を検索します。語句がなければ、その問題はあなたの資料から作られたものではありません。
2. **正解を隠して、引用だけから答える。** 引用された文だけを読んで選択肢を選びます。引用で決まらないなら、その問題は引用に書かれていないことを問うています。
3. **選択肢を見る。** 1つだけ極端に長い選択肢、問題文をそのまま繰り返す選択肢、「上記のすべて」。どれも手がかりであり、その問題から学ぶのではなく、その問題を疑う理由になります。

## 試験対策にとっての意味

これらのチェックを通った問題の集まりは、1問ずつ本当かどうか章を読み直して確かめなくても練習に使えます。却下された分は無駄な労力ではありません。チェックのないツールを使う学生なら、そのまま勉強してしまっていた部分です。このサイトの無料プランでも、書かれるすべての問題に同じチェックが走ります。[サンプルページ](https://meduniexam.com/ja/sample.md)には、通過した3問を、それぞれが引用するページとともに載せています。

## 学生からのよくある質問

### 却下率が高いモデルは、悪いモデルということですか。

それだけでは言えません。手の込んだ臨床症例問題を書くモデルは、単純な想起問題を書くモデルより、2つ目のモデルで多く落ちます。短い章から長く回せば、章にある事実が限られているため重複チェックで問題が落ちます。この割合は、モデル、資料、そしてその実行の組み合わせの性質です。だからこそ報告は、集計のもとになった件数とともに公開しています。

### チェックを通った問題は、正しいと保証されますか。

いいえ。チェックが捕まえるのは、引用が示されたページにない問題、2つ目のモデルが正解と違う答えを出した問題、以前の問題の繰り返し、そしていくつかの構造上の欠陥です。医学の内容そのものは判断できません。だからこそ、残ったすべての問題は引用とページ番号とともに表示され、学生はその問題のもとになった行を読めます。

### 繰り返しの問題が却下に数えられるのはなぜですか。

12ページの配布資料から40問を求められたジェネレーターは、止めるものがなければ、同じ12個の事実を言葉を変えて繰り返すからです。新しい問題はその資料からすでに書かれたすべてと比較され、ほぼ同じものは、新しい練習として学生に渡されるのではなく捨てられます。

### 元データはどこにありますか。

却下率のページは、モデル系統ごととレーンごとの報告をCSVのダウンロードつきで公開しており、このページの数字も同じ報告から読んでいます。呼び出しログは2026年9月14日から記録しています。

[自分のPDFで試す](https://meduniexam.com/#/?lang=ja)

[モデル別の割合を見る](https://meduniexam.com/ja/stats/rejections.md)

試すだけならアカウントは要りません。登録すると、ライブラリ、成績、復習キューがどの端末でも残ります。

## 関連ページ

- [却下率](https://meduniexam.com/ja/stats/rejections.md): 直近30日間の、モデル系統ごとの却下率を公開しています。Nの値とCSVのダウンロードつき。
- [仕組み](https://meduniexam.com/ja/how-it-works.md): 検証の流れを一段階ずつ。何が却下され、なぜ却下されるのかも含みます。
- [記事](https://meduniexam.com/ja/blog.md): 記事の一覧です。すべての記事を新しい順に並べています。
- [1日に何問の練習問題で足りるのか](https://meduniexam.com/ja/blog/how-many-practice-questions-per-day.md): 1日の練習問題の目安を、自分の教材が支えられる重複しない問題の数で決めます。本サイトで数えた17.6パーセントの重複率を、反復が再読に変わる地点の目印として使います。
- [間隔反復のスケジュール: 試験まで3週間](https://meduniexam.com/ja/blog/spaced-repetition-three-weeks-before-exam.md): 試験まで3週間か4週間のときに間隔反復のスケジュールを組む方法です。試験日から逆算してセッションを数え、すべての反復を想起の試みにし、間違えた問題に次のセッションを決めさせます。
