# モデル系統別の却下率

> モデル系統別の却下率。このサイトの本番ジョブから集計しています: 引用が見つからない、2つ目のモデルが不一致、重複、欠陥、受理、そしてN。

https://meduniexam.com/ja/stats/rejections（HTMLページ）のMarkdown版です。MedUni Examが公開しています。 公開日 2026年9月14日, 更新 2026年9月23日. エージェント向けのサイト案内: https://meduniexam.com/llms.txt.

このサイトで書かれるすべての問題は、どのモデルが書いたかにかかわらず同じ検証を通ります。以下は、直近30日間に各モデル系統がどれだけ落としたかと、その率のもとになった件数です。

これらの率は、2026年9月14日から保持している呼び出しログから数えています。サイトの他の場所に出ている累計は、2026年9月11日の開設以降のすべての問題を数えているため、2組の数値は対象期間が異なり、互いに一致するようには作られていません。

集計期間は2026年9月14日から2026年9月24日まで。生成の呼び出し2,459回で6,183問が返されました。モデルファミリーは期間内に200問を返した時点で公開され、それ未満の場合は、わずかな呼び出しから出した割合を載せる代わりに、その旨を表示します。

| モデルファミリー | 作成された問題 | 引用が示されたページになかった | 2つ目のモデルが異なる答えを選んだ | 重複 | 欠陥 | 依頼外または遅すぎた | 採用 |
| --- | --- | --- | --- | --- | --- | --- | --- |
| qwen | 4,583 | 6.2% | 6.1% | 14.0% | 28.9% | 2.1% | 42.7% |
| deepseek | 503 | 14.3% | 3.0% | 2.4% | 11.5% | 2.0% | 66.8% |
| glm | 410 | 2.0% | 7.3% | 5.6% | 51.5% | 2.2% | 31.5% |
| nemotron | 393 | 3.1% | 0.5% | 2.5% | 53.9% | 1.3% | 38.7% |
| gpt-oss | 281 | 7.8% | 1.4% | 1.8% | 38.4% | 1.8% | 48.8% |
| openrouter-primary | 13 | データ不足 | データ不足 | データ不足 | データ不足 | データ不足 | データ不足 |
| gemma | 0 | データ不足 | データ不足 | データ不足 | データ不足 | データ不足 | データ不足 |

## レーン別

無料レーンはまずCloudflare Workers AI上のDeepSeek V4 Flashで動き、ほかのオープンウェイトのモデルが予備になります。有料レーンは優先モデルで動きます。DeepSeek V4 Proが作問し、Kimi K2.6が答えを見ずに解きます。どちらのレーンも同じチェックを受け、どちらもここで集計されます。そのため、このページはレーンではなくモデルファミリーごとの内容です。

| レーン | 作成された問題 | 引用が示されたページになかった | 2つ目のモデルが異なる答えを選んだ | 重複 | 欠陥 | 依頼外または遅すぎた | 採用 |
| --- | --- | --- | --- | --- | --- | --- | --- |
| 無料 | 6,140 | 6.5% | 5.3% | 11.2% | 31.1% | 2.0% | 43.9% |
| 有料 | 43 | データ不足 | データ不足 | データ不足 | データ不足 | データ不足 | データ不足 |

## 各列の意味

- **書かれた問題数**: 解析できる形でモデルが返した問題の数です。JSONとして読めなかった応答は、数えられる問題を返していないため、CSVに呼び出し単位で別に記録されます。
- **引用が示されたページに見つからない**: 逐語的な引用が、モデルの示したページの保存済みテキストになかったか、与えられた範囲の外のページを示していた場合です。CSVではこの2つを分けています。
- **2つ目のモデルが不一致**: 別系統のモデルに、問題と引用は見せて解答キーは見せずに答えさせたところ、別の答えを選んだ場合です。
- **重複**: 同じ文書からすでに受理された問題の繰り返しだったもの。
- **欠陥**: 構造や品質のルールが却下したもの。たとえば正解が透けて見える選択肢の組や、唯一の最良解がない設問文です。これらのルールは、[MCQ欠陥チェッカー](https://meduniexam.com/ja/tools/mcq-checker.md)がブラウザ内で走らせるものと同じです。
- **要求外、または間に合わなかった**: 問題そのものは妥当でしたが、結局学生には届かなかったものです。ジョブが求めていない種類だった（多肢選択のジョブでの記述式の問題など）か、これを書いている間に他の呼び出しでジョブが埋まったかのどちらかです。行の合計が合うように両方とも数えています。どちらもモデルの不備ではありません。
- **受理**: すべてを通過して学生に届いたもの。

## 手法

ここにある数値はすべて、このサイトの本番ジョブから出ています。プロバイダーの呼び出しごとに、その結果が判明した時点で1行を書き込み、保持するのは件数だけです。問題文も文書のテキストも利用者の情報も入りません。件数は実際に答えたモデルに割り当てます。これはジョブが指定したモデルとは限りません。あるモデルがレート制限にかかったり遅かったりすると、プールが別のモデルに切り替えるからです。走らなかったモデルに切り替え先の結果を割り当てれば、間違ったモデルについての数字を公開することになります。

対象期間は直近30日間で、1時間に最大2回まで数え直します。これは3つの固定された期間のうちの1つです。率は各系統が返した問題に対する割合で、呼び出しが返したどの問題もこれらの列のちょうど1つに入るため、受理の割合と合わせて全体になります。すでに終わったジョブに戻ってきた呼び出しは、行をまったく書きません。その問題は見られることがなかったからで、遅れて答えたモデルは、悪く答えたモデルではありません。返した問題が200問未満の系統はデータ不足と表示します。その規模では、1つの悪い範囲で率が数ポイント動くからです。

[同じ数値をCSVでダウンロード](https://meduniexam.com/api/stats/rejections.csv?days=30)、または[JSON](https://meduniexam.com/api/stats/rejections?days=30)で読めます。この数値は[クリエイティブ・コモンズ 表示 4.0](https://creativecommons.org/licenses/by/4.0/)ライセンスで公開しています。利用も引用も自由です。出典としてMedUni Examの名前を記載してください。

2026年9月24日に更新。

[自分の章から生成する](https://meduniexam.com/#/?lang=ja)

[料金を見る](https://meduniexam.com/ja/pricing.md)

試すだけならアカウントは要りません。登録すると、ライブラリ、成績、復習キューがどの端末でも残ります。

## 関連ページ

- [AIが書いた試験問題はどれくらい正確か](https://meduniexam.com/ja/blog/how-accurate-are-ai-exam-questions.md): 直近30日間の実際のジョブから数えた、チェックが捨てたもの。AIが書いた問題を自分で確かめる方法も。
- [仕組み](https://meduniexam.com/ja/how-it-works.md): 検証の流れを一段階ずつ。何が却下され、なぜ却下されるのかも含みます。
- [MCQ欠陥チェッカー](https://meduniexam.com/ja/tools/mcq-checker.md): 貼り付けた1問に、ジェネレーター自身の構造ルールをブラウザ上で適用します。
- [PDFToQuizとMedUni Examを比較: 上限と料金](https://meduniexam.com/ja/compare/pdftoquiz.md): PDFToQuizとの仕様の比較です。先方が優れている行も含みます。
- [MedUni Exam の変更履歴: 何がいつ変わったか](https://meduniexam.com/ja/changes.md): 公開したものを日付つきで新しい順に並べた変更履歴です。
