# 各模型家族的捨棄率

> 各模型家族的捨棄率，取自本站的正式工作：引文未找到、第二個模型不同意、重複、瑕疵、通過，並附上 N。

https://meduniexam.com/zh-hant/stats/rejections（HTML 頁面）的 Markdown 版本，由 MedUni Exam 發布。 發布 2026年9月14日, 更新 2026年9月23日. 給 AI 代理程式的網站指南： https://meduniexam.com/llms.txt.

本站寫出的每一道題目，不論由哪個模型撰寫，都會通過同樣的檢查。以下是過去 30 天內各模型家族有多少題目被捨棄，以及計算比率所依據的題數。

這些比率取自呼叫記錄，該記錄自 2026 年 9 月 14 日起保存。本站其他地方列出的累計總數，計算的是自本站於 2026 年 9 月 11 日開站以來的每一道題目，所以兩組數字涵蓋的期間不同，也不應該互相加總。

統計區間為 2026年9月14日 至 2026年9月24日：2,459 次產生呼叫，共傳回 6,183 題。一個模型家族在該區間傳回 200 題後才會公布；不足時，本頁會如實說明，而不是用寥寥幾次呼叫算出一個比例。

| 模型家族 | 寫出的題目 | 所標頁面上找不到引文 | 第二個模型給出不同答案 | 重複 | 缺陷 | 未要求或來得太晚 | 採用 |
| --- | --- | --- | --- | --- | --- | --- | --- |
| qwen | 4,583 | 6.2% | 6.1% | 14.0% | 28.9% | 2.1% | 42.7% |
| deepseek | 503 | 14.3% | 3.0% | 2.4% | 11.5% | 2.0% | 66.8% |
| glm | 410 | 2.0% | 7.3% | 5.6% | 51.5% | 2.2% | 31.5% |
| nemotron | 393 | 3.1% | 0.5% | 2.5% | 53.9% | 1.3% | 38.7% |
| gpt-oss | 281 | 7.8% | 1.4% | 1.8% | 38.4% | 1.8% | 48.8% |
| openrouter-primary | 13 | 資料不足 | 資料不足 | 資料不足 | 資料不足 | 資料不足 | 資料不足 |
| gemma | 0 | 資料不足 | 資料不足 | 資料不足 | 資料不足 | 資料不足 | 資料不足 |

## 依通道

免費通道先在 Cloudflare Workers AI 上執行 DeepSeek V4 Flash，其他開放權重模型作為備用。付費通道執行優先模型：DeepSeek V4 Pro 出題，Kimi K2.6 在看不到答案的情況下作答。兩條通道經過同樣的核對，也都計入這裡，所以本頁依模型家族而不是依通道統計。

| 通道 | 寫出的題目 | 所標頁面上找不到引文 | 第二個模型給出不同答案 | 重複 | 缺陷 | 未要求或來得太晚 | 採用 |
| --- | --- | --- | --- | --- | --- | --- | --- |
| 免費 | 6,140 | 6.5% | 5.3% | 11.2% | 31.1% | 2.0% | 43.9% |
| 付費 | 43 | 資料不足 | 資料不足 | 資料不足 | 資料不足 | 資料不足 | 資料不足 |

## 各欄的意思

- **寫出的題目**：模型在可解析的回應中回傳的題目。無法以 JSON 讀取的回應會在 CSV 中依呼叫分開計算，因為它們沒有回傳任何可計數的題目。
- **引文未見於所引用的頁面**：逐字引文不在模型所標示頁面的儲存文字中，或它引用了所給範圍之外的頁面。CSV 會把這兩種情形分開。
- **第二個模型不同意**：來自不同家族的模型看到題目與引文，但從來沒有看到答案，卻選了不同的答案。
- **重複**：該題重複了同一份文件中已經通過的題目。
- **瑕疵**：被結構或品質規則捨棄，例如選項組洩漏答案，或題幹沒有單一最佳答案。這些規則就是[選擇題瑕疵檢查工具](https://meduniexam.com/zh-hant/tools/mcq-checker.md)在你瀏覽器中執行的規則。
- **未被要求或太晚**：題目本身沒問題，但仍然沒有送到學生面前。原因可能是這個題型不是該次工作要的（選擇題工作中出現簡答題），或是這題還在寫的時候，該次工作已經由其他呼叫填滿。兩者都計入，好讓整列加總相符；兩者都不算模型的失分。
- **通過**：通過了所有檢查並送到學生面前的題目。

## 方法

這裡的每一個數字都來自本站的正式工作。每一次供應商呼叫會在結果確定的當下寫入一列，只存計數，別無其他：沒有題目文字、沒有文件文字、沒有使用者。計數歸屬於實際作答的模型，而不一定是該次工作原本指定的模型，因為當某個模型被限流或太慢時，模型池會改用另一個模型。把備援的結果算到沒有執行的模型上，等於發布了關於錯誤模型的數字。

區間是過去 30 天，每小時最多重算兩次，而且是三個固定區間之一。比率是以一個家族回傳的題目為分母的占比，一次呼叫回傳的每一道題目都恰好落在其中一欄，所以這些欄位加上通過的占比正好是全部。若呼叫回到一個已經結束的工作，就完全不會寫入任何一列：那些題目根本沒有被看過，回答得晚的模型不是回答得差的模型。回傳題目少於 200 題的家族列為資料不足，因為在這種規模下，一個不好的段落就會讓比率移動好幾個百分點。

[下載同一組數字的 CSV](https://meduniexam.com/api/stats/rejections.csv?days=30)，或以 [JSON](https://meduniexam.com/api/stats/rejections?days=30) 讀取。這些數字以 [Creative Commons Attribution 4.0](https://creativecommons.org/licenses/by/4.0/) 授權發布：歡迎使用、引用，並註明來源為 MedUni Exam。

更新於 2026 年 9 月 24 日。

[用你自己的章節產生題目](https://meduniexam.com/#/?lang=zh-hant)

[查看價格](https://meduniexam.com/zh-hant/pricing.md)

不用帳號就能試用。註冊後，你的題庫、成績與複習佇列會在所有裝置上保留。

## 相關頁面

- [AI 寫的考題有多準確？](https://meduniexam.com/zh-hant/blog/how-accurate-are-ai-exam-questions.md): 過去 30 天真實工作中檢查捨棄了什麼，以及如何自己檢查一道 AI 寫的題目。
- [運作方式](https://meduniexam.com/zh-hant/how-it-works.md): 逐步說明驗證流程，包括什麼會被捨棄以及為什麼。
- [選擇題瑕疵檢查工具](https://meduniexam.com/zh-hant/tools/mcq-checker.md): 在瀏覽器裡執行的檢查工具，會對貼上的單一題目套用出題工具本身的結構規則。
- [PDFToQuiz 與 MedUni Exam：上限、價格與核對](https://meduniexam.com/zh-hant/compare/pdftoquiz.md): 逐項規格對照 PDFToQuiz，包括他們領先的項目。
- [MedUni Exam 變更記錄：改了什麼、何時改的](https://meduniexam.com/zh-hant/changes.md): 已上線內容的日期變更紀錄，最新的在最前面。
