# 各模型家族的驳回率

> 各模型家族的驳回率，来自本站生产任务的统计：引文未找到、第二个模型不同意、重复、缺陷、已接受，并附上 N 值。

https://meduniexam.com/zh-hans/stats/rejections（HTML 页面）的 Markdown 副本，由 MedUni Exam 发布。 发布于 2026年9月14日, 更新于 2026年9月23日. 面向 AI 代理的站点指南： https://meduniexam.com/llms.txt.

为本站写出的每一道题都要经过同样的核对，无论是哪个模型写的。以下是过去 30 天内各模型家族被淘汰的比例，并附上计算这些比率所用的基数。

这些比率来自调用日志，该日志自 2026 年 9 月 14 日起保存。站内其他位置显示的累计数据统计的是自本站于 2026 年 9 月 11 日上线以来的每一道题，因此两组数字覆盖的时间段不同，并不应当彼此对得上。

统计区间为 2026年9月14日 至 2026年9月24日：2,459 次生成调用，共返回 6,183 道题。一个模型家族在该区间返回 200 道题后才会公布；不足时，本页会如实说明，而不是用寥寥几次调用算出一个比例。

| 模型家族 | 写出的题目 | 所标页面上找不到引文 | 第二个模型给出不同答案 | 重复 | 缺陷 | 未要求或来得太晚 | 采用 |
| --- | --- | --- | --- | --- | --- | --- | --- |
| qwen | 4,583 | 6.2% | 6.1% | 14.0% | 28.9% | 2.1% | 42.7% |
| deepseek | 503 | 14.3% | 3.0% | 2.4% | 11.5% | 2.0% | 66.8% |
| glm | 410 | 2.0% | 7.3% | 5.6% | 51.5% | 2.2% | 31.5% |
| nemotron | 393 | 3.1% | 0.5% | 2.5% | 53.9% | 1.3% | 38.7% |
| gpt-oss | 281 | 7.8% | 1.4% | 1.8% | 38.4% | 1.8% | 48.8% |
| openrouter-primary | 13 | 数据不足 | 数据不足 | 数据不足 | 数据不足 | 数据不足 | 数据不足 |
| gemma | 0 | 数据不足 | 数据不足 | 数据不足 | 数据不足 | 数据不足 | 数据不足 |

## 按通道

免费通道先在 Cloudflare Workers AI 上运行 DeepSeek V4 Flash，其他开放权重模型作为备用。付费通道运行优先模型：DeepSeek V4 Pro 出题，Kimi K2.6 在看不到答案的情况下作答。两条通道经过同样的核对，也都计入这里，所以本页按模型家族而不是按通道来统计。

| 通道 | 写出的题目 | 所标页面上找不到引文 | 第二个模型给出不同答案 | 重复 | 缺陷 | 未要求或来得太晚 | 采用 |
| --- | --- | --- | --- | --- | --- | --- | --- |
| 免费 | 6,140 | 6.5% | 5.3% | 11.2% | 31.1% | 2.0% | 43.9% |
| 付费 | 43 | 数据不足 | 数据不足 | 数据不足 | 数据不足 | 数据不足 | 数据不足 |

## 各列的含义

- **已写出的题目**：模型在可解析回答中返回的题目。无法按 JSON 读取的回答在 CSV 中按调用单独计数，因为它们没有返回可计数的题目。
- **引文未在所引页面上找到**：逐字引文不在模型所指页面的存档文字中，或者它引用了给定章节之外的页面。CSV 会把这两种情况分开。
- **第二个模型不同意**：来自不同家族的模型在看到题目和引文但从未看到答案的情况下，选了另一个答案。
- **重复**：该题与同一文档中已接受的某题重复。
- **缺陷**：被结构或质量规则驳回，例如选项组里有明显提示，或者题干没有唯一最佳答案。这些规则正是 [MCQ 缺陷检查器](https://meduniexam.com/zh-hans/tools/mcq-checker.md)在你浏览器中运行的规则。
- **未被要求或太迟**：题目本身没问题，但无论如何没有送到学生面前。要么它的题型不是该任务所要求的（选择题任务中的简答题），要么在它被写出来的同时，任务已经被其他调用的结果填满。两者都计入，这样一行数据才能加总；也都不算模型的过失。
- **已接受**：通过了全部核对并送到学生面前的题目。

## 方法

这里的每一个数字都来自本站的生产任务。每次服务商调用在结果确定时写入一行，只包含计数，别无其他：没有题目文字、没有文档文字、没有用户。计数归属于实际作答的模型，而不总是任务请求的模型，因为当某个模型被限流或过慢时，模型池会回退到另一个模型。把回退结果归给没有运行的模型，等于公布一个关于错误模型的数字。

时间窗为过去 30 天，每小时最多重新统计两次，它是三个固定时间窗之一。比率是某家族返回题目中的占比，某次调用返回的每一道题都恰好落在其中一列，因此这些比率与已接受的占比相加等于全部。返回给一个已经结束的任务的调用根本不会写入任何行：它的题目从未被查看，而回答得晚的模型并不是回答得差的模型。返回题目不足 200 道的家族会标为数据不足，因为在这个规模下，一个糟糕的章节就能让比率变动好几个百分点。

[以 CSV 下载同样的数据](https://meduniexam.com/api/stats/rejections.csv?days=30)，或以 [JSON](https://meduniexam.com/api/stats/rejections?days=30) 形式阅读。 这些数字按 [知识共享署名 4.0](https://creativecommons.org/licenses/by/4.0/) 许可发布：可以使用、引用，并注明来源为 MedUni Exam。

更新于 2026 年 9 月 24 日。

[用你自己的章节生成题目](https://meduniexam.com/#/?lang=zh-hans)

[查看价格](https://meduniexam.com/zh-hans/pricing.md)

试用无需账号。注册之后，你的题库、成绩和复习队列可以在所有设备上保留。

## 相关页面

- [AI 写的考题有多准确？](https://meduniexam.com/zh-hans/blog/how-accurate-are-ai-exam-questions.md): 过去 30 天的真实任务中，核查舍弃了什么，以及如何自己检查一道 AI 写的题目。
- [工作原理](https://meduniexam.com/zh-hans/how-it-works.md): 逐步说明验证流程，包括哪些题目会被舍弃，以及为什么。
- [MCQ 缺陷检查器](https://meduniexam.com/zh-hans/tools/mcq-checker.md): 在浏览器端运行的检查器，用出题工具自己的结构规则检查一道粘贴进去的题目。
- [PDFToQuiz 与 MedUni Exam：上限、价格与核对](https://meduniexam.com/zh-hans/compare/pdftoquiz.md): 与 PDFToQuiz 的逐项规格对比，包括他们领先的那些项。
- [MedUni Exam 更新记录：改了什么、什么时候改的](https://meduniexam.com/zh-hans/changes.md): 按日期记录的更新日志，最新的在前。
