AI 写的考题有多准确?真实任务显示的结果
Every question this site writes is checked before a student sees it, and the checks keep a count. This is what the 10 days since of real jobs on medical textbooks, lecture decks and notes show: how many questions a model writes that cannot be traced to the page, that a second model answers differently, or that repeat one already written.
取自调用日志的数字
| What the checks counted | Share of questions written |
|---|---|
| Questions the models wrote | 6,183 in 2,459 calls |
| Kept, every check passed | 44.0% |
| Thrown out, all reasons | 56.0% |
| 所标页面上找不到引文 | 6.5% |
| Second model answered differently | 5.4% |
| Repeat of a question already written | 11.2% |
| Structural flaw (all of the above, a vague stem, an option that gives itself away) | 30.9% |
Counted from the call log over September 14, 2026 to September 24, 2026, refreshed twice an hour. The same report, split by model family and with a CSV, is on the rejection rates page.
每一种舍弃意味着什么
引文不在标注的页面上。 每道题都必须带上从文件里逐字抄出的一两句话,以及它们所在的页码。服务器会在那一页的存档文本中查找这句话。如果不在,说明模型写了材料没有说过的内容,或者记错了措辞,这道题就被舍弃。这项核查抓的是编造出来的事实。
第二个模型给出了不同答案。 一个来自不同家族的模型只拿到题目和引文,别的什么都没有:没有标准答案,也没有文件。如果它无法只凭引文得出所标注的答案,说明引文并不能证明这个答案,题目就被舍弃。这项核查抓的是听起来对、答案却错了的题,或者引文支撑不了的答案。
重复已经写过的题。 每道新题都会与已经从该文件生成的所有题目比对。近似重复的会被舍弃,这样长时间生成给你的是不同的题目,而不是同样的事实换个说法。
结构缺陷。「以上皆是」「以上皆非」、问哪一项陈述正确的题干、明显比其他选项长的选项、提到「文中」的题目。这些是考官受训要删掉的破绽,在这里会在其他核查之前按规则删除。MCQ 缺陷检查器 会对你粘贴的任何题目运行同样的规则。
为什么不显示引文的生成器无法告诉你它的准确度
一个把测验交给你、却不给出每道题出处句子的工具,无法统计它有多少题目缺乏依据,因为它的流程里没有任何环节去查。它的准确度就是你自己动手检查时发现的结果,而那正是你原本想省下的工作。一个同类工具在自己的帮助页面上要求用户在依赖生成的测验之前先自行审阅,在什么都没核查的情况下,这是诚实的说法。上面这些数字之所以存在,是因为核查发生在学生看到任何东西之前,也因为被舍弃的题目被统计了下来,而不是悄悄丢掉。
如何在二十秒内自己检查一道 AI 题目
- 找到那句话。 如果题目没有显示它的出处,就在文件里搜索它的关键短语。如果文件里没有这个短语,这道题就不是出自你的材料。
- 盖住答案,只凭引文作答。 只读引用的那句话,然后选一个选项。如果引文定不下答案,这道题考的就是引文没有说的内容。
- 看选项。 某个选项比其余选项长得多、某个选项重复了题干、出现「以上皆是」:每一个都是破绽,也都是不该信任这道题的理由,而不是从中学习的理由。
这对备考意味着什么
通过了这些核查的一组题目,你可以直接拿来练习,不必重读那一章去确认每道题是否属实。被舍弃的部分并非白费力气:任何 AI 生成的题库里都有这样一部分,用不做核查的工具的学生,本来就会拿它们来学习。本站的免费方案对它写出的每一道题都运行同样的核查,示例页面 展示了三道通过核查的题目,以及每道题引用的页面。
学生常问的问题
舍弃率高是不是说明模型差?
单看比率不能。写复杂临床情景题的模型,被第二个模型否掉的比例高于写记忆型题目的模型;而从一个短章节里长时间生成,也会因为章节里的事实有限而被重复核查舍弃。这个比率是模型、材料和这次任务共同决定的,所以报告会连同它统计的样本量一起公布。
通过核查的题目一定正确吗?
不一定。这些核查能抓出引文不在所标注页面上的题、被第二个模型答成别的答案的题、重复此前题目的题,以及一组结构缺陷。它们无法判断医学内容本身。这就是为什么每道保留下来的题都会连同它的引文和页码一起显示,让学生能读到这道题出自的那一行。
为什么重复的题目算作舍弃?
因为如果没有东西拦着,一个被要求从十二页讲义里出四十道题的生成器,会把同样的十二个事实换种说法重复一遍。每道新题都会与已经从该文件写出的所有题目比对,近似重复的会被舍弃,而不是当作新的练习交给学生。
原始数据在哪里?
舍弃率页面按模型家族和通道公布这份报告,并提供 CSV 下载,本页的数字读自同一份报告。调用日志自 2026 年 9 月 14 日起保存。
试用无需账号。注册之后,你的题库、成绩和复习队列可以在所有设备上保留。
发布于 , 更新于 .