# 怎样把你的笔记变成值得做的练习题

> 怎样把笔记变成值得做的练习题：会改变输出结果的那几条提示语、统计出来的舍弃率，以及什么时候该停下逐题核对。

https://meduniexam.com/zh-hans/blog/how-to-turn-notes-into-practice-questions（HTML 页面）的 Markdown 副本，由 MedUni Exam 发布。 发布于 2026年9月20日. 面向 AI 代理的站点指南： https://meduniexam.com/llms.txt.

作者：[Nicholas](https://meduniexam.com/zh-hans/about.md)。2026年9月20日核对。

从一讲里弄出能用的练习题，在你开始作答之前大约要花十四分钟，其中大部分是你手写三道题来立个标准。生成要两分钟，决定这一套值不值得做的核对也要两分钟。本文末尾那次完整实操从头到尾五十分钟，因为盲做这些题、再把错题的出处读回去，才是真正教会你东西的部分。跳过核对，你学的就是模型猜出来的东西。2026 年 5 月发表的一篇系统综述给出的错误率，在 71 项研究里从不到 1% 一直到 45%。

## 先手写三道，之后再也不用手写

打开幻灯片。找出三行能自己定下一个答案的内容：一个机制、一个阈值、一种一线药、一项特征性表现。各出一道题，五个选项，一个正确。十分钟，手写这件事从此就算做完了。

那十分钟给你换来一个标准。手写过三道之后，你就知道：一个能用的题干问的是你遮住选项也答得出的东西，五个选项必须是同一类东西、同一种语法形式，而你的材料里必须正好有一句话能定下答案。你还会体会到这有多慢，这就是没人手写四十道的原因。

把那三道留着。它们会成为你衡量模型之后交给你的一切的参照，而当一道生成的题看着不对、你又说不上哪里不对时，把它摆在你自己写的那道旁边，问题通常就定位到选项上了。

## 该怎么提要求：那些能改变输出结果的措辞

一句“考考我这个”，换来的是关于这份文件的琐碎问答，而不是关于这门学科的题目。六条指令能改变回来的东西。把它们粘在你的文字上面，题数和学科按自己的情况改。

> 只用下面这段文字。就二年级心血管生理学写 12 道单项最佳答案题，每道五个选项，正好一个正确答案。每道题之后，印出文中使该答案成立的原句，以及它所在的页码或幻灯片编号。除非那一句话本身就能定下答案，否则不要写这道题。不要“以上都对”，不要“以上都不对”，不要“下列哪项正确”这类题干。五个选项保持同样的长度和同样的语法形式。

- **只用下面这段文字。**漏掉这一条，模型就会凭它本来就知道的东西作答，你练的就成了主考老师从没教过的内容。
- **把原句和页码一起印出来。**六条里数这一条最管用。能查得到的引文，十秒钟就能了结你和标准答案之间的争执；而被要求给出引文的模型，会少写一些它撑不起来的说法。
- **一句话必须能定下答案。**否则你拿到的题目，除了引用的那一行还要再加别处的三个事实，既没法核对，答起来也不公平。
- **写明题型。**只说“出题”，回来的就是判断题、填空题和一句话回忆题混在一起。
- **禁掉那两种题干。**“以上都对”和“下列哪项正确”是生成器最常犯的两个毛病，只要在指令里写明，两个都会消失。
- **长度一致，形式一致。**出题人总会把自己知道是正确的那个选项写得更细，用他们的产出训练出来的模型也学会了这个习惯。

要的题量得是你的材料撑得住的。[关于每天出多少题的那篇文章](https://meduniexam.com/zh-hans/blog/how-many-practice-questions-per-day.md)是一行一行数的，结果接近幻灯片的页数，那数的是能出题的行数，而不是你会留下的题数。实际上一份 40 页的幻灯片能留下 15 到 20 道，因为要 50 道，多半只会换来重复，随后又被核查剔除。

## 回来的东西哪里错、错得多频繁：71 项研究，数过的

两个已发表的数字定下了合理的预期。[Postgraduate Medical Journal](https://academic.oup.com/pmj/advance-article/doi/10.1093/postmj/qgag057/8688271) 上一篇发表于 2026 年 5 月 20 日的系统综述，汇总了来自 24 个国家的 71 项研究，主题是医学教育中 AI 写的多项选择题。错误率从不到 1% 到 45%。题目难度中位数是 0.67，区分度中位数是 0.28，这描述的是一道能把掌握了材料的学生和没掌握的分开、但分得不够利落的题。那些研究大多靠专家评审来判断题目，而不是把题目放到学习者面前，综述的结论是，现有证据还不支持“unsupervised use in summative assessment”。

更早也更直白的一项：[Boston University's Chobanian and Avedisian School of Medicine](https://www.bumc.bu.edu/camed/2023/12/20/study-finds-ai-language-model-failed-to-produce-appropriate-questions-answers-for-medical-school-exam) 在 2023 年 12 月报告说，在被要求为一场医学院考试出题时，ChatGPT 有 32% 的情况写出了题目正确、答案和解析也正确的题。

第三个数字来自本站，它统计自己的核查丢掉了多少，并把这个数字公开。读于 2026 年 9 月 20 日：从调用日志开始的 9 月 14 日到这一天，模型在 1,398 次调用中写出了 3,564 道题。其中 43.1% 通过了全部核查。结构性规则剔除了 32.8%，重复核查 13.5%，第二个模型不看标准答案、只凭引文作答这一项 6.7%，还有 2.2% 要么引用了核查程序在它所标页面上找不到的句子，要么标了所在章节之外的页码。剩下的 1.7% 是在任务已经装满之后才到，或者回来的形式解析程序读不了。

这些比例每跑一个任务都会变，其中重复那一项变得最多。[早一天发布的那篇文章](https://meduniexam.com/zh-hans/blog/how-many-practice-questions-per-day.md)在更短的窗口里数到 17.6%，也就是 2026 年 9 月 14 日到 19 日；这一次读到的是 2026 年 9 月 14 日到 20 日的 13.5%。两者都是对同一份滚动报表的正确读数，所以[舍弃率页面](https://meduniexam.com/zh-hans/stats/rejections.md)上放的是实时数字，上面的一切只是它的一张快照。

这三项放在一起，说的不是别去生成题目。它们说的是，回来的东西里接近一半该扔掉，而你唯一要决定的是由谁来扔。

## 什么时候停下核对，以及一道不过关的题值什么

抓住其中大部分问题的三项核对，在那些数字背后的页面上已经写明：在你的文件里找到引用的那句话；遮住标准答案，只凭引文作答；再抛开题干只读那五个选项。对一套题的前五道跑一遍，总共一分钟，[关于准确性的那篇文章](https://meduniexam.com/zh-hans/blog/how-accurate-are-ai-exam-questions.md)逐项讲了每一项抓的是什么、为什么抓得到。

这些核对不是我想出来的。它们出自那两份来源给出的出题分类体系：[Haladyna、Downing 和 Rodriguez 2002 年在 Applied Measurement in Education 上给出的 31 条规则](https://www.tandfonline.com/doi/abs/10.1207/S15324818AME1503_5)，以及出题人通常拿到的那个实操版本，也就是 [NBME Item-Writing Guide](https://www.nbme.org/sites/default/files/2021-02/NBME_Item%20Writing%20Guide_R_6.pdf)，现在是第六版，发布于 2021 年 2 月。

那一页没有告诉你的是什么时候该停。这里给出数字：核对前五道题，不要再多。五道里有两道不过关，就停下核对，回去改提示语。这么早就栽两次的一套题，几乎总是栽在一个原因上，而一个原因通常就是提示语里的一行，所以把它收紧再生成一遍，只要两分钟。把十五道全核对一遍要花二十分钟，而且下一批里同样的毛病还在。

没通过核对的题目直接扔掉，不要去修。如果引用的那句话定不了答案，改写题干就等于由你自己来定答案，到那一步你成了出题人，模型白占了你一个晚上。五道里不到一道不过关时，扔掉那一道，把剩下的做完。

被扔掉的题也不是白做的。你为了核对它打开了那页幻灯片，也就是说你按原文读了这道题所依据的那一行。把那一行抄到你放错题的地方。一道没通过核对的题和一道你答错的题，最后去的是同一个地方，那里就是明天的起点。

## 护理专业的版本，以及一页课堂幻灯片给不了你的东西

护理专业的学生来到这里，通常带着一个更窄的任务：从一份课堂讲义里弄出 NCLEX 风格的题目。缺的那一块是情境。你的病理生理幻灯片给你一个机制，而一道 NCLEX 风格的题需要一个病人、一个场景、几项发现，再加一句问优先级或问行动的引导语，四个选项都要站得住，其中一个最优。这些在幻灯片上都没有，所以得由提示语把它们放进去。

加一句：把每道题写成医院场景下的一段简短病人情境，结尾问护士应当首先采取哪项措施，四个选项都要是安全的护理措施。针对这类题再加第四项核对：题干给的信息够不够在四个选项之间做出选择？如果其中任何一个都可以合理地排在最前，这道题就不是难，而是答不了，它教会你的只有猜。

从一份讲义里完全够不着的，是新一代题型。病例研究、矩阵、领结、高亮和下拉这几类题，是围绕逐步展开的病人数据构建的，各有自己的计分规则，从课堂幻灯片生成的东西做不出它们。谁要说拿一个 PDF 就能给你做出这些，那是在吹。[本站的 NCLEX-RN 页面](https://meduniexam.com/zh-hans/exam/nclex-rn.md)说的也是同一件事。这里不是 NCLEX 题库，也与 NCSBN 没有任何关系；题目是按那种风格、从你上传的文件写出来的。

## 量大起来，又不被近乎重复的题淹掉

拿一份 12 页的讲义要 60 道题，你收到的是同样 12 个事实换了 60 身衣裳。聊天窗口里没有任何东西拦得住这一点：到第 47 道题时，模型已经把第 14 道忘了，而要认出二十分钟前答过的东西换了个说法，很难。

三个习惯能让长跑保持诚实。一次生成一章，而不是一整个模块，因为重复是在一份材料内部扎堆的。第二遍换题型，把单项最佳答案换成临床情境题，同一个事实改成考推理。作答之前先把题干扫一遍，因为早发现的重复不花什么代价，而在第 30 道题上才发现的重复，会赔掉你整场。

这一部分机器做得比你好。一个把每道新题和同一文件里已经写过的所有题做对比的生成器，会在你看到之前就丢掉近乎重复的那一道，上面统计的重复舍弃正是这么来的：那些题从没到过任何读者手里。

## 用一份 40 页幻灯片做的完整实操

周二晚上，一讲 40 页的心血管课，一口气做完。下面是它实际花掉的时间，不是计划希望它花的时间。

1. **最初十分钟。**手写三道题，取自你记得讲课人放慢了语速的那几页幻灯片。
2. **两分钟。**把提示语粘在幻灯片文字的上面，要 15 道题，不要 50 道。去掉重复之后，40 页幻灯片大致就撑起十五道。
3. **再两分钟。**对前五道题跑一遍核对。预计会有一两道不过关。出现两道不过关，就改提示语重新生成，这要花两分钟，省下二十分钟。
4. **二十三分钟。**把 15 道题全部盲做一遍，每道约 90 秒，在你把答案定下来之前一直遮住选项。
5. **十三分钟。**每做错一道，就翻开题目标注的那页幻灯片，读它所出自的那一行。照原文抄下来，不要写成你自己的概括。
6. **第二天。**下一次学习先从这些错题开始，再碰新东西。它们在之后几周里什么时候再回来，是[间隔重复计划](https://meduniexam.com/zh-hans/blog/spaced-repetition-three-weeks-before-exam.md)那篇文章的主题。

五十分钟，15 道你说得清道理的题，外加一份手写的、把你难住的那些事实的清单。

## 常见问题

### 什么样的提示语能让 ChatGPT 用我的笔记写出好考题？

四条指令几乎承担了全部价值。告诉它只用你粘贴的文字，写明题型是单项最佳答案、五个选项、一个正确答案，要求给出让答案成立的原句和页码，并禁止“以上都对”和“下列哪项正确”这类题干。再加上一句：引用的那句话必须能自己定下答案，剩下的问题也就去掉大半。

### AI 生成的练习题有多准确？

已发表的研究给不出一个统一的数字。Postgraduate Medical Journal 上一篇纳入 71 项研究的系统综述，发表于 2026 年 5 月 20 日，发现错误率从不到 1% 到 45%；Boston University 则在 2023 年 12 月报告说，ChatGPT 有 32% 的情况写出了题目正确、答案和解析也正确的题。决定你自己那一套的，是有没有东西核对过它。本站把自己的核查丢掉的部分公开出来：读于 2026 年 9 月 20 日，生成的 3,564 道题里有 43.1% 通过了每一项核查，其余部分中重复核查占 13.5%。这些比例会随统计窗口变动，所以舍弃率页面上放的是实时数字。

### 从一讲的内容里该出多少道练习题？

按能出题的行数来数，一份 40 页的幻灯片接近每页一行，因为能自己定下一个答案的行就那么多。按核对之后你会留下的题数来数，就接近 15 到 20 道，因为不是每一行都撑得到最后。要 50 道并不会多出事实，只是把同样的事实换个说法再讲一遍，然后被重复核查剔除。一次只生成一讲的内容，等新题不再让你意外时就停。

### 什么时候该停下核对一套生成的题、直接重来？

核对前五道题就停下。五道里有两道不过关，就回去改提示语，而不是去修这一套题，因为这么早就栽两次的一套题，通常只栽在一个原因上，而一个原因通常就是提示语里的一行。重新生成花两分钟；一道一道去修十五道题，要花掉整个晚上。

### AI 能用我的课堂笔记写出 NCLEX 风格的题吗？

如果你让它构造一个带优先级或行动型引导语的病人情境，再配四个安全的选项，它可以写出那种风格的情境题，因为一页课堂幻灯片给得出病理生理，却给不出场景。新一代题型，也就是病例研究、矩阵、领结、高亮和下拉这几种，没法从一份文件生成。这里不是 NCLEX 题库，也与 NCSBN 没有任何关系。

## 相关页面

- [文章](https://meduniexam.com/zh-hans/blog.md): 文章索引：所有文章，最新的在前。
- [能把课堂幻灯片上传到 ChatGPT 吗？](https://meduniexam.com/zh-hans/blog/can-i-upload-lecture-slides-to-chatgpt.md): 一个学生角度的回答：课堂幻灯片到底能不能放进 ChatGPT 或别的 AI 工具。文章依据四所具名医学院的政策及其日期、一所英国大学的现行指南、英美版权法里的私人学习例外，以及那些数据设置具体在什么位置。
- [MRCP Part 1 要准备多久：13 周](https://meduniexam.com/zh-hans/blog/how-long-to-study-for-mrcp-part-1.md): 一份按周推进的 MRCP(UK) Part 1 计划，从已公布的 2027 年考季日期倒着数，总共约四个月，含考纲各部分的分量、与真卷节奏一致的 45 分钟时段，以及你自己的笔记覆盖不到的临床科学内容。
- [AI 写的考题有多准确？](https://meduniexam.com/zh-hans/blog/how-accurate-are-ai-exam-questions.md): 过去 30 天的真实任务中，核查舍弃了什么，以及如何自己检查一道 AI 写的题目。
- [工作原理](https://meduniexam.com/zh-hans/how-it-works.md): 逐步说明验证流程，包括哪些题目会被舍弃，以及为什么。
