怎样把你的笔记变成值得做的练习题
从一讲里弄出能用的练习题,在你开始作答之前大约要花十四分钟,其中大部分是你手写三道题来立个标准。生成要两分钟,决定这一套值不值得做的核对也要两分钟。本文末尾那次完整实操从头到尾五十分钟,因为盲做这些题、再把错题的出处读回去,才是真正教会你东西的部分。跳过核对,你学的就是模型猜出来的东西。2026 年 5 月发表的一篇系统综述给出的错误率,在 71 项研究里从不到 1% 一直到 45%。
先手写三道,之后再也不用手写
打开幻灯片。找出三行能自己定下一个答案的内容:一个机制、一个阈值、一种一线药、一项特征性表现。各出一道题,五个选项,一个正确。十分钟,手写这件事从此就算做完了。
那十分钟给你换来一个标准。手写过三道之后,你就知道:一个能用的题干问的是你遮住选项也答得出的东西,五个选项必须是同一类东西、同一种语法形式,而你的材料里必须正好有一句话能定下答案。你还会体会到这有多慢,这就是没人手写四十道的原因。
把那三道留着。它们会成为你衡量模型之后交给你的一切的参照,而当一道生成的题看着不对、你又说不上哪里不对时,把它摆在你自己写的那道旁边,问题通常就定位到选项上了。
该怎么提要求:那些能改变输出结果的措辞
一句“考考我这个”,换来的是关于这份文件的琐碎问答,而不是关于这门学科的题目。六条指令能改变回来的东西。把它们粘在你的文字上面,题数和学科按自己的情况改。
只用下面这段文字。就二年级心血管生理学写 12 道单项最佳答案题,每道五个选项,正好一个正确答案。每道题之后,印出文中使该答案成立的原句,以及它所在的页码或幻灯片编号。除非那一句话本身就能定下答案,否则不要写这道题。不要“以上都对”,不要“以上都不对”,不要“下列哪项正确”这类题干。五个选项保持同样的长度和同样的语法形式。
- 只用下面这段文字。漏掉这一条,模型就会凭它本来就知道的东西作答,你练的就成了主考老师从没教过的内容。
- 把原句和页码一起印出来。六条里数这一条最管用。能查得到的引文,十秒钟就能了结你和标准答案之间的争执;而被要求给出引文的模型,会少写一些它撑不起来的说法。
- 一句话必须能定下答案。否则你拿到的题目,除了引用的那一行还要再加别处的三个事实,既没法核对,答起来也不公平。
- 写明题型。只说“出题”,回来的就是判断题、填空题和一句话回忆题混在一起。
- 禁掉那两种题干。“以上都对”和“下列哪项正确”是生成器最常犯的两个毛病,只要在指令里写明,两个都会消失。
- 长度一致,形式一致。出题人总会把自己知道是正确的那个选项写得更细,用他们的产出训练出来的模型也学会了这个习惯。
要的题量得是你的材料撑得住的。关于每天出多少题的那篇文章是一行一行数的,结果接近幻灯片的页数,那数的是能出题的行数,而不是你会留下的题数。实际上一份 40 页的幻灯片能留下 15 到 20 道,因为要 50 道,多半只会换来重复,随后又被核查剔除。
回来的东西哪里错、错得多频繁:71 项研究,数过的
两个已发表的数字定下了合理的预期。Postgraduate Medical Journal 上一篇发表于 2026 年 5 月 20 日的系统综述,汇总了来自 24 个国家的 71 项研究,主题是医学教育中 AI 写的多项选择题。错误率从不到 1% 到 45%。题目难度中位数是 0.67,区分度中位数是 0.28,这描述的是一道能把掌握了材料的学生和没掌握的分开、但分得不够利落的题。那些研究大多靠专家评审来判断题目,而不是把题目放到学习者面前,综述的结论是,现有证据还不支持“unsupervised use in summative assessment”。
更早也更直白的一项:Boston University's Chobanian and Avedisian School of Medicine 在 2023 年 12 月报告说,在被要求为一场医学院考试出题时,ChatGPT 有 32% 的情况写出了题目正确、答案和解析也正确的题。
第三个数字来自本站,它统计自己的核查丢掉了多少,并把这个数字公开。读于 2026 年 9 月 20 日:从调用日志开始的 9 月 14 日到这一天,模型在 1,398 次调用中写出了 3,564 道题。其中 43.1% 通过了全部核查。结构性规则剔除了 32.8%,重复核查 13.5%,第二个模型不看标准答案、只凭引文作答这一项 6.7%,还有 2.2% 要么引用了核查程序在它所标页面上找不到的句子,要么标了所在章节之外的页码。剩下的 1.7% 是在任务已经装满之后才到,或者回来的形式解析程序读不了。
这些比例每跑一个任务都会变,其中重复那一项变得最多。早一天发布的那篇文章在更短的窗口里数到 17.6%,也就是 2026 年 9 月 14 日到 19 日;这一次读到的是 2026 年 9 月 14 日到 20 日的 13.5%。两者都是对同一份滚动报表的正确读数,所以舍弃率页面上放的是实时数字,上面的一切只是它的一张快照。
这三项放在一起,说的不是别去生成题目。它们说的是,回来的东西里接近一半该扔掉,而你唯一要决定的是由谁来扔。
什么时候停下核对,以及一道不过关的题值什么
抓住其中大部分问题的三项核对,在那些数字背后的页面上已经写明:在你的文件里找到引用的那句话;遮住标准答案,只凭引文作答;再抛开题干只读那五个选项。对一套题的前五道跑一遍,总共一分钟,关于准确性的那篇文章逐项讲了每一项抓的是什么、为什么抓得到。
这些核对不是我想出来的。它们出自那两份来源给出的出题分类体系:Haladyna、Downing 和 Rodriguez 2002 年在 Applied Measurement in Education 上给出的 31 条规则,以及出题人通常拿到的那个实操版本,也就是 NBME Item-Writing Guide,现在是第六版,发布于 2021 年 2 月。
那一页没有告诉你的是什么时候该停。这里给出数字:核对前五道题,不要再多。五道里有两道不过关,就停下核对,回去改提示语。这么早就栽两次的一套题,几乎总是栽在一个原因上,而一个原因通常就是提示语里的一行,所以把它收紧再生成一遍,只要两分钟。把十五道全核对一遍要花二十分钟,而且下一批里同样的毛病还在。
没通过核对的题目直接扔掉,不要去修。如果引用的那句话定不了答案,改写题干就等于由你自己来定答案,到那一步你成了出题人,模型白占了你一个晚上。五道里不到一道不过关时,扔掉那一道,把剩下的做完。
被扔掉的题也不是白做的。你为了核对它打开了那页幻灯片,也就是说你按原文读了这道题所依据的那一行。把那一行抄到你放错题的地方。一道没通过核对的题和一道你答错的题,最后去的是同一个地方,那里就是明天的起点。
护理专业的版本,以及一页课堂幻灯片给不了你的东西
护理专业的学生来到这里,通常带着一个更窄的任务:从一份课堂讲义里弄出 NCLEX 风格的题目。缺的那一块是情境。你的病理生理幻灯片给你一个机制,而一道 NCLEX 风格的题需要一个病人、一个场景、几项发现,再加一句问优先级或问行动的引导语,四个选项都要站得住,其中一个最优。这些在幻灯片上都没有,所以得由提示语把它们放进去。
加一句:把每道题写成医院场景下的一段简短病人情境,结尾问护士应当首先采取哪项措施,四个选项都要是安全的护理措施。针对这类题再加第四项核对:题干给的信息够不够在四个选项之间做出选择?如果其中任何一个都可以合理地排在最前,这道题就不是难,而是答不了,它教会你的只有猜。
从一份讲义里完全够不着的,是新一代题型。病例研究、矩阵、领结、高亮和下拉这几类题,是围绕逐步展开的病人数据构建的,各有自己的计分规则,从课堂幻灯片生成的东西做不出它们。谁要说拿一个 PDF 就能给你做出这些,那是在吹。本站的 NCLEX-RN 页面说的也是同一件事。这里不是 NCLEX 题库,也与 NCSBN 没有任何关系;题目是按那种风格、从你上传的文件写出来的。
量大起来,又不被近乎重复的题淹掉
拿一份 12 页的讲义要 60 道题,你收到的是同样 12 个事实换了 60 身衣裳。聊天窗口里没有任何东西拦得住这一点:到第 47 道题时,模型已经把第 14 道忘了,而要认出二十分钟前答过的东西换了个说法,很难。
三个习惯能让长跑保持诚实。一次生成一章,而不是一整个模块,因为重复是在一份材料内部扎堆的。第二遍换题型,把单项最佳答案换成临床情境题,同一个事实改成考推理。作答之前先把题干扫一遍,因为早发现的重复不花什么代价,而在第 30 道题上才发现的重复,会赔掉你整场。
这一部分机器做得比你好。一个把每道新题和同一文件里已经写过的所有题做对比的生成器,会在你看到之前就丢掉近乎重复的那一道,上面统计的重复舍弃正是这么来的:那些题从没到过任何读者手里。
用一份 40 页幻灯片做的完整实操
周二晚上,一讲 40 页的心血管课,一口气做完。下面是它实际花掉的时间,不是计划希望它花的时间。
- 最初十分钟。手写三道题,取自你记得讲课人放慢了语速的那几页幻灯片。
- 两分钟。把提示语粘在幻灯片文字的上面,要 15 道题,不要 50 道。去掉重复之后,40 页幻灯片大致就撑起十五道。
- 再两分钟。对前五道题跑一遍核对。预计会有一两道不过关。出现两道不过关,就改提示语重新生成,这要花两分钟,省下二十分钟。
- 二十三分钟。把 15 道题全部盲做一遍,每道约 90 秒,在你把答案定下来之前一直遮住选项。
- 十三分钟。每做错一道,就翻开题目标注的那页幻灯片,读它所出自的那一行。照原文抄下来,不要写成你自己的概括。
- 第二天。下一次学习先从这些错题开始,再碰新东西。它们在之后几周里什么时候再回来,是间隔重复计划那篇文章的主题。
五十分钟,15 道你说得清道理的题,外加一份手写的、把你难住的那些事实的清单。
常见问题
什么样的提示语能让 ChatGPT 用我的笔记写出好考题?
四条指令几乎承担了全部价值。告诉它只用你粘贴的文字,写明题型是单项最佳答案、五个选项、一个正确答案,要求给出让答案成立的原句和页码,并禁止“以上都对”和“下列哪项正确”这类题干。再加上一句:引用的那句话必须能自己定下答案,剩下的问题也就去掉大半。
AI 生成的练习题有多准确?
已发表的研究给不出一个统一的数字。Postgraduate Medical Journal 上一篇纳入 71 项研究的系统综述,发表于 2026 年 5 月 20 日,发现错误率从不到 1% 到 45%;Boston University 则在 2023 年 12 月报告说,ChatGPT 有 32% 的情况写出了题目正确、答案和解析也正确的题。决定你自己那一套的,是有没有东西核对过它。本站把自己的核查丢掉的部分公开出来:读于 2026 年 9 月 20 日,生成的 3,564 道题里有 43.1% 通过了每一项核查,其余部分中重复核查占 13.5%。这些比例会随统计窗口变动,所以舍弃率页面上放的是实时数字。
从一讲的内容里该出多少道练习题?
按能出题的行数来数,一份 40 页的幻灯片接近每页一行,因为能自己定下一个答案的行就那么多。按核对之后你会留下的题数来数,就接近 15 到 20 道,因为不是每一行都撑得到最后。要 50 道并不会多出事实,只是把同样的事实换个说法再讲一遍,然后被重复核查剔除。一次只生成一讲的内容,等新题不再让你意外时就停。
什么时候该停下核对一套生成的题、直接重来?
核对前五道题就停下。五道里有两道不过关,就回去改提示语,而不是去修这一套题,因为这么早就栽两次的一套题,通常只栽在一个原因上,而一个原因通常就是提示语里的一行。重新生成花两分钟;一道一道去修十五道题,要花掉整个晚上。
AI 能用我的课堂笔记写出 NCLEX 风格的题吗?
如果你让它构造一个带优先级或行动型引导语的病人情境,再配四个安全的选项,它可以写出那种风格的情境题,因为一页课堂幻灯片给得出病理生理,却给不出场景。新一代题型,也就是病例研究、矩阵、领结、高亮和下拉这几种,没法从一份文件生成。这里不是 NCLEX 题库,也与 NCSBN 没有任何关系。
发布于 .