MedUni Exam

如何把你的筆記變成值得作答的練習題

從一堂課裡弄出可用的練習題,在你開始作答之前大約要十四分鐘,其中多數花在你手寫三題、替自己立一個標準上。產生題目要兩分鐘,決定這一組值不值得作答的檢查也是兩分鐘。本文最後那次實跑,從頭到尾五十分鐘,因為裸考完再把錯題讀回去,才是真正教會你東西的部分。跳過檢查,你念的就是模型猜出來的東西。2026 年 5 月發表的一篇系統性回顧,把 71 篇研究的錯誤率放在不到 1% 到 45% 之間。

先手寫三題,之後就再也不用寫了

打開投影片。找三行能單獨決定一個答案的內容:一個機轉、一個閾值、一個第一線用藥、一個特徵性發現。各做一題,五個選項,一個正確。十分鐘,從此不必再手寫。

那十分鐘替你買到一個標準。寫過三題之後,你會知道一個能用的題幹,問的是你把選項遮起來也答得出來的東西;五個選項必須是同一類東西、同一種文法形式;而你的來源裡必須剛好有一句話能把答案定下來。你也會體會到這有多慢,這就是為什麼沒有人會手寫四十題。

把那三題留著。它們會變成你日後衡量模型交出的每一題的參照,而當一道生成的題目看起來怪怪的、你又說不上哪裡怪,把它擺在你自己那三題旁邊,問題通常就浮出來了,而且多半出在選項上。

該要什麼,用那些真的會改變產出的字

「考我這個」拿到的是關於這份文件的瑣碎問答,而不是關於這門學科的題目。有六句指令會改變回來的東西。把它們貼在你的文字上方,題數和科目自行替換。

只用下面這段文字。就大二的心血管生理學寫 12 道最佳單選題,每題五個選項,剛好一個正確答案。每一題之後,印出文字中讓那個答案成立的原句,以及它所在的頁碼或投影片編號。除非那一句話單獨就能把答案定下來,否則不要出那一題。不要以上皆是,不要以上皆非,不要下列何者為真這種題幹。五個選項保持一樣長、一樣的文法形式。

  • 只用下面這段文字。少了這一句,模型就會拿它本來就知道的東西作答,而你練的是你的主考官從來沒教過的內容。
  • 印出一字不差的那句話和頁碼。六句裡就數這一句最有用。查得到的引文,十秒內就能結束你跟答案之間的爭論,而被要求交出引文的模型,會少寫一些它撐不起來的說法。
  • 一句話就要能定案。否則你拿到的題目會是既要那句引文、又要再加三個別處的事實,查不動,答起來也不公平。
  • 指定題型。只說「出題目」,回來的會是是非題、填空題和一行式記憶題混在一起。
  • 禁掉那兩種題幹。「以上皆是」和「下列何者為真」是出題工具最常產生的毛病,而且交代一句就都不見了。
  • 一樣長,一樣的形式。出題的人會把自己知道正確的那個選項寫得比較細,用他們的產出訓練出來的模型也學了這個習慣。

要的題數要是你的教材撐得住的。談每日題量的那篇文章是一行一行算的,算出來接近投影片張數,那是可出題行數,不是你會留下來的題數。實務上一份 40 張投影片大約產出 15 到 20 題你會留著的,因為要 50 題買到的多半是重複,之後又被檢查剔掉。

回來的東西哪裡錯、多常錯:71 篇研究,實際統計

兩個已發表的數字立下合理的期待。Postgraduate Medical Journal 上一篇發表於 2026 年 5 月 20 日的系統性回顧,彙整了 24 個國家的 71 篇研究,主題是醫學教育中由 AI 寫的選擇題。錯誤率從不到 1% 到 45%。題目難度中位數是 0.67,鑑別度中位數是 0.28,這描述的是一道能把懂教材的學生和不懂的學生分開、但分得不夠銳利的題目。那些研究多半是靠專家審查來評斷題目,而不是把題目放到學習者面前,而該回顧的結論是,現有證據還不足以支持 "unsupervised use in summative assessment"。

更早、也更不留情面的一份:Boston University's Chobanian and Avedisian School of Medicine 在 2023 年 12 月指出,當 ChatGPT 被要求替一場醫學院考試出題時,有 32% 的情況產生的是正確的題目配上正確的答案與解析。

第三個數字來自本站,它會統計自己的檢查剔掉了多少,並把數字公開。於 2026 年 9 月 20 日讀取:從呼叫紀錄起算的 9 月 14 日到那一天,模型在 1,398 次呼叫中寫出 3,564 題。其中 43.1% 通過了所有檢查。結構性規則剔除 32.8%,重複檢查 13.5%,第二個模型只看引文、不看答案作答剔除 6.7%,還有 2.2% 要不是引用了檢查程式在它所註頁面上找不到的句子,就是引到了該段落之外的頁面。剩下的 1.7% 是在工作已經額滿之後才回來,或回來的形式解析器讀不動。

這些比例每一次工作都在動,而重複那一項動得最多。前一天發表的那一篇在比較短的窗口裡算出 17.6%,也就是 2026 年 9 月 14 日到 19 日;這一次讀到的是 2026 年 9 月 14 日到 20 日的 13.5%。兩者都是同一份滾動報表的正確讀數,這也是為什麼捨棄率頁面上才是即時數字,而上面所有內容都只是它的一張快照。

這三個數字放在一起,說的不是不要用生成的題目。它們說的是回來的東西裡有將近一半該丟掉,而你唯一要決定的,是由誰來丟。

什麼時候該停止檢查,以及一道沒通過的題目值多少

抓到大部分問題的那三道檢查,在那些數字背後的頁面上已經寫清楚了:在你的文件裡找到被引用的那句話;蓋住答案,只看引文作答;再把五個選項拿掉題幹讀一次。對一組題目的前五題跑一遍,總共一分鐘,談準確度的那篇文章逐一說明每道檢查抓到什麼、又為什麼抓得到。

那些檢查不是我發明的。它們來自那兩份來源提出的出題分類:Haladyna、Downing 與 Rodriguez 在 2002 年 Applied Measurement in Education 上提出的 31 條規則,以及出題者實際拿到手的工作版本,也就是 NBME Item-Writing Guide,目前是第六版,2021 年 2 月發布。

那一頁沒有告訴你的是什麼時候該停。數字在這裡:檢查前五題,就這樣。五題裡有兩題不過,就停止檢查,回頭改提示詞。這麼早就錯兩題的一組題目,幾乎一定只錯在一個原因上,而一個原因通常就是提示詞裡的一句話,所以把它收緊、重出一次,花兩分鐘。十五題全部檢查要花二十分鐘,而且下一批還是留著同一個毛病。

沒通過的題目要丟掉,不要修。一道引文無法定案的題目,你重寫題幹就等於自己決定答案,到那一步,出題的人是你,而模型只是浪費了你一個晚上。五題裡不到一題不過,就把那一題丟掉,其餘照答。

被丟掉的那一題還是有它的價值。你為了查它打開了投影片,也就是說你用原文的話讀了那題所依據的那一行。把那一行寫到你放錯題的地方。一道沒通過檢查的題目和一道你答錯的題目,最後去的是同一個地方,而那裡就是明天的起點。

護理版本,以及課堂投影片給不了你的東西

護理系學生來到這裡時,通常帶著一個更窄的任務:從一份上課講義弄出 NCLEX 型的題目。缺的那一塊是情境。你的病生理投影片給你一個機轉,而一道 NCLEX 型的題目需要一位個案、一個場景、幾項發現,還有一句要求優先處置或行動的引導句,外加四個都站得住腳的選項與其中一個最佳解。這些投影片上都沒有,所以得由提示詞把它們放進去。

加一句:把每一題寫成醫院情境裡的短篇個案,最後問護理師應該先採取哪一個處置,並讓四個選項都是安全的護理處置。針對這類題目再加第四道檢查:題幹給的資訊夠不夠在四個選項之間做選擇?只要其中任何一個都有理由排第一,這題就不是難,而是無法作答,它只會教你用猜的。

從一份講義完全構不到的,是 Next Generation 那些題型。個案研究、矩陣題、bow tie、標記題與下拉題,都是圍繞著逐步展開的病人資料、配上自己一套計分規則建起來的,從課堂投影片生成的東西做不出它們。有人拿一份 PDF 賣你這個,那是誇大。本站的 NCLEX-RN 頁面講的也一樣。這裡不是 NCLEX 題庫,也與 NCSBN 沒有任何關聯;題目是以那種風格、從你上傳的檔案寫出來的。

量大的時候,怎麼不被幾乎重複的題目淹沒

拿一份 12 頁的講義要 60 題,你收到的會是同樣 12 個事實換上 60 套外衣。聊天視窗裡沒有任何東西擋得住這件事:到第 47 題時,模型已經忘了第 14 題,而要認出二十分鐘前答過的東西被換句話說了一遍,並不容易。

有三個習慣能讓長期抗戰保持誠實。一次產生一個章節,不要整個模組,因為重複會在同一個來源裡成群出現。第二輪換題型,讓最佳單選題變成臨床情境題,同一個事實改以推理的方式測。作答之前先把題幹掃過一遍,因為早一點抓到重複不花你什麼,而在第 30 題才抓到,花掉的是整個讀書時段。

這個部分機器做得比你好。把每一道新題目拿去跟同一份文件已經寫過的所有題目比對的出題器,會在你看到之前就丟掉幾乎重複的那一題,而上面統計到的重複捨棄就是這些:從來沒有到過讀者眼前的題目。

用一份 40 張投影片實際跑一遍

星期二晚上,一堂 40 張投影片的心臟科課程,一次坐完。下面列的是實際花掉的時間,不是計畫希望的時間。

  1. 最初十分鐘。手寫三題,取自你記得講師講到放慢速度的那幾張投影片。
  2. 兩分鐘。把提示詞貼在投影片文字上方,要 15 題,不要 50 題。十五題差不多就是 40 張投影片在扣掉重複之後撐得起來的量。
  3. 再兩分鐘。對前五題做檢查。預期會有一兩題不過。一旦有兩題不過,就修提示詞重出一次,花兩分鐘,省下二十分鐘。
  4. 二十三分鐘。15 題全部裸考,每題約 90 秒,選項先遮住,等你心裡有答案再看。
  5. 十三分鐘。每答錯一題,就打開題目所引的那張投影片,讀它出自的那一行。用原文的話抄下來,不要抄你自己的摘要。
  6. 明天。那些錯題是下一次讀書時間的開場,排在任何新東西前面。它們在接下來幾週要在什麼時候再出現,是間隔重複計畫的主題。

五十分鐘,15 道你講得出道理的題目,還有一張手寫的清單,記著那些把你考倒的事實。

大家常問的問題

什麼樣的提示詞能讓 ChatGPT 用我的筆記寫出好考題?

價值幾乎都集中在四句話上。叫它只用你貼上去的文字,把題型指名為五個選項、一個正確答案的最佳單選題,要求附上讓答案成立的那句原文和頁碼,並禁止「以上皆是」和「下列何者為真」這兩種題幹。再加一句「引用的那句話必須單獨就能定案」,剩下的問題大半也就沒了。

AI 產生的練習題有多準確?

已發表的研究沒有給出單一數字。Postgraduate Medical Journal 上一篇涵蓋 71 篇研究的系統性回顧,發表於 2026 年 5 月 20 日,發現錯誤率從不到 1% 到 45%,而 Boston University 在 2023 年 12 月指出,ChatGPT 在 32% 的情況下產生的是正確的題目配上正確的答案與解析。決定你自己那一組題目的,是有沒有東西檢查過它。本站會公布自己的檢查剔掉了什麼:於 2026 年 9 月 20 日讀取,3,564 道產生的題目裡有 43.1% 通過了每一道檢查,其餘的部分中,重複檢查占 13.5%。這些比例會隨統計窗口移動,所以捨棄率頁面上才是即時數字。

一堂課的內容應該做出多少道練習題?

如果算的是可以出題的行數,一份 40 張投影片大概是一張一行,因為能單獨決定一個答案的行數就是那麼多。如果算的是檢查後你會留下來的題數,比較接近 15 到 20 題,因為不是每一行可以出題的內容都撐得過檢查。要 50 題並不會生出更多事實,只是把同樣的事實換個說法再講一次,然後被重複檢查剔掉。一次產生一堂課的量,等到新題目不再讓你意外,就停。

什麼時候該停止檢查一組生成的題目、直接重來?

檢查前五題,然後就停。五題裡有兩題不過,就回頭改提示詞,不要去修那一整組,因為這麼早就錯兩題的一組題目,通常只錯在一個原因上,而一個原因通常就是提示詞裡的一句話。重出一次花兩分鐘;一題一題修十五題,花掉整個晚上。

AI 能從我的上課筆記寫出 NCLEX 型的題目嗎?

只要你叫它建出一個個案情境,用優先處置或該採取哪個行動當引導句,再配四個安全的選項,它就能寫出那種風格的情境題,因為課堂投影片給得出病生理,卻從來不給情境。Next Generation 那幾種題型,也就是個案研究、矩陣題、bow tie、標記題與下拉題,沒辦法從一份文件產生。這裡不是 NCLEX 題庫,也與 NCSBN 沒有任何關聯。

發布 .