AI 寫的考題有多準確?真實工作顯示的結果
Every question this site writes is checked before a student sees it, and the checks keep a count. This is what the 10 days since of real jobs on medical textbooks, lecture decks and notes show: how many questions a model writes that cannot be traced to the page, that a second model answers differently, or that repeat one already written.
依呼叫紀錄計算的數字
| What the checks counted | Share of questions written |
|---|---|
| Questions the models wrote | 6,183 in 2,459 calls |
| Kept, every check passed | 44.0% |
| Thrown out, all reasons | 56.0% |
| 所標頁面上找不到引文 | 6.5% |
| Second model answered differently | 5.4% |
| Repeat of a question already written | 11.2% |
| Structural flaw (all of the above, a vague stem, an option that gives itself away) | 30.9% |
Counted from the call log over September 14, 2026 to September 24, 2026, refreshed twice an hour. The same report, split by model family and with a CSV, is on the rejection rates page.
每一種捨棄代表什麼
引文不在所標的頁面上。 每一題都必須帶著從文件複製的一到兩句話,並附上它們所在的頁碼。伺服器會在該頁的儲存文字裡查這句話。如果不在,就表示模型寫的是教材沒說的內容,或記錯了措辭,該題會被捨棄。這道檢查抓的是捏造的事實。
第二個模型答案不同。 另一個家族的模型只拿到題目與引文,沒有其他東西:沒有標準答案,也沒有文件。如果它無法只憑引文得出標準答案,就表示引文並不能證明答案,該題會被捨棄。這道檢查抓的是聽起來對、答案卻錯的題目,或是引文撐不住的答案。
與已寫過的題目重複。 每一道新題目都會與該文件已產生的所有題目比對。近似重複會被捨棄,所以長時間執行會給你不同的題目,而不是同樣的事實換句話說。
結構瑕疵。「以上皆是」、「以上皆非」、問下列何者為真的題幹、明顯比其他長的選項、提到「本文」的題目。這些是出題者受過訓練要移除的徵兆,在這裡會在其他檢查執行前依規則移除。選擇題瑕疵檢查工具會對你貼上的任何題目套用同一套規則。
為什麼不顯示引文的出題工具無法告訴你它的準確度
交給你一份測驗卻不附每題出處句子的工具,沒有辦法算出自己有多少題目沒有依據,因為它的流程裡沒有任何環節去查過。它的準確度就是你自己檢查題目時查到的結果,而那正是你想交出去的工作。某個競爭工具自己的說明頁要求使用者在依賴產生的測驗之前先行複查,在沒有檢查任何東西的情況下,這是誠實的說法。上面的數字之所以存在,是因為檢查發生在學生看到任何東西之前,也因為被丟掉的部分有被計算,而不是悄悄消失。
如何在二十秒內自己檢查一道 AI 題目
- 找出那句話。 如果題目沒有顯示出處,就在文件裡搜尋它的關鍵詞組。如果找不到,這題就不是出自你的教材。
- 遮住答案,只憑引文作答。 只讀引用的那句話,然後選一個選項。如果引文無法定出答案,這題考的就是引文沒說的東西。
- 看選項。 有一個選項明顯比其他長、有選項重複題幹、出現「以上皆是」:每一項都是徵兆,也都是不該相信這題、更不該從中學習的理由。
這對考試準備有什麼意義
通過這些檢查的一組題目,是你可以直接拿來練習的題目,不必為了確認每一題是真的而重讀整章。被捨棄的部分不是白費的工夫;那正是任何 AI 產生的題庫裡,使用未經檢查工具的學生本來會拿去讀的部分。本站的免費方案對它寫出的每一題執行同一套檢查,範例頁面則列出三道通過的題目,以及每一題引用的頁面。
學生常問的問題
捨棄率高就代表模型不好嗎?
不能只看這個。寫出企圖心強的臨床情境題的模型,被第二個模型刷掉的比例會高於寫記憶型題目的模型;而從短短一章長時間出題,也會因為那一章的事實就那麼多而被重複檢查刷掉。這個比率同時取決於模型、教材與該次執行,所以報表會連同計算所依據的題數一起公布。
通過的題目保證正確嗎?
不保證。這些檢查能抓出引文不在所標頁面上的題目、被第二個模型答成與標準答案不同的題目、與先前題目重複的題目,以及一組結構瑕疵。它們無法判斷醫學內容本身。這正是每一道保留下來的題目都會附上引文與頁碼的原因,讓學生可以讀到這題出自的那一行。
為什麼重複的題目也算捨棄?
因為如果沒有東西擋著,被要求從十二頁講義出四十題的出題工具,會把同樣十二個事實換句話說重寫一遍。每一道新題目都會與該文件已寫過的所有題目比對,近似重複會被捨棄,而不是當成新練習交給學生。
原始資料在哪裡?
捨棄率頁面會按模型家族與通道公布報表並提供 CSV 下載,本頁的數字讀自同一份報表。呼叫紀錄自 2026 年 9 月 14 日起保存。
不用帳號就能試用。註冊後,你的題庫、成績與複習佇列會在所有裝置上保留。
發布 , 更新 .