MedUni Exam

各模型家族的捨棄率

本站寫出的每一道題目,不論由哪個模型撰寫,都會通過同樣的檢查。以下是過去 30 天內各模型家族有多少題目被捨棄,以及計算比率所依據的題數。

這些比率取自呼叫記錄,該記錄自 2026 年 9 月 14 日起保存。本站其他地方列出的累計總數,計算的是自本站於 2026 年 9 月 11 日開站以來的每一道題目,所以兩組數字涵蓋的期間不同,也不應該互相加總。

統計區間為 :2,459 次產生呼叫,共傳回 6,183 題。一個模型家族在該區間傳回 200 題後才會公布;不足時,本頁會如實說明,而不是用寥寥幾次呼叫算出一個比例。

模型家族寫出的題目所標頁面上找不到引文第二個模型給出不同答案重複缺陷未要求或來得太晚採用
qwen4,5836.2%6.1%14.0%28.9%2.1%42.7%
deepseek50314.3%3.0%2.4%11.5%2.0%66.8%
glm4102.0%7.3%5.6%51.5%2.2%31.5%
nemotron3933.1%0.5%2.5%53.9%1.3%38.7%
gpt-oss2817.8%1.4%1.8%38.4%1.8%48.8%
openrouter-primary13資料不足資料不足資料不足資料不足資料不足資料不足
gemma0資料不足資料不足資料不足資料不足資料不足資料不足

依通道

免費通道先在 Cloudflare Workers AI 上執行 DeepSeek V4 Flash,其他開放權重模型作為備用。付費通道執行優先模型:DeepSeek V4 Pro 出題,Kimi K2.6 在看不到答案的情況下作答。兩條通道經過同樣的核對,也都計入這裡,所以本頁依模型家族而不是依通道統計。

通道寫出的題目所標頁面上找不到引文第二個模型給出不同答案重複缺陷未要求或來得太晚採用
免費6,1406.5%5.3%11.2%31.1%2.0%43.9%
付費43資料不足資料不足資料不足資料不足資料不足資料不足

各欄的意思

  • 寫出的題目:模型在可解析的回應中回傳的題目。無法以 JSON 讀取的回應會在 CSV 中依呼叫分開計算,因為它們沒有回傳任何可計數的題目。
  • 引文未見於所引用的頁面:逐字引文不在模型所標示頁面的儲存文字中,或它引用了所給範圍之外的頁面。CSV 會把這兩種情形分開。
  • 第二個模型不同意:來自不同家族的模型看到題目與引文,但從來沒有看到答案,卻選了不同的答案。
  • 重複:該題重複了同一份文件中已經通過的題目。
  • 瑕疵:被結構或品質規則捨棄,例如選項組洩漏答案,或題幹沒有單一最佳答案。這些規則就是選擇題瑕疵檢查工具在你瀏覽器中執行的規則。
  • 未被要求或太晚:題目本身沒問題,但仍然沒有送到學生面前。原因可能是這個題型不是該次工作要的(選擇題工作中出現簡答題),或是這題還在寫的時候,該次工作已經由其他呼叫填滿。兩者都計入,好讓整列加總相符;兩者都不算模型的失分。
  • 通過:通過了所有檢查並送到學生面前的題目。

方法

這裡的每一個數字都來自本站的正式工作。每一次供應商呼叫會在結果確定的當下寫入一列,只存計數,別無其他:沒有題目文字、沒有文件文字、沒有使用者。計數歸屬於實際作答的模型,而不一定是該次工作原本指定的模型,因為當某個模型被限流或太慢時,模型池會改用另一個模型。把備援的結果算到沒有執行的模型上,等於發布了關於錯誤模型的數字。

區間是過去 30 天,每小時最多重算兩次,而且是三個固定區間之一。比率是以一個家族回傳的題目為分母的占比,一次呼叫回傳的每一道題目都恰好落在其中一欄,所以這些欄位加上通過的占比正好是全部。若呼叫回到一個已經結束的工作,就完全不會寫入任何一列:那些題目根本沒有被看過,回答得晚的模型不是回答得差的模型。回傳題目少於 200 題的家族列為資料不足,因為在這種規模下,一個不好的段落就會讓比率移動好幾個百分點。

下載同一組數字的 CSV,或以 JSON 讀取。這些數字以 Creative Commons Attribution 4.0 授權發布:歡迎使用、引用,並註明來源為 MedUni Exam。

更新於 2026 年 9 月 24 日。

用你自己的章節產生題目

查看價格

不用帳號就能試用。註冊後,你的題庫、成績與複習佇列會在所有裝置上保留。

發布 , 更新 .