# 모델 계열별 탈락률

> 이 사이트의 실제 운영 작업에서 집계한 모델 계열별 탈락률: 인용문 미발견, 두 번째 모델 불일치, 중복, 결함, 승인, 그리고 N.

MedUni Exam이 발행한 https://meduniexam.com/ko/stats/rejections(HTML 페이지)의 Markdown 사본입니다. 발행 2026년 9월 14일, 수정 2026년 9월 23일. 에이전트를 위한 사이트 안내: https://meduniexam.com/llms.txt.

이 사이트를 위해 작성된 모든 문제는 어떤 모델이 썼든 같은 검증을 거칩니다. 아래는 최근 30일 동안 각 모델 계열이 그중 얼마나 잃는지, 그리고 비율의 바탕이 된 표본 수입니다.

이 비율은 2026년 9월 14일부터 보관해 온 호출 로그에서 집계합니다. 사이트 다른 곳에 표시되는 누적 집계는 2026년 9월 11일 사이트가 문을 연 이후의 모든 문항을 세므로, 두 수치는 서로 다른 기간을 다루며 합이 맞도록 되어 있지 않습니다.

2026년 9월 14일부터 2026년 9월 24일까지 집계: 생성 호출 2,459회가 문항 6,183개를 돌려주었습니다. 모델 계열은 기간 안에 문항 200개를 돌려주면 공개되며, 그보다 적으면 몇 번의 호출로 낸 비율을 싣는 대신 그렇다고 표시합니다.

| 모델 계열 | 작성된 문항 | 제시한 페이지에서 인용문을 찾지 못함 | 두 번째 모델이 다른 답을 고름 | 중복 | 결함 | 요청하지 않았거나 너무 늦음 | 채택 |
| --- | --- | --- | --- | --- | --- | --- | --- |
| qwen | 4,583 | 6.2% | 6.1% | 14.0% | 28.9% | 2.1% | 42.7% |
| deepseek | 503 | 14.3% | 3.0% | 2.4% | 11.5% | 2.0% | 66.8% |
| glm | 410 | 2.0% | 7.3% | 5.6% | 51.5% | 2.2% | 31.5% |
| nemotron | 393 | 3.1% | 0.5% | 2.5% | 53.9% | 1.3% | 38.7% |
| gpt-oss | 281 | 7.8% | 1.4% | 1.8% | 38.4% | 1.8% | 48.8% |
| openrouter-primary | 13 | 데이터 부족 | 데이터 부족 | 데이터 부족 | 데이터 부족 | 데이터 부족 | 데이터 부족 |
| gemma | 0 | 데이터 부족 | 데이터 부족 | 데이터 부족 | 데이터 부족 | 데이터 부족 | 데이터 부족 |

## 레인별

무료 레인은 먼저 Cloudflare Workers AI의 DeepSeek V4 Flash로 돌아가고, 다른 오픈 웨이트 모델이 예비로 쓰입니다. 유료 레인은 우선 모델로 돌아갑니다. DeepSeek V4 Pro가 문항을 쓰고 Kimi K2.6가 답을 보지 않고 풉니다. 두 레인 모두 같은 검증을 거치고 모두 여기에서 집계되므로, 이 페이지는 레인이 아니라 모델 계열을 다룹니다.

| 경로 | 작성된 문항 | 제시한 페이지에서 인용문을 찾지 못함 | 두 번째 모델이 다른 답을 고름 | 중복 | 결함 | 요청하지 않았거나 너무 늦음 | 채택 |
| --- | --- | --- | --- | --- | --- | --- | --- |
| 무료 | 6,140 | 6.5% | 5.3% | 11.2% | 31.1% | 2.0% | 43.9% |
| 유료 | 43 | 데이터 부족 | 데이터 부족 | 데이터 부족 | 데이터 부족 | 데이터 부족 | 데이터 부족 |

## 각 열의 의미

- **작성된 문항**: 모델이 해석 가능한 응답으로 돌려준 문항. JSON으로 읽을 수 없었던 응답은 집계할 문항을 돌려주지 않았으므로 CSV에서 호출 단위로 따로 집계합니다.
- **인용한 페이지에서 인용문을 찾지 못함**: 원문 인용문이 모델이 지정한 페이지의 저장된 텍스트에 없었거나, 주어진 구간 밖의 페이지를 인용한 경우. CSV는 이 둘을 나누어 보여줍니다.
- **두 번째 모델이 다른 답을 냄**: 다른 계열의 모델이 문제와 인용문만 보고 정답 키는 보지 않은 채 다른 답을 고른 경우.
- **중복**: 같은 문서에서 이미 승인된 문제를 반복한 경우.
- **결함**: 정답이 드러나는 선택지 구성이나 단일 최선답이 없는 발문처럼 구조나 품질 규칙에 걸려 버려진 경우. 그 규칙들은 [MCQ 결함 검사기](https://meduniexam.com/ko/tools/mcq-checker.md)가 브라우저에서 실행하는 것과 같습니다.
- **요청하지 않았거나 너무 늦음**: 문제 자체는 멀쩡했지만 어차피 학생에게 도달하지 못한 경우. 작업이 요청하지 않은 유형이었거나(객관식 작업에 들어온 단답형 항목), 이 문제가 작성되는 동안 다른 호출로 작업이 이미 채워진 경우입니다. 행의 합이 맞도록 둘 다 집계하며, 어느 쪽도 모델의 잘못은 아닙니다.
- **승인**: 이 모든 것을 통과해 학생에게 도달한 문제.

## 방법

여기의 모든 수치는 이 사이트의 실제 운영 작업에서 나옵니다. 제공업체 호출마다 결과가 확인되는 시점에 한 행이 기록되며, 집계 수치만 담고 그 밖에는 아무것도 담지 않습니다. 문제 텍스트도, 문서 텍스트도, 사용자도 없습니다. 집계는 실제로 응답한 모델에 귀속되는데, 이는 작업이 요청한 모델과 항상 같지는 않습니다. 한 모델이 요청 제한에 걸리거나 느릴 때 풀이 다른 모델로 넘기기 때문입니다. 대체 실행을 실행되지 않은 모델에 귀속시키면 엉뚱한 모델에 대한 수치를 공개하는 셈이 됩니다.

기간은 최근 30일이며 한 시간에 최대 두 번 다시 집계되고, 고정된 세 기간 중 하나입니다. 비율은 한 계열이 돌려준 문항에 대한 몫이며, 호출이 돌려준 모든 문항은 이 열 중 정확히 하나에 들어가므로 승인 비율과 합하면 전체가 됩니다. 이미 끝난 작업으로 돌아온 호출은 행을 전혀 기록하지 않습니다. 그 문항들은 검토된 적이 없고, 늦게 답한 모델이 나쁘게 답한 모델은 아니기 때문입니다. 돌려준 문항이 200개 미만인 계열은 데이터 부족으로 표시합니다. 그 정도 규모에서는 좋지 않은 구간 하나가 비율을 몇 퍼센트포인트씩 움직이기 때문입니다.

[같은 수치를 CSV로 내려받기](https://meduniexam.com/api/stats/rejections.csv?days=30), 또는 [JSON](https://meduniexam.com/api/stats/rejections?days=30)으로 읽기. 이 수치는 [크리에이티브 커먼즈 저작자표시 4.0](https://creativecommons.org/licenses/by/4.0/) 라이선스로 공개됩니다. 사용하고, 인용하고, 출처로 MedUni Exam을 밝혀주세요.

2026년 9월 24일 갱신.

[내 챕터로 생성하기](https://meduniexam.com/#/?lang=ko)

[요금 보기](https://meduniexam.com/ko/pricing.md)

사용해 보는 데 계정은 필요 없습니다. 가입하면 라이브러리, 성적, 복습 대기열이 모든 기기에 남습니다.

## 관련 페이지

- [AI가 쓴 시험 문제는 얼마나 정확한가요?](https://meduniexam.com/ko/blog/how-accurate-are-ai-exam-questions.md): 최근 30일 동안 실제 작업에서 검사가 버린 것과, AI가 쓴 문제를 직접 확인하는 법.
- [작동 방식](https://meduniexam.com/ko/how-it-works.md): 검증 절차를 단계별로 설명합니다. 무엇이 왜 버려지는지도 다룹니다.
- [MCQ 결함 검사기](https://meduniexam.com/ko/tools/mcq-checker.md): 붙여넣은 문제 하나에 생성기의 구조 규칙을 그대로 적용하는 브라우저 검사기.
- [PDFToQuiz와 MedUni Exam 한도·요금 비교](https://meduniexam.com/ko/compare/pdftoquiz.md): PDFToQuiz와 항목별로 비교했으며, 그들이 앞선 항목도 넣었습니다.
- [MedUni Exam 변경 기록: 무엇이 언제 바뀌었나](https://meduniexam.com/ko/changes.md): 배포된 내용을 날짜와 함께 최신순으로 정리한 변경 기록입니다.
