MedUni Exam

AI가 쓴 시험 문제는 얼마나 정확한가요? 실제 작업이 보여 주는 것

Every question this site writes is checked before a student sees it, and the checks keep a count. This is what the 10 days since of real jobs on medical textbooks, lecture decks and notes show: how many questions a model writes that cannot be traced to the page, that a second model answers differently, or that repeat one already written.

호출 기록에서 센 숫자

What the checks countedShare of questions written
Questions the models wrote6,183 in 2,459 calls
Kept, every check passed44.0%
Thrown out, all reasons56.0%
제시한 페이지에서 인용문을 찾지 못함6.5%
Second model answered differently5.4%
Repeat of a question already written11.2%
Structural flaw (all of the above, a vague stem, an option that gives itself away)30.9%

Counted from the call log over September 14, 2026 to September 24, 2026, refreshed twice an hour. The same report, split by model family and with a CSV, is on the rejection rates page.

각 탈락 사유의 의미

인용문이 표시된 페이지에 없음. 모든 문제는 문서에서 그대로 옮긴 한두 문장을 그 문장이 있는 페이지와 함께 지녀야 합니다. 서버는 그 페이지의 저장된 텍스트에서 그 문장을 찾습니다. 없으면 모델이 자료에 없는 내용으로 문제를 썼거나 표현을 잘못 기억한 것이므로 문제는 버려집니다. 지어낸 사실을 잡아내는 검사입니다.

두 번째 모델이 다르게 답함. 다른 계열의 모델에 문제와 인용문만 주고 그 밖에는 아무것도 주지 않습니다. 정답도 문서도 주지 않습니다. 인용문만으로 정답에 이르지 못하면 인용문이 정답을 증명하지 못하는 것이므로 문제는 버려집니다. 그럴듯하지만 정답이 틀린 문제, 또는 인용문이 뒷받침하지 않는 정답을 잡아내는 검사입니다.

이미 쓴 문제의 반복. 새 문제는 그 문서에서 이미 만들어진 모든 문제와 비교됩니다. 거의 같은 문제는 버려지므로, 길게 돌려도 같은 사실을 다시 쓴 것이 아니라 서로 다른 문제가 나옵니다.

구조적 결함. "위의 모든 것", "위의 어느 것도 아님", 어느 진술이 옳은지 묻는 문두, 다른 선택지보다 눈에 띄게 긴 선택지, "본문"을 가리키는 문제. 출제자가 없애도록 훈련받는 신호들이며, 여기서는 다른 검사가 돌기 전에 규칙으로 제거됩니다. MCQ 결함 검사기가 붙여넣은 문제에 같은 규칙을 돌립니다.

인용문을 보여 주지 않는 생성기가 자기 정확도를 말할 수 없는 이유

각 문제가 나온 문장 없이 퀴즈를 건네는 도구는, 자기 문제 중 몇 개가 근거 없는 문제였는지 셀 방법이 없습니다. 그 절차 안에서 아무것도 확인하지 않았기 때문입니다. 그 정확도는 사용자가 직접 문제를 확인해서 알아내는 값이고, 그것은 애초에 넘기려던 일입니다. 어떤 경쟁 도구의 도움말 페이지는 생성된 퀴즈를 믿기 전에 검토하라고 사용자에게 요청하는데, 아무것도 검사하지 않았다면 그것이 정직한 말입니다. 위의 숫자들은 학생이 무엇을 보기 전에 검사가 이뤄지고, 버려진 것을 조용히 없애지 않고 셌기 때문에 존재합니다.

AI 문제를 20초 만에 직접 확인하는 법

  1. 문장을 찾으세요. 문제가 어디서 나왔는지 보여 주지 않으면, 핵심 구절로 문서를 검색하세요. 그 구절이 없으면 그 문제는 내 자료에서 나온 것이 아닙니다.
  2. 정답을 가리고 인용문만으로 답해 보세요. 인용된 문장만 읽고 선택지를 고르세요. 인용문으로 결론이 나지 않으면, 그 문제는 인용문이 말하지 않는 것을 묻고 있는 것입니다.
  3. 선택지를 보세요. 하나만 유난히 긴 선택지, 문두를 되풀이하는 선택지, "위의 모든 것". 각각이 신호이고, 각각은 그 문제에서 배울 이유가 아니라 그 문제를 의심할 이유입니다.

시험 준비에 주는 의미

이 검사들을 통과한 문제 묶음은, 각 문제가 진짜인지 확인하려고 그 장을 다시 읽지 않아도 연습할 수 있는 묶음입니다. 버려진 몫은 헛수고가 아닙니다. 검사하지 않는 도구를 쓰는 학생이 그대로 공부했을, AI가 만든 문제은행의 일부입니다. 이 사이트의 무료 요금제는 만드는 모든 문제에 같은 검사를 돌리며, 샘플 페이지에 살아남은 세 문제가 각각 인용한 페이지와 함께 나와 있습니다.

학생들이 자주 묻는 질문

탈락률이 높으면 나쁜 모델인가요?

그것만으로는 아닙니다. 난도 높은 임상 사례형을 쓰는 모델은 단순 암기형을 쓰는 모델보다 두 번째 모델 검사에서 더 많이 잃고, 짧은 장에서 길게 돌리면 그 장에 담긴 사실이 한정되어 중복 검사에서 문제를 잃습니다. 이 비율은 모델, 자료, 작업이 함께 만드는 값이라서, 보고서는 집계의 바탕이 된 표본 수와 함께 공개됩니다.

통과한 문제는 반드시 정확한가요?

아니요. 검사는 인용문이 표시된 페이지에 없는 문제, 두 번째 모델이 정답과 다르게 답한 문제, 앞선 문제를 되풀이한 문제, 그리고 몇 가지 구조적 결함을 잡습니다. 의학 내용 자체는 판단하지 못합니다. 그래서 남은 모든 문제를 인용문과 페이지 번호와 함께 보여 주어, 학생이 문제가 나온 줄을 읽을 수 있게 합니다.

반복된 문제는 왜 탈락으로 집계되나요?

12페이지 유인물에서 40문제를 요구하면, 막는 장치가 없는 한 생성기는 같은 사실 열두 개를 표현만 바꿔 다시 씁니다. 새 문제는 그 문서에서 이미 쓴 모든 문제와 비교되고, 거의 같은 문제는 새 연습 문제로 학생에게 건네지 않고 버립니다.

원자료는 어디에 있나요?

탈락률 페이지는 모델 계열별, 경로별 보고서를 CSV 다운로드와 함께 공개하며, 이 페이지의 숫자도 같은 보고서에서 읽어 옵니다. 호출 기록은 2026년 9월 14일부터 보관해 왔습니다.

내 PDF로 해보기

모델별 비율 보기

사용해 보는 데 계정은 필요 없습니다. 가입하면 라이브러리, 성적, 복습 대기열이 모든 기기에 남습니다.

발행 , 수정 .