MedUni Exam

내 필기를 풀 가치가 있는 연습 문제로 바꾸는 법

강의 하나에서 쓸 만한 연습 문제를 얻는 데는 무엇을 풀기도 전에 약 14분이 들고, 그중 대부분은 기준을 세우려고 손으로 세 개를 쓰는 시간입니다. 생성에 2분, 그 묶음이 풀 가치가 있는지 정하는 검사에 다시 2분이 듭니다. 이 글 끝에 있는 실제 진행은 처음부터 끝까지 50분이 걸리는데, 아무 준비 없이 풀고 틀린 것을 되짚어 읽는 부분이 뭔가를 가르치는 부분이기 때문입니다. 검사를 건너뛰면 모델이 추측한 것을 그대로 공부하게 됩니다. 2026년 5월에 발표된 한 체계적 문헌고찰은 연구 71건의 오류율을 1퍼센트 미만에서 45퍼센트까지로 잡았습니다.

먼저 손으로 세 개를 쓰고, 그다음에는 다시 쓰지 않습니다

슬라이드를 엽니다. 혼자서 답을 정할 수 있는 줄 세 개를 찾습니다. 기전 하나, 기준치 하나, 1차 약제 하나, 특징적인 소견 하나 같은 것입니다. 각각에서 문제를 하나씩 만들고, 선택지 다섯에 정답 하나입니다. 10분이면 되고, 손으로 쓰는 일은 이걸로 끝입니다.

그 10분이 기준 하나를 사 줍니다. 세 개를 써 보고 나면 쓸 만한 문두는 선택지를 가린 채로도 답할 수 있는 것을 묻는다는 것, 선택지 다섯은 같은 종류의 것이 같은 문법 형태로 놓여야 한다는 것, 출처의 딱 한 문장이 답을 확정해야 한다는 것을 알게 됩니다. 그 일이 얼마나 느린지도 알게 되는데, 그래서 아무도 마흔 개를 쓰지 않습니다.

손으로 쓴 세 문제는 남겨 두세요. 뒤에 모델이 건네는 모든 것의 기준이 되고, 생성된 문제가 이상한데 어디가 이상한지 말할 수 없을 때 내 문제 옆에 나란히 놓아 보면 대개 선택지에서 문제가 드러납니다.

무엇을 요청할 것인가, 결과를 바꾸는 표현으로

이걸로 문제 좀 내 줘라고 하면 과목이 아니라 문서에 대한 잡학 문제가 돌아옵니다. 지시 여섯 개가 돌아오는 것을 바꿉니다. 개수와 주제만 바꿔서 본문 위에 붙여 넣으세요.

아래 텍스트만 사용하세요. 2학년 심혈관 생리학에 대한 최선답형 문제 12개를 쓰고, 각 문제에 선택지 다섯 개와 정답 정확히 하나를 두세요. 각 문제 뒤에는 그 답이 맞는 근거가 되는 문장을 텍스트에서 원문 그대로 적고, 그 문장이 있는 페이지나 슬라이드 번호를 적으세요. 그 한 문장이 혼자서 답을 확정하지 못하면 문제를 쓰지 마세요. 위의 모든 것, 위의 어느 것도 아님, 다음 중 옳은 것은 형태의 문두는 쓰지 마세요. 선택지 다섯 개는 길이와 문법 형태를 같게 맞추세요.

  • 아래 텍스트만 사용합니다. 이 말을 빼면 모델은 이미 아는 것으로 답을 만들고, 사용자는 출제자가 가르친 적 없는 내용으로 연습하게 됩니다.
  • 원문 그대로의 문장과 페이지를 함께 적게 합니다. 여섯 개 중 일을 가장 많이 하는 문장입니다. 찾아볼 수 있는 인용문은 정답과의 다툼을 10초 안에 끝내고, 인용문을 내놓아야 하는 모델은 뒷받침하지 못할 주장을 덜 씁니다.
  • 한 문장이 답을 확정해야 합니다. 그러지 않으면 인용된 줄에 더해 다른 데서 온 사실 세 개까지 있어야 풀리는 문항이 나옵니다. 검사할 수도 없고 푸는 사람에게 공정하지도 않습니다.
  • 문항 형식을 지정합니다. 그냥 문제라고 하면 참 거짓, 빈칸 채우기, 한 줄 암기가 섞여서 돌아옵니다.
  • 두 가지 문두를 금지합니다. '위의 모든 것'과 '다음 중 옳은 것은'은 생성기가 가장 많이 만드는 결함이고, 둘 다 지시 한 줄이면 사라집니다.
  • 같은 길이, 같은 형태. 문항 출제자는 정답인 줄 아는 선택지를 더 길게 다듬고, 그 결과물로 학습한 모델은 그 버릇을 그대로 따라 합니다.

자료가 감당할 수 있는 개수를 요청하세요. 하루 문제 공급을 다룬 글은 한 줄씩 세어 슬라이드 수 근처에 도달하는데, 그것은 남길 문제의 수가 아니라 답을 정할 수 있는 줄의 수입니다. 실제로 슬라이드 40장짜리 강의에서 남길 만한 것은 15개에서 20개이고, 50개를 요청하면 대개 검사가 걸러 낼 중복만 늘어납니다.

무엇이 틀려서 돌아오고 얼마나 자주인가: 연구 71건을 세어 보면

발표된 숫자 둘이 온당한 기대치를 잡아 줍니다. Postgraduate Medical Journal에 2026년 5월 20일에 실린 체계적 문헌고찰은 의학 교육에서 AI가 쓴 선다형 문제를 다룬 24개국의 연구 71건을 모았습니다. 오류율은 1퍼센트 미만에서 45퍼센트까지였습니다. 문항 난이도의 중앙값은 0.67, 변별도의 중앙값은 0.28이었는데, 이는 내용을 아는 학생과 모르는 학생을 갈라 주기는 하되 날카롭지는 않은 문항을 뜻합니다. 그 연구 대부분은 문제를 학습자에게 내 보는 대신 전문가 검토로 판정했고, 이 고찰은 근거가 아직 "unsupervised use in summative assessment"를 뒷받침하지 않는다고 결론짓습니다.

더 오래되었고 더 무뚝뚝한 숫자도 있습니다. Boston University의 Chobanian and Avedisian School of Medicine은 2023년 12월에, 의과대학 시험 문항을 쓰라고 시켰을 때 ChatGPT가 정답과 해설까지 맞는 문제를 내놓은 경우가 32퍼센트였다고 보고했습니다.

세 번째 숫자는 이 사이트에서 나옵니다. 자기 검사가 무엇을 버리는지 세어 그 숫자를 공개합니다. 2026년 9월 20일에 읽었습니다. 호출 기록이 시작되는 9월 14일부터 그날까지 모델은 호출 1,398번에 걸쳐 문제 3,564개를 썼습니다. 그중 43.1퍼센트가 모든 검사를 통과했습니다. 구조 규칙이 32.8퍼센트, 중복 검사가 13.5퍼센트, 정답 없이 인용문만 보고 답한 두 번째 모델이 6.7퍼센트를 걷어 냈고, 2.2퍼센트는 인용한 문장을 검사기가 해당 페이지에서 찾지 못했거나 해당 절 바깥의 페이지를 인용했습니다. 남은 1.7퍼센트는 작업이 이미 찬 뒤에 도착했거나 파서가 읽을 수 없는 형태로 돌아왔습니다.

그 비율은 작업마다 움직이고, 중복의 몫이 가장 많이 움직입니다. 하루 앞서 올라온 글은 더 짧은 구간인 2026년 9월 14일부터 19일까지를 두고 17.6퍼센트로 셌고, 이번 집계는 2026년 9월 14일부터 20일까지를 두고 13.5퍼센트로 셉니다. 둘 다 같은 롤링 보고서를 바르게 읽은 것이며, 그래서 거부율 페이지에 현재 수치가 있고 위의 내용은 그것의 한 장면입니다.

셋을 합쳐도 문제 생성을 피하라는 말은 되지 않습니다. 돌아온 것의 절반 가까이가 버릴 것이라는 말이고, 사용자가 정할 것은 그 버리는 일을 누가 하느냐뿐입니다.

언제 검사를 멈출 것인가, 그리고 떨어진 문제의 값어치

그 대부분을 잡아내는 검사 세 가지는 그 숫자들이 놓인 페이지에 이미 적혀 있습니다. 인용된 문장을 내 문서에서 찾고, 정답을 가린 채 인용문만으로 답하고, 문두 없이 선택지 다섯 개만 읽어 보는 것입니다. 한 묶음의 처음 다섯 문제에 돌리면 다 합쳐 1분이고, 정확도를 다룬 글이 각 검사가 무엇을 잡아내고 왜 그런지 짚습니다.

이 검사들은 제가 만든 것이 아닙니다. 두 출처가 내놓은 문항 작성 분류 체계에서 왔습니다. Haladyna, Downing, Rodriguez가 2002년 Applied Measurement in Education에 제시한 31개 규칙, 그리고 문항 출제자가 보통 건네받는 실무용 판본인 NBME Item-Writing Guide입니다. 지금은 6판이고 2021년 2월에 올라와 있습니다.

그 페이지가 알려 주지 않는 것은 언제 멈추느냐입니다. 숫자는 이렇습니다. 처음 다섯 문제를 검사하고 그 이상은 하지 않습니다. 다섯 중 둘이 떨어지면 검사를 멈추고 프롬프트로 돌아가세요. 그렇게 이른 단계에서 두 번 떨어지는 묶음은 거의 언제나 한 가지 이유로 떨어지고 그 이유는 보통 프롬프트의 한 줄이므로, 그 줄을 조이고 다시 생성하는 데 2분이 듭니다. 열다섯 개를 다 검사하면 20분이 들고 같은 결함이 다음 묶음에 그대로 남습니다.

검사를 통과하지 못한 문제는 고치는 쪽이 아니라 버리는 쪽입니다. 인용된 문장이 답을 확정하지 못하는 문두를 다시 쓰려면 답을 직접 정해야 하고, 그 순간 출제자는 사용자 자신이 되며 모델은 저녁 시간만 쓴 셈이 됩니다. 실패가 다섯 개 중 한 개 미만이면 그 한 개만 버리고 나머지를 푸세요.

버린 문제도 얻는 것이 있습니다. 확인하려고 슬라이드를 열었다는 것은 그 문제가 기대고 있던 줄을 출처의 표현 그대로 읽었다는 뜻입니다. 그 줄을 틀린 것들을 모아 두는 곳에 적어 두세요. 검사를 통과하지 못한 문제와 내가 틀린 문제는 같은 자리에 모이고, 그 자리가 내일의 시작입니다.

간호학 버전, 그리고 강의 슬라이드가 주지 않는 것

간호학과 학생은 보통 더 좁은 과제를 들고 옵니다. 수업 유인물에서 NCLEX 형식 문항을 뽑는 일입니다. 빠진 조각은 상황입니다. 병태생리 슬라이드는 기전을 건네지만, NCLEX 형식 문항에는 대상자와 장면, 몇 가지 소견, 그리고 우선순위나 행동을 묻는 질문 문구가 필요하고, 선택지 넷은 모두 그럴듯하되 그중 하나가 가장 낫습니다. 그중 어느 것도 슬라이드에는 없으므로 프롬프트가 그것을 넣어 주어야 합니다.

한 줄을 더합니다. 각 문제를 병원 상황의 짧은 대상자 시나리오로 쓰고, 간호사가 가장 먼저 해야 할 행동을 묻는 것으로 끝내며, 선택지 네 개를 모두 안전한 간호 행위로 만들라고 지시하세요. 이런 문항에는 네 번째 검사를 더합니다. 문두에 네 개 중 하나를 고를 만큼의 정보가 들어 있는가? 어느 것이든 먼저 할 만해 보인다면 그 문항은 어려운 것이 아니라 풀 수 없는 것이고, 찍는 법만 가르칩니다.

유인물에서는 아예 손이 닿지 않는 것도 있습니다. Next Generation 형식입니다. 사례 연구, 매트릭스, 보타이, 하이라이트, 드롭다운 문항은 환자 정보가 단계별로 펼쳐지는 구조와 자체 채점 규칙 위에 세워지고, 강의 슬라이드에서 생성한 어떤 것도 그것을 만들어 내지 못합니다. PDF로 그것을 해 준다고 파는 곳이 있다면 과장하는 것입니다. 여기 NCLEX-RN 페이지도 같은 말을 합니다. 이것은 NCLEX 문제은행이 아니며 NCSBN과 아무 관계가 없습니다. 문항은 사용자가 올린 파일에서 그 형식으로 쓰입니다.

비슷비슷한 중복에 빠지지 않으면서 많이 만드는 법

12쪽짜리 유인물에서 60문항을 요청하면 같은 사실 12개가 60가지 옷을 입고 돌아옵니다. 채팅 창 안에서는 그것을 막을 방법이 없습니다. 47번 문제에 이르면 모델은 14번 문제를 잊었고, 20분 전에 푼 것을 말만 바꾼 문제를 알아채기는 어렵습니다.

긴 여정을 정직하게 유지하는 습관이 셋 있습니다. 모듈 전체가 아니라 한 번에 한 장씩 생성하세요. 중복은 한 자료 안에서 뭉치기 때문입니다. 두 번째 회차에서는 문항 유형을 바꿔 최선답형을 임상 사례형으로 만들고 같은 사실을 추론으로 묻게 하세요. 그리고 풀기 전에 문두들을 훑으세요. 일찍 잡아낸 반복은 아무 대가가 없지만 30번 문제에서 잡히는 반복은 그 회차를 통째로 앗아 갑니다.

이 부분은 기계가 사람보다 낫습니다. 같은 문서에서 이미 쓴 모든 문제와 새 문제를 일일이 견주는 생성기는 비슷한 반복을 사용자가 보기도 전에 버리고, 위에서 센 중복 거부 건수가 바로 그것입니다. 독자에게 한 번도 닿지 않은 문제들입니다.

슬라이드 40장짜리 강의 하나로 해 본 실제 진행

화요일 저녁, 슬라이드 40장짜리 심장내과 강의, 한자리에서. 아래는 계획이 바라는 시간이 아니라 실제로 걸리는 시간입니다.

  1. 처음 10분. 강사가 속도를 늦추던 기억이 있는 슬라이드에서 손으로 문제 세 개를 씁니다.
  2. 2분. 위의 프롬프트를 슬라이드 텍스트 앞에 붙여 넣고 50개가 아니라 15개를 요청합니다. 중복을 걸러 내고 나면 슬라이드 40장이 감당하는 양이 대략 열다섯 개입니다.
  3. 다시 2분. 처음 다섯 문항에 검사를 돌립니다. 한두 개는 떨어질 것으로 보면 됩니다. 두 개가 떨어지면 프롬프트를 고치고 다시 생성합니다. 2분이 들고 20분을 아낍니다.
  4. 23분. 15개를 아무 준비 없이 다 풉니다. 한 문항에 약 90초, 답을 정하기 전까지 선택지는 가립니다.
  5. 13분. 틀린 문항마다 그 문항이 인용한 슬라이드를 열고 문장이 나온 줄을 읽습니다. 내 요약이 아니라 출처의 표현 그대로 옮겨 적습니다.
  6. 내일. 그 틀린 문항들이 새 내용보다 먼저 다음 공부를 엽니다. 그것들이 이후 몇 주 중 언제 다시 돌아오는지는 간격 반복 일정에서 다룹니다.

50분, 근거를 댈 수 있는 문제 15개, 그리고 나를 이긴 사실들을 손으로 적은 목록.

자주 묻는 질문

어떤 프롬프트를 쓰면 ChatGPT가 제 필기로 좋은 시험 문제를 쓰나요?

네 개의 문장이 값어치의 대부분을 만들어 냅니다. 붙여 넣은 텍스트만 쓰라고 지시하고, 형식을 선택지 다섯 개에 정답 하나인 최선답형으로 지정하고, 답이 맞는 근거가 되는 원문 그대로의 문장과 페이지 번호를 요구하고, 위의 모든 것과 다음 중 옳은 것은 형태의 문두를 금지하는 것입니다. 인용한 문장이 혼자서 답을 확정해야 한다는 말을 더하면 남은 문제 대부분이 사라집니다.

AI가 생성한 연습 문제는 얼마나 정확한가요?

발표된 연구들은 하나의 숫자를 주지 않습니다. Postgraduate Medical Journal에 2026년 5월 20일에 실린 연구 71건에 대한 체계적 문헌고찰은 오류율을 1퍼센트 미만에서 45퍼센트까지로 잡았고, Boston University는 2023년 12월에 ChatGPT가 정답과 해설까지 맞는 문제를 내놓은 경우가 32퍼센트였다고 보고했습니다. 내 문제 묶음을 결정하는 것은 그것을 무엇이 검사했는가입니다. 이 사이트는 자기 검사가 무엇을 버리는지 공개합니다. 2026년 9월 20일에 읽은 수치로, 생성된 문제 3,564개 중 43.1퍼센트가 모든 검사를 통과했고 중복 검사가 나머지의 13.5퍼센트를 차지했습니다. 그 비율은 집계 구간에 따라 움직이므로, 거부율 페이지에 현재 수치가 있습니다.

강의 하나에서 연습 문제를 몇 개 만들어야 하나요?

답을 정할 수 있는 줄을 세면 슬라이드 40장짜리 강의는 한 장에 하나 꼴에 가깝습니다. 혼자서 답을 정할 수 있는 줄이 그만큼이기 때문입니다. 검사하고 나서 남길 문제로 세면 15개에서 20개 쪽에 가깝습니다. 그런 줄이 모두 살아남지는 않기 때문입니다. 50개를 요청한다고 사실이 더 생기지는 않고, 같은 사실이 새 표현으로 다시 나올 뿐이며 중복 검사가 그것을 걷어 냅니다. 한 번에 강의 하나씩 생성하고, 새 문제가 더 이상 놀랍지 않으면 멈추세요.

생성된 묶음을 언제 그만 검사하고 처음부터 다시 해야 하나요?

처음 다섯 문제를 검사하고 거기서 멈춥니다. 다섯 중 둘이 떨어지면 묶음을 손보는 대신 프롬프트로 돌아가세요. 그렇게 이른 단계에서 두 번 떨어지는 묶음은 대개 한 가지 이유로 떨어지고, 그 한 가지 이유는 보통 프롬프트의 한 줄입니다. 다시 생성하는 데는 2분이 들고, 열다섯 문제를 하나씩 손보는 데는 저녁 하나가 통째로 듭니다.

AI가 제 수업 필기로 NCLEX 형식의 문제를 쓸 수 있나요?

대상자 상황을 만들고 우선순위나 행동을 묻는 질문 문구로 끝내며 안전한 선택지 네 개를 두라고 지시하면, 그 형식의 시나리오 문항을 쓸 수 있습니다. 강의 슬라이드는 병태생리는 주지만 상황은 주지 않기 때문입니다. 사례 연구, 매트릭스, 보타이, 하이라이트, 드롭다운을 뜻하는 Next Generation 형식은 문서에서 만들어 낼 수 없습니다. 이것은 NCLEX 문제은행이 아니며 NCSBN과 아무 관계가 없습니다.

발행 .