Cómo convertir tus apuntes en preguntas de práctica que merezca la pena responder
Sacar preguntas de práctica aprovechables de una sola clase cuesta unos catorce minutos antes de responder nada, y la mayor parte de eso eres tú escribiendo tres a mano para fijar un listón. Generar lleva dos minutos, y otros dos la comprobación que decide si el conjunto merece la pena responderlo. El caso resuelto del final de este artículo lleva cincuenta minutos de principio a fin, porque responder las preguntas en frío y volver sobre los fallos es la parte que te enseña algo. Si te saltas la comprobación, estudias lo que el modelo haya adivinado. Una revisión sistemática publicada en mayo de 2026 situó la tasa de error en 71 estudios entre menos del 1 por ciento y el 45 por ciento.
Escribe tres a mano primero, y nunca más
Abre la presentación. Busca tres líneas que puedan decidir una respuesta por sí solas: un mecanismo, un umbral, un fármaco de primera línea, un hallazgo característico. Construye una pregunta con cada una, cinco opciones, una correcta. Diez minutos, y ya has terminado de escribir a mano para siempre.
Esos diez minutos te dan un listón. Después de escribir tres, sabes que un enunciado aprovechable pregunta algo que podrías responder con las opciones tapadas, que las cinco opciones tienen que ser la misma clase de cosa en la misma forma gramatical, y que exactamente una frase de tu fuente tiene que zanjar la respuesta. También aprendes lo lento que es, y por eso nadie escribe cuarenta.
Guarda las tres. Se convierten en tu referencia para todo lo que un modelo te dé después, y cuando una pregunta generada parece mal y no sabes decir por qué, ponerla al lado de una de las tuyas suele localizar el problema en las opciones.
Qué pedir, con las palabras que cambian el resultado
Un simple hazme preguntas sobre esto da trivialidades sobre el documento en vez de preguntas sobre la materia. Seis instrucciones cambian lo que vuelve. Pégalas encima de tu texto, cambiando la cantidad y la materia.
Usa solo el texto de abajo. Escribe 12 preguntas de mejor respuesta única sobre fisiología cardiovascular de segundo curso, cada una con cinco opciones y exactamente una correcta. Después de cada pregunta, imprime la frase literal del texto que hace correcta la respuesta, y el número de página o de diapositiva en el que está. No escribas una pregunta salvo que esa única frase zanje la respuesta por sí sola. Nada de todas las anteriores, nada de ninguna de las anteriores, nada de enunciados del tipo cuál de las siguientes es cierta. Mantén las cinco opciones con la misma longitud y la misma forma gramatical.
- Usa solo el texto de abajo. Si lo dejas fuera, el modelo responde con lo que ya sabe y practicas con material que tu examinador nunca dio.
- Que imprima la frase literal y la página. Esa cláusula es la que más trabajo hace de las seis. Las citas que puedes ir a buscar zanjan una discusión con la respuesta correcta en diez segundos, y un modelo obligado a dar una escribe menos afirmaciones que no puede sostener.
- Una sola frase tiene que zanjarlo. Si no, te llegan ítems que necesitan la línea citada más otros tres datos de fuera, imposibles de comprobar e injustos de responder.
- Di el formato del ítem. Si pides preguntas, te llegan verdadero o falso, rellenar el hueco y recuerdo de una línea, todo mezclado.
- Prohíbe los dos enunciados. Todas las anteriores y cuál de las siguientes es cierta son los defectos que más producen los generadores, y los dos desaparecen si lo pides.
- La misma longitud, la misma forma. Quien escribe ítems desarrolla más la opción que sabe correcta, y un modelo entrenado con lo que produce copia la costumbre.
Pide una cantidad que tu material pueda sostener. El artículo sobre cuántas preguntas da el día cuenta línea a línea y acaba cerca del número de diapositivas, que es un recuento de líneas examinables y no de preguntas que te quedas. En la práctica una presentación de 40 diapositivas da de 15 a 20 que te quedarías, porque pedir 50 compra sobre todo duplicados que luego quitan las comprobaciones.
Qué vuelve mal, y con qué frecuencia: 71 estudios, contados
Dos números publicados fijan una expectativa justa. Una revisión sistemática en el Postgraduate Medical Journal, publicada el 20 de mayo de 2026, reunió 71 estudios de 24 países sobre preguntas de opción múltiple escritas por IA en la educación médica. Las tasas de error iban de menos del 1 por ciento al 45 por ciento. La dificultad mediana de los ítems fue de 0,67 y la discriminación mediana de 0,28, lo que describe un ítem que separa a los estudiantes que conocen el material de los que no, pero sin nitidez. La mayoría de esos estudios juzgaron las preguntas por revisión de expertos y no poniéndolas delante de estudiantes, y la revisión concluye que la evidencia todavía no respalda el "unsupervised use in summative assessment".
Más antiguo y más tajante: la Chobanian and Avedisian School of Medicine de Boston University informó en diciembre de 2023 de que ChatGPT produjo una pregunta correcta con respuesta y explicación correctas en el 32 por ciento de los casos cuando se le pidió escribir ítems para un examen de facultad de medicina.
Tercer número, de este sitio, que cuenta lo que descartan sus comprobaciones y publica el recuento. Leído el 20 de septiembre de 2026: entre el 14 de septiembre, cuando empieza el registro de llamadas, y esa fecha los modelos escribieron 3.564 preguntas en 1.398 llamadas. De esas, el 43,1 por ciento superó todo. Las reglas estructurales quitaron el 32,8 por ciento, la comprobación de duplicados el 13,5 por ciento, un segundo modelo respondiendo desde la cita y sin la respuesta correcta el 6,7 por ciento, y el 2,2 por ciento o bien citó una frase que el comprobador no encontró en la página indicada o bien citó una página fuera de la sección. El 1,7 por ciento restante llegó cuando el trabajo ya estaba lleno o volvió en un formato que el analizador no pudo leer.
Esas proporciones se mueven con cada trabajo, y la de duplicados es la que más se mueve. El artículo publicado un día antes la contó en el 17,6 por ciento en una ventana más corta, del 14 al 19 de septiembre de 2026; esta lectura cuenta el 13,5 por ciento del 14 al 20 de septiembre de 2026. Las dos son lecturas correctas del mismo informe continuo, y por eso la página de tasas de rechazo lleva la cifra en vivo y todo lo de arriba es una foto fija de ella.
Juntos, esos tres no dicen que evites generar preguntas. Dicen que cerca de la mitad de lo que vuelve va a la basura, y lo único que decides es quién la tira.
Cuándo dejar de comprobar, y cuánto vale una pregunta que falla
Las tres comprobaciones que pillan casi todo ya están escritas en la página que hay detrás de esos recuentos: busca la frase citada en tu documento, tapa la respuesta correcta y contesta solo con la cita, y luego lee las cinco opciones sin el enunciado. Pásalas a las cinco primeras preguntas de un conjunto, un minuto en total, y el artículo sobre la precisión repasa qué pilla cada una y por qué.
Esas comprobaciones no son mías. Salen de la taxonomía de escritura de ítems que establecen esas dos fuentes: las 31 reglas que Haladyna, Downing y Rodriguez expusieron en Applied Measurement in Education en 2002, y la versión de trabajo que se suele dar a quien escribe ítems, la NBME Item-Writing Guide, ya en su sexta edición y publicada en febrero de 2021.
Lo que esa página no te dice es cuándo parar. Aquí está el número: comprueba las cinco primeras preguntas y ninguna más. Con dos fallos de cinco, deja de comprobar y vuelve al prompt. Un conjunto que falla dos veces tan pronto casi siempre falla por un solo motivo, y un solo motivo suele ser una sola línea del prompt, así que afinarla y generar otra vez cuesta dos minutos. Comprobar las quince cuesta veinte y deja el mismo defecto en el lote siguiente.
Una pregunta que falla va a la basura, no a reparación. Reescribir un enunciado cuya frase citada no zanja la respuesta significa decidir tú la respuesta, y en ese momento el que escribe el ítem eres tú y el modelo te ha gastado la tarde. Por debajo de un fallo de cada cinco, tira esa y responde el resto.
La pregunta que va a la basura también deja algo. Abriste la diapositiva para comprobarla, lo que significa que leíste la línea sobre la que se construyó, con las palabras de la fuente. Apunta esa línea donde van tus fallos. Una pregunta que no pasó una comprobación y una pregunta que respondiste mal acaban en el mismo sitio, que es el comienzo del día siguiente.
La versión de enfermería, y lo que no te da una diapositiva de clase
Los estudiantes de enfermería suelen llegar aquí con un encargo más estrecho: sacar ítems estilo NCLEX de un apunte de clase. La pieza que falta es la situación. Tu diapositiva de fisiopatología te da un mecanismo, mientras que un ítem estilo NCLEX necesita un paciente, un entorno, unos cuantos hallazgos y una entrada que pida una prioridad o una acción, con cuatro opciones todas defendibles y una que es la mejor. Nada de eso está en la diapositiva, así que tiene que ponerlo el prompt.
Añade una línea: escribe cada pregunta como una situación breve de un paciente en un entorno hospitalario, terminada con qué acción debe hacer primero la enfermera, y haz que las cuatro opciones sean acciones de enfermería seguras. Añade una cuarta comprobación para estas: ¿lleva el enunciado información suficiente para elegir entre las cuatro? Cuando cualquiera de ellas podría ir primero con fundamento, el ítem no es difícil, es irresoluble, y te enseña a adivinar.
Completamente fuera del alcance de un apunte: los formatos Next Generation. Los ítems de caso clínico, matriz, pajarita, resaltado y desplegable se construyen alrededor de datos del paciente que se van desplegando, con reglas de puntuación propias, y nada generado a partir de una presentación de clase los produce. Quien te venda eso a partir de un PDF está prometiendo de más. La página del NCLEX-RN de aquí dice lo mismo. Esto no es un banco de preguntas del NCLEX y no tiene ninguna relación con el NCSBN; los ítems se escriben con ese estilo a partir del archivo que subes.
Hacerlo en volumen sin ahogarte en preguntas casi repetidas
Pide 60 preguntas a partir de un apunte de 12 páginas y recibes los mismos 12 datos con 60 disfraces. Nada en una ventana de chat lo impide: cuando va por la pregunta 47 el modelo ha perdido la pregunta 14, y detectar una paráfrasis de algo que respondiste hace veinte minutos es difícil.
Tres costumbres mantienen honesta una racha larga. Genera un capítulo cada vez y no un módulo entero, porque los duplicados se agrupan dentro de una misma fuente. Cambia el tipo de ítem en la segunda pasada, así la mejor respuesta única pasa a viñeta clínica y el mismo dato se examina como razonamiento. Ojea los enunciados antes de responder ninguno, porque una repetición detectada pronto no cuesta nada y una detectada en la pregunta 30 te cuesta la sesión.
Las máquinas son mejores que tú en esta parte. Un generador que compara cada pregunta nueva con todo lo que ya se ha escrito a partir del mismo documento tira una casi repetida antes de que llegues a verla, y eso son los rechazos por duplicado contados más arriba: preguntas que nunca llegaron a un lector.
Un caso resuelto a partir de una presentación de 40 diapositivas
Un martes por la tarde, una clase de cardiología de 40 diapositivas, de una sentada. Abajo están los tiempos que lleva de verdad, no los que le gustarían a un plan.
- Primeros diez minutos. Tres preguntas a mano, sacadas de las diapositivas en las que recuerdas que el profesor bajó el ritmo.
- Dos minutos. Pega el prompt encima del texto de la presentación y pide 15 preguntas, no 50. Quince es más o menos lo que dan de sí 40 diapositivas una vez que salen las repetidas.
- Otros dos minutos. Pasa las comprobaciones a los cinco primeros ítems. Cuenta con que fallen uno o dos. Con dos fallos, arregla el prompt y genera otra vez, lo que cuesta dos minutos y ahorra veinte.
- Veintitrés minutos. Responde las 15 en frío, unos 90 segundos cada una, con las opciones tapadas hasta que te hayas decidido.
- Trece minutos. Por cada fallo, abre la diapositiva que cita la pregunta y lee la línea de la que salió. Cópiala con las palabras de la fuente, no con tu resumen de ella.
- Mañana. Esos fallos abren la siguiente sesión, antes que nada nuevo. En qué punto de las semanas siguientes vuelven a aparecer es el tema de el calendario de repetición espaciada.
Cincuenta minutos, 15 preguntas que puedes defender y una lista escrita a mano de los datos que te ganaron.
Preguntas que hace la gente
¿Qué prompt hace que ChatGPT escriba buenas preguntas de examen a partir de mis apuntes?
Cuatro cláusulas se llevan casi todo el valor. Dile que use solo el texto que has pegado, di que el formato es mejor respuesta única con cinco opciones y una sola correcta, exige la frase literal y el número de página que hacen correcta la respuesta, y prohíbe los enunciados de todas las anteriores y cuál de las siguientes es cierta. Añadir que la frase citada tiene que zanjar la respuesta por sí sola quita casi todo lo que queda.
¿Cuál es la precisión de las preguntas de práctica generadas por IA?
Los estudios publicados no dan un solo número. Una revisión sistemática de 71 estudios en el Postgraduate Medical Journal, publicada el 20 de mayo de 2026, encontró tasas de error desde menos del 1 por ciento hasta el 45 por ciento, y Boston University informó en diciembre de 2023 de que ChatGPT produjo una pregunta correcta con respuesta y explicación correctas en el 32 por ciento de los casos. Lo que decide tu propio conjunto es si algo lo comprobó. Este sitio publica lo que descartan sus comprobaciones: leído el 20 de septiembre de 2026, el 43,1 por ciento de 3.564 preguntas generadas superó todas las comprobaciones, y la comprobación de duplicados dio cuenta del 13,5 por ciento del resto. Esas proporciones se mueven con la ventana, así que la página de tasas de rechazo lleva la cifra en vivo.
¿Cuántas preguntas de práctica debería sacar de una sola clase?
Si cuentas líneas examinables, una presentación de 40 diapositivas se queda cerca de una por diapositiva, porque esas son las líneas que podrían decidir una respuesta por sí solas. Si cuentas preguntas que te quedarías después de comprobar, está más cerca de 15 a 20, porque no toda línea examinable sobrevive. Pedir 50 no crea más datos, repite los mismos con otras palabras y la comprobación de duplicados los quita. Genera una clase cada vez y para cuando las preguntas nuevas dejen de sorprenderte.
¿Cuándo debería dejar de comprobar un conjunto generado y empezar de nuevo?
Comprueba las cinco primeras preguntas y para ahí. Con dos fallos de cinco, vuelve al prompt en vez de arreglar el conjunto, porque un conjunto que falla dos veces tan pronto suele fallar por un solo motivo, y un solo motivo suele ser una sola línea del prompt. Regenerar cuesta dos minutos; arreglar quince preguntas de una en una cuesta la tarde entera.
¿Puede la IA escribir preguntas estilo NCLEX a partir de mis apuntes de clase?
Puede escribir ítems de situación con ese estilo si le dices que construya la situación de un paciente con una entrada de prioridad o de acción y cuatro opciones seguras, porque una diapositiva de clase da la fisiopatología pero nunca el escenario. Los formatos Next Generation, es decir, caso clínico, matriz, pajarita, resaltado y desplegable, no se pueden producir a partir de un documento. Esto no es un banco de preguntas del NCLEX y no tiene ninguna relación con el NCSBN.
Publicado .