MedUni Exam

Como transformar os teus apontamentos em perguntas de treino que valem a pena

Tirar perguntas de treino aproveitáveis de uma aula custa cerca de catorze minutos antes de responderes a seja o que for, e a maior parte disso és tu a escrever três à mão para fixares um padrão. Gerar leva dois minutos, e a verificação que decide se o conjunto vale a pena responder leva outros tantos. O exemplo trabalhado no fim deste artigo leva cinquenta minutos do princípio ao fim, porque responder às perguntas a frio e reler os erros é a parte que te ensina alguma coisa. Salta a verificação e passas a estudar o que o modelo adivinhou. Uma revisão sistemática publicada em maio de 2026 pôs a taxa de erro em 71 estudos algures entre menos de 1 por cento e 45 por cento.

Escreve três à mão primeiro, e depois nunca mais

Abre a apresentação. Encontra três linhas capazes de decidir uma resposta sozinhas: um mecanismo, um limiar, um fármaco de primeira linha, um achado característico. Constrói uma pergunta a partir de cada uma, cinco opções, uma certa. Dez minutos, e acabaste de vez com a escrita à mão.

Esses dez minutos compram-te um padrão. Depois de teres escrito três, sabes que um enunciado aproveitável pergunta uma coisa a que conseguirias responder com as opções tapadas, que as cinco opções têm de ser o mesmo tipo de coisa na mesma forma gramatical, e que exatamente uma frase da tua fonte tem de resolver a resposta. Também aprendes como isto é lento, e é por isso que ninguém escreve quarenta.

Guarda as três. Passam a ser a tua referência para tudo o que um modelo te entregar depois, e quando uma pergunta gerada parece errada e não consegues dizer porquê, pô-la ao lado de uma das tuas costuma localizar o problema nas opções.

O que pedir, nas palavras que mudam o resultado

Dizer pergunta-me sobre isto dá-te curiosidades sobre o documento em vez de perguntas sobre a matéria. Seis instruções mudam o que volta. Cola-as por cima do teu texto, mudando a quantidade e o tema.

Usa apenas o texto abaixo. Escreve 12 perguntas de melhor resposta única sobre fisiologia cardiovascular do segundo ano, cada uma com cinco opções e exatamente uma resposta correta. Depois de cada pergunta, imprime a frase literal do texto que torna a resposta correta, e o número de página ou de slide onde ela está. Não escrevas uma pergunta a não ser que essa frase resolva a resposta sozinha. Nada de todas as anteriores, nada de nenhuma das anteriores, nada de enunciados do tipo qual das seguintes é verdadeira. Mantém as cinco opções com o mesmo comprimento e a mesma forma gramatical.

  • Usa apenas o texto abaixo. Se deixares isto de fora, o modelo responde a partir do que já sabe e tu treinas com matéria que o teu examinador nunca deu.
  • Manda imprimir a frase literal e a página. É a cláusula que faz mais trabalho das seis. Citações que podes ir confirmar resolvem uma discussão com a chave de resposta em dez segundos, e um modelo obrigado a produzir uma escreve menos afirmações que não consegue sustentar.
  • Uma frase tem de resolver a resposta. Caso contrário ficas com perguntas que precisam da linha citada mais três factos vindos de outro lado, impossíveis de verificar e injustas de responder.
  • Diz qual é o formato da pergunta. Se pedires perguntas, recebes verdadeiro ou falso, preencher o espaço e evocação de uma linha, tudo à mistura.
  • Proíbe os dois enunciados. Todas as anteriores e qual das seguintes é verdadeira são as falhas que os geradores mais produzem, e ambas desaparecem quando se dá a instrução.
  • Mesmo comprimento, mesma forma. Quem escreve perguntas desenvolve mais a opção que sabe estar certa, e um modelo treinado com esse material copia o hábito.

Pede uma quantidade que o teu material aguente. O artigo sobre a oferta diária de perguntas conta uma linha de cada vez e chega perto do número de slides, que é uma contagem de linhas aproveitáveis e não de perguntas que ficas a guardar. Na prática, uma apresentação de 40 slides rende 15 a 20 que guardarias, porque pedir 50 compra sobretudo repetições que as verificações depois removem.

O que volta errado, e com que frequência: 71 estudos, contados

Dois números publicados fixam uma expectativa justa. Uma revisão sistemática no Postgraduate Medical Journal, publicada a 20 de maio de 2026, juntou 71 estudos de 24 países sobre perguntas de escolha múltipla escritas por IA no ensino médico. As taxas de erro iam de menos de 1 por cento a 45 por cento. A dificuldade mediana das perguntas foi 0,67 e a discriminação mediana 0,28, o que descreve uma pergunta que separa os alunos que sabem a matéria dos que não sabem, mas não de forma nítida. A maioria desses estudos avaliou as perguntas por revisão de peritos em vez de as pôr à frente de alunos, e a revisão conclui que a evidência ainda não sustenta "unsupervised use in summative assessment".

Mais antigo e mais direto: a Chobanian and Avedisian School of Medicine da Boston University comunicou em dezembro de 2023 que o ChatGPT produziu uma pergunta correta com resposta e explicação corretas em 32 por cento dos casos quando lhe pediram que escrevesse perguntas para um exame de uma faculdade de medicina.

Terceiro número, deste site, que conta o que as suas verificações deitam fora e publica a contagem. Lido a 20 de setembro de 2026: entre 14 de setembro, quando começa o registo de chamadas, e essa data, os modelos escreveram 3.564 perguntas em 1.398 chamadas. Dessas, 43,1 por cento sobreviveram a tudo. As regras de estrutura removeram 32,8 por cento, a verificação de repetições 13,5 por cento, um segundo modelo a responder a partir da citação sem a chave 6,7 por cento, e 2,2 por cento ou citaram uma frase que o verificador não encontrou na página indicada ou citaram uma página fora da secção. Os restantes 1,7 por cento chegaram depois de o trabalho já estar cheio ou voltaram numa forma que o analisador não conseguiu ler.

Essas percentagens mexem-se a cada trabalho, e a das repetições é a que mais mexe. O artigo publicado um dia antes contou-a em 17,6 por cento numa janela mais curta, de 14 a 19 de setembro de 2026; esta leitura conta 13,5 por cento de 14 a 20 de setembro de 2026. As duas são leituras corretas do mesmo relatório rolante, e é por isso que a página das taxas de rejeição leva o número em direto e tudo o que está acima é um instantâneo dele.

Postos lado a lado, esses três números não dizem que se deve evitar gerar perguntas. Dizem que perto de metade do que volta pertence ao lixo, e a tua única decisão é quem faz essa triagem.

Quando parar de verificar, e quanto vale uma pergunta falhada

As três verificações que apanham a maior parte já estão escritas na página por trás dessas contagens: encontra a frase citada no teu documento, tapa a chave e responde só a partir da citação, depois lê as cinco opções sem o enunciado. Corre-as nas cinco primeiras perguntas de um conjunto, um minuto ao todo, e o artigo sobre rigor percorre o que cada uma apanha e porquê.

Essas verificações não são minhas. Vêm da taxonomia de escrita de perguntas que essas duas fontes definem: as 31 regras que Haladyna, Downing e Rodriguez apresentaram na Applied Measurement in Education em 2002, e a versão de trabalho que costuma ser entregue a quem escreve perguntas, o NBME Item-Writing Guide, agora na sexta edição e publicado em fevereiro de 2021.

O que essa página não te diz é quando parar. O número é este: verifica as cinco primeiras perguntas e mais nenhuma. Com duas falhas em cinco, para de verificar e volta à instrução. Um conjunto que falha duas vezes tão cedo falha quase sempre por uma razão só, e uma razão é quase sempre uma linha da instrução, por isso apertá-la e gerar outra vez custa dois minutos. Verificar as quinze custa vinte e deixa o mesmo defeito no lote seguinte.

Uma pergunta que falha vai para o lixo, não para reparação. Reescrever um enunciado cuja frase citada não resolve a resposta significa decidires tu a resposta, e nesse momento quem escreve a pergunta és tu e o modelo desperdiçou-te a noite. Abaixo de uma falha em cada cinco, deita essa fora e responde às restantes.

A pergunta que foi para o lixo ainda rende alguma coisa. Abriste o slide para a conferir, o que quer dizer que leste a linha em que a pergunta foi construída, nas palavras da fonte. Escreve essa linha onde guardas os teus erros. Uma pergunta que falhou uma verificação e uma pergunta que respondeste mal acabam no mesmo sítio, que é o começo do dia seguinte.

A versão para enfermagem, e o que um slide de aula não te dá

Os estudantes de enfermagem chegam aqui normalmente com um trabalho mais estreito: tirar perguntas ao estilo do NCLEX de um documento das aulas. A situação é a peça que falta. O teu slide de fisiopatologia dá-te um mecanismo, enquanto uma pergunta ao estilo do NCLEX precisa de um doente, de um contexto, de alguns achados e de um enunciado a pedir uma prioridade ou uma ação, com quatro opções todas defensáveis e uma que é a melhor. Nada disso está no slide, por isso é a instrução que o tem de lá pôr.

Acrescenta uma linha: escreve cada pergunta como um cenário curto com um doente em ambiente hospitalar, a terminar com a ação que o enfermeiro deve tomar primeiro, e faz com que as quatro opções sejam todas ações de enfermagem seguras. Para estas, acrescenta uma quarta verificação: o enunciado traz informação suficiente para escolher entre as quatro? Quando qualquer uma delas pode razoavelmente ser a primeira, a pergunta não é difícil, é impossível de responder, e ensina-te a adivinhar.

Fora de alcance a partir de um documento das aulas, por completo: os formatos Next Generation. As perguntas de caso clínico, matriz, laço, destaque e lista pendente são construídas à volta de dados de doentes que se vão revelando, com regras de pontuação próprias, e nada gerado a partir de uma apresentação de aula as produz. Quem te vender isso a partir de um PDF está a prometer demais. A página do NCLEX-RN aqui diz o mesmo. Isto não é um banco de perguntas do NCLEX e não tem ligação à NCSBN; as perguntas são escritas nesse estilo a partir do ficheiro que carregas.

Fazer isto em quantidade sem te afogares em quase repetições

Pede 60 perguntas a partir de um documento de 12 páginas e recebes os mesmos 12 factos em 60 disfarces. Nada numa janela de conversa o impede: à pergunta 47 o modelo já perdeu a pergunta 14, e reparar numa paráfrase de uma coisa a que respondeste há vinte minutos é difícil.

Três hábitos mantêm uma corrida longa honesta. Gera um capítulo de cada vez em vez de um módulo inteiro, porque as repetições agrupam-se dentro de uma fonte. Muda o tipo de pergunta numa segunda passagem, para que a melhor resposta única passe a vinheta clínica e o mesmo facto seja testado como raciocínio. Passa os olhos pelos enunciados antes de responderes a qualquer um, já que uma repetição apanhada cedo não custa nada e uma apanhada na pergunta 30 custa-te a sessão.

As máquinas são melhores nesta parte do que tu. Um gerador que compara cada pergunta nova com tudo o que já foi escrito a partir do mesmo documento deita fora uma quase repetição antes de a chegares a ver, e é isso que são as rejeições por repetição contadas acima: perguntas que nunca chegaram a um leitor.

Um exemplo trabalhado a partir de uma apresentação de 40 slides

Terça à noite, uma aula de cardiologia de 40 slides, numa sentada. Abaixo estão os tempos que aquilo leva, não os que um plano gostaria.

  1. Primeiros dez minutos. Três perguntas à mão, a partir de slides em que te lembras de o professor ter abrandado.
  2. Dois minutos. Cola a instrução acima do texto da apresentação e pede 15 perguntas, não 50. Quinze é mais ou menos o que 40 slides aguentam depois de saírem as repetidas.
  3. Mais dois. Corre as verificações nas cinco primeiras perguntas. Conta que uma ou duas falhem. Com duas falhas, corrige a instrução e gera outra vez, o que custa dois minutos e poupa vinte.
  4. Vinte e três minutos. Responde às 15 a frio, cerca de 90 segundos cada, com as opções tapadas até te teres decidido.
  5. Treze minutos. Por cada erro, abre o slide que a pergunta cita e lê a linha de onde ela veio. Copia-a nas palavras da fonte, não no teu resumo dela.
  6. Amanhã. Esses erros abrem a sessão seguinte, antes de qualquer coisa nova. Onde voltam nas semanas seguintes é o assunto do plano de repetição espaçada.

Cinquenta minutos, 15 perguntas que consegues defender, e uma lista escrita à mão dos factos que te venceram.

Perguntas que as pessoas fazem

Que instrução faz o ChatGPT escrever boas perguntas de exame a partir dos meus apontamentos?

Quatro cláusulas trazem quase todo o valor. Diz-lhe para usar apenas o texto que colaste, dá nome ao formato como melhor resposta única com cinco opções e uma resposta correta, exige a frase literal e o número de página que tornam a resposta correta, e proíbe os enunciados do tipo todas as anteriores e qual das seguintes é verdadeira. Acrescentar que a frase citada tem de resolver a resposta sozinha tira quase tudo o que resta.

Qual é o rigor das perguntas de treino geradas por IA?

Os estudos publicados não dão um número só. Uma revisão sistemática de 71 estudos no Postgraduate Medical Journal, publicada a 20 de maio de 2026, encontrou taxas de erro entre menos de 1 por cento e 45 por cento, e a Boston University comunicou em dezembro de 2023 que o ChatGPT produziu uma pergunta correta com resposta e explicação corretas em 32 por cento dos casos. O que decide o teu próprio conjunto é se alguma coisa o verificou. Este site publica o que as suas verificações deitam fora: lido a 20 de setembro de 2026, 43,1 por cento das 3.564 perguntas geradas sobreviveram a todas as verificações, com a verificação de repetições a responder por 13,5 por cento do resto. Essas percentagens mexem-se com a janela, por isso a página das taxas de rejeição leva o número em direto.

Quantas perguntas de treino devo fazer a partir de uma aula?

A contar linhas aproveitáveis, uma apresentação de 40 slides fica perto de uma por slide, já que é esse o número de linhas capazes de decidir uma resposta sozinhas. A contar perguntas que guardarias depois de verificar, fica mais perto de 15 a 20, porque nem toda a linha aproveitável sobrevive. Pedir 50 não cria mais factos, repete os mesmos por outras palavras e a verificação de repetições remove-os. Gera uma aula de cada vez e para quando as perguntas novas deixarem de te surpreender.

Quando devo parar de verificar um conjunto gerado e começar de novo?

Verifica as cinco primeiras perguntas e fica por aí. Com duas falhas em cinco, volta à instrução em vez de reparares o conjunto, porque um conjunto que falha duas vezes tão cedo falha quase sempre por uma razão só, e uma razão é quase sempre uma linha da instrução. Gerar outra vez custa dois minutos; reparar quinze perguntas uma a uma custa a noite toda.

A IA consegue escrever perguntas ao estilo do NCLEX a partir dos meus apontamentos das aulas?

Consegue escrever perguntas com cenários nesse estilo se lhe disseres para construir uma situação com um doente e um enunciado que peça uma prioridade ou uma ação, com quatro opções seguras, já que um slide de aula dá a fisiopatologia mas nunca o contexto. Os formatos Next Generation, ou seja caso clínico, matriz, laço, destaque e lista pendente, não podem ser produzidos a partir de um documento. Isto não é um banco de perguntas do NCLEX e não tem ligação à NCSBN.

Publicado .