Taxas de rejeição por família de modelos
Todas as perguntas escritas para este site passam pelas mesmas verificações, seja qual for o modelo que as escreveu. Isto é quantas delas cada família de modelos perde, nos últimos 30 dias, com o número a partir do qual as taxas são calculadas.
Estas taxas são contadas a partir do registo de chamadas, guardado desde 14 de setembro de 2026. Os totais acumulados impressos noutras partes do site contam todas as perguntas desde que o site abriu, a 11 de setembro de 2026, por isso os dois conjuntos de números cobrem períodos diferentes e não se destinam a somar entre si.
Contado de a : 2.459 chamadas de geração que devolveram 6.183 perguntas. Uma família é publicada quando devolve 200 perguntas no período; abaixo disso, a página di-lo em vez de mostrar uma taxa tirada de meia dúzia de chamadas.
| Família de modelos | Perguntas escritas | Citação não encontrada na página indicada | O segundo modelo discordou | Duplicada | Defeito | Não pedida ou tarde demais | Aceites |
|---|---|---|---|---|---|---|---|
| qwen | 4,583 | 6.2% | 6.1% | 14.0% | 28.9% | 2.1% | 42.7% |
| deepseek | 503 | 14.3% | 3.0% | 2.4% | 11.5% | 2.0% | 66.8% |
| glm | 410 | 2.0% | 7.3% | 5.6% | 51.5% | 2.2% | 31.5% |
| nemotron | 393 | 3.1% | 0.5% | 2.5% | 53.9% | 1.3% | 38.7% |
| gpt-oss | 281 | 7.8% | 1.4% | 1.8% | 38.4% | 1.8% | 48.8% |
| openrouter-primary | 13 | dados insuficientes | dados insuficientes | dados insuficientes | dados insuficientes | dados insuficientes | dados insuficientes |
| gemma | 0 | dados insuficientes | dados insuficientes | dados insuficientes | dados insuficientes | dados insuficientes | dados insuficientes |
Por via
A via gratuita corre primeiro o DeepSeek V4 Flash no Cloudflare Workers AI, com outros modelos de pesos abertos como alternativa. A via paga corre os modelos prioritários: o DeepSeek V4 Pro escreve e o Kimi K2,6 responde às cegas. As duas vias passam pelas mesmas verificações e ambas são contadas aqui, e é por isso que esta página fala de famílias de modelos e não de vias.
| Via | Perguntas escritas | Citação não encontrada na página indicada | O segundo modelo discordou | Duplicada | Defeito | Não pedida ou tarde demais | Aceites |
|---|---|---|---|---|---|---|---|
| gratuita | 6,140 | 6.5% | 5.3% | 11.2% | 31.1% | 2.0% | 43.9% |
| paga | 43 | dados insuficientes | dados insuficientes | dados insuficientes | dados insuficientes | dados insuficientes | dados insuficientes |
O que significa cada coluna
- Perguntas escritas: perguntas que o modelo devolveu numa resposta legível. As respostas que não puderam ser lidas como JSON são contadas à parte no CSV, por chamada, porque não devolveram perguntas para contar.
- Citação não encontrada na página citada: a citação literal não estava no texto guardado da página indicada pelo modelo, ou o modelo citou uma página fora da secção que lhe foi dada. O CSV separa esses dois casos.
- Segundo modelo discordou: um modelo de outra família, a quem foram mostradas a pergunta e as suas citações mas nunca a chave de resposta, escolheu uma resposta diferente.
- Duplicada: a pergunta repetia outra já aceite do mesmo documento.
- Falha: uma regra estrutural ou de qualidade rejeitou-a, por exemplo um conjunto de opções com uma pista ou um enunciado sem uma única melhor resposta. Essas regras são as que o verificador de falhas de perguntas de escolha múltipla corre no teu navegador.
- Não pedida ou tardia: a pergunta estava correta mas mesmo assim nunca chegou a um estudante. Ou era de um tipo que o trabalho não pediu (uma pergunta de resposta curta num trabalho de escolha múltipla), ou o trabalho ficou completo com outras chamadas enquanto esta estava a ser escrita. As duas são contadas para que a linha bata certo; nenhuma delas é uma falha do modelo.
- Aceites: o que sobreviveu a tudo isto e chegou a um estudante.
Método
Todos os números aqui vêm de trabalhos em produção neste site. É escrita uma linha por cada chamada a um fornecedor, no momento em que o resultado da chamada é conhecido, com contagens e mais nada: sem texto de perguntas, sem texto de documentos e sem utilizador. As contagens são atribuídas ao modelo que respondeu de facto, que nem sempre é o modelo que o trabalho pediu, porque o conjunto recorre a outro modelo quando um atinge o limite de pedidos ou está lento. Atribuir uma substituição ao modelo que não correu publicaria um número sobre o modelo errado.
A janela são os últimos 30 dias, recontados no máximo duas vezes por hora, e é uma de três janelas fixas. As taxas são proporções das perguntas que uma família devolveu, e todas as perguntas que uma chamada devolveu estão exatamente numa destas colunas, por isso somam, com a proporção aceite, o total. Uma chamada que chegou a um trabalho já terminado não escreve linha nenhuma: as suas perguntas nunca foram vistas, e um modelo que respondeu tarde não é um modelo que respondeu mal. Uma família com menos de 200 perguntas devolvidas é indicada como dados insuficientes, porque a esse tamanho uma secção má move uma taxa em vários pontos.
Transfere os mesmos números em CSV, ou lê-os em JSON. Os números são publicados sob a licença Creative Commons Attribution 4,0: usa-os, cita-os e indica o MedUni Exam como fonte.
Atualizado a 24 de setembro de 2026.
Gera a partir do teu próprio capítulo
Não é preciso conta para experimentar. Com registo, a tua biblioteca, as notas e a fila de revisão ficam guardadas em todos os dispositivos.
Publicado , atualizado .