Tasas de rechazo por familia de modelos
Cada pregunta escrita para este sitio pasa por las mismas comprobaciones, la haya escrito el modelo que la haya escrito. Esto es cuántas pierde cada familia de modelos, en los últimos 30 días, con el número sobre el que se calculan las tasas.
Estas tasas se cuentan a partir del registro de llamadas, que se guarda desde el 14 de septiembre de 2026. Los totales acumulados que se imprimen en otras partes del sitio cuentan todas las preguntas desde que el sitio abrió el 11 de septiembre de 2026, así que los dos conjuntos de números cubren periodos distintos y no están pensados para cuadrar entre sí.
Contado del al : 2.459 llamadas de generación que devolvieron 6.183 preguntas. Una familia se publica cuando ha devuelto 200 preguntas en el periodo; por debajo, la página lo dice en lugar de imprimir una tasa sacada de un puñado de llamadas.
| Familia de modelos | Preguntas escritas | Cita no encontrada en la página citada | El segundo modelo no coincidió | Duplicada | Defecto | No pedida o demasiado tarde | Aceptadas |
|---|---|---|---|---|---|---|---|
| qwen | 4,583 | 6.2% | 6.1% | 14.0% | 28.9% | 2.1% | 42.7% |
| deepseek | 503 | 14.3% | 3.0% | 2.4% | 11.5% | 2.0% | 66.8% |
| glm | 410 | 2.0% | 7.3% | 5.6% | 51.5% | 2.2% | 31.5% |
| nemotron | 393 | 3.1% | 0.5% | 2.5% | 53.9% | 1.3% | 38.7% |
| gpt-oss | 281 | 7.8% | 1.4% | 1.8% | 38.4% | 1.8% | 48.8% |
| openrouter-primary | 13 | datos insuficientes | datos insuficientes | datos insuficientes | datos insuficientes | datos insuficientes | datos insuficientes |
| gemma | 0 | datos insuficientes | datos insuficientes | datos insuficientes | datos insuficientes | datos insuficientes | datos insuficientes |
Por vía
La vía gratuita usa primero DeepSeek V4 Flash en Cloudflare Workers AI, con otros modelos de pesos abiertos como respaldo. La vía de pago usa los modelos prioritarios: DeepSeek V4 Pro redacta y Kimi K2,6 responde a ciegas. Las dos vías pasan las mismas comprobaciones y ambas se cuentan aquí, por eso esta página trata de familias de modelos y no de vías.
| Vía | Preguntas escritas | Cita no encontrada en la página citada | El segundo modelo no coincidió | Duplicada | Defecto | No pedida o demasiado tarde | Aceptadas |
|---|---|---|---|---|---|---|---|
| gratuita | 6,140 | 6.5% | 5.3% | 11.2% | 31.1% | 2.0% | 43.9% |
| de pago | 43 | datos insuficientes | datos insuficientes | datos insuficientes | datos insuficientes | datos insuficientes | datos insuficientes |
Qué significa cada columna
- Preguntas escritas: preguntas que el modelo devolvió en una respuesta que se pudo leer. Las respuestas que no se pudieron leer como JSON se cuentan aparte en el CSV, por llamada, porque no devolvieron ninguna pregunta que contar.
- Cita no encontrada en la página citada: la cita literal no estaba en el texto guardado de la página que nombró el modelo, o citó una página fuera de la sección que se le dio. El CSV separa esos dos casos.
- El segundo modelo no coincidió: un modelo de otra familia, al que se le enseñó la pregunta y sus citas pero nunca la clave de respuestas, eligió otra respuesta.
- Duplicada: la pregunta repetía una ya aceptada del mismo documento.
- Defecto: la rechazó una regla estructural o de calidad, como un juego de opciones con una pista regalada o un enunciado sin una única mejor respuesta. Esas reglas son las que ejecuta en tu navegador el verificador de defectos de preguntas tipo test.
- No pedida o demasiado tarde: la pregunta era válida pero aun así nunca llegó a un estudiante. O era de un tipo que el trabajo no había pedido (una pregunta de respuesta corta en un trabajo de opción múltiple), o el trabajo se llenó con otras llamadas mientras esta se estaba escribiendo. Las dos se cuentan para que la fila cuadre; ninguna es un punto en contra del modelo.
- Aceptadas: las que sobrevivieron a todo y llegaron a un estudiante.
Método
Todos los números de aquí vienen de trabajos de producción de este sitio. Se escribe una fila por llamada al proveedor, en el momento en que se conoce el resultado de la llamada, con recuentos y nada más: sin texto de preguntas, sin texto de documentos y sin usuario. Los recuentos se atribuyen al modelo que respondió de verdad, que no siempre es el modelo que pidió el trabajo, porque el conjunto recurre a otro modelo cuando uno está limitado o lento. Atribuir un modelo de reserva al modelo que no llegó a ejecutarse publicaría un número sobre el modelo equivocado.
La ventana son los últimos 30 días, se recuenta como mucho dos veces por hora, y es una de tres ventanas fijas. Las tasas son proporciones de las preguntas que devolvió una familia, y cada pregunta que devolvió una llamada está exactamente en una de estas columnas, así que suman con la proporción de aceptadas hasta el total. Una llamada que volvió a un trabajo que ya había terminado no escribe ninguna fila: sus preguntas nunca se miraron, y un modelo que respondió tarde no es un modelo que respondió mal. Una familia por debajo de 200 preguntas devueltas aparece como datos insuficientes, porque con ese tamaño una mala sección mueve una tasa varios puntos.
Descarga los mismos números en CSV, o léelos en JSON. Los números se publican bajo la licencia Creative Commons Attribution 4,0: úsalos, cítalos y nombra a MedUni Exam como fuente.
Actualizado el 24 de septiembre de 2026.
Genera a partir de tu propio capítulo
No hace falta cuenta para probarlo. Registrarte guarda tu biblioteca, tus notas y tu cola de repaso en todos tus dispositivos.
Publicado , actualizado .