MedUni Exam

Taux de rejet par famille de modèles

Chaque question écrite pour ce site passe par les mêmes contrôles, quel que soit le modèle qui l’a écrite. Voici combien chaque famille de modèles en perd, sur les 30 derniers jours, avec l’effectif sur lequel les taux sont calculés.

Ces taux sont calculés à partir du journal des appels, tenu depuis le 14 septembre 2026. Les totaux cumulés affichés ailleurs sur le site comptent chaque question depuis l’ouverture du site le 11 septembre 2026, donc les deux séries de chiffres couvrent des périodes différentes et ne sont pas censées coïncider.

Compté du au : 2 459 appels de génération qui ont renvoyé 6 183 questions. Une famille est publiée dès qu’elle a renvoyé 200 questions sur la période ; en dessous, la page le dit au lieu d’afficher un taux tiré d’une poignée d’appels.

Famille de modèlesQuestions écritesCitation absente de la page citéeLe second modèle n’était pas d’accordDoublonDéfautNon demandée ou trop tardAcceptées
qwen4,5836.2%6.1%14.0%28.9%2.1%42.7%
deepseek50314.3%3.0%2.4%11.5%2.0%66.8%
glm4102.0%7.3%5.6%51.5%2.2%31.5%
nemotron3933.1%0.5%2.5%53.9%1.3%38.7%
gpt-oss2817.8%1.4%1.8%38.4%1.8%48.8%
openrouter-primary13pas assez de donnéespas assez de donnéespas assez de donnéespas assez de donnéespas assez de donnéespas assez de données
gemma0pas assez de donnéespas assez de donnéespas assez de donnéespas assez de donnéespas assez de donnéespas assez de données

Par voie

La voie gratuite fait d’abord tourner DeepSeek V4 Flash sur Cloudflare Workers AI, avec d’autres modèles à poids ouverts en secours. La voie payante utilise les modèles prioritaires : DeepSeek V4 Pro rédige et Kimi K2,6 répond à l’aveugle. Les deux voies passent les mêmes vérifications et sont toutes deux comptées ici, c’est pourquoi cette page parle de familles de modèles plutôt que de voies.

VoieQuestions écritesCitation absente de la page citéeLe second modèle n’était pas d’accordDoublonDéfautNon demandée ou trop tardAcceptées
gratuite6,1406.5%5.3%11.2%31.1%2.0%43.9%
payante43pas assez de donnéespas assez de donnéespas assez de donnéespas assez de donnéespas assez de donnéespas assez de données

Ce que signifie chaque colonne

  • Questions écrites : les questions que le modèle a renvoyées dans une réponse analysable. Les réponses illisibles en JSON sont comptées séparément dans le CSV, par appel, car elles n’ont renvoyé aucune question à compter.
  • Citation introuvable sur la page citée : la citation textuelle n’était pas dans le texte stocké de la page nommée par le modèle, ou celui-ci a cité une page en dehors de la section qui lui était donnée. Le CSV sépare ces deux cas.
  • Le second modèle n’était pas d’accord : un modèle d’une autre famille, à qui la question et ses citations ont été montrées mais jamais le corrigé, a choisi une autre réponse.
  • Doublon : la question répétait une question déjà acceptée issue du même document.
  • Défaut : une règle de structure ou de qualité l’a rejetée, par exemple un jeu d’options qui trahit la réponse ou un énoncé sans réponse unique la meilleure. Ces règles sont celles que fait tourner le vérificateur de défauts de QCM dans votre navigateur.
  • Non demandée ou trop tardive : la question était correcte mais n’a de toute façon jamais atteint un étudiant. Soit c’était un type que la tâche ne demandait pas (une question à réponse courte dans une tâche à choix multiples), soit la tâche s’est remplie avec d’autres appels pendant que celle-ci était écrite. Les deux sont comptées pour que la ligne soit complète ; ni l’une ni l’autre n’est un reproche au modèle.
  • Acceptées : ce qui a survécu à tout cela et est parvenu à un étudiant.

Méthode

Tous les chiffres présentés ici viennent de tâches de production sur ce site. Une ligne est écrite par appel à un fournisseur, au moment où le résultat de l’appel est connu, et elle contient des compteurs et rien d’autre : aucun texte de question, aucun texte de document et aucun utilisateur. Les compteurs sont attribués au modèle qui a réellement répondu, qui n’est pas toujours celui que la tâche a demandé, car l’ensemble bascule sur un autre modèle quand l’un est limité en débit ou lent. Attribuer un basculement au modèle qui n’a pas tourné publierait un chiffre sur le mauvais modèle.

La fenêtre porte sur les 30 derniers jours, recomptée au plus deux fois par heure, et c’est l’une des trois fenêtres fixes. Les taux sont des parts des questions qu’une famille a renvoyées, et chaque question renvoyée par un appel se trouve dans exactement une de ces colonnes, donc elles totalisent le tout avec la part acceptée. Un appel revenu à une tâche déjà terminée n’écrit aucune ligne : ses questions n’ont jamais été examinées, et un modèle qui a répondu tard n’est pas un modèle qui a mal répondu. Une famille sous 200 questions renvoyées est indiquée comme données insuffisantes, car à cette taille une seule mauvaise section déplace un taux de plusieurs points.

Télécharger les mêmes chiffres en CSV, ou les lire en JSON. Les chiffres sont publiés sous licence Creative Commons Attribution 4,0 : utilisez-les, citez-les, et nommez MedUni Exam comme source.

Mis à jour le 24 septembre 2026.

Générer à partir de votre propre chapitre

Voir les tarifs

Aucun compte n’est nécessaire pour l’essayer. L’inscription conserve votre bibliothèque, vos notes et votre file de révision sur tous vos appareils.

Publié le , mis à jour le .