MedUni Exam

Wskaźniki odrzuceń według rodziny modeli

Każde pytanie napisane dla tej strony przechodzi przez te same kontrole, niezależnie od tego, który model je napisał. Tyle z nich traci każda rodzina modeli w ciągu ostatnich 30 dni, wraz z liczbą, od której liczone są wskaźniki.

Te wskaźniki są liczone z dziennika wywołań, prowadzonego od 14 września 2026. Sumy bieżące drukowane w innych miejscach strony liczą każde pytanie od otwarcia strony 11 września 2026, więc oba zestawy liczb obejmują różne okresy i nie mają się do siebie sumować.

Policzone od do : 2 459 wywołań generowania, które zwróciły 6 183 pytań. Rodzina modeli jest publikowana, gdy zwróci w tym okresie 200 pytań; poniżej tego progu strona to mówi, zamiast podawać wskaźnik z garstki wywołań.

Rodzina modeliNapisane pytaniaCytatu nie ma na wskazanej stronieDrugi model się nie zgodziłDuplikatWadaNiezamówione albo za późnoPrzyjęte
qwen4,5836.2%6.1%14.0%28.9%2.1%42.7%
deepseek50314.3%3.0%2.4%11.5%2.0%66.8%
glm4102.0%7.3%5.6%51.5%2.2%31.5%
nemotron3933.1%0.5%2.5%53.9%1.3%38.7%
gpt-oss2817.8%1.4%1.8%38.4%1.8%48.8%
openrouter-primary13za mało danychza mało danychza mało danychza mało danychza mało danychza mało danych
gemma0za mało danychza mało danychza mało danychza mało danychza mało danychza mało danych

Według toru

Darmowy tor najpierw uruchamia DeepSeek V4 Flash w Cloudflare Workers AI, a inne modele o otwartych wagach służą jako zapasowe. Płatny tor używa modeli priorytetowych: DeepSeek V4 Pro pisze, a Kimi K2,6 odpowiada w ciemno. Oba tory przechodzą te same sprawdzenia i oba są tu liczone, dlatego ta strona mówi o rodzinach modeli, a nie o torach.

TorNapisane pytaniaCytatu nie ma na wskazanej stronieDrugi model się nie zgodziłDuplikatWadaNiezamówione albo za późnoPrzyjęte
darmowy6,1406.5%5.3%11.2%31.1%2.0%43.9%
płatny43za mało danychza mało danychza mało danychza mało danychza mało danychza mało danych

Co znaczy każda kolumna

  • Napisane pytania: pytania, które model zwrócił w odpowiedzi dającej się przetworzyć. Odpowiedzi, których nie dało się odczytać jako JSON, są liczone osobno w CSV, na każde wywołanie, bo nie zwróciły żadnych pytań do policzenia.
  • Cytatu nie ma na wskazanej stronie: dosłownego cytatu nie było w zapisanym tekście strony, którą model wskazał, albo model przywołał stronę spoza fragmentu, który dostał. CSV rozdziela te dwa przypadki.
  • Drugi model się nie zgodził: model z innej rodziny, któremu pokazano pytanie i jego cytaty, ale nigdy klucza odpowiedzi, wybrał inną odpowiedź.
  • Duplikat: pytanie powtarzało inne, już przyjęte z tego samego dokumentu.
  • Wada: odrzuciła je reguła strukturalna albo jakościowa, na przykład zestaw opcji z podpowiedzią albo polecenie bez jednej najlepszej odpowiedzi. Te reguły są tymi, które sprawdzarka wad pytań MCQ uruchamia w Twojej przeglądarce.
  • Niezamówione albo za późne: pytanie było poprawne, ale i tak nigdy nie trafiło do studenta. Albo było typem, o który zadanie nie prosiło (pytanie otwarte w zadaniu z pytaniami wielokrotnego wyboru), albo zadanie zapełniło się z innych wywołań, gdy to pytanie było jeszcze pisane. Oba są liczone, żeby wiersz się sumował; żadne nie jest zarzutem wobec modelu.
  • Przyjęte: to, co przeszło przez wszystko i trafiło do studenta.

Metoda

Każda liczba tutaj pochodzi z produkcyjnych zadań na tej stronie. Jeden wiersz jest zapisywany na każde wywołanie dostawcy, w chwili gdy znany jest wynik wywołania, i zawiera liczniki i nic więcej: żadnej treści pytania, żadnej treści dokumentu i żadnego użytkownika. Liczniki są przypisywane do modelu, który faktycznie odpowiedział, a nie zawsze jest to model, o który prosiło zadanie, bo pula sięga po inny model, gdy jeden jest ograniczany limitem albo powolny. Przypisanie odpowiedzi zastępczej do modelu, który nie zadziałał, oznaczałoby opublikowanie liczby o niewłaściwym modelu.

Okno to ostatnie 30 dni, przeliczane najwyżej dwa razy na godzinę, i jest jednym z trzech stałych okien. Wskaźniki to udziały w pytaniach, które zwróciła dana rodzina, a każde pytanie zwrócone przez wywołanie jest w dokładnie jednej z tych kolumn, więc razem z udziałem przyjętych sumują się do całości. Wywołanie, które wróciło do zadania już zakończonego, nie zapisuje żadnego wiersza: na jego pytania nikt nie patrzył, a model, który odpowiedział późno, to nie model, który odpowiedział źle. Rodzina poniżej 200 zwróconych pytań jest oznaczona jako za mało danych, bo przy takiej wielkości jeden zły fragment przesuwa wskaźnik o kilka punktów.

Pobierz te same liczby jako CSV albo przeczytaj je jako JSON. Liczby są publikowane na licencji Creative Commons Attribution 4,0: korzystaj z nich, cytuj je i podawaj MedUni Exam jako źródło.

Zaktualizowano 24 września 2026.

Wygeneruj z własnego rozdziału

Zobacz cennik

Żeby spróbować, konto nie jest potrzebne. Rejestracja zachowuje bibliotekę, oceny i kolejkę powtórek na wszystkich urządzeniach.

Opublikowano , zaktualizowano .