Wskaźniki odrzuceń według rodziny modeli
Każde pytanie napisane dla tej strony przechodzi przez te same kontrole, niezależnie od tego, który model je napisał. Tyle z nich traci każda rodzina modeli w ciągu ostatnich 30 dni, wraz z liczbą, od której liczone są wskaźniki.
Te wskaźniki są liczone z dziennika wywołań, prowadzonego od 14 września 2026. Sumy bieżące drukowane w innych miejscach strony liczą każde pytanie od otwarcia strony 11 września 2026, więc oba zestawy liczb obejmują różne okresy i nie mają się do siebie sumować.
Policzone od do : 2 459 wywołań generowania, które zwróciły 6 183 pytań. Rodzina modeli jest publikowana, gdy zwróci w tym okresie 200 pytań; poniżej tego progu strona to mówi, zamiast podawać wskaźnik z garstki wywołań.
| Rodzina modeli | Napisane pytania | Cytatu nie ma na wskazanej stronie | Drugi model się nie zgodził | Duplikat | Wada | Niezamówione albo za późno | Przyjęte |
|---|---|---|---|---|---|---|---|
| qwen | 4,583 | 6.2% | 6.1% | 14.0% | 28.9% | 2.1% | 42.7% |
| deepseek | 503 | 14.3% | 3.0% | 2.4% | 11.5% | 2.0% | 66.8% |
| glm | 410 | 2.0% | 7.3% | 5.6% | 51.5% | 2.2% | 31.5% |
| nemotron | 393 | 3.1% | 0.5% | 2.5% | 53.9% | 1.3% | 38.7% |
| gpt-oss | 281 | 7.8% | 1.4% | 1.8% | 38.4% | 1.8% | 48.8% |
| openrouter-primary | 13 | za mało danych | za mało danych | za mało danych | za mało danych | za mało danych | za mało danych |
| gemma | 0 | za mało danych | za mało danych | za mało danych | za mało danych | za mało danych | za mało danych |
Według toru
Darmowy tor najpierw uruchamia DeepSeek V4 Flash w Cloudflare Workers AI, a inne modele o otwartych wagach służą jako zapasowe. Płatny tor używa modeli priorytetowych: DeepSeek V4 Pro pisze, a Kimi K2,6 odpowiada w ciemno. Oba tory przechodzą te same sprawdzenia i oba są tu liczone, dlatego ta strona mówi o rodzinach modeli, a nie o torach.
| Tor | Napisane pytania | Cytatu nie ma na wskazanej stronie | Drugi model się nie zgodził | Duplikat | Wada | Niezamówione albo za późno | Przyjęte |
|---|---|---|---|---|---|---|---|
| darmowy | 6,140 | 6.5% | 5.3% | 11.2% | 31.1% | 2.0% | 43.9% |
| płatny | 43 | za mało danych | za mało danych | za mało danych | za mało danych | za mało danych | za mało danych |
Co znaczy każda kolumna
- Napisane pytania: pytania, które model zwrócił w odpowiedzi dającej się przetworzyć. Odpowiedzi, których nie dało się odczytać jako JSON, są liczone osobno w CSV, na każde wywołanie, bo nie zwróciły żadnych pytań do policzenia.
- Cytatu nie ma na wskazanej stronie: dosłownego cytatu nie było w zapisanym tekście strony, którą model wskazał, albo model przywołał stronę spoza fragmentu, który dostał. CSV rozdziela te dwa przypadki.
- Drugi model się nie zgodził: model z innej rodziny, któremu pokazano pytanie i jego cytaty, ale nigdy klucza odpowiedzi, wybrał inną odpowiedź.
- Duplikat: pytanie powtarzało inne, już przyjęte z tego samego dokumentu.
- Wada: odrzuciła je reguła strukturalna albo jakościowa, na przykład zestaw opcji z podpowiedzią albo polecenie bez jednej najlepszej odpowiedzi. Te reguły są tymi, które sprawdzarka wad pytań MCQ uruchamia w Twojej przeglądarce.
- Niezamówione albo za późne: pytanie było poprawne, ale i tak nigdy nie trafiło do studenta. Albo było typem, o który zadanie nie prosiło (pytanie otwarte w zadaniu z pytaniami wielokrotnego wyboru), albo zadanie zapełniło się z innych wywołań, gdy to pytanie było jeszcze pisane. Oba są liczone, żeby wiersz się sumował; żadne nie jest zarzutem wobec modelu.
- Przyjęte: to, co przeszło przez wszystko i trafiło do studenta.
Metoda
Każda liczba tutaj pochodzi z produkcyjnych zadań na tej stronie. Jeden wiersz jest zapisywany na każde wywołanie dostawcy, w chwili gdy znany jest wynik wywołania, i zawiera liczniki i nic więcej: żadnej treści pytania, żadnej treści dokumentu i żadnego użytkownika. Liczniki są przypisywane do modelu, który faktycznie odpowiedział, a nie zawsze jest to model, o który prosiło zadanie, bo pula sięga po inny model, gdy jeden jest ograniczany limitem albo powolny. Przypisanie odpowiedzi zastępczej do modelu, który nie zadziałał, oznaczałoby opublikowanie liczby o niewłaściwym modelu.
Okno to ostatnie 30 dni, przeliczane najwyżej dwa razy na godzinę, i jest jednym z trzech stałych okien. Wskaźniki to udziały w pytaniach, które zwróciła dana rodzina, a każde pytanie zwrócone przez wywołanie jest w dokładnie jednej z tych kolumn, więc razem z udziałem przyjętych sumują się do całości. Wywołanie, które wróciło do zadania już zakończonego, nie zapisuje żadnego wiersza: na jego pytania nikt nie patrzył, a model, który odpowiedział późno, to nie model, który odpowiedział źle. Rodzina poniżej 200 zwróconych pytań jest oznaczona jako za mało danych, bo przy takiej wielkości jeden zły fragment przesuwa wskaźnik o kilka punktów.
Pobierz te same liczby jako CSV albo przeczytaj je jako JSON. Liczby są publikowane na licencji Creative Commons Attribution 4,0: korzystaj z nich, cytuj je i podawaj MedUni Exam jako źródło.
Zaktualizowano 24 września 2026.
Wygeneruj z własnego rozdziału
Żeby spróbować, konto nie jest potrzebne. Rejestracja zachowuje bibliotekę, oceny i kolejkę powtórek na wszystkich urządzeniach.
Opublikowano , zaktualizowano .