Elutasítási arányok modellcsaládonként
Az ezen az oldalon megírt minden kérdés ugyanazokon az ellenőrzéseken megy át, bármelyik modell írta is. Ennyit veszítenek belőlük az egyes modellcsaládok az elmúlt 30 napban, azzal a darabszámmal együtt, amelyből az arányokat számoljuk.
Ezeket az arányokat a hívásnaplóból számoljuk, amelyet 2026. szeptember 14-e óta vezetünk. Az oldalon máshol kiírt futó összesítések minden kérdést számolnak azóta, hogy az oldal 2026. szeptember 11-én elindult, így a két számsor különböző időszakot fed le, és nem is kell összeadódniuk.
Számolva és között: 2 459 generálási hívás, amely 6 183 kérdést adott vissza. Egy modellcsalád akkor jelenik meg, ha az időszakban 200 kérdést adott vissza; ez alatt az oldal ezt írja ki, ahelyett hogy maroknyi hívásból számolt arányt közölne.
| Modellcsalád | Megírt kérdések | Az idézet nincs a megadott oldalon | A második modell nem értett egyet | Ismétlés | Hiba | Nem kérték, vagy túl későn jött | Elfogadva |
|---|---|---|---|---|---|---|---|
| qwen | 4,583 | 6.2% | 6.1% | 14.0% | 28.9% | 2.1% | 42.7% |
| deepseek | 503 | 14.3% | 3.0% | 2.4% | 11.5% | 2.0% | 66.8% |
| glm | 410 | 2.0% | 7.3% | 5.6% | 51.5% | 2.2% | 31.5% |
| nemotron | 393 | 3.1% | 0.5% | 2.5% | 53.9% | 1.3% | 38.7% |
| gpt-oss | 281 | 7.8% | 1.4% | 1.8% | 38.4% | 1.8% | 48.8% |
| openrouter-primary | 13 | kevés adat | kevés adat | kevés adat | kevés adat | kevés adat | kevés adat |
| gemma | 0 | kevés adat | kevés adat | kevés adat | kevés adat | kevés adat | kevés adat |
Sávonként
Az ingyenes sáv először a DeepSeek V4 Flasht futtatja a Cloudflare Workers AI-on, és más nyílt súlyú modellek állnak tartalékban. A fizetős sáv a kiemelt modelleket futtatja: a DeepSeek V4 Pro ír, a Kimi K2,6 vakon válaszol. Mindkét sáv ugyanazokon az ellenőrzéseken megy át, és mindkettőt itt számoljuk, ezért szól ez az oldal modellcsaládokról, nem sávokról.
| Sáv | Megírt kérdések | Az idézet nincs a megadott oldalon | A második modell nem értett egyet | Ismétlés | Hiba | Nem kérték, vagy túl későn jött | Elfogadva |
|---|---|---|---|---|---|---|---|
| ingyenes | 6,140 | 6.5% | 5.3% | 11.2% | 31.1% | 2.0% | 43.9% |
| fizetős | 43 | kevés adat | kevés adat | kevés adat | kevés adat | kevés adat | kevés adat |
Mit jelentenek az egyes oszlopok
- Megírt kérdések: azok a kérdések, amelyeket a modell értelmezhető válaszban adott vissza. Azokat a válaszokat, amelyeket nem lehetett JSON-ként beolvasni, külön számoljuk a CSV-ben, hívásonként, mert nem adtak vissza megszámolható kérdést.
- Az idézet nem található a hivatkozott oldalon: a szó szerinti idézet nem volt benne a modell által megnevezett oldal tárolt szövegében, vagy a modell a kapott szakaszon kívüli oldalra hivatkozott. A CSV ezt a kettőt szétbontja.
- A második modell nem értett egyet: egy másik családból való modell, amely látta a kérdést és az idézeteit, de a megoldókulcsot soha, más választ jelölt meg.
- Duplikátum: a kérdés megismételt egy ugyanabból a dokumentumból már elfogadott kérdést.
- Hiba: egy szerkezeti vagy minőségi szabály utasította el, például olyan válaszkészlet, amely elárulja a megoldást, vagy olyan kérdésfelvezetés, amelyhez nincs egyetlen legjobb válasz. Ezek azok a szabályok, amelyeket az MCQ-hibaellenőrző futtat a böngésződben.
- Nem volt rá igény vagy elkésett: a kérdés rendben volt, de mégsem jutott el egy hallgatóhoz. Vagy olyan típus volt, amelyet a feladat nem kért (egy rövid válaszos elem egy feleletválasztós feladatban), vagy a feladat megtelt más hívásokból, miközben ez íródott. Mindkettőt számoljuk, hogy a sor összege kijöjjön; egyik sem a modell hibája.
- Elfogadva: ami mindezt túlélte és eljutott egy hallgatóhoz.
Módszer
Minden itteni szám ezen az oldalon futó éles feladatokból származik. Szolgáltatói hívásonként egy sor íródik, abban a pillanatban, amikor a hívás kimenetele ismertté válik, és csak darabszámokat tartalmaz: nincs benne kérdésszöveg, dokumentumszöveg és felhasználó. A darabszámokat ahhoz a modellhez rendeljük, amely ténylegesen válaszolt, ami nem mindig az a modell, amelyet a feladat kért, mert a készlet átvált egy másik modellre, ha az egyik sebességkorlátba ütközik vagy lassú. Ha egy átváltást ahhoz a modellhez rendelnénk, amely nem futott, akkor rossz modellről tennénk közzé egy számot.
Az ablak az elmúlt 30 nap, óránként legfeljebb kétszer újraszámolva, és három rögzített ablak egyike. Az arányok annak a kérdésmennyiségnek a hányadai, amelyet egy család visszaadott, és minden visszaadott kérdés pontosan az egyik oszlopba kerül, így az elfogadott hányaddal együtt kiadják az egészet. Az a hívás, amely egy már befejezett feladathoz ért vissza, egyáltalán nem ír sort: a kérdéseit senki nem nézte meg, és az a modell, amely későn válaszolt, nem az a modell, amely rosszul válaszolt. Az a család, amely 200 visszaadott kérdés alatt marad, nincs elég adat jelzést kap, mert ekkora mintánál egyetlen rossz szakasz több százalékponttal elmozdítja az arányt.
Töltsd le ugyanezeket a számokat CSV-ben, vagy olvasd őket JSON formában. A számokat a Creative Commons Attribution 4,0 licenc alatt tesszük közzé: használd őket, idézd őket, és nevezd meg forrásként a MedUni Examet.
Frissítve: 2026. szeptember 24.
A kipróbáláshoz nem kell fiók. A regisztráció megőrzi a könyvtáradat, a jegyeidet és az ismétlési sorodat minden eszközön.
Közzétéve , frissítve