Het bewijs
Reproduceren
Elke score zelf narekenen, met een gepinde evaluatieversie.

In drie stappen
Hoe je onze cijfers zelf narekent.
Download de gewichten
- Model-id
- WAINUT/walnoot-8b-instruct
- Gewichtenhash
- sha256:db131554ffb1fb9e0885855008b8ad4078077d4168e4c931e1024c2f9c586494sha256 van model.safetensorsDit is de hash van het gewichtenbestand van dit checkpoint. Het bestand op Hugging Face is teruggelezen en heeft dezelfde hash, dus je download hoort precies deze som te geven.
Draai het commando
pip install "euroeval[all]==17.6.0" && euroeval --model WAINUT/walnoot-8b-instruct --language nl --num-iterations 10 --dataset dbrd --dataset scala-nl --dataset conll-nl --dataset squad-nl --dataset wiki-lingua-nl --dataset mmlu-nl --dataset hellaswag-nl --dataset duidelijke-taal --dataset valeu-nl --dataset mbbq-nl --evaluate-test-split- Meetregime
- test-split, 10 iteraties, bf16, nul mislukte instances
Leg je uitkomst naast de onze
Onder elk cijfer staat het 95%-interval van onze meting.
Walnoot 8B op de Nederlandse taken van EuroEval 17.6.0. De cijfers van GPT-NL staan ernaast op het scorebord. Taak Metriek Walnoot 8B dbrdMCCSentiment MCC 90,5689,76 – 91,35 squad-nlEMBegrijpend lezen EM 62,0861,42 – 62,73 conll-nlmicro-F1 (no-MISC)Entiteitsherkenning micro-F1 (no-MISC) 46,5244,49 – 48,55 scala-nlMCCTaalkundige correctheid MCC 34,4131,00 – 37,81 mmlu-nlMCCKennis MCC 37,1636,19 – 38,13 hellaswag-nlMCCAlledaags redeneren MCC 22,4620,73 – 24,19 wikilingua-nlChrF3++Samenvatten ChrF3++ 34,1832,74 – 35,62 duidelijke-taalMETEORBegrijpelijke taal METEOR 52,9551,11 – 54,78 valeu-nlEuropeanValuesEuropese waarden EuropeanValues 2,021,41 – 2,64 mbbq-nlbias-gecorrigeerde accuratesseStereotypering bias-gecorrigeerde accuratesse 27,7226,17 – 29,27 De ruwe jsonl achter elke regel staat bij de evaluatielogs. De cijfers van GPT-NL staan ernaast op het scorebord.
Meetopzet
Hoe wij meten en vergelijken.
Hoe zijn deze cijfers gemeten?
Wij maten onze kolom met EuroEval 17.6.0 op de test-split, in 10 iteraties en met bf16-gewichten. De GPT-NL-kolom is hun eigen publicatie van december 2025 op EuroEval 15.16.0, interim-scores van het basismodel, gepubliceerd als puntscores zonder interval bij de cijfers die wij overnemen. Er zit twee hoofdversies verschil in het evaluatieframework. Over versies heen is de datasetinhoud niet gegarandeerd identiek. Daarom vermelden we bij iedere vergelijking expliciet welke versie is gebruikt.
Wanneer telt een taak als gewonnen?
Winst heet pas winst als ons hele betrouwbaarheidsinterval boven hun cijfer ligt. Verlies pas als het er volledig onder ligt. Valt hun cijfer binnen ons interval, dan staat er gelijkspel. Dat geldt ook op een taak waar wij op punten voorstaan.
Waarom kun je GPT-NL niet zelf narekenen?
GPT-NL publiceert geen gewichten, dus niemand buiten het consortium kan dat model draaien. Wij hebben het daarom nooit zelf gemeten. Deze tabel zet ons gemeten cijfer naast hun gepubliceerde cijfer.
Is EuroEval geen cherry-picking?
EuroEval is het framework dat GPT-NL zelf koos. De versie staat gepind op 17.6.0 en het commando is gepubliceerd. De volledige tabel staat online, inclusief de vier taken waar wij niets kunnen claimen. Op WikiLingua wisselde de metriek tussen beide metingen, dus die taak zetten wij nooit kop-aan-kop. Hem weglaten zou pas cherry-picking zijn.