Naar de hoofdinhoud

Het bewijs

Reproduceren

Elke score zelf narekenen, met een gepinde evaluatieversie.

Evaluatie
EuroEval 17.6.0
Model
Walnoot 8B Instruct 1.0
Cijfers bijgewerkt
17 september 2026
Een notenkraker die een walnoot langs de naad openbreekt, met een paar schilfers ernaast.

In drie stappen

Hoe je onze cijfers zelf narekent.

  1. Download de gewichten

    Model-id
    WAINUT/walnoot-8b-instruct
    Gewichtenhash
    sha256:db131554ffb1fb9e0885855008b8ad4078077d4168e4c931e1024c2f9c586494sha256 van model.safetensorsDit is de hash van het gewichtenbestand van dit checkpoint. Het bestand op Hugging Face is teruggelezen en heeft dezelfde hash, dus je download hoort precies deze som te geven.

    Gewichten op Hugging Face

  2. Draai het commando

    pip install "euroeval[all]==17.6.0" && euroeval --model WAINUT/walnoot-8b-instruct --language nl --num-iterations 10 --dataset dbrd --dataset scala-nl --dataset conll-nl --dataset squad-nl --dataset wiki-lingua-nl --dataset mmlu-nl --dataset hellaswag-nl --dataset duidelijke-taal --dataset valeu-nl --dataset mbbq-nl --evaluate-test-split
    Meetregime
    test-split, 10 iteraties, bf16, nul mislukte instances
  3. Leg je uitkomst naast de onze

    Onder elk cijfer staat het 95%-interval van onze meting.

    Walnoot 8B op de Nederlandse taken van EuroEval 17.6.0. De cijfers van GPT-NL staan ernaast op het scorebord.
    TaakMetriekWalnoot 8B
    dbrdMCCSentimentMCC90,5689,76 – 91,35
    squad-nlEMBegrijpend lezenEM62,0861,42 – 62,73
    conll-nlmicro-F1 (no-MISC)Entiteitsherkenningmicro-F1 (no-MISC)46,5244,49 – 48,55
    scala-nlMCCTaalkundige correctheidMCC34,4131,00 – 37,81
    mmlu-nlMCCKennisMCC37,1636,19 – 38,13
    hellaswag-nlMCCAlledaags redenerenMCC22,4620,73 – 24,19
    wikilingua-nlChrF3++SamenvattenChrF3++34,1832,74 – 35,62
    duidelijke-taalMETEORBegrijpelijke taalMETEOR52,9551,11 – 54,78
    valeu-nlEuropeanValuesEuropese waardenEuropeanValues2,021,41 – 2,64
    mbbq-nlbias-gecorrigeerde accuratesseStereotyperingbias-gecorrigeerde accuratesse27,7226,17 – 29,27

    De ruwe jsonl achter elke regel staat bij de evaluatielogs. De cijfers van GPT-NL staan ernaast op het scorebord.

Meetopzet

Hoe wij meten en vergelijken.

  • Hoe zijn deze cijfers gemeten?

    Wij maten onze kolom met EuroEval 17.6.0 op de test-split, in 10 iteraties en met bf16-gewichten. De GPT-NL-kolom is hun eigen publicatie van december 2025 op EuroEval 15.16.0, interim-scores van het basismodel, gepubliceerd als puntscores zonder interval bij de cijfers die wij overnemen. Er zit twee hoofdversies verschil in het evaluatieframework. Over versies heen is de datasetinhoud niet gegarandeerd identiek. Daarom vermelden we bij iedere vergelijking expliciet welke versie is gebruikt.

  • Wanneer telt een taak als gewonnen?

    Winst heet pas winst als ons hele betrouwbaarheidsinterval boven hun cijfer ligt. Verlies pas als het er volledig onder ligt. Valt hun cijfer binnen ons interval, dan staat er gelijkspel. Dat geldt ook op een taak waar wij op punten voorstaan.

  • Waarom kun je GPT-NL niet zelf narekenen?

    GPT-NL publiceert geen gewichten, dus niemand buiten het consortium kan dat model draaien. Wij hebben het daarom nooit zelf gemeten. Deze tabel zet ons gemeten cijfer naast hun gepubliceerde cijfer.

  • Is EuroEval geen cherry-picking?

    EuroEval is het framework dat GPT-NL zelf koos. De versie staat gepind op 17.6.0 en het commando is gepubliceerd. De volledige tabel staat online, inclusief de vier taken waar wij niets kunnen claimen. Op WikiLingua wisselde de metriek tussen beide metingen, dus die taak zetten wij nooit kop-aan-kop. Hem weglaten zou pas cherry-picking zijn.