Naar de hoofdinhoud

Het bewijs

Evaluatielogs

Wij publiceren de ruwe meetlogs achter onze cijfers op het scorebord, zodat je ze zelf kunt nalopen.

Model
Walnoot 8B Instruct 1.0
Evaluatieframework
EuroEval 17.6.0
Meetregime
test-split, 10 iteraties, bf16, nul mislukte instances

Vindplaats

Waar staan de logs?

Ze staan op GitHub, in de map evaluatie. Daarin staat de ruwe uitvoer van EuroEval 17.6.0 voor alle 10 taken. Je vindt er meer dan in de tabel op het scorebord, zoals de 29,13 die het model op conll-nl haalt inclusief MISC.

Recept en logs op GitHub

Welke taken zitten erin?

  1. dbrdSentimentMCCdirect vergelijkbaar
  2. squad-nlBegrijpend lezenEMdirect vergelijkbaar
  3. conll-nlEntiteitsherkenningmicro-F1 (no-MISC)direct vergelijkbaar
  4. scala-nlTaalkundige correctheidMCCdirect vergelijkbaar
  5. mmlu-nlKennisMCCdirect vergelijkbaar
  6. hellaswag-nlAlledaags redenerenMCCdirect vergelijkbaar
  7. wikilingua-nlSamenvattenChrF3++metriekwissel
  8. duidelijke-taalBegrijpelijke taalMETEORgeen publicatie
  9. valeu-nlEuropese waardenEuropeanValuesgeen publicatie
  10. mbbq-nlStereotyperingbias-gecorrigeerde accuratessegeen publicatie

Bijgewerkt: 17 september 2026

Openheid

Mag je de logs gebruiken?

  • Evaluatielogs: Apache 2.0, publiek, ruwe jsonl
  • Evaluatieconfiguratie: Apache 2.0, publiek, gepind op 17.6.0