Naar de hoofdinhoud

Het model

Modelkaart

Het model telt 8,05 miljard parameters en staat onder Apache 2.0. Het bouwt voort op Apertus en is gemaakt voor afgebakende taken.

Model
Walnoot 8B Instruct 1.0
Basismodel
Apertus
Licentie
Apache 2.0

Identiteit

Wat is Walnoot 8B?

Walnoot 8B is een Nederlands taalmodel van WAINUT. Je downloadt het model en draait het in je eigen omgeving, ook voor toepassingen waarbij gegevens die eigen omgeving niet mogen verlaten. Alles wat we meten en publiceren, kun je zelf controleren.

Zo draai je Walnoot zelf

Een walnotenschaal van heel dichtbij, met de nerven schuin van opzij aangelicht.

Specificatie

Welk model is dit?

Uitgever
WAINUT
Model
Walnoot 8B Instruct
Versie
1.0
Omvang
8,05 miljard parameters
Basismodel
Apertus, Swiss AI Initiative (ETH Zürich en EPFL)
Licentie
Apache 2.0
Taal
Nederlands
Evaluatie
EuroEval 17.6.0

Recept

Hoe is Walnoot 8B gebouwd?

  1. Europese basis

    Apertus-8B-2509 van de Swiss AI Initiative, uitgegeven onder Apache 2.0.

    Wat WAINUT toevoegde

    Niets. Dit is het werk van de makers.

  2. Doortraining op Nederlands

    WAINUT trainde dat model verder op Nederlandstalig materiaal, met een afkoelfase aan het eind. De mix was 70 procent Nederlands, 20 procent Engels en 10 procent code.

    Wat WAINUT toevoegde

    Een eigen Nederlandse basis. Die geven wij niet apart uit.

  3. Instructielaag

    Daarop leerde het model Nederlandse opdrachten opvolgen: vragen beantwoorden bij een document, gegevens uit een tekst halen en teksten indelen.

    Wat WAINUT toevoegde

    Een eigen instructielaag, met chatsjabloon en systeemprompt.

  4. Nabewerking met terugkoppeling

    Ten slotte is het model bijgestuurd op eigen antwoorden die een beoordelingsstap goedkeurde.

    Wat WAINUT toevoegde

    De laatste stap van het recept. De vakterm is rejection fine-tuning.

Is Walnoot 8B gewoon een Apertus-finetune?

Walnoot 8B bouwt voort op Apertus, maar er is meer gebeurd dan alleen een finetune. Eerst is het basismodel verder getraind op miljarden tokens Nederlandse tekst. Daarna volgde een eigen Nederlandse instructielaag en een laatste trainingsstap waarin het model verder leerde van zijn eigen antwoorden die een beoordelingsstap had goedgekeurd. Die stappen zitten allemaal in het model dat je downloadt.

Een belangrijk verschil zit in de data en de keuzes die we daarin hebben gemaakt. We volgden de lijn van GPT-NL op soevereiniteit: de herkomst van bronnen is bekend, rechten zijn herleidbaar en de gebruikte data is controleerbaar. Dat bepaalde welke data we wel en niet gebruikten en heeft daarmee ook invloed op wat het model uiteindelijk kan.

We publiceren de herkomst van de Nederlandse data per bron, het trainingsrecept en de ruwe meetlogs, zodat je de route grotendeels kunt controleren.

Lees het technisch rapportNaar de dataherkomst

Bedoeld gebruik

Waar is het model voor bedoeld?

  1. Vragen beantwoorden bij een document

    Een vraag stellen over een meegeleverd stuk en het antwoord uit dat stuk laten halen, met de tekst ernaast.

    Begrijpend lezen, taak squad-nl: 62,08 tegen de gepubliceerde 51 van GPT-NL.

  2. Gegevens uit een tekst halen

    Namen, plaatsen en organisaties uit een Nederlandse tekst lichten, zodat je ze kunt overnemen in een formulier of een register.

    Entiteitsherkenning, taak conll-nl: 46,52 tegen de gepubliceerde 36 van GPT-NL.

  3. Teksten indelen

    Binnengekomen post, tickets en documenten labelen en naar de juiste plek sturen.

    Indelen meten wij via sentiment, taak dbrd: 90,56 tegen de gepubliceerde 90 van GPT-NL. Dat is gelijkspel onder onze eigen regel.

  4. Een standaardtekst opstellen

    Een brief of memo opstellen volgens een vast stramien, met de gegevens die je aanlevert.

    Hier hebben wij geen gemeten cijfer voor.

  • Gebruik samenvattingen als eerste opzet en controleer ze altijd voordat je ze verder gebruikt.
  • Herschrijven naar eenvoudige taal valt buiten het bedoelde gebruik van Walnoot 8B.

Bekijk de volledige tabel

Bovengrens

Wat buiten het bedoelde gebruik valt

Walnoot 8B is gebouwd voor afgebakende taken. Voor opdrachten die veel algemene kennis, brede context of langdurig redeneren vragen, zijn grotere modellen geschikter. Dat zie je ook terug in de EuroEval-resultaten. We publiceren alle scores, dus ook de taken waarop Walnoot minder sterk presteert.

Niet voor

  • Open redeneerwerk en lange, complexe analyse
  • Creatief werk zonder kaders
  • Codegeneratie
  • Alles waar een fout direct grote gevolgen heeft zonder mens ertussen

Daar is een frontier-model het betere gereedschap.

Bekende beperkingen

Wat je vooraf wilt weten

Drie dingen vallen bij het eerste gebruik op, vooral bij Engelse invoer. Zelf houden wij de invoer Nederlands en lezen wij samenvattingen na.

  1. Herhalingslus

    Het model kan in een herhaling blijven hangen, waarbij het dezelfde zin of dezelfde zinswending blijft produceren.

  2. Antwoordtaal

    Op Engelse vragen komt er soms een Nederlands antwoord, terwijl de systeemprompt voorschrijft dat het model de taal van de gebruiker volgt.

  3. De naam van het basismodel

    Bij Engelse identiteitsvragen valt de naam van het basismodel soms spontaan, terwijl het identiteitsbeleid die naam pas na doorvragen noemt.

Wij kennen deze drie en ze staan op de lijst voor de volgende versie.

Meten

Hoe is Walnoot 8B gemeten?

Het oorspronkelijke doel is gehaald: GPT-NL op alle zes gepubliceerde benchmarks minimaal evenaren. Vijf keer erboven, op dbrd gelijk. WikiLingua-nl valt buiten de vergelijking, want daar wisselde de metriek. Walnoot 8B telt 8,05 miljard parameters tegen 26,03 miljard van GPT-NL.

Wij maten onze kolom met EuroEval 17.6.0 op de test-split, in 10 iteraties en met bf16-gewichten. De GPT-NL-kolom is hun eigen publicatie van december 2025 op EuroEval 15.16.0, interim-scores van het basismodel, gepubliceerd als puntscores zonder interval bij de cijfers die wij overnemen. Er zit twee hoofdversies verschil in het evaluatieframework. Over versies heen is de datasetinhoud niet gegarandeerd identiek. Daarom vermelden we bij iedere vergelijking expliciet welke versie is gebruikt.

Toon het commando
pip install "euroeval[all]==17.6.0" && euroeval --model WAINUT/walnoot-8b-instruct --language nl --num-iterations 10 --dataset dbrd --dataset scala-nl --dataset conll-nl --dataset squad-nl --dataset wiki-lingua-nl --dataset mmlu-nl --dataset hellaswag-nl --dataset duidelijke-taal --dataset valeu-nl --dataset mbbq-nl --evaluate-test-split

Draai de benchmark zelf

Waarom Walnoot

De onderzoeksvraag en de uitkomst.

Onze onderzoeksvraag was of een Nederlands model, doorgetraind op een Europees basismodel, GPT-NL op alle zes door GPT-NL gepubliceerde benchmarks minimaal kan evenaren, onder vergelijkbare eisen aan de herkomst, de rechten en de controleerbaarheid van de trainingsdata. Dat is gelukt, met vijf keer erboven en een keer gelijk.

Wat is open en onder welke licentie?
Per artefact de licentie en de toegang. Waar niets anders staat, geldt Apache 2.0.
ArtefactLicentieToegang
Gewichten (8B)Apache 2.0Publiek, zonder registratie
EvaluatielogsApache 2.0Publiek, ruwe jsonl
TrainingsreceptApache 2.0Publiek
EvaluatieconfiguratieApache 2.0Publiek, gepind op 17.6.0
Ons Nederlandse corpusGedocumenteerd per bronHerkomst publiek, brondata niet door ons gepubliceerd
Trainingsdata van het basismodelVoorwaarden per bronGedocumenteerd door de Swiss AI Initiative, niet van ons om te publiceren

Naar de openheidsmatrixLees de licentieNaar de soevereiniteitstest