Do not believe us. Run it yourself.
Nederlands taalmodel dat je in je eigen omgeving draait
Breek het open.Kijk wat erin zit.
Het model
Walnoot 8B is een Nederlands taalmodel van WAINUT. Je downloadt het model en draait het in je eigen omgeving, ook voor toepassingen waarbij gegevens die eigen omgeving niet mogen verlaten. Alles wat we meten en publiceren, kun je zelf controleren.
Scorebord
Het oorspronkelijke doel is gehaald: GPT-NL op alle zes gepubliceerde benchmarks minimaal evenaren. Vijf keer erboven, op dbrd gelijk.
- Model
- Walnoot 8B Instruct
- Versie
- 1.0
- Licentie
- Apache 2.0
- Evaluatie
- EuroEval 17.6.0
WAINUT
Waarom wij dit bouwden.

Foto: Yasin Celik
We zitten dagelijks aan tafel bij organisaties die met gevoelige gegevens werken. Daar zagen we steeds hetzelfde probleem. Er komt een brief, dossier of document binnen waar je iets mee wilt doen, maar de informatie mag de eigen omgeving niet uit. Een frontiermodel, zoals GPT of Claude, is dan simpelweg niet altijd het juiste gereedschap. Dus blijft zo'n toepassing liggen. En dat zien we bij heel verschillende organisaties, in meerdere sectoren.
Tegelijkertijd hoorden we, vooral bij overheden, steeds dezelfde naam: GPT-NL. De behoefte aan een Nederlands taalmodel dat organisaties zelf kunnen draaien en controleren, bleek daar groot.
En toen stelde een Amerikaanse aanbieder zijn nieuwste model tijdelijk alleen beschikbaar in de Verenigde Staten. Dat maakte nog eens zichtbaar hoe afhankelijk we in Europa zijn van een klein aantal buitenlandse partijen.
Wij vinden daar iets van. En dan kun je erover blijven praten, of je probeert zelf iets te bouwen.
Dus stelden we vooraf één concreet doel: GPT-NL op zes vergelijkbare taken minimaal evenaren. Vanaf daar zijn we gaan bouwen aan een compact Nederlands taalmodel voor afgebakende taken.
Waarom Walnoot
Wat je eraan hebt.

Nederlands eerst
Walnoot is doorgetraind op Nederlands materiaal en gemeten op tien Nederlandse taken, elk met het betrouwbaarheidsinterval erbij.
Houd controle
Gevoelig materiaal hoeft je eigen omgeving niet te verlaten, want je downloadt de gewichten en draait ze op je eigen machine of server.
Weet wat je gebruikt
De herkomst per bron, het recept, de evaluatielogs en de grenzen liggen open, dus je hoeft ons niet op ons woord te geloven.
Open onder Apache 2.0
De gewichten staan onder Apache 2.0, ook voor commercieel gebruik. Omdat Walnoot open-weight is, blijft wat je downloadt van jou, ook als je later van leverancier wisselt.
Groeit met je mee
Met de licentie en het recept kun je Walnoot gebruiken zoals het is en later aanpassen als je organisatie meer nodig heeft.
Gebouwd op
Wij begonnen niet bij nul.

Europese basis
Apertus-8B-2509 van de Swiss AI Initiative, uitgegeven onder Apache 2.0.
Wat WAINUT toevoegde
Niets. Dit is het werk van de makers.
Doortraining op Nederlands
WAINUT trainde dat model verder op Nederlandstalig materiaal, met een afkoelfase aan het eind. De mix was 70 procent Nederlands, 20 procent Engels en 10 procent code.
Wat WAINUT toevoegde
Een eigen Nederlandse basis. Die geven wij niet apart uit.
Instructielaag
Daarop leerde het model Nederlandse opdrachten opvolgen: vragen beantwoorden bij een document, gegevens uit een tekst halen en teksten indelen.
Wat WAINUT toevoegde
Een eigen instructielaag, met chatsjabloon en systeemprompt.
Nabewerking met terugkoppeling
Ten slotte is het model bijgestuurd op eigen antwoorden die een beoordelingsstap goedkeurde.
Wat WAINUT toevoegde
De laatste stap van het recept. De vakterm is rejection fine-tuning.
Het instructiemodel van Apertus zelf koos een andere datamix en een andere nabewerking. Wij kozen data die je per bron kunt herleiden en een recept dat je kunt nalopen. De trainingsrun duurde minder dan een week en binnen ongeveer een maand draaide het eerste model.

Scorebord
Wat wij gemeten hebben.
Het oorspronkelijke doel is gehaald: GPT-NL op alle zes minimaal evenaren. Vijf keer erboven, op dbrd gelijk.
squad-nl
Begrijpend lezen
- Onze score
- 62,08
- GPT-NL
- 51
gewonnen
conll-nl
Entiteitsherkenning
- Onze score
- 46,52
- GPT-NL
- 36
gewonnen
scala-nl
Taalkundige correctheid
- Onze score
- 34,41
- GPT-NL
- 19
gewonnen
mmlu-nl
Kennis
- Onze score
- 37,16
- GPT-NL
- 2
gewonnen
hellaswag-nl
Alledaags redeneren
- Onze score
- 22,46
- GPT-NL
- −2
gewonnen
dbrd
Sentiment
- Onze score
- 90,56
- GPT-NL
- 90
gelijkspel
Ruim drie keer kleiner dan GPT-NL en toch hoger op vijf van de zes.
Walnoot 8B telt 8,05 miljard parameters tegen 26,03 miljard van GPT-NL.
De evaluatie en de vergelijking met GPT-NL zijn door een onafhankelijke tester nagerekend op de nieuwste versie van EuroEval.
Walnoot 8B is gebouwd voor werk dat zich laat afbakenen.
Lees de grenzen op de modelkaartBekijk alle tien de taken met hun interval
Waarom niet gewoon
Drie vragen die wij zelf ook stelden.
Waarom niet gewoon een frontier-API?
Vaak is dat ook gewoon de beste keuze. Voor complexe analyses, breed redeneerwerk en taken met veel context zijn frontiermodellen zoals GPT en Claude sterker.
Walnoot is bedoeld voor iets anders: afgebakende taken waarbij gegevens je eigen omgeving niet uit mogen. Denk aan vragen beantwoorden over een document, informatie uit tekst halen of stukken automatisch indelen.
De data blijven waar jij ze wilt hebben en je bepaalt zelf waar het model draait.
Waarom niet gewoon Apertus?
Apertus is de Europese basis waarop Walnoot is gebouwd en daar zijn we gewoon transparant over. WAINUT bouwde daarop verder met drie stappen: extra Nederlandse pretraining, een eigen Nederlandse instructielaag en een nabewerking op goedgekeurde antwoorden (rejection fine-tuning).
Daarbovenop hebben we Walnoot op tien Nederlandse taken geëvalueerd. Ook publiceren we de herkomst van de gebruikte bronnen en het recept waarmee het model is gemaakt.
Voor het instructiemodel van Apertus is gekozen voor een andere datamix en een andere nabewerking. Wij maakten daarin onze eigen keuzes: Nederlandse data waarvan de herkomst per bron te volgen is en een recept waarvan je kunt zien wat er in iedere stap gebeurt.
Is GPT-NL geen lage lat?
Dat is een terechte vraag. GPT-NL was de meetlat die we vooraf voor onszelf hebben vastgelegd. Ons doel was helder: op de vergelijkbare taken minimaal even goed presteren. Die lat hebben we tijdens het bouwen niet verlegd als de resultaten tegenvielen.
Op het scorebord laten we alle tien de taken zien, ook de vier waarvoor geen directe vergelijking met GPT-NL mogelijk is.
De bewijslaag
Alles hierboven is na te lopen.

Waar de data vandaan komt.
Onze Nederlandse trainingsstap draait op het GPT-NL Public Corpus onder CC BY 4.0, met 28 subsets op een gepinde revisie en per bron de grondslag en de bewerkingen erbij. Ook wat er niet in zit staat erbij, zoals krantenarchieven die we op kwaliteit uitsloten.
Wat er werkelijk openligt.
| Artefact | Licentie | Toegang |
|---|---|---|
| Gewichten (8B) | Apache 2.0 | Publiek, zonder registratie |
| Evaluatielogs | Apache 2.0 | Publiek, ruwe jsonl |
| Trainingsrecept | Apache 2.0 | Publiek |
| Evaluatieconfiguratie | Apache 2.0 | Publiek, gepind op 17.6.0 |
| Ons Nederlandse corpus | Gedocumenteerd per bron | Herkomst publiek, brondata niet door ons gepubliceerd |
| Trainingsdata van het basismodel | Voorwaarden per bron | Gedocumenteerd door de Swiss AI Initiative, niet van ons om te publiceren |
Reproduceren
Hoe je het zelf draait.
Een bestand en een handleiding per programma. Wil je de cijfers narekenen, dan staat het volledige commando met de gepinde evaluatieversie erbij.
Het commando
euroeval --model WAINUT/walnoot-8b-instruct --num-iterations 10 --evaluate-test-split --dataset …Verkorte weergave. Het volledige commando zit achter de kopieerknop.
Toon het volledige commando
pip install "euroeval[all]==17.6.0" && euroeval --model WAINUT/walnoot-8b-instruct --language nl --num-iterations 10 --dataset dbrd --dataset scala-nl --dataset conll-nl --dataset squad-nl --dataset wiki-lingua-nl --dataset mmlu-nl --dataset hellaswag-nl --dataset duidelijke-taal --dataset valeu-nl --dataset mbbq-nl --evaluate-test-splitVerder in het dossier