Het model
Modelkaart
Het model telt 8,05 miljard parameters en staat onder Apache 2.0. Het bouwt voort op Apertus en is gemaakt voor afgebakende taken.
Identiteit
Wat is Walnoot 8B?
Walnoot 8B is een Nederlands taalmodel van WAINUT. Je downloadt het model en draait het in je eigen omgeving, ook voor toepassingen waarbij gegevens die eigen omgeving niet mogen verlaten. Alles wat we meten en publiceren, kun je zelf controleren.

Specificatie
Welk model is dit?
- Uitgever
- WAINUT
- Model
- Walnoot 8B Instruct
- Versie
- 1.0
- Omvang
- 8,05 miljard parameters
- Basismodel
- Apertus, Swiss AI Initiative (ETH Zürich en EPFL)
- Licentie
- Apache 2.0
- Taal
- Nederlands
- Evaluatie
- EuroEval 17.6.0
- Gewichten
- WAINUT/walnoot-8b-instruct
Recept
Hoe is Walnoot 8B gebouwd?
Europese basis
Apertus-8B-2509 van de Swiss AI Initiative, uitgegeven onder Apache 2.0.
Wat WAINUT toevoegde
Niets. Dit is het werk van de makers.
Doortraining op Nederlands
WAINUT trainde dat model verder op Nederlandstalig materiaal, met een afkoelfase aan het eind. De mix was 70 procent Nederlands, 20 procent Engels en 10 procent code.
Wat WAINUT toevoegde
Een eigen Nederlandse basis. Die geven wij niet apart uit.
Instructielaag
Daarop leerde het model Nederlandse opdrachten opvolgen: vragen beantwoorden bij een document, gegevens uit een tekst halen en teksten indelen.
Wat WAINUT toevoegde
Een eigen instructielaag, met chatsjabloon en systeemprompt.
Nabewerking met terugkoppeling
Ten slotte is het model bijgestuurd op eigen antwoorden die een beoordelingsstap goedkeurde.
Wat WAINUT toevoegde
De laatste stap van het recept. De vakterm is rejection fine-tuning.
Is Walnoot 8B gewoon een Apertus-finetune?
Walnoot 8B bouwt voort op Apertus, maar er is meer gebeurd dan alleen een finetune. Eerst is het basismodel verder getraind op miljarden tokens Nederlandse tekst. Daarna volgde een eigen Nederlandse instructielaag en een laatste trainingsstap waarin het model verder leerde van zijn eigen antwoorden die een beoordelingsstap had goedgekeurd. Die stappen zitten allemaal in het model dat je downloadt.
Een belangrijk verschil zit in de data en de keuzes die we daarin hebben gemaakt. We volgden de lijn van GPT-NL op soevereiniteit: de herkomst van bronnen is bekend, rechten zijn herleidbaar en de gebruikte data is controleerbaar. Dat bepaalde welke data we wel en niet gebruikten en heeft daarmee ook invloed op wat het model uiteindelijk kan.
We publiceren de herkomst van de Nederlandse data per bron, het trainingsrecept en de ruwe meetlogs, zodat je de route grotendeels kunt controleren.
Bedoeld gebruik
Waar is het model voor bedoeld?
Vragen beantwoorden bij een document
Een vraag stellen over een meegeleverd stuk en het antwoord uit dat stuk laten halen, met de tekst ernaast.
Begrijpend lezen, taak squad-nl: 62,08 tegen de gepubliceerde 51 van GPT-NL.
Gegevens uit een tekst halen
Namen, plaatsen en organisaties uit een Nederlandse tekst lichten, zodat je ze kunt overnemen in een formulier of een register.
Entiteitsherkenning, taak conll-nl: 46,52 tegen de gepubliceerde 36 van GPT-NL.
Teksten indelen
Binnengekomen post, tickets en documenten labelen en naar de juiste plek sturen.
Indelen meten wij via sentiment, taak dbrd: 90,56 tegen de gepubliceerde 90 van GPT-NL. Dat is gelijkspel onder onze eigen regel.
Een standaardtekst opstellen
Een brief of memo opstellen volgens een vast stramien, met de gegevens die je aanlevert.
Hier hebben wij geen gemeten cijfer voor.
- Gebruik samenvattingen als eerste opzet en controleer ze altijd voordat je ze verder gebruikt.
- Herschrijven naar eenvoudige taal valt buiten het bedoelde gebruik van Walnoot 8B.
Bovengrens
Wat buiten het bedoelde gebruik valt
Walnoot 8B is gebouwd voor afgebakende taken. Voor opdrachten die veel algemene kennis, brede context of langdurig redeneren vragen, zijn grotere modellen geschikter. Dat zie je ook terug in de EuroEval-resultaten. We publiceren alle scores, dus ook de taken waarop Walnoot minder sterk presteert.
Niet voor
- Open redeneerwerk en lange, complexe analyse
- Creatief werk zonder kaders
- Codegeneratie
- Alles waar een fout direct grote gevolgen heeft zonder mens ertussen
Daar is een frontier-model het betere gereedschap.
Bekende beperkingen
Wat je vooraf wilt weten
Drie dingen vallen bij het eerste gebruik op, vooral bij Engelse invoer. Zelf houden wij de invoer Nederlands en lezen wij samenvattingen na.
Herhalingslus
Het model kan in een herhaling blijven hangen, waarbij het dezelfde zin of dezelfde zinswending blijft produceren.
Antwoordtaal
Op Engelse vragen komt er soms een Nederlands antwoord, terwijl de systeemprompt voorschrijft dat het model de taal van de gebruiker volgt.
De naam van het basismodel
Bij Engelse identiteitsvragen valt de naam van het basismodel soms spontaan, terwijl het identiteitsbeleid die naam pas na doorvragen noemt.
Wij kennen deze drie en ze staan op de lijst voor de volgende versie.
Meten
Hoe is Walnoot 8B gemeten?
Het oorspronkelijke doel is gehaald: GPT-NL op alle zes gepubliceerde benchmarks minimaal evenaren. Vijf keer erboven, op dbrd gelijk. WikiLingua-nl valt buiten de vergelijking, want daar wisselde de metriek. Walnoot 8B telt 8,05 miljard parameters tegen 26,03 miljard van GPT-NL.
Wij maten onze kolom met EuroEval 17.6.0 op de test-split, in 10 iteraties en met bf16-gewichten. De GPT-NL-kolom is hun eigen publicatie van december 2025 op EuroEval 15.16.0, interim-scores van het basismodel, gepubliceerd als puntscores zonder interval bij de cijfers die wij overnemen. Er zit twee hoofdversies verschil in het evaluatieframework. Over versies heen is de datasetinhoud niet gegarandeerd identiek. Daarom vermelden we bij iedere vergelijking expliciet welke versie is gebruikt.
Toon het commando
pip install "euroeval[all]==17.6.0" && euroeval --model WAINUT/walnoot-8b-instruct --language nl --num-iterations 10 --dataset dbrd --dataset scala-nl --dataset conll-nl --dataset squad-nl --dataset wiki-lingua-nl --dataset mmlu-nl --dataset hellaswag-nl --dataset duidelijke-taal --dataset valeu-nl --dataset mbbq-nl --evaluate-test-splitWaarom Walnoot
De onderzoeksvraag en de uitkomst.
Onze onderzoeksvraag was of een Nederlands model, doorgetraind op een Europees basismodel, GPT-NL op alle zes door GPT-NL gepubliceerde benchmarks minimaal kan evenaren, onder vergelijkbare eisen aan de herkomst, de rechten en de controleerbaarheid van de trainingsdata. Dat is gelukt, met vijf keer erboven en een keer gelijk.
Wat is open en onder welke licentie?
| Artefact | Licentie | Toegang |
|---|---|---|
| Gewichten (8B) | Apache 2.0 | Publiek, zonder registratie |
| Evaluatielogs | Apache 2.0 | Publiek, ruwe jsonl |
| Trainingsrecept | Apache 2.0 | Publiek |
| Evaluatieconfiguratie | Apache 2.0 | Publiek, gepind op 17.6.0 |
| Ons Nederlandse corpus | Gedocumenteerd per bron | Herkomst publiek, brondata niet door ons gepubliceerd |
| Trainingsdata van het basismodel | Voorwaarden per bron | Gedocumenteerd door de Swiss AI Initiative, niet van ons om te publiceren |
Naar de openheidsmatrixLees de licentieNaar de soevereiniteitstest