Naar de hoofdinhoud

Do not believe us. Run it yourself.

Nederlands taalmodel dat je in je eigen omgeving draait

Breek het open.Kijk wat erin zit.

Het model

Walnoot 8B is een Nederlands taalmodel van WAINUT. Je downloadt het model en draait het in je eigen omgeving, ook voor toepassingen waarbij gegevens die eigen omgeving niet mogen verlaten. Alles wat we meten en publiceren, kun je zelf controleren.

Scorebord

Het oorspronkelijke doel is gehaald: GPT-NL op alle zes gepubliceerde benchmarks minimaal evenaren. Vijf keer erboven, op dbrd gelijk.

Model
Walnoot 8B Instruct
Versie
1.0
Licentie
Apache 2.0
Evaluatie
EuroEval 17.6.0

WAINUT

Waarom wij dit bouwden.

We zitten dagelijks aan tafel bij organisaties die met gevoelige gegevens werken. Daar zagen we steeds hetzelfde probleem. Er komt een brief, dossier of document binnen waar je iets mee wilt doen, maar de informatie mag de eigen omgeving niet uit. Een frontiermodel, zoals GPT of Claude, is dan simpelweg niet altijd het juiste gereedschap. Dus blijft zo'n toepassing liggen. En dat zien we bij heel verschillende organisaties, in meerdere sectoren.

Tegelijkertijd hoorden we, vooral bij overheden, steeds dezelfde naam: GPT-NL. De behoefte aan een Nederlands taalmodel dat organisaties zelf kunnen draaien en controleren, bleek daar groot.

En toen stelde een Amerikaanse aanbieder zijn nieuwste model tijdelijk alleen beschikbaar in de Verenigde Staten. Dat maakte nog eens zichtbaar hoe afhankelijk we in Europa zijn van een klein aantal buitenlandse partijen.

Wij vinden daar iets van. En dan kun je erover blijven praten, of je probeert zelf iets te bouwen.

Dus stelden we vooraf één concreet doel: GPT-NL op zes vergelijkbare taken minimaal evenaren. Vanaf daar zijn we gaan bouwen aan een compact Nederlands taalmodel voor afgebakende taken.

Hoe we het bouwden

Waarom Walnoot

Wat je eraan hebt.

Een walnoot in de bek van een stalen notenkraker. De schaal is net gebroken en er springen splinters weg.
  • Nederlands eerst

    Walnoot is doorgetraind op Nederlands materiaal en gemeten op tien Nederlandse taken, elk met het betrouwbaarheidsinterval erbij.

    De drie trainingsstappen

  • Houd controle

    Gevoelig materiaal hoeft je eigen omgeving niet te verlaten, want je downloadt de gewichten en draait ze op je eigen machine of server.

    Zo draai je het zelf

  • Weet wat je gebruikt

    De herkomst per bron, het recept, de evaluatielogs en de grenzen liggen open, dus je hoeft ons niet op ons woord te geloven.

    Lees de dataherkomst

  • Open onder Apache 2.0

    De gewichten staan onder Apache 2.0, ook voor commercieel gebruik. Omdat Walnoot open-weight is, blijft wat je downloadt van jou, ook als je later van leverancier wisselt.

    Wat valt er onder de licentie

  • Groeit met je mee

    Met de licentie en het recept kun je Walnoot gebruiken zoals het is en later aanpassen als je organisatie meer nodig heeft.

    Van oriënteren tot inbouwen

Gebouwd op

Wij begonnen niet bij nul.

Een rij walnoten in een donkere ruimte. Er valt een schuine baan licht over de rij en één noot is opengebroken zodat de pit zichtbaar is.
  1. Europese basis

    Apertus-8B-2509 van de Swiss AI Initiative, uitgegeven onder Apache 2.0.

    Wat WAINUT toevoegde

    Niets. Dit is het werk van de makers.

  2. Doortraining op Nederlands

    WAINUT trainde dat model verder op Nederlandstalig materiaal, met een afkoelfase aan het eind. De mix was 70 procent Nederlands, 20 procent Engels en 10 procent code.

    Wat WAINUT toevoegde

    Een eigen Nederlandse basis. Die geven wij niet apart uit.

  3. Instructielaag

    Daarop leerde het model Nederlandse opdrachten opvolgen: vragen beantwoorden bij een document, gegevens uit een tekst halen en teksten indelen.

    Wat WAINUT toevoegde

    Een eigen instructielaag, met chatsjabloon en systeemprompt.

  4. Nabewerking met terugkoppeling

    Ten slotte is het model bijgestuurd op eigen antwoorden die een beoordelingsstap goedkeurde.

    Wat WAINUT toevoegde

    De laatste stap van het recept. De vakterm is rejection fine-tuning.

Het instructiemodel van Apertus zelf koos een andere datamix en een andere nabewerking. Wij kozen data die je per bron kunt herleiden en een recept dat je kunt nalopen. De trainingsrun duurde minder dan een week en binnen ongeveer een maand draaide het eerste model.

Lees de modelkaart

Een walnoot naast de bek van een stalen schuifmaat, van bovenaf op een donkere leistenen plaat.

Scorebord

Wat wij gemeten hebben.

Het oorspronkelijke doel is gehaald: GPT-NL op alle zes minimaal evenaren. Vijf keer erboven, op dbrd gelijk.

  • squad-nl

    Begrijpend lezen

    Onze score
    62,08
    GPT-NL
    51

    gewonnen

  • conll-nl

    Entiteitsherkenning

    Onze score
    46,52
    GPT-NL
    36

    gewonnen

  • scala-nl

    Taalkundige correctheid

    Onze score
    34,41
    GPT-NL
    19

    gewonnen

  • mmlu-nl

    Kennis

    Onze score
    37,16
    GPT-NL
    2

    gewonnen

  • hellaswag-nl

    Alledaags redeneren

    Onze score
    22,46
    GPT-NL
    −2

    gewonnen

  • dbrd

    Sentiment

    Onze score
    90,56
    GPT-NL
    90

    gelijkspel

Ruim drie keer kleiner dan GPT-NL en toch hoger op vijf van de zes.

Walnoot 8B telt 8,05 miljard parameters tegen 26,03 miljard van GPT-NL.

De evaluatie en de vergelijking met GPT-NL zijn door een onafhankelijke tester nagerekend op de nieuwste versie van EuroEval.

Walnoot 8B is gebouwd voor werk dat zich laat afbakenen.

Lees de grenzen op de modelkaartBekijk alle tien de taken met hun interval

Waarom niet gewoon

Drie vragen die wij zelf ook stelden.

Waarom niet gewoon een frontier-API?

Vaak is dat ook gewoon de beste keuze. Voor complexe analyses, breed redeneerwerk en taken met veel context zijn frontiermodellen zoals GPT en Claude sterker.

Walnoot is bedoeld voor iets anders: afgebakende taken waarbij gegevens je eigen omgeving niet uit mogen. Denk aan vragen beantwoorden over een document, informatie uit tekst halen of stukken automatisch indelen.

De data blijven waar jij ze wilt hebben en je bepaalt zelf waar het model draait.

Waarom niet gewoon Apertus?

Apertus is de Europese basis waarop Walnoot is gebouwd en daar zijn we gewoon transparant over. WAINUT bouwde daarop verder met drie stappen: extra Nederlandse pretraining, een eigen Nederlandse instructielaag en een nabewerking op goedgekeurde antwoorden (rejection fine-tuning).

Daarbovenop hebben we Walnoot op tien Nederlandse taken geëvalueerd. Ook publiceren we de herkomst van de gebruikte bronnen en het recept waarmee het model is gemaakt.

Voor het instructiemodel van Apertus is gekozen voor een andere datamix en een andere nabewerking. Wij maakten daarin onze eigen keuzes: Nederlandse data waarvan de herkomst per bron te volgen is en een recept waarvan je kunt zien wat er in iedere stap gebeurt.

Is GPT-NL geen lage lat?

Dat is een terechte vraag. GPT-NL was de meetlat die we vooraf voor onszelf hebben vastgelegd. Ons doel was helder: op de vergelijkbare taken minimaal even goed presteren. Die lat hebben we tijdens het bouwen niet verlegd als de resultaten tegenvielen.

Op het scorebord laten we alle tien de taken zien, ook de vier waarvoor geen directe vergelijking met GPT-NL mogelijk is.

Alle bezwaren met het antwoord erbij

De bewijslaag

Alles hierboven is na te lopen.

Een open hand met een walnoot in de palm, tegen een donkere achtergrond.

Waar de data vandaan komt.

Onze Nederlandse trainingsstap draait op het GPT-NL Public Corpus onder CC BY 4.0, met 28 subsets op een gepinde revisie en per bron de grondslag en de bewerkingen erbij. Ook wat er niet in zit staat erbij, zoals krantenarchieven die we op kwaliteit uitsloten.

Lees de dataherkomst

Wat er werkelijk openligt.

Wat er werkelijk openligt.
ArtefactLicentieToegang
Gewichten (8B)Apache 2.0Publiek, zonder registratie
EvaluatielogsApache 2.0Publiek, ruwe jsonl
TrainingsreceptApache 2.0Publiek
EvaluatieconfiguratieApache 2.0Publiek, gepind op 17.6.0
Ons Nederlandse corpusGedocumenteerd per bronHerkomst publiek, brondata niet door ons gepubliceerd
Trainingsdata van het basismodelVoorwaarden per bronGedocumenteerd door de Swiss AI Initiative, niet van ons om te publiceren

Bekijk de openheidsmatrix

Reproduceren

Hoe je het zelf draait.

Een bestand en een handleiding per programma. Wil je de cijfers narekenen, dan staat het volledige commando met de gepinde evaluatieversie erbij.

Zo draai je het zelfReken elke score na

Het commando

euroeval --model WAINUT/walnoot-8b-instruct --num-iterations 10 --evaluate-test-split --dataset …

Verkorte weergave. Het volledige commando zit achter de kopieerknop.

Toon het volledige commando
pip install "euroeval[all]==17.6.0" && euroeval --model WAINUT/walnoot-8b-instruct --language nl --num-iterations 10 --dataset dbrd --dataset scala-nl --dataset conll-nl --dataset squad-nl --dataset wiki-lingua-nl --dataset mmlu-nl --dataset hellaswag-nl --dataset duidelijke-taal --dataset valeu-nl --dataset mbbq-nl --evaluate-test-split

Verder bouwen

Vandaag gebruiken. Morgen aanpassen als dat nodig is.

Van oriënteren tot inbouwen