Proberen
Zelf draaien
Walnoot 8B draait op je eigen machine of server. Er gaat geen tekst naar ons en je hebt geen sleutel nodig.
In drie stappen
Wat is de kortste weg naar een eerste antwoord?
Download walnoot-8b-instruct-bf16.gguf en het Modelfile uit WAINUT/walnoot-8b-instruct. Zet ze in dezelfde map.
Bouw en start het model met Ollama. Alle instellingen en de systeemprompt zitten in het Modelfile, dus je hoeft verder niets te zetten.
ollama create walnoot-8b-instruct -f Modelfile ollama run walnoot-8b-instructTyp je vraag en druk op Enter.
Werk je liever in een venster zonder opdrachtregel, neem dan LM Studio. Daar zet je de instellingen zelf.
Wat je ervoor nodig hebt
Waar past het op?
Het bestand is ongeveer 16 GB en dat moet ergens in passen.
- 24 GB videogeheugen
- Het model gaat er in zijn geheel op.
- Minder videogeheugen
- Het programma verdeelt de lagen over kaart en processor. Dat werkt, maar het wordt trager.
- Laptop met 12 GB videogeheugen en 32 GB werkgeheugen
- Ruim de helft van de lagen staat op de kaart.
Hoe snel het model loopt hangt sterk af van je kaart en je geheugen. Meet het een keer na op je eigen machine.
Wij leveren het model alleen onverkleind, in bf16. Dat zijn dezelfde bf16-gewichten als waarop de cijfers op deze site zijn gemeten, dus jij draait wat wij hebben gemeten.
Waarom geen kleinere variant?
Kleinere, gekwantiseerde varianten passen op lichtere kaarten, maar dan gelden onze cijfers niet meer en verandert het gedrag van het model. Die publiceren wij daarom niet.
De drie die ertoe doen
Welke instellingen maken verschil?
- Herhalingsstraf op 1,0
- Walnoot is getraind om uit een brondocument te citeren en een herhalingsstraf straft juist dat af.
- Contextlengte op 8192
- De standaard in LM Studio en Ollama is te krap zodra er een document bij moet.
- Temperatuur op 0 bij werk aan een document
- Het model kiest dan steeds het meest waarschijnlijke woord en verzint minder.
Waarom deze waarden?
Herhalingsstraf op 1,0
Walnoot is getraind om uit een brondocument te citeren. Een herhalingsstraf straft precies dat gedrag af en laat het model juist de woorden uit de bron vermijden. Zet hem daarom op 1,0. LM Studio zet hem standaard op 1,1.
Contextlengte op 8192
LM Studio begint op 2048 en Ollama op 4096. Dat is te krap zodra er een document bij moet. 8192 is het advies voor de meeste machines; 32768 is de bediengrens die wij hebben gezet en de architectuur laat 65536 toe. Laat de KV-cache daarbij onverkleind staan, anders lijdt het teruglezen van een lang stuk eronder.
Temperatuur op 0 bij werk aan een document
Voor samenvatten, gegevens eruit halen en vragen over een tekst is 0 de juiste waarde, omdat het model dan steeds het meest waarschijnlijke woord kiest en minder verzint. Voor vrij schrijfwerk kun je 0,7 nemen met top-p op 0,9.
Per programma
Welk programma past bij jou?
LM Studio en Ollama hebben wij op het uitgegeven model getoetst. De andere twee routes niet. llama.cpp leest de instellingen uit het meegeleverde bestand; bij vLLM stuurt je programma de temperatuur zelf mee.
LM Studio
Een venster om in te typen, zonder opdrachtregel.GetoetstLaad het GGUF-bestand in LM Studio. LM Studio beheert bij deze route zelf de runtime- en samplinginstellingen. Stel deze daarom handmatig in.
Bij het laden van het model:
- Context Length: 8192
- Laat de KV-cache op volledige precisie staan; gebruik geen KV-cache-quantisatie zoals Q8 of Q4. Offload KV Cache to GPU Memory en Unified KV Cache mogen aan blijven.
Laad daarna het model en ga naar Settings. Stel daar in:
- Temperature: 0
- Repeat Penalty: 1.0
- Top K Sampling: 0
- Presence Penalty: uit
- Top P Sampling: 1.0
- Min P Sampling: 0.0
Plak tot slot de volledige inhoud van systeemprompt.txt in het System Prompt-veld.
Let opSla dit niet over. Met de standaardinstellingen meet je LM Studio en niet Walnoot.
GetoetstDeze route hebben wij op 27 september op het uitgegeven model getoetst, met precies deze instellingen.
Ollama
Twee commando's en de instellingen staan meteen goed.GetoetstBouw het model met het meegeleverde Modelfile en start het. Alle instellingen en de systeemprompt zitten daarin, dus je hoeft verder niets te zetten.
ollama create walnoot-8b-instruct -f Modelfile ollama run walnoot-8b-instructLet opRoep je Ollama vanuit een programma aan, gebruik dan zijn eigen route /api/chat. Op de OpenAI-route /v1/chat/completions negeert Ollama de instellingen uit het Modelfile en zet het de temperatuur stil op 1,0. Gebruik je die route toch, stuur dan zelf temperatuur 0 en top-p 1 mee.
GetoetstDeze route hebben wij op 27 september op het uitgegeven model getoetst, met precies deze twee commando's. Wat hierboven over de twee ingangen staat, is een eigenschap van Ollama zelf en niet van het model.
llama.cpp
Een eigen server op je werkplek.Niet nagemetenDe instellingen zitten in het bestand en worden daaruit gelezen, dus je start de server zonder samplervlaggen. Gebruik een uitgave van llama.cpp van oktober 2025 of later, want oudere versies kennen de rekenstap van dit model niet.
llama-server \ --model walnoot-8b-instruct-bf16.gguf \ --ctx-size 8192 \ --parallel 1 \ --cache-type-k f16 \ --cache-type-v f16Let opControleer na het starten wat de server aanhoudt: temperatuur 0, top-k 0, top-p 1,0, min-p 0,0 en herhalingsstraf 1,0. Stuurt een programma zijn eigen instellingen mee, dan winnen die altijd van de onze.
GetoetstDeze route hebben wij niet op het uitgegeven model nagemeten. De vlaggen hierboven horen bij het meegeleverde bestand.
vLLM, op een server
Meerdere gebruikers tegelijk, in je eigen datacentrum of cloudomgeving.Niet zelf gedraaidVoor een server neem je niet het gguf-bestand maar de gewichten zelf, uit de gewone modelrepository. vLLM bedient meerdere verzoeken tegelijk. Reken op een kaart met minimaal 24 GB videogeheugen. Hoe je vLLM start hangt af van je opstelling; dit zijn de instellingen die je hem meegeeft.
--model /pad/naar/walnoot \ --served-model-name walnoot-8b-instruct \ --generation-config auto \ --max-model-len 8192 \ --dtype bfloat16Let opvLLM haalt uit de meegeleverde bestanden geen temperatuur. Laat je programma daarom bij elk verzoek zelf temperatuur 0 en top-p 1 meesturen. Krijg je de melding dat de architectuur niet wordt ondersteund, dan is je vLLM te oud voor het basismodel waarop Walnoot is gebouwd.
GetoetstDeze route hebben wij niet zelf gedraaid en wij hebben er geen meting onder liggen.
De systeemprompt
Waarom hoort er een systeemprompt bij?
Zonder systeemprompt bedenkt het model per gesprek een eigen rol en krijg je antwoorden in een toon die je niet hebt gevraagd. Wij leveren er een mee als systeemprompt.txt, in dezelfde repo als het gguf-bestand. In Ollama zit hij al in het Modelfile. In LM Studio plak je de inhoud in het System Prompt-veld.
Daarna
Wat kun je er zelf mee controleren?
Draait het, dan kun je de cijfers van deze site zelf narekenen.