Naar de hoofdinhoud

Proberen

Zelf draaien

Walnoot 8B draait op je eigen machine of server. Er gaat geen tekst naar ons en je hebt geen sleutel nodig.

Model
Walnoot 8B Instruct 1.0
Formaat
bf16, ongeveer 16 GB
Licentie
Apache 2.0

In drie stappen

Wat is de kortste weg naar een eerste antwoord?

  1. Download walnoot-8b-instruct-bf16.gguf en het Modelfile uit WAINUT/walnoot-8b-instruct. Zet ze in dezelfde map.

  2. Bouw en start het model met Ollama. Alle instellingen en de systeemprompt zitten in het Modelfile, dus je hoeft verder niets te zetten.

    ollama create walnoot-8b-instruct -f Modelfile
    ollama run walnoot-8b-instruct
  3. Typ je vraag en druk op Enter.

Werk je liever in een venster zonder opdrachtregel, neem dan LM Studio. Daar zet je de instellingen zelf.

Download op Hugging FaceNaar de vier programma's

Wat je ervoor nodig hebt

Waar past het op?

Het bestand is ongeveer 16 GB en dat moet ergens in passen.

24 GB videogeheugen
Het model gaat er in zijn geheel op.
Minder videogeheugen
Het programma verdeelt de lagen over kaart en processor. Dat werkt, maar het wordt trager.
Laptop met 12 GB videogeheugen en 32 GB werkgeheugen
Ruim de helft van de lagen staat op de kaart.

Hoe snel het model loopt hangt sterk af van je kaart en je geheugen. Meet het een keer na op je eigen machine.

Wij leveren het model alleen onverkleind, in bf16. Dat zijn dezelfde bf16-gewichten als waarop de cijfers op deze site zijn gemeten, dus jij draait wat wij hebben gemeten.

Waarom geen kleinere variant?

Kleinere, gekwantiseerde varianten passen op lichtere kaarten, maar dan gelden onze cijfers niet meer en verandert het gedrag van het model. Die publiceren wij daarom niet.

De drie die ertoe doen

Welke instellingen maken verschil?

Herhalingsstraf op 1,0
Walnoot is getraind om uit een brondocument te citeren en een herhalingsstraf straft juist dat af.
Contextlengte op 8192
De standaard in LM Studio en Ollama is te krap zodra er een document bij moet.
Temperatuur op 0 bij werk aan een document
Het model kiest dan steeds het meest waarschijnlijke woord en verzint minder.

Waarom deze waarden?

Herhalingsstraf op 1,0

Walnoot is getraind om uit een brondocument te citeren. Een herhalingsstraf straft precies dat gedrag af en laat het model juist de woorden uit de bron vermijden. Zet hem daarom op 1,0. LM Studio zet hem standaard op 1,1.

Contextlengte op 8192

LM Studio begint op 2048 en Ollama op 4096. Dat is te krap zodra er een document bij moet. 8192 is het advies voor de meeste machines; 32768 is de bediengrens die wij hebben gezet en de architectuur laat 65536 toe. Laat de KV-cache daarbij onverkleind staan, anders lijdt het teruglezen van een lang stuk eronder.

Temperatuur op 0 bij werk aan een document

Voor samenvatten, gegevens eruit halen en vragen over een tekst is 0 de juiste waarde, omdat het model dan steeds het meest waarschijnlijke woord kiest en minder verzint. Voor vrij schrijfwerk kun je 0,7 nemen met top-p op 0,9.

Per programma

Welk programma past bij jou?

LM Studio en Ollama hebben wij op het uitgegeven model getoetst. De andere twee routes niet. llama.cpp leest de instellingen uit het meegeleverde bestand; bij vLLM stuurt je programma de temperatuur zelf mee.

  1. LM Studio

    Een venster om in te typen, zonder opdrachtregel.Getoetst

    Laad het GGUF-bestand in LM Studio. LM Studio beheert bij deze route zelf de runtime- en samplinginstellingen. Stel deze daarom handmatig in.

    Bij het laden van het model:

    • Context Length: 8192
    • Laat de KV-cache op volledige precisie staan; gebruik geen KV-cache-quantisatie zoals Q8 of Q4. Offload KV Cache to GPU Memory en Unified KV Cache mogen aan blijven.

    Laad daarna het model en ga naar Settings. Stel daar in:

    • Temperature: 0
    • Repeat Penalty: 1.0
    • Top K Sampling: 0
    • Presence Penalty: uit
    • Top P Sampling: 1.0
    • Min P Sampling: 0.0

    Plak tot slot de volledige inhoud van systeemprompt.txt in het System Prompt-veld.

    Let opSla dit niet over. Met de standaardinstellingen meet je LM Studio en niet Walnoot.

    GetoetstDeze route hebben wij op 27 september op het uitgegeven model getoetst, met precies deze instellingen.

  2. Ollama

    Twee commando's en de instellingen staan meteen goed.Getoetst

    Bouw het model met het meegeleverde Modelfile en start het. Alle instellingen en de systeemprompt zitten daarin, dus je hoeft verder niets te zetten.

    ollama create walnoot-8b-instruct -f Modelfile
    ollama run walnoot-8b-instruct

    Let opRoep je Ollama vanuit een programma aan, gebruik dan zijn eigen route /api/chat. Op de OpenAI-route /v1/chat/completions negeert Ollama de instellingen uit het Modelfile en zet het de temperatuur stil op 1,0. Gebruik je die route toch, stuur dan zelf temperatuur 0 en top-p 1 mee.

    GetoetstDeze route hebben wij op 27 september op het uitgegeven model getoetst, met precies deze twee commando's. Wat hierboven over de twee ingangen staat, is een eigenschap van Ollama zelf en niet van het model.

  3. llama.cpp

    Een eigen server op je werkplek.Niet nagemeten

    De instellingen zitten in het bestand en worden daaruit gelezen, dus je start de server zonder samplervlaggen. Gebruik een uitgave van llama.cpp van oktober 2025 of later, want oudere versies kennen de rekenstap van dit model niet.

    llama-server \
      --model walnoot-8b-instruct-bf16.gguf \
      --ctx-size 8192 \
      --parallel 1 \
      --cache-type-k f16 \
      --cache-type-v f16

    Let opControleer na het starten wat de server aanhoudt: temperatuur 0, top-k 0, top-p 1,0, min-p 0,0 en herhalingsstraf 1,0. Stuurt een programma zijn eigen instellingen mee, dan winnen die altijd van de onze.

    GetoetstDeze route hebben wij niet op het uitgegeven model nagemeten. De vlaggen hierboven horen bij het meegeleverde bestand.

  4. vLLM, op een server

    Meerdere gebruikers tegelijk, in je eigen datacentrum of cloudomgeving.Niet zelf gedraaid

    Voor een server neem je niet het gguf-bestand maar de gewichten zelf, uit de gewone modelrepository. vLLM bedient meerdere verzoeken tegelijk. Reken op een kaart met minimaal 24 GB videogeheugen. Hoe je vLLM start hangt af van je opstelling; dit zijn de instellingen die je hem meegeeft.

    --model /pad/naar/walnoot \
      --served-model-name walnoot-8b-instruct \
      --generation-config auto \
      --max-model-len 8192 \
      --dtype bfloat16

    Let opvLLM haalt uit de meegeleverde bestanden geen temperatuur. Laat je programma daarom bij elk verzoek zelf temperatuur 0 en top-p 1 meesturen. Krijg je de melding dat de architectuur niet wordt ondersteund, dan is je vLLM te oud voor het basismodel waarop Walnoot is gebouwd.

    GetoetstDeze route hebben wij niet zelf gedraaid en wij hebben er geen meting onder liggen.

De systeemprompt

Waarom hoort er een systeemprompt bij?

Zonder systeemprompt bedenkt het model per gesprek een eigen rol en krijg je antwoorden in een toon die je niet hebt gevraagd. Wij leveren er een mee als systeemprompt.txt, in dezelfde repo als het gguf-bestand. In Ollama zit hij al in het Modelfile. In LM Studio plak je de inhoud in het System Prompt-veld.