GPAI-stukken
Modeldocumentatie voor afnemers
De velden uit het modeldocumentatieformulier die voor afnemers zijn bedoeld.
Document van 28 september 2026. Modelversie 1.0, uitgifte 28 september 2026.
Vrijwillig gepubliceerd door WAINUT; zie de verklaring in dit document.
Dit document is nog niet door een juridisch adviseur beoordeeld.
Citaten uit Engelstalige EU-documenten zijn eigen vertalingen.
Dit is de informatie voor afnemers uit het modeldocumentatieformulier (Model Documentation Form) voor Walnoot 8B Instruct; het formulier als geheel wordt op verzoek overhandigd aan het AI-bureau of aan de nationale bevoegde autoriteit.
Ingevuld door WAINUT met het modeldocumentatieformulier dat als bijlage hoort bij het transparantiehoofdstuk van de praktijkcode voor AI-modellen voor algemene doeleinden.
Status. Naar eigen meting, vastgelegd in de eigen interne beoordeling van WAINUT van haar plichten voor dit model, is WAINUT geen aanbieder van een AI-model voor algemene doeleinden in de zin van Verordening (EU) 2024/1689 (de AI-verordening), omdat de trainingsrekencapaciteit van haar wijziging ver onder de indicatieve drempel van de richtsnoeren van de Commissie blijft. Ook voor een aanbieder gelden de drie transparantiemaatregelen niet voor een model dat onder een vrije en opensourcelicentie zonder systeemrisico is uitgegeven: "In overeenstemming met artikel 53(2) AI-verordening zijn deze Maatregelen niet van toepassing op aanbieders van AI-modellen voor algemene doeleinden die zijn uitgegeven onder een vrije en opensourcelicentie die voldoet aan de in die bepaling gestelde voorwaarden, tenzij het model een AI-model voor algemene doeleinden met systeemrisico is." WAINUT vult het formulier vrijwillig in, om dezelfde reden als de uitgever van het basismodel dat deed.
Afspraken. Er komen geen interne paden, hostnamen, sleutels of opslagadressen in dit document voor. Er komt geen prompt-, record- of antwoordtekst uit de trainingsdata in dit document voor. Getallen zijn geschreven met het scheidingsteken voor duizendtallen van het Nederlandse gebruik. Nederlandse citaten worden woordelijk weergegeven. De Engelse versie van dit document zet achter zo'n citaat een eigen vertaling van WAINUT tussen vierkante haken; die vertaling is niet gezaghebbend.
Datum waarop dit document voor het laatst is bijgewerkt:
28 september 2026
Algemene informatie
Juridische naam van de aanbieder van het model:
Aanbieder: WAiNuT B.V. (statutaire naam in het handelsregister), handelend onder de naam WAINUT, een besloten vennootschap die bij de Nederlandse Kamer van Koophandel (KvK) is ingeschreven onder nummer 93560915, Rivium Westlaan 48, 2909LD Capelle aan den IJssel, Nederland. Contactpunt: support@walnoot.ai. Website: https://walnoot.ai. Vestigingsnummer: 000059092947.
Het contactpunt hierboven is het adres voor vragen over dit formulier, voor afnemers, voor rechthebbenden en voor klachten.
Naam van het model:
Walnoot 8B Instruct, versie 1.0. Verspreid als WAINUT/walnoot-8b-instruct. Publiek beschikbare versie die door deze documentatie wordt gedekt: versie 1.0, waarvan de laatste trainingsstap nabewerking met terugkoppeling (rejection fine-tuning, RFT) is, de naam die de modelkaart aan die stap geeft. Het is gewone gesuperviseerde fijnafstemming op de eigen antwoorden van het model die een beoordelingsstap had goedgekeurd; het gepubliceerde trainingsrecept zegt in zijn eigen kopje dat er geen referentiemodel en geen voorkeursparen zijn. Geen andere versie is publiek beschikbaar gemaakt.
Uitgiftedatum:
28 september 2026.
Datum van op de markt brengen in de Unie:
28 september 2026, dezelfde datum als de uitgiftedatum hierboven.
Afhankelijkheden van het model:
swiss-ai/Apertus-8B-2509, gepubliceerd door het Swiss AI Initiative onder de Apache License 2.0. Walnoot 8B Instruct is het resultaat van doortrainen, instructieafstemming en een nabewerkingsstap die op dat model zijn toegepast.
De uitgever van het basismodel hanteert daarnaast een apart beleid voor aanvaardbaar gebruik met een eigen versienummer, de Apertus LLM Acceptable Use Policy versie 1.0 van 1 september 2025, dat los van de licentie kan veranderen. Die naam, versie en datum komen uit de modelkaart van het basismodel zelf, in zijn veld voor toegang achter een poort, dat het kopje "Apertus LLM Acceptable Use Policy" draagt gevolgd door "(1.0 | September 1, 2025)". De eigen interne licentiebeoordeling van WAINUT pint hetzelfde beleid vast, maar op het 70B-leraarmodel en niet op het basismodel, zodat die beoordeling niet de bron voor deze vermelding is.
Een tweede model van dezelfde uitgever, swiss-ai/Apertus-70B-Instruct-2509 onder de Apache License 2.0, is als leraar gebruikt om de synthetische antwoorden in de instructiedata te maken. Het maakte de antwoorden, niet de instructiedata als geheel: de brondocumenten van een deel van die data komen uit het publieke corpus van een derde; de wetenschappelijke tak komt uit bestaande publieke annotatiedatasets. Het is geen afhankelijkheid van de uitgegeven gewichten.
Eigenschappen van het model
Architectuur van het model:
Een transformer met alleen een decoder, uit de Apertus-familie. Het configuratiebestand dat met de gewichten wordt meegeleverd geeft de architectuur op als ApertusForCausalLM met modeltype apertus. Het heeft 32 transformerlagen, een verborgen breedte van 4.096 en een tussenliggende breedte van 21.504. De aandacht is grouped-query attention, met 32 aandachtskoppen over 8 sleutelwaardekoppen en met normalisatie van query en key. De activatie is xIELU en de normalisatie is RMS-normalisatie met een epsilon van 1e-05. De positiecodering is rotatie van het llama3-type, met een basis van 12.000.000 en een schaalfactor van 8,0 over een oorspronkelijke context van 8.192, wat een architectuurcontext van 65.536 posities geeft. Het vocabulaire bevat 131.072 tokens, de gewichten zijn bfloat16 en de invoer- en uitvoerembeddings zijn niet gekoppeld.
Het model behoudt de architectuur van het basismodel swiss-ai/Apertus-8B-2509. De wijziging veranderde alleen gewichten. Dat is gelezen uit het configuratiebestand dat met de gewichten wordt meegeleverd en is niet afgeleid uit de trainingsmethode. Totaal aantal parameters 8,05 miljard. Contextlengte van de architectuur 65.536, waarvan 32.768 wordt aangeboden.
Invoermodaliteiten:
- [X] Tekst
- [ ] Afbeeldingen
- [ ] Audio
- [ ] Video
Indien anders, specificeer: geen.
Maximale invoeromvang: tekst, 32.768 tokens zoals aangeboden. De architectuur draagt 65.536.
Uitvoermodaliteiten:
- [X] Tekst
- [ ] Afbeeldingen
- [ ] Audio
- [ ] Video
Indien anders, specificeer: geen.
Maximale uitvoeromvang: N.v.t. WAINUT stelt geen maximale uitvoerlengte in. Wat een generatie begrenst is de aangeboden contextlengte van 32.768 tokens.
Totale omvang van het model (bereik):
- [ ] 1-500M
- [ ] 500M-5B
- [X] 5B-15B
- [ ] 15B-50B
- [ ] 50B-100B
- [ ] 100B-500B
- [ ] 500B-1T
- [ ] >1T
Wijzen van verspreiding en licenties
Verspreidingskanalen (voor afnemers):
Het model is voor afnemers beschikbaar als open gewichten op de modelpagina https://huggingface.co/WAINUT/walnoot-8b-instruct, met toegang op het niveau van de gewichten. Er is geen toegang achter een poort, geen aanvraagprocedure en geen API die WAINUT beheert. De publieke repository op GitHub, die het trainingsrecept, de evaluatie-instellingen en jobtekst, de herkomstdocumenten en de decontaminatiedocumenten draagt, is https://github.com/WAINUTAI/walnoot-8b-instruct.
Deze kolom van het formulier, de publieke samenvatting van de trainingsinhoud en het auteursrechtbeleid worden gepubliceerd in het Nederlands op https://walnoot.ai/transparantie en in het Engels op https://walnoot.ai/en/transparantie. Het contactpunt voor afnemers, voor rechthebbenden, voor klachten en voor vragen is support@walnoot.ai.
Waarom WAINUT dit formulier toch invult. Naar eigen meting, vastgelegd in de eigen interne beoordeling van WAINUT van haar plichten voor dit model, is WAINUT geen aanbieder van een AI-model voor algemene doeleinden in de zin van de AI-verordening. WAINUT publiceert deze documenten vrijwillig. WAINUT tekent de praktijkcode niet en volgt haar als leidraad.
Licentie (voor afnemers):
Een vrije en opensourcelicentie, de Apache License 2.0, waaronder het model openlijk kan worden gedeeld en afnemers het of gewijzigde versies ervan vrij kunnen benaderen, gebruiken, wijzigen en verder verspreiden. WAINUT legt geen aanvullende gebruiksbeperking op, geen niet-commercieel beding, geen beding dat alleen onderzoek toestaat en geen gebruikersdrempel.
Let op voor afnemers: de uitgever van het basismodel houdt een apart beleid voor aanvaardbaar gebruik aan met een eigen versienummer, dat los van de licentie kan veranderen. De eigen uitgifte van WAINUT draagt de kale Apache License 2.0 zonder addendum.
Aanvullende bestanddelen die beschikbaar worden gesteld:
| Bestanddeel | Hoe het te benaderen is | Licentie |
|---|---|---|
| Modelgewichten, safetensors en bf16-GGUF | modelpagina, https://huggingface.co/WAINUT/walnoot-8b-instruct | Apache License 2.0 |
| Modelkaart, met herkomst van de data, evaluatie en beperkingen | modelpagina, als hierboven | Apache License 2.0 |
| NOTICE met de bronvermeldingslijst per bron | modelpagina, als hierboven | als hierboven |
| Gewichtenmanifest met omvangen en hashes | modelpagina, als hierboven | als hierboven |
| Bestand met de systeemprompt, 1.527 bytes, met een gepinde sha256 | modelpagina, als hierboven | als hierboven |
| Trainingsrecept in drie delen, evaluatie-instellingen en jobtekst, herkomstdocumenten, decontaminatiedocumenten | publieke repository op GitHub, https://github.com/WAINUTAI/walnoot-8b-instruct | Apache License 2.0 |
| Trainingsdata | wordt niet beschikbaar gesteld. De modelkaart zegt: "Er wordt geen trainingsdata gepubliceerd. Wij publiceren de brondata niet; wat openligt is de herkomst per bron." | niet van toepassing |
Gebruik
Beleid voor aanvaardbaar gebruik:
WAINUT publiceert geen eigen beleid voor aanvaardbaar gebruik. De beperkingen en waarschuwingen die er zijn worden door de modelkaart gedragen. Maatregel 1.4 van het auteursrechthoofdstuk staat een vrije en opensource-uitgifte toe om gebruikers in de begeleidende documentatie te waarschuwen in plaats van in een beleid voor aanvaardbaar gebruik. De modelkaart draagt een zin die gebruikers wijst op het verbod op inbreukmakend gebruik.
Beoogde gebruiksdoelen:
Walnoot 8B Instruct is een taalmodel voor het Nederlands. Het is bedoeld als hulpmiddel bij werk met Nederlandse zakelijke en juridische teksten. Het is geen zoekmachine, geen feitenbasis en geen vervanging van professioneel oordeel. Het is getraind op Nederlandse instructietaken: een vraag beantwoorden tegen een aangeleverd document, gegevens uit een tekst halen, teksten classificeren en standaardteksten opstellen. Samenvatten hoort er ook bij, maar alleen als een eerste opzet die de gebruiker terugleest.
Beperkte en verboden gebruiksdoelen, ontleend aan de modelkaart:
- Het model mag niet worden gebruikt om persoonsgegevens uit documenten te verwijderen.
- Herschrijven naar eenvoudige taal werkt niet goed, samenvatten is zwak. De modelkaart legt in totaal vier genummerde beperkingen vast.
- Het model is niet op veiligheid getoetst in de zin van een gestructureerde red-teamronde. De modelkaart draagt dat punt bij haar resultaten en niet in de genummerde lijst: de biastaak in de publieke evaluatiebatterij raakt bias en is geen veiligheidsbeoordeling.
- Een gebruiker die het model inzet in een omgeving met persoonsgegevens blijft verwerkingsverantwoordelijke en kan zich niet op de metingen van WAINUT beroepen.
Soort en aard van de AI-systemen waarin het AI-model voor algemene doeleinden kan worden geïntegreerd:
Systemen met tekst erin en tekst eruit in de Nederlandse taal: assistenten en schrijfhulpen voor tekst van de overheid en van de administratie, gegevens uit een tekst halen en teksten classificeren, vragen beantwoorden over aangeleverde documenten. Samenvatten past alleen als een eerste opzet die de gebruiker terugleest. Voor herschrijven naar eenvoudige taal is het model niet geschikt. Het model is getraind met een vaste systeemprompt, die deel is van de integratie; de EuroEval-metingen draaiden zonder systeemprompt.
Het model is niet geschikt als onderdeel in een systeem dat tot doel heeft persoonsgegevens op te sporen of te verwijderen, omdat de modelkaart dat gebruik verbiedt. Het model is niet beoordeeld voor gebruik in een omgeving met een hoog risico onder de AI-verordening. Dit formulier doet geen uitspraak over zulk gebruik.
Technische middelen voor integratie van het model:
Gewichten in het safetensors-formaat, plus een omzetting naar bf16-GGUF voor runtimes die dat formaat lezen. De vaste systeemprompt wordt meegeleverd als een bestand van 1.527 bytes met een gepinde sha256; de modelkaart zegt dat die bij het model hoort, omdat het model zich zonder die prompt anders gedraagt dan waarop het is afgestemd. Neutrale generatie-instellingen die voor de meting zijn gebruikt: temperature 0.0, top_p 1.0, top_k 0, min_p 0.0, repeat_penalty 1.0.
Vereiste hardware:
WAINUT stelt geen hardwarevereiste voor inferentie. Het anker dat er wel is, is het gewichtenbestand van 16.106.727.320 bytes in bf16, dus wat nodig is, is een versneller met geheugen boven die omvang plus de overhead van de runtime, of een runtime die de gewichten kwantiseert terwijl zij ze laadt. Er worden twee verspreidingsartefacten gepubliceerd, het safetensors-bestand en een omzetting naar bf16-GGUF. WAINUT publiceert geen gekwantiseerde variant.
Vereiste software:
WAINUT stelt ook geen vereiste aan de software voor inferentie. Wat in plaats daarvan kan worden gegeven is de serveerstapel waarin de gepubliceerde metingen zijn gedaan, gelezen uit het eigen containerimage: vllm 0.24.0+cu129, transformers 5.14.1, torch 2.11.0+cu129, euroeval 17.6.0, xgrammar 0.2.3, flashinfer-python 0.6.12, python 3.12. Dat is een gemeten omgeving en geen vereiste. Het bf16-GGUF-bestand draait in elke runtime die dat formaat leest.
Voor de volledigheid het trainingsimage, dat evenmin een vereiste voor inferentie is: axolotl 0.17.0.dev0, transformers 5.9.0, torch 2.10.0+cu128, trl 1.5.1, peft 0.19.1, deepspeed 0.18.9, flash-attn 2.8.1, python 3.12. Dat image draagt een tweede python-boom met andere versies erin; de acht getallen hier komen uit de eerste boom.
Informatie over de data die voor training, toetsing en validatie is gebruikt
Soort data/modaliteit:
- [X] Tekst
- [ ] Afbeeldingen
- [ ] Audio
- [ ] Video
Herkomst van de data:
Kruis alles aan wat van toepassing is:
- [ ] Webcrawling
- [ ] Private, niet publiek beschikbare datasets verkregen van derden
- [ ] Gebruikersdata
- [X] Publiek beschikbare datasets
- [X] Data die op andere wijze is verzameld
- [X] Synthetische data die niet publiek toegankelijk is (wanneer rechtstreeks gemaakt door of namens de aanbieder)
- Indien anders, specificeer: geen.
Webcrawling is niet aangekruist omdat WAINUT geen eigen crawler heeft gedraaid. Materiaal dat van het web komt bereikt het model alleen via het publieke corpus van een derde en via het basismodel, dat in de eigen samenvatting van zijn uitgever wordt beschreven.
Er heeft ook niemand namens WAINUT gecrawld. Het materiaal kwam binnen via de open datasetrepository van de uitgever van het corpus en via publieke datasets. Dat is een verklaring van WAINUT zelf en het is de enige bron die daarvoor bestaat. Op beide archiefdomeinen achter de twee subsets die hieronder worden besproken staat geen robots.txt; dat is een gemeten feit over die domeinen en het is geen argument, omdat WAINUT daar niets heeft opgehaald. Het rechtenvoorbehoud dat telt is daarom het voorbehoud dat de uitgever van die dataset in acht moest nemen.
Methodes voor datacuratie:
- Filters op lengte en taal. Onderbouwende documenten moesten tussen 400 en 6.000 tekens liggen met een taalscore van ten minste 0,80.
- Filtering en ontdubbeling over het hele corpus: 806.473 documenten afgevallen over negentien redenen, samen 9.137.134.433 tekens, met het verwijderen van bijna-duplicaten als grootste reden met 377.787 afvallers, taal 141.535 afvallers.
- Uitsluiting van krantenarchieven.
- Uitsluiting van acht parquet-bestanden in een subset die een virusscanner had gemarkeerd.
- Licentietriage per bron, herleid tot primaire bronnen.
- Decontaminatie tegen de publieke evaluatiebatterij: voor de training over een eerdere bouw van het corpus en over de eigen bron van WAINUT die in het corpus de opmaak van tekst moet behouden; na de training over de instructiedata en de nabewerkingsdata die werkelijk zijn getraind. De bouw van het corpus waarop het model is doorgetraind, is als geheel niet opnieuw gemeten.
- Verwerping van 16.776 kandidaatpassages op persoonsgegevens, onder de letterlijke corpuspassages die voor documenttaken in de instructiedata waren klaargezet, waarbij een herhaling van de poort nul treffers gaf op 1.600 passages. De poort ging alleen over die kandidaatpassages; de rest van de trainingsdata is er niet doorheen gegaan.
Over de licentiewaarde van twee subsets van het corpus. Op de gepinde revisie waarop de voortgezette pretraining liep, dragen 26 van de 28 gebruikte subsets een expliciete licentiewaarde in de metadata per document en dragen twee archiefsubsets de waarde "unknown". Samen houden die twee 81.169 documenten, 117.179.121 tekens en 37.011.724 geschatte tokens: 0,43 procent van de geschatte tokens en 0,41 procent van de tekens over alle 28 subsets. De waarde staat in het eigen herkomstmanifest van WAINUT. Het script dat het corpus bouwde, schreef haar daar vanuit de licentiekolom per document in de parquetbestanden van het corpus op die revisie; de statistiekbestanden per subset die de uitgever in de datasetrepository meelevert, dragen op die revisie dezelfde waarde. Op 7 september 2026, na die revisie, zette de uitgever beide subsets op "public-domain". WAINUT heeft niet kunnen vaststellen waar de waarde vandaan kwam; in de beschrijving van die commit schrijft de uitgever dat de waarde eerder een gat in de metadata lijkt dan een bewust gekozen waarde. Drie feiten wegen tegen een lezing van die waarde als beperking. De uitgever van het corpus rekent beide subsets in zijn eigen verzamelingsmetadata tot het publieke domein. Beide archieven plaatsen hun open data onder CC0. En wat is gebruikt is tekst uit tekenherkenning en geen beeldmateriaal, zodat er geen apart recht op een scan of een foto in het spel komt. Beide subsets blijven in de trainingsdata, omdat het auteursrechtbeleid van WAINUT op bronniveau werkt en het corpus daar als één bron onder CC BY 4.0 staat. Het relaas met de bronnen waaruit is geciteerd staat in de publieke samenvatting van de trainingsinhoud op https://walnoot.ai/transparantie.
Erkenning van de rekencapaciteit, woordelijk vereist in elke publicatie over dit model
Verplichte bronvermelding (Engels, woordelijk):
"We acknowledge EuroHPC JU for awarding the project ID EHPC-AIF-2026PG01-984 access to MareNostrum5 ACC hosted by BSC, Spain"