GPAI-stukken
Publieke samenvatting van de trainingsinhoud
Welke data in onze eigen trainingsstap ging, per bron en per soort.
Document van 28 september 2026. Modelversie 1.0, uitgifte 28 september 2026.
Vrijwillig gepubliceerd door WAINUT; zie de verklaring in dit document.
Dit document is nog niet door een juridisch adviseur beoordeeld.
Citaten uit Engelstalige EU-documenten zijn eigen vertalingen.
Ingevuld door WAINUT met het sjabloon dat als bijlage hoort bij de toelichtende mededeling van de Commissie over de publieke samenvatting van de trainingsinhoud voor AI-modellen voor algemene doeleinden die artikel 53, lid 1, onder d, van Verordening (EU) 2024/1689 (de AI-verordening) verplicht stelt.
Status. Naar eigen beoordeling is WAINUT geen aanbieder van een AI-model voor algemene doeleinden in de zin van de AI-verordening, omdat de trainingsrekencapaciteit van haar wijziging ver onder de indicatieve drempel van de richtsnoeren van de Commissie blijft. Die beoordeling staat uitgewerkt in de interne vastlegging van WAINUT. WAINUT vult dit sjabloon toch vrijwillig in, omdat openheid over de herkomst van de data de kern van dit project is. WAINUT heeft de praktijkcode voor AI-modellen voor algemene doeleinden niet getekend. Zij volgt die code als leidraad zonder haar te tekenen.
Afspraken. De veldnamen hieronder zijn woordelijk uit het sjabloon overgenomen. Er komen geen interne paden, hostnamen, sleutels of opslagadressen in dit document voor. Er komt geen prompt-, record- of antwoordtekst uit de trainingsdata in dit document voor. Nederlandse citaten worden woordelijk weergegeven. De Engelse versie van dit document zet achter zo'n citaat een eigen vertaling van WAINUT tussen vierkante haken; die vertaling is niet gezaghebbend. Citaten uit Engelstalige stukken van derden staan hier woordelijk in het Engels; waar een Nederlandse weergave tussen vierkante haken volgt, is die een eigen vertaling van WAINUT en is zij niet gezaghebbend.
Versie van de samenvatting:
Versie 1.0, gepubliceerd met het model op 28 september 2026. Er is geen eerdere versie van deze samenvatting gepubliceerd, dus er worden geen verwijzingen naar eerdere versies gegeven.
Laatst bijgewerkt:
28/09/26
1. Algemene informatie
1.1 Identificatie van de aanbieder
Naam en contactgegevens van de aanbieder:
Aanbieder: WAiNuT B.V. (statutaire naam in het handelsregister), handelend onder de naam WAINUT, een besloten vennootschap die bij de Nederlandse Kamer van Koophandel (KvK) is ingeschreven onder nummer 93560915, Rivium Westlaan 48, 2909LD Capelle aan den IJssel, Nederland. Contactpunt: support@walnoot.ai. Website: https://walnoot.ai.
Waar deze gegevens vandaan komen: de statutaire naam, de rechtsvorm, het nummer bij de Kamer van Koophandel en het adres zijn de inschrijving van de onderneming in het Nederlandse handelsregister; de statutaire naam staat hierboven in de spelling van dat register. Het e-mailadres is het contactpunt van WAINUT voor rechthebbenden, voor afnemers, voor klachten en voor vragen. Er staan hier geen telefoonnummer en geen contactpersoon met naam: het contactpunt hierboven is het geheel.
Naam en contactgegevens van de gemachtigde vertegenwoordiger:
N.v.t. WAINUT is in Nederland gevestigd, dus de verplichting in artikel 54 van de AI-verordening geldt niet. Punt (48) van de richtsnoeren van de Commissie zegt dat "aanbieders die in een derde land gevestigd of gelegen zijn, een in de Unie gevestigde gemachtigde vertegenwoordiger moeten aanwijzen voordat zij een AI-model voor algemene doeleinden op de markt van de Unie brengen (artikel 54 van de AI-verordening)".
1.2 Identificatie van het model
Modelnaam of modelnamen met versie:
Walnoot 8B Instruct, versie 1.0, verspreid als WAINUT/walnoot-8b-instruct op https://huggingface.co/WAINUT/walnoot-8b-instruct. De laatste trainingsstap van het uitgebrachte model is nabewerking met terugkoppeling (rejection fine-tuning, RFT), de naam die de modelkaart aan die stap geeft. Het is gewone gesuperviseerde fijnafstemming op eigen antwoorden van het model die een beoordelingsstap had goedgekeurd. Licentie: Apache License 2.0. Totaal aantal parameters: 8,05 miljard. Talen: Nederlands en Engels. Geserveerde contextlengte 32.768. De modelkaart die bij de gewichten is gepubliceerd, is de gezaghebbende publieke beschrijving van het model.
Afhankelijkheden van het model:
Walnoot 8B Instruct is het resultaat van een wijziging, waaronder fijnafstemming, van swiss-ai/Apertus-8B-2509, een open Europees basismodel dat de Swiss AI Initiative onder de Apache License 2.0 heeft gepubliceerd. De uitgever van het basismodel heeft een eigen publieke samenvatting van de trainingsinhoud gepubliceerd, die de data dekt waarmee het basismodel is getraind. Die samenvatting beschrijft de trainingsdata van het basismodel, deze samenvatting niet.
Die samenvatting is gepubliceerd op https://huggingface.co/swiss-ai/Apertus-70B-2509/blob/main/Apertus_EU_Public_Summary.pdf. De modelkaart van het basismodel verwijst ernaar onder het kopje "EU AI Act Transparency Documentation and Code of Practice". Zij draagt versie V1 met een laatste bijwerking van 1 september 2025 en zij noemt Apertus-8B, Apertus-70B, Apertus-8B-Instruct en Apertus-70B-Instruct als de modellen die zij dekt. Dezelfde uitgever publiceert een byte-identieke kopie van dat bestand in zijn eigen publieke juridische repository.
Een tweede model van dezelfde uitgever, swiss-ai/Apertus-70B-Instruct-2509, is als leraar gebruikt om synthetische instructiedata te genereren. Dat wordt gemeld onder paragraaf 2.5 van deze samenvatting en niet hier, omdat Walnoot 8B Instruct geen wijziging van dat model is.
Datum waarop het model op de markt van de Unie is gebracht:
28/09/26. Walnoot 8B Instruct wordt op 28 september 2026 uitgegeven en wordt op diezelfde datum op de markt van de Unie gebracht. De modelkaart die bij de gewichten is gepubliceerd, draagt die datum.
1.3 Modaliteiten, totale omvang van de trainingsdata en andere kenmerken
Het sjabloon leidt deze paragraaf als volgt in: "Deze paragraaf vraagt om algemene informatie over de totale trainingsdata na de voorbewerking en voor de training van het model." De cijfers hieronder gaan alleen over de eigen wijziging van WAINUT.
| Modaliteit | Omvang van de trainingsdata | Soorten inhoud |
|---|---|---|
| [X] Tekst | [X] 1 miljard tot 10 biljoen tokens. Of geef de omvang bij benadering in een andere maateenheid: ongeveer 4,07 miljard tokens voortgezette pretraining, 3.816 stappen hoofdfase plus 64 stappen afkoelfase van 1.048.576 tokens per stap, afgeleid uit het aantal stappen en niet geteld met de tokenizer, plus 40.957.043 gemeten tokens in 51.875 instructierecords, plus 1.177.826 gemeten tokens in 1.157 records in de nabewerkingslaag. | Nederlandse overheids- en bestuursteksten, rechterlijke uitspraken, archiefmateriaal, encyclopedische en algemene webtekst die onder open licenties is vrijgegeven, Engelse tekst, broncode, synthetische Nederlandse instructiedata, synthetische chatparen uit een eigen bron van WAINUT om de opmaak van tekst te behouden (gemaakt met hetzelfde leraarmodel als de instructiedata, ongeveer 2,0 procent van de tekens van de voortgezette pretraining), bestaande publieke wetenschappelijke annotatiedatasets in het Engels. |
| [ ] Beeld | niet van toepassing | geen |
| [ ] Audio | niet van toepassing | geen |
| [ ] Video | niet van toepassing | geen |
| [ ] Overig | niet van toepassing | geen |
Het tokencijfer voor de voortgezette pretraining is afgeleid uit het aantal optimaliseringsstappen. Het uitgebrachte model rust op het bewaarpunt bij stap 3.816 van de hoofdfase, dat is 4.001.366.016 tokens, gevolgd door een aparte afkoelfase van 64 stappen op hetzelfde corpus, dat is 67.108.864 tokens. Samen is dat 4.068.474.880 tokens. Een stap is 1.048.576 tokens, het product van micro batch 8, accumulatie 4, 8 ranks en sequentielengte 4.096. Het cijfer is geen telling met de tokenizer. De pretrainingrun liep door tot stap 7.632, ongeveer 8 miljard tokens, in lijn met het tokenbudget van de corpusbouw. De beste uitkomst lag bij stap 3.816 en het uitgebrachte model rust op dat bewaarpunt. De omvang van het corpus waaruit die tokens zijn getrokken, is een schatting die uit tellingen van tekens is afgeleid en geen meting met de tokenizer. De corpusbouw ging uit van een tokenbudget van 8.000.000.000 met een oversamplefactor van 1,10; de schatting per subset over 28 subsets telt op tot 8.615.679.298 geschatte tokens.
De twee andere cijfers zijn metingen met de tokenizer van het uitgebrachte model, gedaan op 23 september 2026. De instructiedata die is getraind, bevat 51.875 records en 40.957.043 tokens. De nabewerkingslaag bevat 1.157 records en 1.177.826 tokens. Beide tellingen dekken de tekst van elke beurt in elk record, de systeembeurt inbegrepen. Geteld zoals de twee bestanden onder het chatsjabloon van het uitgebrachte model renderen, zodat ook de rolmarkeringen en het begin-van-reekstoken worden meegeteld, zijn de cijfers 41.299.228 tokens en 1.185.925 tokens. De herhaalde systeembeurt is goed voor 13.364.632 tokens van het eerste cijfer en voor 488.254 tokens van het tweede; zonder haar zijn de tellingen 27.592.411 tokens en 689.572 tokens.
Laatste datum van verwerving of verzameling van data voor de training van het model:
09/2026. Dat is de laatste verwerving van data voor deze wijziging. De wetenschappelijke tak van de instructiedata is in één verwerving gelezen in 09/2026 en de laatste eigen generatieronde van WAINUT is gedraaid in 09/2026. Voor de voortgezette pretraining is het Nederlandse corpus van een derde eerder gelezen, in 07/2026.
Dat corpus is gelezen op revisie 1e17d21afa6518939523fbdcc1fbb3167b671725, met lastModified 2026-05-04T12:42:07Z.
In de code die de instructiedata streamde, stond geen expliciete revisiepin. De voortgezette pretraining liep op de gepinde revisie hierboven. Na die revisie kreeg de repository nog twee commits. De commit van 24 augustus 2026 wijzigde alleen de README. De commit van 7 september 2026 wijzigde de licentiewaarde van de twee archiefsubsets van het Noord-Hollands Archief en Het Utrechts Archief, in hun twee statistiekbestanden en in vijf parquetbestanden; volgens de beschrijving van die commit veranderde in die parquetbestanden alleen de licentiekolom. De andere 26 gebruikte subsets zijn byte-gelijk op de revisie hierboven en op de kop van de repository zoals die op 27 september 2026 stond. Een expliciete pin toevoegen staat in de interne vastlegging van WAINUT als een aanbeveling.
Per bronset niet vastgelegd voor de veertien publieke wetenschappelijke annotatiedatasets. Zij zijn niet een voor een binnengekomen. De hele wetenschappelijke tak is in één verwerving van een instructiemix van een derde gelezen, op één gepinde revisie. Elk record van die tak in de instructiedata die is getraind, draagt die pin als zijn vastgelegde bron: allenai/SciRIFF via ai2-adapt-dev/tulu_v3.9_sciriff_10k in swiss-ai/apertus-sft-mixture op revisie 51998bcb2f80bc3ad1779bdfe5ebdc4d4df9f624. Die verwerving vond plaats in 09/2026. De gepinde revisie zelf is voor het laatst gewijzigd op 19 september 2025.
Het model wordt na de uitgifte niet doorlopend op nieuwe of dynamische data getraind.
Beschrijving van de taalkundige kenmerken van de totale trainingsdata:
Nederlands is de doeltaal van de wijziging. Nederlands is een officiële taal van de Unie.
Het corpus van de voortgezette pretraining is gebouwd op een tokenbudgetmix van 70 procent Nederlands, 20 procent Engels, 10 procent broncode, met een oversamplefactor van 1,10 en tekens per token van 3,166 voor Nederlands, 3,761 voor Engels en 3,599 voor code. Tijdens de corpusbouw is een taalfilter toegepast: 141.535 documenten zijn op taal afgevallen. Documenten die de instructiedata moesten verankeren, moesten een taalscore van ten minste 0,80 halen, binnen een lengtevenster van 400 tot 6.000 tekens.
De instructielaag is Nederlands. De wetenschappelijke tak van de instructiedata is Engels.
Andere relevante kenmerken van de totale trainingsdata:
- Er is geen filter op persoonsgegevens over de trainingsdata als geheel gelopen. De modelkaart zegt dat onomwonden: "Persoonsgegevens. De trainingsdata is als geheel niet door een PII-filter gegaan." Wat wel bestaat, is een meting achteraf op de nabewerkingslaag, gemeld onder paragraaf 3.2.
- Krantenarchieven zijn uitgesloten, op grond van kwaliteit en niet op grond van recht. De modelkaart zegt: "Krantenarchieven zijn uitgesloten. De grond is kwaliteit en geen recht: het gaat om historisch materiaal met een verouderde spelling en veel ruis uit tekstherkenning."
- Acht parquetbestanden die een virusscanner in één bronsubset had gemarkeerd, zijn uitgesloten via een expliciete uitsluitlijst, een eigen aanscherping boven de bron.
- Filtering en ontdubbeling. Over het hele corpus zijn 806.473 documenten afgevallen op negentien gronden, samen 9.137.134.433 tekens, waarbij het weghalen van bijna-dubbelen met 377.787 afvallers de grootste enkele grond is.
- Decontaminatie tegen de publieke evaluatiebatterij is in drie metingen gedraaid. Twee liepen voor de training, over een eerdere bouw van het corpus en over de eigen bron van WAINUT die in het corpus de opmaak van tekst moet behouden en die uit synthetische chatparen bestaat. De derde liep na de training, over de instructiedata en de nabewerkingsdata die werkelijk zijn getraind. De bouw van het corpus waarop het model is doorgetraind, is als geheel niet opnieuw gemeten. Zie paragraaf 3.3.
- Er wordt geen trainingsdata gepubliceerd. De modelkaart zegt: "Er wordt geen trainingsdata gepubliceerd. Wij publiceren de brondata niet; wat openligt is de herkomst per bron." Wat wel wordt gepubliceerd, is de herkomst per bron.
- Op de gebruikte revisie dragen twee van de 28 corpussubsets in de metadata per document de licentiewaarde "unknown". Samen zijn die twee 81.169 documenten, 117.179.121 tekens en 37.011.724 geschatte tokens: 0,43 procent van de geschatte tokens en 0,41 procent van de tekens over alle 28 subsets. Op 7 september 2026, na die revisie, zette de uitgever beide op "public-domain". Waar die waarde op rust, wat de bronnen zelf zeggen en wat WAINUT heeft geconcludeerd, staat in paragraaf 2.1 onder "Aanvullende opmerkingen".
Aanvullende opmerkingen (facultatief):
De momentopname van de bronrepository van de derde bevat 8.320 bestanden over 32 subsets en 948,14 GB. De interne vastlegging van WAINUT over die momentopname draagt geen telling van de gebruikte subsets. Hoeveel er zijn gebruikt, staat hieronder in paragraaf 2.1, op het gezag van de modelkaart.
Voor de training ging het corpus door een eigen decontaminatiecontrole. Die controle gaat niet over de testsets van de evaluatie. Zij gaat over een retentieset die WAINUT apart houdt om te meten of het model kennis verliest tijdens de voortgezette pretraining. De controle kwam erdoor met één aanpassing. Eén poort in die controle gaf een gezakte uitslag; op de retentieset raakte de controle 2.754 van de 6.244 records, 44,11 procent. De modelkaart publiceert die uitslag. Die uitslag is niet herroepen.
2. Lijst van databronnen
2.1 Publiek beschikbare datasets
Hebt u publiek beschikbare datasets gebruikt om het model te trainen?
- [X] Ja
- [ ] Nee
Gedekte modaliteiten:
- [X] Tekst
- [ ] Beeld
- [ ] Audio
- [ ] Video
Lijst van grote publiek beschikbare datasets:
GPT-NL Public Corpus, repositoryaanduiding GPT-NL/GPT-NL_Public_Corpus, uitgebracht door het GPT-NL-consortium onder CC BY 4.0. Gepinde revisie 1e17d21afa6518939523fbdcc1fbb3167b671725 (lastModified 2026-05-04T12:42:07Z). Het corpus is publiek en niet achter een poort.
Dit is de enige dataset die de drempel van het sjabloon voor "groot" haalt. Het sjabloon omschrijft die drempel zo: "Een dataset geldt als groot als de totale omvang van de data voor een van de modaliteiten in die dataset meer is dan 3% van de omvang van alle publiek beschikbare datasets die voor die modaliteit bij de training zijn gebruikt."
Wat eruit is gehaald en hoe het is geselecteerd: 28 van de 32 subsets zijn gebruikt. Na de filtering bevat het gebouwde corpus 116 shards, 3.448.292 trainingsdocumenten, 29.240.230.710 tekens, plus 5.451 validatiedocumenten. Krantenarchieven zijn uitgesloten. Acht parquetbestanden in één subset die een virusscanner had gemarkeerd, zijn uitgesloten. De subsets dekken Nederlandse overheids- en bestuurspublicaties, rechterlijke uitspraken, archiefcollecties, encyclopedische en algemene webtekst die onder open licenties is vrijgegeven, Engelse tekst en opensourcecode. De grootste Nederlandstalige subset in het herkomstmanifest bevat 576.454 documenten en 8.563.896.056 tekens onder CC BY.
De repository staat op https://huggingface.co/datasets/GPT-NL/GPT-NL_Public_Corpus.
Naast het corpus zit in de voortgezette pretraining een kleine eigen bron van WAINUT, ongeveer 2,0 procent van de tekens. Het zijn synthetische chatparen, gemaakt met hetzelfde leraarmodel als de instructiedata, om het model de opmaak van tekst te laten behouden. Die bron bevat 311.105 records met 585.781.778 tekens, 9,0 procent van de documenten van het gebouwde corpus. De cijfers van het gebouwde corpus hierboven tellen haar mee.
Algemene beschrijving van andere publiek beschikbare datasets die hierboven niet zijn genoemd:
Veertien publieke wetenschappelijke annotatiedatasets zijn gebruikt om de wetenschappelijke tak van de instructiedata te bouwen. Dertien daarvan zitten in de data die is getraind; de veertiende, AnatEM, wordt hieronder onder punt 2 toegelicht. Voor elk van de vier punten waar het sjabloon om vraagt:
- Modaliteiten: alleen tekst.
- Aard van de inhoud: biomedische en wetenschappelijke annotatiedata, waaronder vragen beantwoorden, entiteitsannotatie, samenvattingsdoelen en tekst over geschiktheid voor klinische proeven. De licentie van elk ervan is uit een primaire bron vastgesteld. Zij zijn, met hun licentie: BioASQ (CC BY 2.5), MedMentions (CC0 1.0), Chia (CC BY 4.0), SciTLDR (Apache 2.0), QASA (MIT), COVID-QA (Apache 2.0), JNLPBA (CC BY 3.0), NCBI Disease (publiek domein), AnatEM (CC BY-SA 3.0), Qasper (CC BY 4.0), PubMedQA (MIT), MatSci Text Corpus (MIT), NLM-Chem (CC0 1.0), LINNAEUS (BSD). Dat zijn veertien bronsets, waaruit zestien taken zijn getrokken. AnatEM is de ene bronset met een share-alikeplicht in die tak. De eigen toets van WAINUT op die tak legt vast dat zij 168 records levert en stelt haar licentie vast op CC BY-SA 3.0 en niet op de CC BY die de tabel van het artikel claimt. Die 168 records halen de instructiedata van 51.875 records die is getraind niet. De tak is geleverd als 2.659 records over negen licentierijen, waarvan er één de rij met CC BY-SA 3.0 en 168 records is. Binnen de instructiedata die is getraind bevat de tak 2.491 records, dus die 2.659 records zonder de rij met CC BY-SA 3.0. De acht andere rijen komen record voor record overeen: CC BY 2.5 812, Apache 2.0 516, MIT 412, CC0 1.0 281, CC BY 4.0 279, publiek domein 171, CC BY 3.0 16 en BSD 4, samen 2.491. Een telling over het licentieveld van die instructiedata, gedaan op 23 september 2026, geeft tien rijen en geen share-alikerij daaronder. Op deze uitgave rust dus geen share-alikeplicht. De lijst met naamsvermeldingen die bij de gewichten is gepubliceerd, noemt dertien annotatiesets en noemt AnatEM terecht niet.
- Taalkundige kenmerken: Engels.
- Begin- en einddatum van de verzameling bij benadering: Per bronset niet vastgelegd. De tak als geheel is in één verwerving gelezen in 09/2026, zoals hierboven is vermeld onder "Laatste datum van verwerving of verzameling van data voor de training van het model".
Aanvullende opmerkingen (facultatief):
Regel voor de licentiekeuze. Per externe bron is de licentie herleid tot een primaire bron, dus tot het licentiebestand of de datasetkaart van de bronset zelf, of tot de bijlage van het artikel van die set. De tiende rij van de triage is de eigen identiteitslaag van WAINUT, die uit geen enkele externe bron komt. De modelkaart zegt: "Per externe bron is de licentie herleid uit een primaire bron, dus uit het licentiebestand of de datasetkaart van die bron zelf." Van 9.722 kandidaatrecords kwamen er 4.421 door die licentiepoort. Na alle latere kwaliteitspoorten bleven er 2.659 over. De aanscherping van de regel bracht het cijfer bij de licentiepoort van 4.702 naar 4.421 en liet drie bronsets met samen 281 records vallen. Een van die drie is het geval dat de regel uitlokte: geen primaire bron staat commercieel gebruik toe, terwijl de meest specifieke beschikbare bron, de tussenliggende bron waaruit het corpus die set zelf betrekt, een niet-commerciële licentie noemt waar de eigen tabel van het artikel CC BY claimde. Bij de licentiepoort als geheel viel meer weg dan die drie: vijf bronsets met naam, plus de zestien bronsets waarvoor de tabel van het artikel helemaal geen licentie vastlegt zodat er geen primaire bron is gezocht.
Die zestien bevatten samen 4.749 records: CRAFT-Chem 305, SciCite 305, HealthVer 296, Scientific Papers 564, ACL ARC 293, LitCOVID 284, ChemSum 283, Drug Combinations 283, Lay Summarisation 542, ChemProt 531, EBM-NLP PICO 251, CHEMDNER 245, CovidFact 234, BioCreative V CDR 143, GNormPlus 96 en SciERC 94.
Licentiesamenstelling van de instructiemix die werkelijk is getraind. De mix onder het uitgebrachte model bevat 51.875 records. De licentietriage op bronniveau geeft tien rijen: 49.134 records onder Apache-2.0-clean, 812 onder CC BY 2.5, 516 onder Apache 2.0, 412 onder MIT, 281 onder CC0 1.0, 279 onder CC BY 4.0, 250 in eigendom van WAINUT, 171 in het publieke domein, 16 onder CC BY 3.0 en 4 onder BSD. Apache-2.0-clean is geen licentie van een externe bron maar een afgeleid label van WAINUT voor het gegenereerde materiaal van de mix. De records die op een letterlijke passage uit het corpus steunen dragen dat label ook; de passage zelf valt onder CC BY 4.0, de licentie van het corpus. Het corpus staat met zijn bronvermelding in het NOTICE-bestand. In de mix komt geen niet-commerciële licentie voor, geen share-alikelicentie, geen GPL en geen licentie alleen voor onderzoek.
Twee corpussubsets met de licentiewaarde "unknown", hier te goeder trouw gemeld. Op de gebruikte revisie dragen twee van de 28 corpussubsets die waarde in de metadata per document: een subset van 7.995 documenten uit het Noord-Hollands Archief en een subset van 73.174 documenten uit Het Utrechts Archief, twee Nederlandse regionale archieven. Samen zijn zij 81.169 documenten, 117.179.121 tekens en 37.011.724 geschatte tokens: 0,43 procent van de geschatte tokens en 0,41 procent van de tekens over alle 28 subsets. De andere 26 subsets dragen elk een expliciete licentiewaarde. Het eigen auteursrechtbeleid van WAINUT eist dat een waarde "unknown" de pijplijn stillegt voor onderzoek. Dat onderzoek is op 22 september 2026 uitgevoerd. De uitkomst volgt hieronder.
Waar de waarde staat en waar WAINUT haar vandaan heeft. De waarde staat in het eigen herkomstmanifest van WAINUT, het bestand herkomst/provenance-manifest.json dat naar de publieke repository op GitHub gaat, https://github.com/WAINUTAI/walnoot-8b-instruct, in de map herkomst, op precies twee van de 28 subsets. WAINUT heeft haar niet zelf toegekend: het script dat het corpus bouwde, schreef haar in het manifest vanuit de licentiekolom per document in de parquetbestanden van het corpus, waar de waarde op de gebruikte revisie voor deze twee subsets "unknown" leest. De statistiekbestanden per subset die de uitgever van het corpus in de datasetrepository meelevert, dragen op die revisie dezelfde waarde voor deze twee subsets en "Public domain" voor de naburige archiefsubsets. Op 7 september 2026 om 11:34 UTC, na die revisie, zette de uitgever beide subsets in een nieuwe commit op "public-domain", revisie 1b4408c2e78fced22626123c1e8ad840d5183f12. Die commit wijzigde de twee statistiekbestanden en volgens zijn beschrijving de licentiekolom van elk document in beide subsets. De datasetkaart van het corpus draagt "unknown" niet onder de waarden die zij voor dat veld documenteert; de waarden die zij noemt, zijn "public domain/CC-0/CC-by".
Wat de uitgever van het corpus over deze twee subsets zegt. In de collectiemetadata van het corpus, een bestand van 452.087 bytes met sha256 46fa6d006f80cd482d8a950bb1c26c55d86d48463832457a29b4cb7842ffc88e zoals opgehaald op 22 september 2026, dragen beide archieven woordelijk "license": {"type": ["public-domain"]}. De rijtellingen in dat bestand zijn gelijk aan de eigen momentopname van WAINUT, dus dit zijn aantoonbaar dezelfde twee subsets. Dat bestand kan veranderen en daarom staan hier zijn omvang, zijn controlegetal en de datum van ophalen. De uitgever beschrijft het Utrechtse deel als collecties ouder dan 100 jaar, met een temporele dekking van voor 1950 van 1,0. Het Noord-Hollandse deel beschrijft hij als raadsnotulen van één gemeente, rond 2015 gedigitaliseerd met optische tekenherkenning.
Wat de twee archieven zelf zeggen. Beide archieven publiceren hun open data onder CC0. De pagina met de open data van het Noord-Hollands Archief, op 22 september 2026 vers opgehaald zonder dat per pagina een ophaaldatum is vastgelegd, zegt woordelijk: "Personen en organisaties kunnen de open data van het Noord-Hollands Archief vrijelijk gebruiken, al dan niet voor commerciële doeleinden. Er geldt de licentie CC0 (no rights reserved), dat wil zeggen iedereen mag de gegevens vrij gebruiken zonder toestemming te vragen. Bronvermelding is niet nodig, maar wordt wel op prijs gesteld." De pagina met de open data van Het Utrechts Archief, op dezelfde manier vers opgehaald en eveneens zonder dat per pagina een ophaaldatum is vastgelegd, zegt woordelijk: "Personen en organisaties kunnen de open data vrijelijk gebruiken, al dan niet voor commerciële doeleinden. Wel zijn er enkele spelregels. Voor de nu vrijgegeven gegevens geldt de licentie CC0." Bij die twee citaten hoort één kanttekening: zij worden gedaan over de open data van de archieven, dus over hun archiefinventarissen en niet met zoveel woorden over de tekst van de documenten zelf.
Wat WAINUT niet heeft kunnen vaststellen. Waarom de waarde op de gebruikte revisie "unknown" leest, wordt op die revisie nergens uitgelegd. In de beschrijving van zijn commit van 7 september 2026 schrijft de uitgever dat de waarde eerder een gat in de metadata lijkt dan een bewust gekozen waarde. Of de uitgever de waarde van het archief heeft overgenomen of haar zelf heeft ingevuld bij gebrek aan een veld, staat niet op de datasetkaart en niet in de samenvatting van het corpusartikel. Drie feiten wegen tegen de lezing dat die waarde een beperking op hergebruik is. De uitgever telt beide collecties in zijn eigen collectiemetadata als publiek domein. Beide archieven publiceren hun open data onder CC0 en verbieden hergebruik van dit materiaal nergens. En wat is gebruikt, is tekst uit tekenherkenning en geen beeldmateriaal, zodat er geen apart recht op een scan of een foto in het spel komt: het Noord-Hollandse deel bestaat uit raadsnotulen van één gemeente, rond 2015 gedigitaliseerd met tekenherkenning; het Utrechtse deel is op het eigen cijfer van de uitgever volledig materiaal van voor 1950. WAINUT heeft de twee subsets niet document voor document bij de bron doorgelopen.
De uitkomst. Beide subsets blijven in de trainingsdata. Het auteursrechtbeleid van WAINUT werkt op het niveau van de bron; op dat niveau is het corpus één bron onder CC BY 4.0: de uitgever noemt die licentie in het label van de repository, op de datasetkaart en in het corpusartikel. De uitgever telt beide subsets in zijn eigen collectiemetadata als publiek domein. De twee delen verwijderen kan sowieso niet meer, omdat het model is getraind en niet is vastgelegd welke documenten zijn getrokken, zodat er geen lijst van de gebruikte documenten bestaat. WAINUT meldt dat hier liever dan het te laten vinden.
2.2 Private, niet publiek beschikbare datasets verkregen van derden
2.2.1 Datasets waarvoor rechthebbenden of hun vertegenwoordigers een commerciële licentie hebben verleend
Hebt u datasets waarvoor rechthebbenden of hun vertegenwoordigers een commerciële licentie hebben verleend, gebruikt om het model te trainen?
- [ ] Ja
- [X] Nee
Gedekte modaliteiten: geen.
2.2.2 Private datasets verkregen van andere derden
Hebt u private datasets van andere derden gebruikt om het model te trainen?
- [ ] Ja
- [X] Nee
Gedekte modaliteiten: geen.
Noem, voor zover publiek bekend, de private datasets die van andere derden zijn verkregen:
N.v.t.
Algemene beschrijving van niet publiek bekende private datasets verkregen van derden:
N.v.t.
Aanvullende opmerkingen (facultatief):
Geen.
2.3 Data die met crawlers en scrapers uit onlinebronnen is gehaald
Zijn er crawlers gebruikt door de aanbieder of namens de aanbieder?
- [ ] Ja
- [X] Nee
WAINUT heeft voor deze wijziging geen webcrawler gedraaid en niemand heeft namens WAINUT gecrawld. Al het materiaal van derden is binnengekomen via gepubliceerde datasets, gemeld onder paragraaf 2.1.
Zo ja, noem de naam of namen en de identificatie van de crawlers:
N.v.t.
Doeleinden van de crawlers:
N.v.t.
Algemene beschrijving van het gedrag van de crawlers:
N.v.t. voor de eigen pijplijn van WAINUT. Voor de volledigheid: het webgebonden deel van het corpus van de derde bereikt WAINUT alleen via dat corpus. De samensteller ervan beperkte zijn webextract tot pagina's met een expliciete CC0- of CC BY-verklaring in de HTML, waarbij sites die robots.txt blokkeert zijn uitgesloten. WAINUT heeft die filtering zelf niet geverifieerd.
Periode van dataverzameling:
N.v.t. voor WAINUT. Het corpus van de derde is gepind op een revisie van 4 mei 2026.
Volledige beschrijving van het soort inhoud en van de onlinebronnen die zijn gecrawld:
N.v.t.
Soort gedekte modaliteit:
N.v.t.
Samenvatting van de meest relevante gecrawlde domeinnamen:
N.v.t. Omdat WAINUT geen crawler heeft gebruikt en niemand er namens WAINUT een heeft gebruikt, komt de melding van domeinnamen niet aan de orde.
Aanvullende opmerkingen (facultatief):
De eigen regel van WAINUT, vastgelegd in haar interne vastlegging, is dat een claim van "geen webcrawl" nooit over het model als geheel mag gaan en alleen over de eigen laag van WAINUT. Het basismodel is door zijn eigen uitgever op webdata getraind en diens samenvatting dekt dat.
2.4 Gebruikersdata
Is data uit interacties van gebruikers met het AI-model (bijvoorbeeld invoer en prompts van gebruikers) gebruikt om het model te trainen?
- [ ] Ja
- [X] Nee
Is data uit interacties van gebruikers met andere diensten of producten van de aanbieder gebruikt om het model te trainen?
- [ ] Ja
- [X] Nee
Soort gedekte modaliteit:
Geen.
Aanvullende opmerkingen (facultatief):
WAINUT had tijdens de ontwikkeling van dit model geen uitgerold product dat interacties van gebruikers opleverde.
2.5 Synthetische data
Hebt u synthetische data gebruikt om het model te trainen?
- [X] Ja
- [ ] Nee
Gedekte modaliteiten:
- [X] Tekst
- [ ] Beeld
- [ ] Audio
- [ ] Video
Zo ja, noem het AI-model of de AI-modellen voor algemene doeleinden waarmee de synthetische data is gegenereerd, voor zover die op de markt beschikbaar zijn:
swiss-ai/Apertus-70B-Instruct-2509, gepubliceerd onder de Apache License 2.0. Het genereerde de antwoorden in de instructiedata, op 51 met de hand geschreven startprompts en op passages uit het publieke corpus dat in paragraaf 2.1 is genoemd. Generatie-instellingen: temperature 0.8, top_p 0.9, max_tokens 1024, seed 1234. In de instructiemix die werkelijk is getraind, dragen 47.488 van de 51.875 records dat model als hun vastgelegde generator.
Dat model heeft dezelfde uitgever als het basismodel en wordt gedekt door dezelfde publieke samenvatting van de trainingsinhoud, op https://huggingface.co/swiss-ai/Apertus-70B-2509/blob/main/Apertus_EU_Public_Summary.pdf. De modelkaart van dat model verwijst naar hetzelfde bestand. Die samenvatting noemt Apertus-70B-Instruct onder de modellen die zij dekt.
Informatie over andere AI-modellen waarmee synthetische data is gegenereerd, waaronder eigen AI-modellen van de aanbieder die niet op de markt beschikbaar zijn:
De nabewerkingslaag van 1.157 records bestaat uit eigen generaties van WAINUT uit eerdere versies van dit model die tijdens de eigen training zijn gemaakt en die niet op de markt beschikbaar zijn. In dat stadium is geen nieuwe externe bron bijgekomen. De modelkaart zegt: "Daar komt dus geen nieuwe externe bron bij: de vragen komen uit dezelfde verzameling als hierboven en de antwoorden zijn eigen generaties."
Die 1.157 records zijn geselecteerd uit generatieverzamelingen van 24.000, 12.000 en 15.400 records. Binnen de laag zelf valt de herkomst uiteen in 871 records uit één generatieronde, 145 uit een tweede en 141 uit een derde. Geen bron legt vast uit welke verzameling een bepaald deel van die verdeling komt, dus de twee reeksen cijfers worden hier niet aan elkaar gekoppeld.
Aanvullende opmerkingen (facultatief):
Tijdens het genereren heeft geen enkele prompt de rekennode verlaten naar een externe API. De generator was het model dat hierboven is genoemd en geen ander. De eigen vastlegging van WAINUT over de instructiedata draagt dat als nalevingsvoorwaarde van de generatieronde.
De eigen staande regel van WAINUT heeft twee delen. Het licentieplafond is dat synthetische data alleen mag komen van modellen onder een Apache 2.0- of MIT-licentie. Binnen dat plafond versmalt WAINUT de keuze verder tot twee modellen met naam, Apertus en OLMo. Diezelfde regel verbiedt uitvoer van modellen van OpenAI, Anthropic of Gemini ronduit. Zij eist ook dat het generatormodel, de prompts en de filtering worden gedocumenteerd.
De licentie van het leraarmodel beperkt het trainen op zijn uitvoer niet. De eigen licentietoets van WAINUT legt vast dat trainen op de uitvoer niet verboden is en niet aan een voorwaarde is gebonden.
2.6 Andere databronnen
Hebt u andere databronnen gebruikt om het model te trainen?
- [X] Ja
- [ ] Nee
Zo ja, geef een beschrijving in woorden van deze databronnen en van de data:
Twee onderdelen vallen hieronder.
- Met de hand geschreven startprompts. 51 startprompts zijn met de hand geschreven. Zij zijn het vertrekpunt voor het zelfinstructiedeel van de instructiedata. Zij zijn Nederlandse tekst en zij zijn niet uit een externe bron overgenomen. Wat de vastlegging van die data draagt, is het aantal en het feit dat de prompts met de hand zijn geschreven. Zij noemt geen auteur, dus hier wordt er geen genoemd.
- Selectie in de nabewerkingslaag. In haar laatste trainingsstap is het uitgebrachte model getraind op eigen antwoorden die een beoordelingsstap had goedgekeurd. Er zijn geen voorkeursparen gebruikt.
Geen mens heeft de selectie in die stap gemaakt. In de drie families met een controleerbaar antwoord (classificatie, extractie en redactie van persoonsgegevens) besliste een regelgebaseerde controle; die controle meet niet of er iets is verzonnen. Buiten die drie families was de beoordelingsstap een panel van gepinde rechtermodellen van derden, elk bij zijn eigen aanbieder gehost, met de aanbieder gepind en met terugvalopties uitgeschakeld. Twee rechters beoordeelden elk antwoord en een antwoord telde als goed wanneer beide het goed noemden. Waren zij het oneens, dan besliste een derde rechter met een meerderheid van twee van de drie. Er bleef hoogstens één antwoord per prompt staan. Een antwoord viel af als het langer liep dan 1,8 maal de mediane lengte in tekens van de goedgekeurde antwoorden van dezelfde laag. Waar die regel het enige goedgekeurde antwoord van een prompt liet vallen, leverde die prompt helemaal geen record op. Het recept van die stap gaat naar de publieke repository op GitHub, https://github.com/WAINUTAI/walnoot-8b-instruct, zodat een lezer dit kan nagaan.
Aanvullende opmerkingen (facultatief):
De instructiedata van het uitgebrachte model bevat 51.875 records in twintig taakcategorieën: samenvatten 6.858, instructies volgen 5.998, redeneren en rekenen 5.600, vragen beantwoorden over overheid en recht 5.001, tekst vereenvoudigen 3.986, Nederlandse tekstclassificatie 3.853, weigeren op veiligheidsgronden 3.438, meerkeuze 3.214, herschrijven 2.832, Engelse wetenschappelijke annotatie 2.491, classificatie 2.400, extractie 2.017, Engelse retentie 1.500, herschrijven naar eenvoudig Nederlands op niveau B1 660, brieven opstellen 547, onthouding 500, commercieel rekenen 400, identiteit 250, gedragslaag 247 en redactie van persoonsgegevens in een aangeleverde tekst 83. Die twintig tellingen zijn op 23 september 2026 gemeten over de instructiedata die is getraind.
3. Aspecten van de dataverwerking
3.1 Eerbiediging van het rechtenvoorbehoud bij de uitzondering of beperking voor tekst- en datamining
Bent u ondertekenaar van de praktijkcode voor AI-modellen voor algemene doeleinden, die verbintenissen bevat om het rechtenvoorbehoud bij de uitzondering of beperking voor tekst- en datamining te eerbiedigen?
- [ ] Ja
- [X] Nee
WAINUT heeft de praktijkcode niet getekend. WAINUT volgt het auteursrechthoofdstuk van die code toch als leidraad; haar eigen auteursrechtbeleid is geschreven naar de vijf maatregelen van dat hoofdstuk.
Beschrijving van de maatregelen om het rechtenvoorbehoud voor en tijdens de dataverzameling te eerbiedigen, waaronder de nageleefde opt-outprotocollen, ook die van derden van wie datasets zijn verkregen:
WAINUT heeft voor deze wijziging geen eigen crawler gedraaid, dus WAINUT heeft geen eigen beslissing over robots.txt genomen. Het rechtenvoorbehoud wordt één stap stroomopwaarts geëerbiedigd, op twee plaatsen.
- In het Nederlandse corpus van de derde. Het webgebonden deel ervan is een op licentie gefilterd extract dat alleen pagina's houdt met een expliciete CC0- of CC BY-verklaring in de HTML, waarbij sites die robots.txt blokkeert zijn uitgesloten. WAINUT voegt zelf geen verse webdata toe.
- In het basismodel. De uitgever ervan zegt in zijn eigen praktijkcode: "In addition, data from websites which have recently opted out by specifying at least one of the common AI crawlers, at the time of January 2025, was removed. Crucially, such removals were also applied retroactively in all earlier crawls since 2013, of each corresponding website present in our datasets." [Daarnaast is data verwijderd van websites die zich onlangs hebben afgemeld door ten minste een van de gangbare AI-crawlers te noemen, naar de stand van januari 2025. Van belang is dat die verwijderingen ook met terugwerkende kracht zijn toegepast op alle eerdere crawls sinds 2013, voor elke bijbehorende website die in onze datasets voorkomt.] Dat is de verklaring van de uitgever over het basismodel en geen meting van WAINUT.
Verdere maatregelen op de eigen laag van WAINUT: elke externe bron in de instructiemix is tot een primaire licentiebron herleid, waarbij de tiende rij van de triage de eigen identiteitslaag van WAINUT is, die uit geen enkele externe bron komt; er komt geen niet-commerciële licentie, geen share-alikelicentie, geen GPL en geen licentie alleen voor onderzoek voor in de mix die is getraind; bronnen waarvan de meest specifieke primaire licentie commercieel gebruik verbiedt, zijn geschrapt in plaats van gebruikt.
Wat WAINUT niet heeft gedaan, apart gehouden van wat de uitgever heeft gedaan. WAINUT heeft geen crawler gedraaid, dus WAINUT heeft tijdens de verzameling geen eigen rechtenvoorbehoud geëerbiedigd. Het materiaal bereikte WAINUT via de open datasetrepository van de uitgever, dus het rechtenvoorbehoud dat voor dit materiaal telt, is het voorbehoud dat de uitgever van de dataset eerbiedigt. Op de twee archiefdomeinen achter de subsets die in paragraaf 2.1 aan de orde komen, staat geen robots.txt. Dat is een gemeten feit over die domeinen. Het is geen argument, want WAINUT heeft niets van die sites gehaald.
Aanvullende opmerkingen (facultatief):
Het auteursrechtbeleid van WAINUT voor dit model staat in een apart document, dat de vijf maatregelen van het auteursrechthoofdstuk van de praktijkcode volgt. Het is gepubliceerd op https://walnoot.ai/transparantie, naast deze samenvatting. Rechthebbenden, afnemers en wie een klacht of een vraag heeft, kunnen WAINUT bereiken op support@walnoot.ai.
3.2 Verwijdering van illegale inhoud
Algemene beschrijving van de genomen maatregelen:
- Afwijzing van kandidaatpassages met persoonsgegevens. Een poort liep over de letterlijke passages uit het corpus die als kandidaat voor documenttaken in de instructiedata waren klaargezet. Zij wees 16.776 van die passages af omdat er persoonsgegevens in stonden. Die zijn weggelaten in plaats van bewerkt. Een herhaling van de poort over het geleverde bestand gaf nul treffers op 1.600 passages. De poort ging alleen over die kandidaatpassages; de rest van de trainingsdata is er niet doorheen gegaan.
- Bestanden met een malwaremarkering uitgesloten. Acht parquetbestanden in één bronsubset die een virusscanner had gemarkeerd, zijn met een expliciete uitsluitlijst uitgesloten.
- Detectie van persoonsgegevens. Er bestaat een filter met achttien detectoren, dat patronen met een rekenkundige controle combineert, bijvoorbeeld de elfproef voor burgerservicenummers, mod 97 voor IBAN-nummers en Luhn voor kaartnummers. De recall per klasse is niet gemeten en kan met deze opzet ook niet worden gemeten, omdat zes van de tien klassen een lege noemer hebben. Wat wel is gemeten, is de recall op de klassen die voorkomen in een gestratificeerde steekproef van 300 records, met dezelfde gepinde detectorset: nul voor namen van privépersonen, nul voor indirect identificerende gegevens, plus nul voor de verwijderregel tegen alle negen echte gevallen in die steekproef. De geplande tweede laag heeft nooit gedraaid; de interne vastlegging van WAINUT noemt haar een Nederlands model voor benoemde entiteiten en raadt aan haar niet te installeren. Zij heeft niet over de trainingsdata als geheel gelopen. De meting die er wel is, is een telling achteraf op de nabewerkingslaag van 1.157 records: elf van de achttien detectoren vuren, samen 702 treffers, verdeeld als 528 treffers aan de invoerkant en 174 aan de uitvoerkant. Van de zeven detectoren die nul geven, is aangetoond dat zij op synthetische testgevallen vuren, dus die nul is geen stille detector. De detectoren vonden geen burgerservicenummer, geen creditcardnummer, geen geboortedatum in context en geen bankrekeningnummer dat de rekenkundige controle doorstaat. Adressen, postcodes, kentekens, telefoonnummers en e-mailadressen zijn wel gevonden. Wat op deze data zelf is gemeten, is dit: geen e-mailadres erin combineert een persoonsvormig lokaal deel met een bestaand domein. Het oordeel dat de andere soorten overwegend synthetisch zijn of naar een gereserveerd domein wijzen, rust op een handmatige lezing van vergelijkbare data uit een eerdere ronde en niet op een handmatige lezing van deze data.
- Twee datafamilies werken naar hun aard met persoonsgegevens, omdat zij het model leren zulke gegevens te markeren of te verwijderen. Dat hun waarden uit gereserveerde reeksen komen, is een aanwijzing en geen toets; zo legt de modelkaart het ook vast: de rekenkundige controle op bankrekeningnummers vuurt in beide families nul keer terwijl waarden met de vorm van een rekeningnummer er wel in voorkomen. Een handmatige lezing van juist deze twee families is niet gedaan. Er geldt voor deze twee families geen uitzondering op de maskering. De vraag komt niet aan de orde, omdat de trainingsdata als geheel niet door een filter op persoonsgegevens is gegaan, zoals paragraaf 1.3 vastlegt.
- Openbare rechtspraak is niet bewerkt, omdat de bron zelf al haar eigen bescherming toepast. Namen van personen in een beroepsmatige context zijn behouden. De grond die voor die keuze is vastgelegd, is de rechtsgrond en de belangenafweging, niet het feit dat de bron openbaar is.
- Wat de uitgever van het corpus zelf over een van de twee archiefsubsets zegt. In zijn collectiemetadata, opgehaald op 22 september 2026, schrijft de uitgever over de subset van het Noord-Hollands Archief: "Names of citizens (e.g., those filing complaints) and addresses appear in the documents. These are part of the original municipal records." [Namen van burgers (bijvoorbeeld van indieners van klachten) en adressen komen in de documenten voor. Die horen bij de oorspronkelijke gemeentelijke archiefstukken.] Dat is een verklaring van de uitgever over zijn eigen collectie en geen meting van WAINUT. Zij wordt hier gemeld omdat zij het punt hierboven raakt: de trainingsdata als geheel is niet door een filter op persoonsgegevens gegaan, dus dit materiaal is in het corpus gekomen zoals de uitgever het beschrijft.
- Geen aparte detectie op de zwaarste categorieën illegaal materiaal. WAINUT heeft over haar eigen laag geen aparte detectie op materiaal van seksueel kindermisbruik of op intiem beeldmateriaal zonder toestemming gedraaid. De trainingsdata is tekst zonder beeld.
3.3 Overige informatie (facultatief)
Decontaminatie tegen de publieke evaluatiebatterij. De referentieset van de twee metingen van juli 2026 is 35 datasetsplits van EuroEval met 29.273 records, geïndexeerd als 2.980.615 unieke n-gramvingerafdrukken. Die 35 splits zijn niet allemaal testsplits: de eigen vastlegging van de meting van WAINUT telt er train- en validatiesplits onder, dus zij komen uit ongeveer dertien verschillende datasets. De modelkaart noemt de versie achter die referentieset: "35 bestanden uit EuroEval 17.6.0, samen 29.273 records, elk met een eigen controlegetal." Die versie komt van de modelkaart. De eigen vastlegging van de meting van WAINUT noemt alleen de versie van het meetgereedschap.
Er zijn drie metingen en zij gaan niet over hetzelfde materiaal. De eerste pas, van 22 juli 2026, ging over een eerdere en kleinere bouw van het corpus van de voortgezette pretraining en over de instructiedata van dat moment, samen 238.971 documenten. Op dertien woorden achter elkaar raakte zij 16 van de 29.273 records, 0,0547 procent, wat tegen een faaldrempel van nul een afgekeurde uitslag is. De diepte-pas op zestien, twintig en vijfentwintig woorden hield van die zestien één echte treffer over: een breed verspreide vaste gebedstekst in één testvraag. De andere vijftien waren valse treffers op vaste uitdrukkingen die de diepte-pas niet overleefden. Die eerste pas is niet opnieuw gedraaid op de bouw van het corpus waarop het model is doorgetraind. De tweede meting, van 30 juli 2026, ging over de twee bronbestanden van de eigen bron van WAINUT die in het corpus de opmaak van tekst moet behouden en die uit synthetische chatparen bestaat (zie paragraaf 2.1). Zij komt op dertien woorden uit op nul, per bron gemeten, voor beide bronnen. De bindende vastlegging van die tweede meting zegt dat er geen overlap is gevonden: geen van de 29.273 evaluatierecords deelt een reeks van dertien woorden met die twee bestanden. Een controle op acht woorden geeft 723 records voor de ene bron en 591 voor de andere. Die controle noemt zichzelf een poort in dezelfde woorden als die op dertien woorden. Zij draait met een faaldrempel van 100 procent besmette records per dataset, dus in de praktijk meldt zij in plaats van te blokkeren; de blokkerende poort is de controle op dertien woorden, met een drempel van 0 procent.
De derde meting, van 12 september 2026, ging over de bestanden waarop het uitgebrachte model werkelijk is getraind: de instructiedata van 51.875 records en de nabewerkingsdata van 1.157 records. Zij liep na de training, tegen de tien Nederlandse taken van EuroEval waarop het model is gemeten: 28 splits met samen 42.925 items, elk een keer op de vraag en een keer op het gouden antwoord gemeten. De poort ligt daar op twintig woorden. In de instructiedata raakten op dertien woorden twee items uit de testsplit van squad-nl, aan de kant van de vraag. Het gedeelde stuk beslaat hoogstens 1,27 procent van zo'n item en is op zestien woorden weg, dus het is een vaste frase. Op twintig woorden en meer raakte niets. In de nabewerkingsdata raakte op dertien woorden en meer niets. Het oordeel is schoon. Een audit op acht woorden raakte 659 items in de instructiedata en 33 in de nabewerkingsdata. Een samenvatting van die meting staat in de map decontaminatie van de publieke repository op GitHub, https://github.com/WAINUTAI/walnoot-8b-instruct.
Waarborgen voor de modelkwaliteit die geen dataverwerking zijn. De modelkaart legt vier genummerde beperkingen vast, waaronder dat het model niet mag worden gebruikt om persoonsgegevens uit documenten te verwijderen. Dat het model niet door een gestructureerde red-teamronde is getest, legt de modelkaart elders vast, bij de resultaten en niet in die genummerde lijst.
Rechtsgrond onder het gegevensbeschermingsrecht. WAINUT beroept zich voor de verwerking op het gerechtvaardigd belang onder artikel 6, lid 1, onder f, AVG. De belangenafweging daarvoor is intern vastgelegd volgens de cumulatieve driestapstoets uit EDPB-advies 28/2024. Die vastlegging dateert van juli 2026. Zij is niet bijgewerkt voor deze uitgave en geen juridisch adviseur heeft haar beoordeeld. De modelkaart voegt toe: "Hoeveel de detectie mist, is alleen in een steekproef gemeten. In 300 records uit onze eigen databestanden, waarvan 90 uit de instructiedata van dit model, vond dezelfde detectorset geen van de negen echte gevallen van persoonsgegevens. Op de nabewerkingsdata zelf en per soort is het niet gemeten. Wie dit model in een omgeving met persoonsgegevens inzet, blijft zelf verwerkingsverantwoordelijke en kan zich niet op deze meting beroepen."
Erkenning van de rekencapaciteit, woordelijk vereist in elke publicatie over dit model:
Verplichte bronvermelding (Engels, woordelijk):
"We acknowledge EuroHPC JU for awarding the project ID EHPC-AIF-2026PG01-984 access to MareNostrum5 ACC hosted by BSC, Spain"