Naar de hoofdinhoud

GPAI-stukken

Auteursrechtbeleid

Hoe wij omgaan met auteursrecht en met voorbehouden bij tekst- en datamining.

Model
Walnoot 8B Instruct 1.0
Uitgifte
28 september 2026

Terug naar GPAI-transparantie

Document van 28 september 2026. Modelversie 1.0, uitgifte 28 september 2026.

Vrijwillig gepubliceerd door WAINUT; zie de verklaring in dit document.

Dit document is nog niet door een juridisch adviseur beoordeeld.

Citaten uit Engelstalige EU-documenten zijn eigen vertalingen.

Een beleid om te voldoen aan het Unierecht inzake auteursrechten en naburige rechten, geschreven langs de vijf Maatregelen van het auteursrechthoofdstuk van de praktijkcode voor AI-modellen voor algemene doeleinden.


De aanbieder, het model en dit document

Aanbieder: WAiNuT B.V. (statutaire naam in het handelsregister), handelend onder de naam WAINUT, een besloten vennootschap die bij de Nederlandse Kamer van Koophandel (KvK) is ingeschreven onder nummer 93560915, Rivium Westlaan 48, 2909LD Capelle aan den IJssel, Nederland. Contactpunt: support@walnoot.ai. Website: https://walnoot.ai.

veldwaarde
Model waarop dit beleid zietWalnoot 8B Instruct, versie 1.0
Modelrepositoryhttps://huggingface.co/WAINUT/walnoot-8b-instruct
Publieke repository op GitHubhttps://github.com/WAINUTAI/walnoot-8b-instruct
Uitgegeven en op de Uniemarkt gebracht28 september 2026
Dit documentversie van 28 september 2026
Gepubliceerd ophttps://walnoot.ai/transparantie in het Nederlands, https://walnoot.ai/en/transparantie in het Engels

De modelrepository en de publieke repository op GitHub gaan met de uitgave op 28 september 2026 live.

De juridische naam staat hierboven in de spelling die het handelsregister voert. Overal elders in dit document wordt de handelsnaam WAINUT gebruikt.

Status, reikwijdte en afspraken

Status. Naar eigen meting is WAINUT geen aanbieder van een AI-model voor algemene doeleinden in de zin van Verordening (EU) 2024/1689 (de AI-verordening), omdat de trainingsrekencapaciteit van haar wijziging ver onder de indicatieve drempel van de richtsnoeren van de Commissie blijft. Die meting is in de interne administratie van WAINUT vastgelegd en wordt niet gepubliceerd. WAINUT is geen ondertekenaar van de praktijkcode en volgt de code als leidraad. Dit beleid wordt vrijwillig gepubliceerd op de transparantiepagina van WAINUT, in het Nederlands op https://walnoot.ai/transparantie en in het Engels op https://walnoot.ai/en/transparantie. De modelkaart draagt een verwijzing naar die pagina. De publieke samenvatting van de trainingsinhoud en de kolom van het modeldocumentatieformulier (Model Documentation Form) voor afnemers worden op diezelfde pagina gepubliceerd. Het modeldocumentatieformulier als geheel wordt niet gepubliceerd: het wordt bewaard en op verzoek aan het AI-bureau of aan de nationale bevoegde autoriteit overhandigd.

Twee dingen maken die keuze weloverwogen in plaats van decoratief. Ten eerste stelt de Commissie dat een vrije en opensource-uitgave de auteursrechtelijke verplichting niet wegneemt: "aanbieders van AI-modellen voor algemene doeleinden die voldoen aan de voorwaarden bedoeld in afdeling 4.2 zijn niet vrijgesteld van de verplichting die is neergelegd in artikel 53, lid 1, punt c, van de AI-verordening om een beleid in te voeren om aan het auteursrecht van de Unie te voldoen. Die verplichting omvat het identificeren van en het voldoen aan een rechtenvoorbehoud dat is gemaakt op grond van artikel 4, lid 3, van Richtlijn (EU) 2019/790 van het Europees Parlement en de Raad." Ten tweede is openheid over herkomst het doel van dit project, dus moet een lezer in één document kunnen zien wat WAINUT heeft gedaan.

Reikwijdte. Dit beleid ziet op de eigen wijziging van het basismodel door WAINUT. Waar de verplichtingen van een aanbieder zouden gelden, zijn zij beperkt tot de wijziging: "het auteursrechtbeleid dat wordt vereist door artikel 53, lid 1, punt c, van de AI-verordening en de samenvatting van de voor training gebruikte inhoud die wordt vereist door artikel 53, lid 1, punt d, van de AI-verordening zijn beperkt tot de gegevens die als onderdeel van de wijziging zijn gebruikt." Voor het basismodel gelden het beleid en de samenvatting van de eigen uitgever daarvan.

Dit is één document. Maatregel 1.1 vraagt het beleid te beschrijven in één document dat de Maatregelen van het hoofdstuk verwerkt. Dit is dat document.

Afspraken. Er wordt hier niets geclaimd wat WAINUT niet heeft gedaan. Er komen geen interne paden, hostnamen, sleutels of opslagadressen in dit document voor. Er komt geen prompt-, record- of antwoordtekst uit de trainingsdata in dit document voor. Nederlandse citaten worden woordelijk weergegeven. De Engelse versie van dit document zet achter zo'n citaat een eigen vertaling van WAINUT tussen vierkante haken; die vertaling is niet gezaghebbend. Citaten uit Engelstalige stukken van derden staan hier woordelijk in het Engels; waar een Nederlandse weergave tussen vierkante haken volgt, is die een eigen vertaling van WAINUT en is zij niet gezaghebbend.


Maatregel 1.1 Een auteursrechtbeleid opstellen, actueel houden en uitvoeren

De Maatregel luidt: "Ondertekenaars stellen een beleid op om te voldoen aan het Unierecht inzake auteursrechten en naburige rechten voor alle AI-modellen voor algemene doeleinden die zij op de Uniemarkt brengen, houden dat actueel en voeren het uit. Ondertekenaars verbinden zich ertoe dat beleid te beschrijven in één document dat de in dit hoofdstuk vastgestelde Maatregelen verwerkt. Ondertekenaars wijzen binnen hun organisatie verantwoordelijkheden toe voor de uitvoering van en het toezicht op dit beleid."

Wat WAINUT deed. WAINUT legde een datanorm vast: rechtmatig verkregen materiaal dat rechtenvoorbehouden respecteert, met het publiek uitgegeven CC BY-corpus van het GPT-NL-consortium genoemd bij de toegestane bronnen. De norm is vastgelegd in een interne juridische checklist. Die checklist is een werkdocument en legt zelf geen naleving vast, dus wordt zij hier niet aangeboden als bewijs dat er naar de norm is gewerkt. Wat met het model is gepubliceerd laat zien hoe de norm is toegepast: een modelkaart die de herkomst per bron vermeldt, een NOTICE-bestand dat de bronvermeldingslijst draagt, een herkomstmanifest per subset en een licentietriage op bronniveau over de instructiemix die werkelijk is getraind.

Drie regels uit die norm hebben de data gevormd:

  1. Elke licentie moet worden herleid tot een primaire bron, dat wil zeggen het licentiebestand of de datasetkaart van de bronverzameling zelf, of de bijlage van het eigen artikel van die verzameling. Niet een tabel in een artikel over een andere verzameling en niet een tussenliggende aggregator.
  2. De eigen norm van WAINUT sluit materiaal met een share-alike- of niet-commerciële licentie uit. Daarom staat Wikipedia niet bij haar toegestane bronnen. Die regel staat, ook nu een andere Nederlandse onderzoeksgroep CC BY-SA als toegestaan gelicentieerd telt. Zij kost deze uitgave niets: een telling over het licentieveld van de instructiemix die is getraind levert tien licentierijen op en daaronder geen share-alikerij.
  3. Synthetische data mogen alleen worden gegenereerd met modellen onder een Apache 2.0- of MIT-licentie. Binnen dat plafond beperkt WAINUT zich verder tot twee met name genoemde modellen, Apertus en OLMo. Uitvoer van modellen van OpenAI, Anthropic of Gemini wordt niet gebruikt. Het generatormodel, de prompts en de filtering moeten worden gedocumenteerd.

Actueel houden. Dit beleid wordt eens per jaar en bij elke nieuwe modeluitgave door WAINUT herzien. Een herziening wordt goedgekeurd door de eigenaar van WAINUT.

Verantwoordelijkheden. De directie van WAINUT draagt de verantwoordelijkheid voor de uitvoering van en het toezicht op dit beleid. Alles wat dit beleid raakt gaat naar support@walnoot.ai.


Maatregel 1.2 Bij het crawlen van het World Wide Web alleen rechtmatig toegankelijke auteursrechtelijk beschermde inhoud verveelvoudigen en extraheren

De Maatregel verbindt ondertekenaars ertoe "doeltreffende technische voorzieningen zoals omschreven in artikel 6, lid 3, van Richtlijn 2001/29/EG die bedoeld zijn om ongeoorloofde handelingen ten aanzien van werken en ander beschermd materiaal te voorkomen of te beperken niet te omzeilen, in het bijzonder door elke technische weigering of beperking van toegang die door abonnementsmodellen of betaalmuren wordt opgelegd te respecteren". Zij verbindt hen er verder toe "van hun webcrawling websites uit te sluiten die inhoud voor het publiek beschikbaar stellen en die op het moment van de webcrawling door rechterlijke instanties of overheidsinstanties in de Europese Unie en de Europese Economische Ruimte zijn erkend als aanhoudend en herhaaldelijk inbreukmakend op auteursrechten en naburige rechten op commerciële schaal."

Wat WAINUT deed.

  1. WAINUT gebruikte geen eigen webcrawler. Er is daarom geen eigen crawl van WAINUT waarin een technische voorziening omzeild had kunnen worden en geen eigen crawl van WAINUT waaruit een site uitgesloten had moeten worden. WAINUT verklaart daarbij dat niemand namens WAINUT heeft gecrawld: er is geen crawl uitbesteed en er is geen webpagina in opdracht opgehaald. Het materiaal bereikte WAINUT via de open datasetrepository van de uitgever van het corpus en via gepubliceerde datasets. Die verklaring is de bron voor dit punt; een andere is er niet.
  2. Al het materiaal van derden is verkregen uit gepubliceerde datasets via hun eigen distributiekanalen. De Nederlandse laag komt uit één openbare, niet-afgeschermde repository, het GPT-NL Public Corpus, uitgegeven door het consortium dat het bouwde onder CC BY 4.0, gedownload op een gepinde revisie. De wetenschappelijke tak komt uit veertien openbare annotatiedatasets, waarvan elke licentie tot een primaire bron is herleid. Die veertien kwamen niet op dezelfde manier binnen: hun primaire bronnen staan op de distributiekanalen van de afzonderlijke verzamelingen en niet op één gepinde repositoryrevisie. Een van de veertien, AnatEM, draagt CC BY-SA 3.0 op haar primaire bron. Haar 168 records halen de instructiemix die is getraind niet; zie de noot onder Bronvermelding hieronder.
  3. Er is geen bron gebruikt achter een betaalmuur, met een abonnementsbeperking of met een andere toegangsbeperking. Er is geen toegangscontrole omzeild, omdat geen enkele gebruikte bron er een had.
  4. Van het web afgeleid materiaal zit pas één stap stroomopwaarts. Binnen het corpus van derden houdt het webextract alleen pagina's over die een uitdrukkelijke CC0- of CC BY-vermelding in de HTML dragen, waarbij sites die door robots.txt geblokkeerd zijn uitgesloten zijn. WAINUT steunt op die filtering door de samensteller van het corpus; WAINUT heeft haar niet opnieuw geverifieerd en claimt niet dat te hebben gedaan.
  5. Op de instructiedata is een licentiepoort op bronniveau toegepast. Die kostte records. Van 9.722 kandidaatrecords haalden er 4.421 de primairebronregel; 2.659 bleven over na alle latere kwaliteitspoorten. De aanscherping van de regel zelf liet drie bronverzamelingen vallen met samen 281 records. Een van die drie is het geval dat de regel uitlokte: geen enkele primaire bron staat commercieel gebruik toe, terwijl de meest specifieke beschikbare bron, de tussenliggende hulpbron waaruit het corpus die verzameling zelf betrekt, een niet-commerciële licentie vermeldt waar de tabel in het artikel over het corpus CC BY claimde. Bij de licentiepoort als geheel viel meer weg dan die drie: vijf met name genoemde bronverzamelingen, plus de zestien bronverzamelingen waarvoor die tabel helemaal geen licentie vastlegt zodat er geen primaire bron is gezocht. Die zestien dragen samen 4.749 records.
  6. Overheidsteksten. Nederlandse wetten, besluiten en rechterlijke uitspraken zijn vrij van auteursrecht op grond van de artikelen 11 en 15b van de Auteurswet. Dat is de grond waarop het overheids- en jurisprudentiemateriaal in het corpus wordt gebruikt.
  7. Een eigen aanscherping boven de bron. Acht parquet-bestanden in één subset die een virusscanner had gemarkeerd zijn door een uitdrukkelijke uitsluitlijst uitgesloten.

Wat WAINUT niet claimt. WAINUT claimt nooit "geen webcrawling" voor het model als geheel. De claim geldt alleen voor de eigen laag van WAINUT. Het basismodel is door zijn eigen uitgever op webdata getraind. Het eigen beleid en de eigen samenvatting van die uitgever dekken dat.


Maatregel 1.3 Rechtenvoorbehouden identificeren en naleven bij het crawlen van het World Wide Web

De Maatregel verbindt ondertekenaars ertoe "webcrawlers in te zetten die instructies lezen en volgen die zijn uitgedrukt overeenkomstig het Robot Exclusion Protocol (robots.txt), zoals gespecificeerd in Request for Comments nr. 9309 van de Internet Engineering Task Force (IETF) en elke latere versie van dit protocol". Haar vierde lid vraagt ondertekenaars informatie openbaar te maken over de ingezette crawlers en hun robots.txt-eigenschappen, met een middel waarmee getroffen rechthebbenden automatisch op de hoogte worden gesteld wanneer die informatie wordt bijgewerkt.

Wat WAINUT deed.

  1. WAINUT zet geen webcrawler in, dus neemt WAINUT geen eigen robots.txt-beslissing. Er is geen crawlernaam, geen user agent en geen crawlschema om te publiceren, omdat die niet bestaan. De verplichting om crawlerinformatie te publiceren heeft aan de kant van WAINUT geen onderwerp.
  2. Rechtenvoorbehouden worden stroomopwaarts geëerbiedigd, op twee plaatsen, door partijen die wel crawlden. In het Nederlandse corpus van derden, via het op licentie gefilterde webextract dat onder Maatregel 1.2 is beschreven en dat sites uitsluit die door robots.txt geblokkeerd zijn. In het basismodel, waarvan de uitgever in zijn eigen praktijkcode stelt: "In addition, data from websites which have recently opted out by specifying at least one of the common AI crawlers, at the time of January 2025, was removed. Crucially, such removals were also applied retroactively in all earlier crawls since 2013, of each corresponding website present in our datasets." [Daarnaast is data verwijderd van websites die zich onlangs hebben afgemeld door ten minste een van de gangbare AI-crawlers te noemen, naar de stand van januari 2025. Van belang is dat die verwijderingen ook met terugwerkende kracht zijn toegepast op alle eerdere crawls sinds 2013, voor elke bijbehorende website die in onze datasets voorkomt.] Dat is de eigen verklaring van de uitgever over zijn eigen model. WAINUT geeft haar hier weer als de reden waarom de stroomopwaartse laag voor WAINUT aanvaardbaar is; WAINUT heeft haar niet geverifieerd.
  3. WAINUT voegt geen verse webdata toe. Er is niets geschraapt nadat de corpusrevisie was gepind.
  4. Wat WAINUT ophaalde en wat anderen ophaalden zijn twee verschillende dingen. Geen van de twee archiefdomeinen achter de twee hieronder beschreven subsets draagt een robots.txt en op de pagina's die daar zijn gelezen is geen voorbehoud tegen tekst- en datamining gevonden. Dat is een gemeten feit en het is geen argument voor wat dan ook, want WAINUT heeft niets van die sites opgehaald: het materiaal bereikte WAINUT via de open datasetrepository van de uitgever van het corpus. Het rechtenvoorbehoud dat voor dit materiaal telt is daarom het voorbehoud dat de uitgever van die dataset moest identificeren en naleven.

Wat er daarom niet is. WAINUT publiceert geen crawlerinformatie en biedt geen webfeed die rechthebbenden op de hoogte stelt van veranderingen in crawlergedrag, omdat WAINUT geen crawler gebruikt. Als WAINUT ooit crawlt, moet deze Maatregel volledig zijn uitgevoerd voordat die crawl begint.


Maatregel 1.4 Het risico op auteursrechtinbreukmakende uitvoer beperken

De Maatregel verbindt ondertekenaars ertoe "passende en evenredige technische waarborgen in te voeren om te voorkomen dat hun modellen uitvoer genereren die trainingsinhoud die door het Unierecht inzake auteursrechten en naburige rechten wordt beschermd op inbreukmakende wijze verveelvoudigt". Zij verbindt hen er verder toe "auteursrechtinbreukmakend gebruik van een model te verbieden in hun beleid voor aanvaardbaar gebruik, hun algemene voorwaarden of andere gelijkwaardige documenten, of in het geval van AI-modellen voor algemene doeleinden die onder vrije en opensourcelicenties zijn uitgegeven gebruikers te wijzen op het verbod op auteursrechtinbreukmakend gebruik van het model in de documentatie die bij het model hoort, onverminderd het vrije en opensourcekarakter van de licentie."

Wat WAINUT deed.

  1. Er wordt geen trainingsdata herverspreid. De modelkaart stelt: "Er wordt geen trainingsdata gepubliceerd." WAINUT publiceert gewichten, documentatie en recept, geen corpora. Dat neemt de meest directe route weg waarlangs beschermd materiaal opnieuw gepubliceerd zou kunnen worden.
  2. Ontdubbeling tijdens de corpusbouw. Verwijdering van bijna-duplicaten is met 377.787 documenten de grootste enkele afvalreden in de corpusbouw, van de 806.473 afvallers over negentien redenen. Dit is om de datakwaliteit gedaan. Het vermindert herhaalde blootstelling aan identieke passages, wat een bekende aanjager van woordelijke memorisatie is.
  3. De instructielaag is grotendeels gegenereerd en niet gekopieerd. In de mix die is getraind dragen 47.488 van de 51.875 records een openlijk gelicentieerd leraarmodel als vastgelegde bron van de antwoordtekst. De natrainingslaag van 1.157 records voegt geen nieuwe externe bron toe: de antwoorden zijn eigen generaties van WAINUT, gekozen door een beoordelingsstap. De vragen komen uit dezelfde verzameling als de instructielaag, die hierboven is verantwoord. De modelkaart voegt toe dat voor een deel van die laag de oorsprong niet positief kan worden vastgesteld en dat dit deel als niet-synthetisch wordt geteld, aan de strenge kant.
  4. Het basismodel draagt de eigen beperkende maatregel van zijn uitgever. Zijn uitgever beschrijft een trainingstechniek die in zijn eigen woorden "avoids verbatim memorization of text sequences longer than 50 tokens" [voorkomt woordelijke memorisatie van tekstreeksen die langer zijn dan 50 tokens]. WAINUT heeft die eigenschap na voortgezette voortraining niet opnieuw gemeten.

Wat WAINUT niet deed, ronduit gezegd. WAINUT heeft geen eigen technische waarborg tegen auteursrechtinbreukmakende uitvoer ingevoerd en geen memorisatietest op de uitgegeven gewichten gedraaid. De n-gramdecontaminatie die WAINUT wel draaide, op dertien woorden tegen de publieke evaluatiebatterij, is gebouwd om de evaluatie eerlijk te houden en niet om verveelvoudiging van beschermde werken te meten. Zij mag niet als zodanig worden gepresenteerd.

Het uitvoerfilter van de uitgever van het basismodel. Het beleid voor aanvaardbaar gebruik van die uitgever adviseert een bestand met hashwaarden als uitvoerfilter toe te passen. De uitgever schrijft op de kaart van het basismodel dat zo'n filter op dit moment niet wordt geleverd, in zijn eigen woorden: "Currently no output filter is provided." [Op dit moment wordt geen uitvoerfilter geleverd.] De modelkaart van Walnoot 8B Instruct zegt hetzelfde. WAINUT legt die vraag in september 2026 aan de uitgever voor en zal het antwoord hier vastleggen. Er was geen antwoord ontvangen toen dit document uitging.

Wat WAINUT gaat doen. Er wordt voor publicatie geen memorisatiemeting op de uitgegeven gewichten gedaan. WAINUT voert die meting na de uitgave uit en legt de uitkomst hier vast. De modelkaart draagt een zin die gebruikers erop wijst dat auteursrechtinbreukmakend gebruik van het model verboden is. Dat is wat deze Maatregel van een vrije en opensource-uitgave vraagt.


Maatregel 1.5 Een contactpunt aanwijzen en het indienen van klachten mogelijk maken

De Maatregel luidt: "Ondertekenaars verbinden zich ertoe een contactpunt aan te wijzen voor elektronische communicatie met getroffen rechthebbenden en daarover gemakkelijk toegankelijke informatie te verstrekken." Haar tweede lid vraagt om een elektronisch klachtenmechanisme, waarbij op klachten wordt gehandeld "op een zorgvuldige, niet-willekeurige wijze en binnen een redelijke termijn, tenzij een klacht kennelijk ongegrond is of de ondertekenaar al heeft geantwoord op een identieke klacht van dezelfde rechthebbende."

Het contactpunt. WAINUT wijst support@walnoot.ai aan als het contactpunt voor elektronische communicatie met getroffen rechthebbenden en voor klachten over materiaal in de trainingsdata. Dat besluit is genomen op 22 september 2026. Het adres staat in de modelkaart van Walnoot 8B Instruct en wordt ook op https://walnoot.ai/transparantie gepubliceerd. De modelkaart noemt datzelfde adres voor drie gevallen, waarvan dit er een is: een rechthebbende die iets wil melden over materiaal in de trainingsdata, een melding over persoonsgegevens en een fout in de kaart zelf.

De algemene bedrijfsgegevens, ongewijzigd en openbaar: WAINUT, Rivium Westlaan 48, 2909LD Capelle aan den IJssel, Nederland, KvK-nummer 93560915, website https://walnoot.ai. Voor alles wat dit beleid raakt is support@walnoot.ai het adres. Er wordt hier geen tweede e-mailadres en geen tweede domein genoemd, zodat een rechthebbende één adres heeft om naar te schrijven en één plek om te kijken.

Het klachtenmechanisme. Een rechthebbende die iets wil melden over materiaal in de trainingsdata schrijft naar support@walnoot.ai. Er is geen apart elektronisch formulier en geen tweede adres, zodat dat ene adres dient voor alles waar dit beleid op ziet. WAINUT bevestigt de ontvangst van een klacht binnen vijf werkdagen en antwoordt inhoudelijk binnen dertig dagen. Een klacht wordt binnen WAINUT via datzelfde adres behandeld. Het postadres is het bedrijfsadres hierboven.

Wat WAINUT een rechthebbende belooft. Bij een klacht die gegrond blijkt haalt WAINUT de betrokken bron uit de trainingsmix van een volgende versie van het model. WAINUT belooft geen hertraining van een model dat al is uitgegeven en geen intrekking daarvan, want er bestaat geen lijst van de documenten die werkelijk zijn gebruikt, dus zo'n belofte zou niet nagekomen kunnen worden. WAINUT draait ook geen auteursrechtfilter aan de uitvoerkant in realtime; dat staat hierboven onder Maatregel 1.4.


Bronvermelding

Sommige gebruikte bronnen vragen bronvermelding. Het NOTICE-bestand dat met het model meegaat draagt de lijst, met rechthebbende, plaats van publicatie en licentie per bron. Het noemt het GPT-NL Public Corpus, Chia en Qasper onder CC BY 4.0, BioASQ onder CC BY 2.5 en JNLPBA onder CC BY 3.0 met clausule 4 van de GENIA Project License. Het noemt SciRIFF, de verzameling waaruit de wetenschappelijke tak komt, onder ODC-By. Het noemt SciTLDR en COVID-QA onder Apache 2.0, QASA, PubMedQA en MatSci Text Corpus onder MIT en LINNAEUS onder BSD; ook die licenties vragen bronvermelding. Bronnen waarvan de licentie geen bronvermelding vraagt staan er voor de volledigheid ook in: MedMentions en NLM-Chem onder CC0 1.0 en NCBI Disease in het publieke domein. Het leraarmodel dat voor de synthetische antwoorden is gebruikt wordt daar ook genoemd, met zijn Apache License 2.0.

De licentiesamenstelling van de instructiemix die werkelijk is getraind telt tien rijen in de triage. Acht van die tien komen uit externe bronnen en alle acht staan commercieel gebruik toe. De negende, Apache-2.0-clean, is geen licentie van een externe bron maar een afgeleid label van WAINUT voor het gegenereerde materiaal van de mix. De records die op een letterlijke passage uit het corpus steunen dragen dat label ook; de passage zelf valt onder CC BY 4.0, de licentie van het corpus. Het corpus staat met zijn bronvermelding in het NOTICE-bestand. De tiende is de eigen identiteitslaag van WAINUT, die uit geen enkele externe bron komt. Dat is de telling die de modelkaart draagt. Geen niet-commerciële licentie, geen share-alikelicentie, geen GPL en geen licentie alleen voor onderzoek komt in die triage voor.

Bij die laatste zin hoort één bronverzameling. Eén verzameling in de wetenschappelijke tak, AnatEM, is gelicentieerd onder CC BY-SA 3.0 en leverde 168 records. Die 168 records halen de mix die is getraind niet. De tak komt met 2.491 records in die mix, dat zijn de 2.659 geleverde records zonder de CC BY-SA 3.0-rij. De acht andere licentierijen kloppen record voor record: CC BY 2.5 812, Apache 2.0 516, MIT 412, CC0 1.0 281, CC BY 4.0 279, publiek domein 171, CC BY 3.0 16 en BSD 4, samen 2.491. Een telling over het licentieveld van die mix levert helemaal geen share-alikerij op. Er rust daarom geen bronvermeldings- of share-alikeplicht uit die bronverzameling op deze uitgave. Dat is op 23 september 2026 met die telling beslecht. De NOTICE-lijst hierboven noemt dertien annotatieverzamelingen en noemt AnatEM terecht niet.


De twee corpussubsets met de licentiewaarde "unknown"

De eigen regel van WAINUT is dat een licentiewaarde buiten een vaste verzameling de pijplijn stilzet voor onderzoek, met "unknown" daarin genoemd. Die regel is op 22 september 2026 voor deze twee subsets gedraaid. Dit is de uitkomst, hier vastgelegd op 23 september 2026.

Wat de waarde draagt. Op de revisie van het corpus waarop de voortgezette pretraining liep, dragen twee van de 28 corpussubsets die zijn gebruikt de licentiewaarde "unknown": een subset van 7.995 documenten uit het Noord-Hollands Archief en een subset van 73.174 documenten uit Het Utrechts Archief. Die waarde staat in het eigen herkomstmanifest van WAINUT, het bestand herkomst/provenance-manifest.json dat naar de publieke repository op GitHub gaat, https://github.com/WAINUTAI/walnoot-8b-instruct, in de map herkomst. Zij is daar geschreven door het script dat het corpus bouwde, vanuit de licentiekolom per document in de parquetbestanden van het corpus zoals die op die revisie staan. De statistiekbestanden per subset die de uitgever van het corpus in zijn datasetrepository meelevert, dragen op die revisie dezelfde waarde. Die revisie is 1e17d21afa6518939523fbdcc1fbb3167b671725. De andere 26 subsets dragen elk een uitdrukkelijke waarde. Op 7 september 2026 om 11:34 UTC, na die revisie, zette de uitgever beide subsets in een nieuwe commit op "public-domain", revisie 1b4408c2e78fced22626123c1e8ad840d5183f12. Die commit wijzigde de twee statistiekbestanden en volgens zijn beschrijving de licentiekolom van elk document in beide subsets.

Wat de twee delen wegen. Samen zijn zij 81.169 documenten, 117.179.121 tekens en 37.011.724 geschatte tokens. Over alle 28 subsets is dat 0,43 procent van de geschatte tokens en 0,41 procent van de tekens.

Wat de uitgever zegt. In zijn eigen collectiemetadata legt de uitgever beide archieven vast als publiek domein. Die collectiemetadata zijn de grond om deze twee delen als publiek domein te lezen; er wordt hier geen andere grond voor geclaimd. Het bestand is 452.087 bytes met sha256 46fa6d006f80cd482d8a950bb1c26c55d86d48463832457a29b4cb7842ffc88e, opgehaald op 22 september

  1. Dat bestand kan veranderen. Op zijn datasetkaart zet diezelfde uitgever beide archieven in de

categorie Archive/Public Domain en zet hij het corpus als geheel onder CC BY 4.0. De waarden die die kaart voor het licentieveld per document documenteert zijn public domain, CC-0 en CC-by; "unknown" staat daar niet bij.

Wat de twee archieven zeggen. Beide publiceren hun open data onder CC0.

Het Noord-Hollands Archief, op zijn pagina met de open data, vers opgehaald op 22 september 2026 zonder dat er per pagina een ophaaldatum is vastgelegd: "Personen en organisaties kunnen de open data van het Noord-Hollands Archief vrijelijk gebruiken, al dan niet voor commerciële doeleinden. Er geldt de licentie CC0 (no rights reserved), dat wil zeggen iedereen mag de gegevens vrij gebruiken zonder toestemming te vragen. Bronvermelding is niet nodig, maar wordt wel op prijs gesteld."

Het Utrechts Archief, op zijn pagina met de open data, op dezelfde manier vers opgehaald en eveneens zonder dat er per pagina een ophaaldatum is vastgelegd: "Personen en organisaties kunnen de open data vrijelijk gebruiken, al dan niet voor commerciële doeleinden. Wel zijn er enkele spelregels. Voor de nu vrijgegeven gegevens geldt de licentie CC0."

Beide verklaringen gaan over de open data van die archieven, dat wil zeggen over hun archiefinventarissen, niet met zoveel woorden over de tekst van de documenten zelf. Dat is de grens van wat zij bewijzen.

Wat WAINUT niet kon vaststellen. Waar de waarde "unknown" vandaan kwam. In de beschrijving van zijn commit van 7 september 2026 schrijft de uitgever dat de waarde eerder een gat in de metadata lijkt dan een bewust gekozen waarde. Noch de datasetkaart noch de samenvatting van het artikel over het corpus zegt of de uitgever de waarde van het archief heeft overgenomen of haar bij gebrek aan een veld heeft ingevuld. Drie feiten wegen tegen het lezen van die waarde als een beperking. De uitgever legt beide subsets in zijn eigen collectiemetadata vast als publiek domein. Beide archieven zetten hun open data onder CC0. En wat is gebruikt is tekst uit tekenherkenning en geen beeldmateriaal, dus komt er geen apart recht op een scan of een foto bij kijken: het Utrechtse deel wordt door de uitgever beschreven als collecties van meer dan honderd jaar oud, met een tijdsdekking die geheel voor 1950 ligt. Het Noord-Hollandse deel bestaat uit gemeenteraadsnotulen van één gemeente, rond 2015 gedigitaliseerd via tekenherkenning.

De uitkomst. Beide delen blijven in de trainingsdata. Dit beleid werkt op bronniveau, het corpus staat op dat niveau als één bron onder CC BY 4.0 en de uitgever telt beide delen in zijn eigen collectiemetadata als publiek domein. Twee dingen horen naast die uitkomst en WAINUT noemt ze zelf in plaats van ze over te laten om gevonden te worden. WAINUT heeft deze twee subsets niet bij de bron zelf doorlopen. En het model is al getraind terwijl er geen lijst bestaat van de documenten die werkelijk zijn gebruikt, dus kunnen deze twee delen niet meer uit de uitgegeven gewichten worden gehaald. WAINUT leest wat overblijft als een gat in de metadata per document op de revisie waarop de voortgezette pretraining liep. De uitgever heeft die waarde sindsdien op publiek domein gezet en schrijft dat de eerdere waarde een gat in de metadata lijkt. WAINUT ziet dat gat niet als beletsel. Die lezing rust op wat de uitgever en de twee archieven verklaren, zoals hierboven staat. Geen juridisch adviseur heeft haar beoordeeld.


Open punten

Drie dingen staan open. Zij worden hier voluit opgeschreven in plaats van overgelaten om gevonden te worden.

  1. Geen juridisch adviseur heeft dit document gelezen. Zolang dat niet is gebeurd blijft het een concept.
  2. De uitgever van het basismodel heeft de vraag over het uitvoerfilter niet beantwoord. WAINUT legt die vraag in september 2026 aan de uitgever voor en zal het antwoord hier vastleggen.
  3. Er is geen memorisatiemeting op de uitgegeven gewichten gedaan. WAINUT voert die meting na de uitgave uit en legt de uitkomst hier vast.

Erkenning van de rekencapaciteit, woordelijk vereist in elke publicatie over dit model

Verplichte bronvermelding (Engels, woordelijk):

"We acknowledge EuroHPC JU for awarding the project ID EHPC-AIF-2026PG01-984 access to MareNostrum5 ACC hosted by BSC, Spain"