Podcast · Episode 12

GPT-NL: een eigen Nederlands taalmodel

Met Saskia Lensink

In deze aflevering

Nederland heeft een eigen taalmodel, en het is niet gebouwd op gestolen data. Saskia Lensink, projectleider van GPT-NL bij TNO, vertelt hoe haar team met 13,5 miljoen euro overheidsgeld (een fractie van de miljarden van big tech) een Nederlands AI-model traint op de supercomputer Snellius in Amsterdam. Voor Philippe heeft de aflevering een persoonlijk tintje: via NDP Nieuwsmedia sloten alle Nederlandse uitgevers een licentieovereenkomst waarmee twintig jaar journalistiek, netjes betaald, de trainingsdata in ging. Een wereldprimeur.

Lensink is verfrissend nuchter over de ambities. GPT-NL wordt geen nieuwe ChatGPT, maar een zakelijk model dat drie dingen goed moet doen: samenvatten, versimpelen naar B1-taalniveau en RAG (vragen stellen aan je eigen documenten). De lat: minstens het niveau van de eerste ChatGPT uit 2022, en daar zit het model al op. Minstens zo interessant is het ecosysteem erachter: data-eigenaren delen straks mee in de opbrengsten, het model draait bij klanten op eigen afgesloten infrastructuur, en “soevereiniteit” is een keiharde eis richting investeerders: geen exit naar een Amerikaanse partij.

Het gesprek duikt ook heerlijk de techniek in: waarom er naast tien procent Nederlands ook Engels, programmeercode en vertaald Duits en Deens in de trainingsdata zit, hoe je met een loss-curve ziet of het model nog leert, en het babysitschema waarmee het team een zomer lang avond en weekend de trainende machine bewaakte. Plus een eerlijke anekdote: hoe het team vergat de domeinnaam te registreren, en de les die daaruit volgde. Wie nog launching customer wil worden moet snel zijn, de lijst zit bijna vol.

“Er wordt heel veel geld verdiend met AI, en er lijkt nog vrij weinig terug te vloeien naar de eigenaren van de allerbelangrijkste grondstof die erin zit: de data.”

Saskia Lensink · 13:59

Hoofdstukken

  1. 0:00 Nederland heeft een eigen taalmodel
  2. 4:03 Wat kun je met 13,5 miljoen tegenover miljarden?
  3. 8:22 Snellius: rekenen op de nationale supercomputer
  4. 10:35 Hoe goed is het? De eerste metingen
  5. 13:59 Een eerlijk ecosysteem: data-eigenaren delen mee
  6. 17:00 De les van OpenAI en de angst voor een Amerikaanse exit
  7. 21:13 Waar is GPT-NL goed in: samenvatten, versimpelen en RAG
  8. 24:27 De gekaapte domeinnaam
  9. 26:56 Onder de motorkap: data, gewichten en het Llama-recept
  10. 41:19 Op de knop drukken: maanden trainen met een babysitschema
  11. 48:27 Europa: van Mistral tot het Zwitserse Apertus
  12. 53:26 Kunnen uitgevers zelf zo'n model bouwen?
  13. 57:54 Launching customer worden? Dat kan nog net
Transcript Lees het volledige transcript

Dit transcript is automatisch gegenereerd en licht geredigeerd; er kunnen onnauwkeurigheden in staan. Tijdstempels linken naar het fragment op Spotify.

Lars Anderson 0:00

In aflevering twaalf van de Media Innovatiepodcast is onze gast Saskia Lensink. Saskia is projectleider van het Nederlandse AI model GPTNL. Ja, je hoort het goed Nederland heeft een eigen taal model dat is getraind op artikelen van publieke bronnen en verhalen uit Nederlandse nieuwsmedia. Het model wordt gebouwd en getraind onder toezicht van TNO. Techbedrijf OpenAI begon ooit als onderzoekslab en ontwikkelde ChatGPT met miljarden aan durfkapitaal. Tno moet het doen met 13,5 miljoen, een fractie van wat de grote tech bedrijven beweren nodig te hebben voor een superslim redenerend AI model. Het model van TNO is bijna af. Hoe goed gaat het zijn? Wat is het doel van dit model? Wie wil dit gebruiken als je ook gewoon toegang hebt tot de topmodellen van Google en Anthropic of het Franse Mistral? Genoeg vragen voor een urgent gesprek met Saskia Lensink. Misschien wel de Nederlandse versie van Sam Altman, baas van OpenAI. Philippe. Wat? Wat vond je van mijn intro over de.

Philippe Remarque 1:00

Top er erg ronkend. Ik hoop dat je het zelf hebt geschreven. Jij hebt het zelf geschreven. Ik heb geschreven, Maar er was toch geen woord van gelogen? Ja, dat zijn als dat mag Saskia zelf relativeren. Maar kijk, ik vind dit. Ik ben echt een beetje opgewonden hierover omdat ik. We krijgen gewoon binnenkort een Nederlands LLM dat getraind is op specifiek Nederlandse data, waar het toch echt anders zal zijn dan die andere. En wat ik natuurlijk heel leuk vind. En er. Achter de schermen heeft de NDP nieuwsmedia zich daar mee bemoeid. En waar ik in het bestuur zit, hebben wij dus een licentieovereenkomst gesloten met alle Nederlandse uitgevers, van DPG tot De Groene Amsterdammer, om onze backcatalogus van twintig jaar journalistiek daarin te krijgen. En dat zullen we zo nog over hebben. Wat dat wat dat betekent voor het model. Maar daar is dus een licentieovereenkomst gewonnen. Dus dit is een ethisch LLM dat niet gebaseerd is op de diefstal die de afgelopen jaren heeft plaatsgevonden. Zoals alle big tech modellen die gewoon ons zonder vragen gescrapt hebben dus, en eigenlijk nog steeds zitten te scrapen. En zonder dat ze daar heel veel tegen kunnen doen op het moment. Dus ja, ik vind dat op twee manieren heel erg interessante ontwikkeling. Een Europees autonome ontwikkeling dus daar moeten we het over gaan hebben.

Lars Anderson 2:18

Ja, gaan we het over hebben, maar ben je niet ergens ook een beetje sceptisch?

Philippe Remarque 2:22

Nee. Nou ja, nee, want ik nou ik dat zullen we zo horen. Het gaat er om waar je het model precies allemaal voor gebruikt en wat het moet kunnen.

Lars Anderson 2:31

Nou, we gaan Saskia erbij halen. Saskia, je hebt meegeluisterd met de aankondiging. Ja. Vond je het goed? Herkende je jezelf erin?

Saskia Lensink 2:49

Nou, ik zou mezelf niet direct een Sam Altman noemen, maar ik vond de hoopgevende boodschap die jullie hebben en het vertrouwen in GPT-NL wel heel mooi en passend, want wij worden er zelf ook heel enthousiast van.

Lars Anderson 3:00

Ja en ja, we gaan natuurlijk praten over waar staan jullie nu? Het model is voor een groot deel getraind. Jullie zijn op zoek naar founding partners. De. Er gebeurt een hele hoop, maar ik zou toch nog heel even die. Die parallel willen maken met OpenAI en big tech. ChatGPT van OpenAI had ongeveer € 100 miljoen nodig om getraind te worden met heel veel data en heel veel rekencapaciteit. ChatGPT-5, de kenners schatten in dat het ongeveer op 1 miljard zit om dat model te trainen. General purpose model. Ja, en jij hebt van de overheid een kapitaalinjectie gekregen van € 13,5 miljoen. Toch een schijntje als je dit afzet tegen de duizelingwekkende getallen van Big Tech. Ja, mijn eerste vraag zou dan zijn wat deed je besluiten om dit project op te pakken en te geloven dat je verschil kan maken hiermee? Want dat lijkt me zo moeilijk dat je dat je een relatief klein budget hebt voor iets wat zo groot uitgemeten wordt op dit moment in onze media.

Saskia Lensink 4:03

Ja, en deze vraag krijgen we natuurlijk continu. Ja. Zijn jullie helemaal gek? Dertien en een half miljoen, wat kun je daar nou mee? Misschien wel goed om te beginnen met verduidelijken dat wij niet een nieuwe chat GPT aan het bouwen zijn. ChatGPT is een algemeen taalmodel dat zowel voor de consumentenmarkt als de zakelijke markt, als voor heel veel soorten dingen ingezet kan worden en ook allerlei leuke features heeft. Niet alle features zijn even nuttig of noodzakelijk, en wij hebben vanaf het begin af aan gezegd we zien dat er met name een behoefte zit de zakelijke markt. We vinden het vooral nu belangrijk om ons even te focussen op zakelijke toepassingen. Want we zien dat Er komt een enorme uitdaging op ons af. Die is er al. We hebben personeelstekort. Onze arbeidsproductiviteit moet gewoon omhoog, willen we relevant blijven in deze wereld. Ai kan daar een mooie oplossing voor vormen, maar dan zouden we wel heel graag AI willen gebruiken die relevant is voor ons en die we goed kunnen inzetten, zonder dat we ons daar ongemakkelijk over voelen.

Lars Anderson 4:59

Jij keert het eigenlijk een beetje om, heb ik het idee. Want je hebt het over We hebben een enorme uitdaging. We hebben een personeelstekort en AI kan daarbij helpen. Terwijl je iedereen die ik spreek bang is voor zijn baan, omdat ze denken dat ze weg worden geconcurreerd.

Saskia Lensink 5:13

Nou, zo zien we hem niet. We denken juist dat er een enorme meerwaarde kan zitten in AI en de mogelijkheden die het biedt.

Lars Anderson 5:18

Ja.

Saskia Lensink 5:19

En voor ons ook. Toen we dit initiatief startten, voelden we ons ongemakkelijk bij de manier waarop Big Tech de producten insteekt, maar ook onze afhankelijkheid ervan en onze gebrek aan kennis. Ze begrijpen het ook wel. Gewoon noodzakelijk dat je weet hoe je dit soort producten zelf kan maken. Dus heel belangrijk om die kennis zelf te ontwikkelen en ook om niet gelijk op te geven. Het feit dat jij minder budget hebt, betekent niet dat je geen stappen vooruit kan zetten. En dat is denk ik wel de allerbelangrijkste energie die wij steeds vasthouden. Ja, je kan wel de hele tijd kijken naar ja maar de rest heeft meer en het is niet eerlijk. En oh, laat maar zitten, maar dan kom je geen steek verder met elkaar. Klagen heeft niet zo heel veel zin. En met 13,5 miljoen zijn we heel ver gekomen. En natuurlijk zijn er wel momenten dat je even twijfelt met Oh jeetje, kunnen we dit wel? Moeten we dit wel? Maar op het moment dat je gewoon heel scherp hebt we hebben dit budget en je gaat terug redeneren wat heb je, wat kun je daarvoor doen? En past dat een beetje binnen de ambitie die we hebben? Dan zie je dat er heel veel mogelijk is. Dus we hebben daar vanaf het begin af aan wel in geloofd dat wij in ieder geval voor de zakelijke markt, voor een aantal kerntaken echt wel een flinke stap vooruit kunnen zetten. En natuurlijk, er zijn altijd onduidelijkheden en onzekerheden, maar we geloofden er vanaf het begin af aan heel sterk in.

Philippe Remarque 6:30

Ja, ook omdat jullie rekencapaciteit hebben, krijgen jullie gratis in principe bij de snellere computer, de supercomputer die hier in Amsterdam Oost staat.

Saskia Lensink 6:40

Helaas niet gratis.

Philippe Remarque 6:41

Oké.

Saskia Lensink 6:41

Nee, nee. Zo, zo mooi is het net niet. Maar het is wel heel mooi om met SURF samen te werken. Wat dat betreft is dat echt heel mooi dat we daar de krachten kunnen bundelen met hen.

Lars Anderson 6:53

Ik denk dat je voor de luisteraar moet vertellen wat.

Saskia Lensink 6:56

Het betekent.

Lars Anderson 6:57

Wat het nou eigenlijk allemaal.

Saskia Lensink 6:58

Is. Zeker. Zeker. SURF is de ICT-dienstverlener en -leverancier van onderwijs en onderzoek in Nederland. Veel mensen zijn wel eens in aanraking gekomen met SURFsara of met de Snellius-supercomputer die in Amsterdam staat. Surf heeft zelf uitgebreide ervaring, ook met het bouwen en maken van AI modellen op basis van publieke waarde. En dat was echt wel een houding en een richting die wij heel erg mooi vinden en ook heel goed vonden passen bij dit onderwerp. En daarnaast hebben zij natuurlijk een flinke expertise op het gebied van high performance computing. Dus ja, één en één was al heel gauw twee.

Philippe Remarque 7:32

Ja en ze hebben toch 88 Nvidia-chips? Het zijn niet de 20.000 van Sam Altman, maar eh. Maar je kunt daar toch wel iets doen op zo'n.

Saskia Lensink 7:43

Je kan heel veel doen. Ja, bijvoorbeeld een GPT NL versie één trainen en wat we dus aan het doen zijn. Maar we vinden nog heel veel andere onderzoeken plaats die met hulp van Snellius getraind worden. Dus dat is echt fantastisch. Heel mooi dat we dat hebben. Wat nog mooier is, is dat surfen ook samen met TNO en een aantal andere bedrijven en dan vooral ook de regio Noord, samen een AI factory aan het bouwen zijn. Dus dat gaat ook weer een enorme stoot vooruit betekenen in de rekencapaciteit die we hebben in Nederland. Ja, er zijn ook initiatieven in Brabant. Er zijn initiatieven in Amsterdam, dus er is. Er wordt steeds meer gewerkt aan het verhogen van al die computercapaciteit en ook de kennis en kunde die we daar hebben in Nederland.

Lars Anderson 8:22

Die supercomputer Snellius is vernoemd naar de natuurkundige van de brekingswet van Snellius. 88 GPU's H100 Nvidia GPU's zijn dat zeg maar de hoe noem je dat de meest geavanceerde chips. Er zit er iets van 655 in, waarvan 430 als ik het goed heb onthouden van die van die topmodellen. Maar waarom hebben jullie zo'n relatief beperkt deel van die supercomputer tot jullie beschikking? En waarom niet gewoon the whole shebang, de hele computer.

Saskia Lensink 8:52

Dan was het budget op en dan konden we onze mensen niet meer betalen. Ja, dat is inderdaad gewoon echt een kostenafweging. We hebben een bepaald budget gekregen en dat is natuurlijk ook echt. Het is inderdaad een injectie van de overheid, een startkapitaal en daarmee moeten we ook gewoon laten zien wat we kunnen. Zo zie ik het ook heel erg. En we hebben. En dan? Dan ga je gewoon terugrekenen. We denken zoveel data te kunnen verzamelen, zoveel mensen nodig te hebben, zoveel computer gaat dat kosten en dan probeer je dat allemaal zo te optimaliseren dat je die 13,5 miljoen uitgeeft en niet daar ver boven schiet, maar ook niet heel veel over houdt.

Lars Anderson 9:25

Ja, en hebben jullie nog gekeken? Eventueel ook? En die werkt natuurlijk heel veel met durfkapitaal. En hebben jullie ook nog gekeken of jullie ergens nog wat kapitaal weg konden halen om toch meer slagkracht te krijgen? Dus dat je als overheid zegt van 13,5 miljoen en daar het bedrijfsleven zetten dan ook 13,5 miljoen tegenover.

Saskia Lensink 9:42

Zeker, daar zijn we nu volop mee bezig, maar dat.

Lars Anderson 9:44

Zijn er nu, nu op dit moment mee bezig.

Saskia Lensink 9:46

Ja, daar zijn we nu volop mee bezig in deze fase. Waarom niet vanaf het begin of vanaf het begin? Als eerste ook. Ten eerste de scepsis van iedereen met nou moeten we dit wel willen en kunnen we dit wel? Dat is natuurlijk een hele grote vraag. Je kan wel de ambitie hebben en je kan wel het geloof hebben dat je er heel veel mee kan bereiken, maar je moet het wel echt even laten zien. Nou, dat hebben we nu gedaan. Een heel belangrijke stap vooruit was daarin ook de deal die we konden sluiten met NDP nieuwsmedia. Dus alle data die we nu mogen gebruiken. En dat was voor ons ook echt wel een teken aan de wand dat deze aanpak gaat werken en dat deze aanpak werkt. Uiteindelijk moet je het laten zien. Je moet het bewijzen voordat je naar de vervolg.

Lars Anderson 10:24

Aanpak is dan de samenwerking denk ik in eerste instantie dat werkt. Maar dan heb je nog de vervolgstap nodig van ja, we gaan dit trainen. Komt daar dan straks uit waar je op hoopt?

Saskia Lensink 10:35

Ja, daar. De eerste tekenen zijn heel goed. Er zijn twee dingen die je dan moet doen. Eerste plaats heb je natuurlijk je interne meetinstrumenten. Dus we kunnen het model langs een aantal meetlatten leggen Die een algemeen beeld geven van zijn performance en hoe goed hij het doet. Maar daarnaast moet je ook gaan uitproberen met daadwerkelijke klanten hoe het model in de praktijk functioneert. Want ik kan jou een standaard wiskunde test geven, maar dat betekent nog niet dat jij in staat bent om een brug te ontwerpen. Of dus dat zijn twee heel belangrijke stappen. Die interne meetinstrumenten, die zijn we er nu langzaam aan het leggen. En dat laat wel een heel mooi beeld zien. Ja, dan zeg ik bijvoorbeeld Met samenvatten zien we al dat hij in een vroeg stadium van de training het net zo goed of zelfs beter doet op Nederlandse teksten dan modellen van vergelijkbare grootte.

Lars Anderson 11:21

Wij hebben het dan over modellen van vergelijkbare grootte.

Saskia Lensink 11:23

Een bekend model dat vaak wordt ingezet is OLMo 3 voor de mensen die het kennen. Dat is een model dat op ongeveer dezelfde hoeveelheid data is getraind en dezelfde aantal parameters heeft. Een aantal parameters van een model zegt iets over hoe groot het is en hoe hoeveel complexiteit het aankan ook.

Lars Anderson 11:40

Ook hoeveel verbindingen die kan leggen.

Saskia Lensink 11:42

Min of meer ja, ja, ja, daar komt het op neer. Dus je wil geen appels met peren zeggen.

Lars Anderson 11:46

Als je een verbinding legt in je hersenen kan zeg maar 26 miljard parameters. Kan zo veel verbindingen leggen. Binnen het model?

Saskia Lensink 11:56

Ja, min of meer. Het is altijd wel een beetje gevaarlijk om de link te maken met hoe het menselijk brein functioneert. Ik Snap ik, maar ik. Ik heb ooit wel eens een heel bekend neuro scientist horen zeggen dat een vergelijking tussen hoe neurale netwerken in de AI werken en het brein de slechtste vergelijking ooit is die je kan maken. Dat heb ik altijd ter harte genomen, maar het is wel inderdaad een parallel die je kan aanhouden. En de grap is hier inderdaad kijk, we vergelijken het voor de interne evaluaties met modellen van vergelijkbare grootte, maar we kijken natuurlijk ook hoe doet hij het dan ten opzichte van die nieuwste generatie modellen? Dus Precies. En we hebben wel vanaf het begin af aan gezegd het is een succes als wij hetzelfde niveau weten te halen op deze kerntaken als ChatGPT 3.5. Dus dat was de eerste ChatGPT die uitkwam in november 2022, toen we ineens allemaal omvergeblazen werden. Die kwaliteit moeten we echt wel minimaal kunnen halen. En daar zitten we op. Oké.

Lars Anderson 12:53

En nog verder dan die kwaliteit. Of zit je echt op die kwaliteit of.

Saskia Lensink 12:58

We zitten ongeveer op die kwaliteit. Maar het is wat ik al zei, het is een beetje appels met peren vergelijken. En we willen ook heel graag met klanten in hun praktijkcontext gaan kijken. Hoe goed functioneert het model voordat we echt die hele harde conclusie kunnen trekken?

Philippe Remarque 13:14

Ja en. Want ik.

Saskia Lensink 13:14

Begrijp goed uit.

Philippe Remarque 13:15

Want ik begrijp hem als je. Oppervlakkig gezien zou je zeggen ja, we zijn toch al weer veel verder. Een paar jaar later veel modellen meer en dat haalt het niet bij. Maar jullie zeggen dit model is voor een paar soorten functies geschikt, dus het is geconcentreerd en het bevat heel veel Nederlands. Onder andere artikelen die ik en Lars hebben geschreven denk ik. Heel veel dank. Dat waren sommige van de tokens in de zee en. Maar daar zal en dat zou. Dan compenseert dat dan een beetje zeg maar die. Die extra's die erbij zijn gekomen in de afgelopen jaren bij de grote Big Tech modellen compenseert.

Saskia Lensink 13:59

Deels waar het natuurlijk ook heel goed voor is. Het is ook het creëren en het eerste stappen zetten in een gezond ecosysteem. Ai heeft een hele complexe keten. Er moet heel veel data in computer, weet ik wat allemaal. En wij vinden dat ecosysteem. Een ecosysteem moet worden waarin onder andere data eigenaren ook meeprofiteren van alle ontwikkelingen die er zijn. Er wordt op dit moment heel veel geld verdiend in Silicon Valley met dit soort modellen, met AI, met alle hypes die er omheen hangen. En er lijkt op dit moment nog vrij weinig terug te vloeien naar de eigenaren van de allerbelangrijkste grondstof die erin zit, namelijk de data.

Lars Anderson 14:37

Ja, basically niks nieuws. Er is een understatement lijkt me.

Saskia Lensink 14:42

Het is inmiddels wat. Wat ik wel mooi vind om te zien. Er zijn wel steeds meer bedrijven die de keuze maken om ook licentiedeals af te sluiten en naar tot betaling over te gaan. Dus het is helemaal. Het is niet zo zwart wit dat niemand betaalt.

Philippe Remarque 14:56

Hoop ik. Je bedoelt boekenuitgevers?

Lars Anderson 14:58

Je bedoelt de partnerships tussen Axel Springer bijvoorbeeld? En. Exact. Ja, precies.

Saskia Lensink 15:03

En Microsoft?

Philippe Remarque 15:04

Ja, dat gaat over live nieuws enzo. Maar een topic heeft ook iets aan boekauteurs gegeven geloof ik.

Saskia Lensink 15:11

Ja, er is daar ook of afgekocht, toch? Ja.

Philippe Remarque 15:14

Dat moet je het zo zien. Nadat ze een rechtszaak aangespannen. Ja.

Saskia Lensink 15:17

Ja, exact. Dus je ziet dat er heel veel rechtszaken lopen momenteel.

Lars Anderson 15:20

Maar goed, we dwalen af. Het gaat om copyright. Het gaat erom dat de data waarop de machine is getraind zijn. Intellect mag het eigenlijk niet noemen, maar eigenlijk zijn voorspellende gaven, Laat ik het dan zo maar noemen dat die zo juist mogelijk is en met name in het Nederlands taalgebied. En dat iedereen die daar aan heeft bijgedragen dat, ja, dat dan ergens terugvloeit, die knowhow. Die kennis dus. Dat is in elk geval gelukt.

Saskia Lensink 15:47

Ja, het is gelukt. Wij hebben nu ook met jullie onder andere afgesproken dat alles wat alle betaalde of private datasets die erin gaan, die gaan straks de eigenaren daarvan, die gaan straks meedelen in een deel van de opbrengsten die wij genereren met dit model. Ja, dus er vindt een compensatiemodel plaats en dat is twee. Dat. Dat levert twee mooie voordelen op. Aan de ene kant fijn, want dan hebben we een ecosysteem opgezet waarbij we eerlijker met elkaar profiteren van alle potentie die er in deze modellen zit. En tegelijkertijd creëer je ook een incentive. Een reden voor andere data eigenaren om ook in te gaan stappen naar de toekomst toe. Ja, want we willen natuurlijk door met een groter model en dan heb je toch meer data nodig.

Lars Anderson 16:29

En blijft dan het vehikel wat zeg maar dit aanstuurt. Blijft dat TNO.

Saskia Lensink 16:33

Zou kunnen we zijn.

Lars Anderson 16:35

Kan me voorstellen dat op een gegeven moment dat een zakelijk iets wordt, dat het lastig zit om dat daarbinnen binnen TNO te houden.

Saskia Lensink 16:41

Ja, dat zou kunnen is een heel terechte vraag die je hier stelt. En we zien deze uitdaging ook, want we zullen uiteindelijk ook en we gaan nu ook naar een veel meer operationele fase.

Lars Anderson 16:50

Grappig genoeg heb je eigenlijk dus hetzelfde probleem als dat OpenAI had op een gegeven moment. Zij begonnen als onderzoeksinstituut en als een non-profit instituut.

Saskia Lensink 17:00

Ja, en het is ook niet voor niks dat wij hier dus nu niet direct ja of nee op antwoorden. Want we hebben natuurlijk ook heel goed gekeken naar dat voorbeeld en ook gezien wat er eigenlijk mis is gegaan. Het is vanuit een heel idealistische gedachte gestart en dat is toch best wel afgedreven naar. En wat we nu ook zien. Je ziet de hele discussie rondom Solvinity die plaatsvindt, dus waar.

Philippe Remarque 17:21

Waar de DigiD-data exact zijn opgeslagen.

Saskia Lensink 17:24

Die overgekocht dreigt te worden door een Amerikaanse partij. En daar voelen we ons nu heel erg ongemakkelijk over met z'n allen. Oh jeetje, we willen toch niet dat platform in handen komt van een Amerikaanse partij, terwijl wij al onze gevoelige data daar overheen laten gaan? Hoe lastig. Lastig dus. Je voelt al de hele stemming en de manier van denken over dit soort ontwikkelingen begint zich toch wel te draaien. En dat heeft als consequentie dat wij nu aan het kijken zijn. Natuurlijk, die operationele slagkracht is heel belangrijk. We willen ook groeien. We zien ook heel veel potentie om dit verder op te schalen. Betekent ook dat er een investeringsbehoefte zit. Ja, maar je wil voorkomen dat de boel uiteindelijk straks bij een Amerikaan of een Chinees terecht komt op het moment dat het een beetje succesvol begint te worden.

Lars Anderson 18:11

Want wat gebruiken jullie? Al het Amerikaans is Draaien jullie bijvoorbeeld servers op AWS van Amazon of hoe, wat, wat? Wat zit er allemaal Al wat geconnecteerd is met Amerika.

Saskia Lensink 18:19

Op dit moment helemaal niks. Kijk, we hebben nu het model gemaakt. We zijn nu verder aan het finetunen en we gaan met onze eerste klanten aan de slag. En dat doen we expliciet even alleen maar met klanten die het model op hun eigen afgesloten infrastructuur kunnen draaien. Dus daar hoeft geen platform of cloudaanbieder bij te komen kijken.

Lars Anderson 18:37

Heb je een voorbeeld van een klant? Is dat het NIOD.

Saskia Lensink 18:41

Wij zijn met een aantal publieke overheid heeft.

Lars Anderson 18:43

Het Nederlands Forensisch Instituut bedoel ik eigenlijk.

Saskia Lensink 18:45

Dat is een consortium partner van ons. Het niet.

Lars Anderson 18:47

Precies.

Saskia Lensink 18:48

Precies. Zij zijn vanaf het begin af aan betrokken, net zoals SERV. De reden dat we met het NFI ook de samenwerking zijn aangegaan, is niet alleen omdat zij heel veel ervaring hebben met taalmodellen en AI modellen, maar ook vanwege de hele complexe context waarbinnen zij die modellen inzetten, namelijk forensische opsporing. Daar moet je wel heel goed nadenken over de ethische implicaties en wettelijke kaders. Dus wat dat betreft zijn zij een hele strenge partner die op hele strenge wijze meekijkt en ook tegen hele concrete problemen aanloopt als zij zomaar AI zouden inzetten. Dus dat geeft ons ook echt een extra reden om dingen heel goed te doen.

Philippe Remarque 19:28

En, en dat zijn ook degenen dat, dat NFI is ook waar jullie het gaan uitproberen. Of aan.

Saskia Lensink 19:32

Tafel. Ja, we gaan het NFI, zeker het model ook verder uitproberen op hun lokale context. Ook om te kijken of dat uiteindelijk misschien in hun praktijk ingezet gaat worden. Dat blijft wel ingewikkeld. Het is een ingewikkelde context, dus dat is ook aan het NFI om daar de eigen afwegingen in te gaan maken. Maar de meeste launching customers waar we mee werken zijn partijen in de publieke overheid. Publieke sector, ook een partij in de private sector. En dat geeft ons een hele mooie kans om verder te kijken. Waar werkt het en waar werkt het niet?

Philippe Remarque 20:05

Ja, en dat is ook de hoop voor de toekomst van het model natuurlijk. De exploitatie. Dat Nederlandse ministeries en publieke instellingen die. Die zullen misschien de verplichting krijgen op den duur om niet met Amerikaanse modellen te werken, maar met de eigen modellen, zodat ze ook doorontwikkeld kunnen worden. Allemaal in het kader van de Europese autonomie en Exact. Ja.

Saskia Lensink 20:26

En er zijn nu ook al wel use cases waar geen generatieve AI ingezet mag worden, omdat het om hele gevoelige informatie gaat, of omdat men zich daar heel ongemakkelijk bij voelt. En daar wil je alvast met een alternatief kunnen komen, maar uiteindelijk. Het is leuk als je een alternatief hebt dat het een beetje doet, maar het is wel cruciaal dat het alternatief uiteindelijk niet alleen maar goed, maar heel goed gaat werken, zodat je veel meer waarde kan toevoegen.

Philippe Remarque 20:49

Ja, ik Saskia, wij, wij, wij. Als licentieafsluiter mogen wij het model ook gebruiken en er wordt hier in bedrijven al over gepraat. Dadelijk als we GPT-NL hebben. Dat zal jou als muziek in de oren klinken en dan willen we er ook mee gaan werken. Maar waar dan? Ja, dan krijg je natuurlijk ook wel heel veel kritische blikken. En dus onze vraag is natuurlijk hoe goed is het model en waar is het goed in?

Saskia Lensink 21:13

Het is goed in samenvatten, in versimpelen en in RAG, voor zover dat voor de luisteraars iets zegt. RAG, of retrieval augmented generation, is in feite een zoekmachine zoals we die kennen, gekoppeld aan een groot taalmodel, in dit geval GPT, nl. In je eigen documenten. Dus dat zorgt ervoor dat je heel makkelijk door je eigen documenten heen kan zoeken, vragen kan stellen en daar informatie uit kan trekken. Daar, daar hebben we GPT-NL op geoptimaliseerd. Dus op dat samenvatten, versimpelen en die RAG.

Lars Anderson 21:43

En wat is dat versimpelen dan? Kun je dat? Kun je daar een voorbeeld van geven?

Saskia Lensink 21:46

Ja, wat je vaak ziet is dat. Stel je hebt een juridisch document en je wil dat in gewone mensentaal aan mij uitleggen. Dan is dat fijn als je daar een stukje automatisering in hebt. Voor veel overheidspartijen is het belangrijk om naar de burger te communiceren op B1 taalniveau. Ja, ga zo maar door. Dus daar zijn we mee bezig.

Lars Anderson 22:04

Dus dan kun je er gewoon een knop op de site maken met maakt dit makkelijker leesbaar voor mij. En dan klik je erop en dan gebeurt dat.

Saskia Lensink 22:11

Dat zou een hele mooie uitkomst zijn. Ja inderdaad. Dus we gaan nu ook kijken met een overheidspartij. Hoe goed werkt dat? Dus wij gaan daar met.

Philippe Remarque 22:18

Ja, en wij hebben bijvoorbeeld op een van onze websites hebben we in België van Het Laatste Nieuws. Daar kan je al vragen stellen aan het nieuws en dat is uiteraard gebaseerd op de. Op de eerder gepubliceerde artikelen van die titel. En dat zie je ook elders in de wereld gebeuren. En dat zou die bijvoorbeeld ook vrij goed kunnen, want dat is een typische RAG-oplossing eigenlijk.

Saskia Lensink 22:41

Precies. En daar, daar gaan we volop op testen en valideren de komende maanden.

Lars Anderson 22:45

Misschien een kleine nuancering bij. Bij de Laatste Nieuws hebben ze voorgeprogrammeerde vragen, dus je kunt niet letterlijk zelf praten met het nieuws, maar het zijn vragen, zeg maar die de redactie interessant vindt op basis van een AI die daar dan antwoorden op geeft.

Philippe Remarque 22:59

Ja, het is een eerste stap. Ook omdat we natuurlijk nog helemaal niet zo zeker zijn van de uitkomsten en zo en het natuurlijk nagekeken moet worden. En moet natuurlijk alles heel zorgvuldig doen. Maar. Maar dit is wel iets wat in de toekomst van mediagebruik best belangrijk zou kunnen worden.

Saskia Lensink 23:12

Ja, en het is ook een hele veilige weg om het eerst iets meer afgeschermd te doen met elkaar. En dat is ook precies de stappen die je wil zetten. Want het is niet alleen je taalmodel, het is ook het proces wat je daaromheen inricht.

Lars Anderson 23:22

En waarom zou het GPT-NL-taalmodel juist heel goed zijn in RAG?

Saskia Lensink 23:30

Nou, ik zou niet willen zeggen dat het juist heel goed is in RAG ten opzichte van andere taalmodellen die ook goed moeten.

Lars Anderson 23:36

Samenvattingen, Die snap ik. Het versimpelen van taalgebruik ook, want het gaat heel erg over dat taalgebruik. Maar dat retrieval. Dat is ook iets wat je via de andere modellen kunt doen. Dat we hebben, passen het nu al toe op onze eigen, op onze eigen artikelen. Het enige is dan dat we. We gebruiken een AI wat niet copyright, technisch beschermd of wel legitiem is. Althans wij heel veel haken en ogen aan zitten. We weten voor een heel groot deel niet hoe dat ding werkt. En bij jullie weten we dat waarschijnlijk nu ook nog niet. Alhoewel ik wel een tabel zag waarin jullie echt wel met copyright werken en dat jullie niet alles gescrapt hebben. Dan snap je. Dus alles is gewoon, alles is tot in de puntjes geregeld. Dus dat is gewoon ook prettig om aan onze abonnees en lezers uit te leggen van wij. Wij schaden hiermee niemand. Dat zou een hele fijne zijn.

Philippe Remarque 24:23

Max Havelaar AI eigenlijk exact Ja. Ja.

Saskia Lensink 24:25

Ja, ja, zo zou je het kunnen noemen.

Philippe Remarque 24:27

Ja. Misschien zo. Jullie moeten toch naar een nieuwe naam, begrijp ik, Want we hebben vernomen dat jullie naam gekaapt is door een boef. Kun je daar iets over zeggen?

Saskia Lensink 24:39

Ik zou het, ik zou het niet willen omschrijven.

Lars Anderson 24:41

Handiger?

Philippe Remarque 24:42

Ja, nou hij niks fout gedaan.

Saskia Lensink 24:45

Dat is gewoon onze eigen gebrek aan ervaring. Laat ik het zo zeggen. Gewoon een domme fout van ons jullie.

Philippe Remarque 24:51

Maar wat is er gebeurd dan?

Saskia Lensink 24:52

Ja, nou, wij hadden heel trots aangekondigd Wij krijgen een stuk subsidie om GPTNL te gaan bouwen. Wat een feest! Maar we waren vergeten om een website, naam en domeinnaam te registreren en dat was niet zo handig. Dus een andere partij heeft dat toen wel gedaan en dat is GPTNL dot com geworden. En dat is prima. Dat mag iedereen doen. Dat is wat.

Lars Anderson 25:14

Op zich ook een waardeloze URL is trouwens. Dus op zich op zich, het had.

Philippe Remarque 25:18

Slechter gekund. Maar we zijn nu. Want als ik op jullie echte site kom, dan staat er een waarschuwingsdingetje van. Er is een. Want zij bieden ook abonnementen aan die helemaal niet bestaan. Dus. Dus ze proberen ook al mensen op te lichten.

Saskia Lensink 25:31

Nou, ik zou het geen oplichting willen noemen en wellicht bestaan die diensten wel. Kijk, het staat iedere partij vrij om dit soort dingen in de markt te zetten. En als wij die naam niet hebben getrademarkt of geregistreerd, dan mag dat gewoon.

Philippe Remarque 25:43

Je kan geen aangifte bij de politie doen als zij niet onder jouw onder jouw naam eigenlijk een verkoop van niet bestaande diensten. Dat, dat. Dat gebeurt ook veel met de BN'ers die daarvoor gebruikt worden. Die spannen wel rechtszaken aan en zo.

Saskia Lensink 25:59

Ja, we hebben wel een cease-and-desist letter gestuurd, zoals dat dan heet. Dus dan vraag je aan die partij joh, kun je ermee stoppen? Maar uiteindelijk doen ze helemaal niks verkeerds en het is gewoon echt onze eigen fout geweest. Als jij oversteekt zonder om je heen te kijken en je wordt aangereden, dan kun je dat niet aan de andere kant kwijt.

Lars Anderson 26:15

Ik vind het eigenlijk om dat. Dit is echt iets wat. Ik begrijp hier echt helemaal niets van. Als ik een initiatief begin of een bedrijfje, dan is het eerste wat ik doe checken is die wel vrij of niet?

Saskia Lensink 26:24

Dus nu ook Ja.

Philippe Remarque 26:26

We hebben ervan geleerd. Maar Saskia en jullie denken Jullie zijn dus ook op zoek naar een nieuwe naam en de Is. Is daar al iets over bekend? Kun je die onthullen in onze podcast?

Saskia Lensink 26:37

Nee, ik ga hem nog niet delen, om alle redenen. We hebben nu wel een beetje onze les geleerd. Hij is inmiddels geregistreerd. We hebben een trademark aangevraagd, dus dat komt binnenkort. Dus we gaan het nog even niet delen.

Philippe Remarque 26:49

En niet Max Havelaar.

Saskia Lensink 26:50

Het is geen Max Havelaar, dat is het enige wat ik kan zeggen. Het zou wel een hele goede naam zijn geweest.

Lars Anderson 26:56

Ik wil even terug naar het model, want daar zijn heel veel luisteraars denk ik heel nieuwsgierig naar. Hoe kwam hij nou tot dit idee? Hoe kwam je aan de mensen en hoe kwam je aan de data? Hoe kies je welke data je wel gebruikt en wat je niet gebruikt? Jullie hebben ook synthetische data gebruikt. Daarvan vraag ik me ook af hoe kom je daar dan aan en wanneer voldoet dat aan een bepaalde kwaliteit? Dan hang je nog gewichten aan de data. Van welke data laat je zwaarder tellen? In dit geval neem ik aan dat een Nederlandstalige data zijn, als ik het goed uit mijn hoofd heb. 10% van de data is Nederlandstalig, 70% van de data is pakweg Engelstalig. Dan zit er nog iets van dertig, 25 tot 20% Germaanse talen. Zitten er in.

Saskia Lensink 27:45

Dna code met name.

Lars Anderson 27:46

Ook codecode? Ja, ik dacht Germaanse talen en dan nog 5% synthetische data.

Saskia Lensink 27:51

Ja, dat is die Germaanse data. Wat we. Hij zit ongeveer zo in elkaar. Ja, dus wat we hebben is ook data uit bijvoorbeeld Duitse of Deense context. Dat is een context die heel erg lijkt op de Nederlandse context. Die hebben wij vertaald naar het Nederlands en die hebben wij ook toegevoegd aan de dataset. Dat is maar een klein stukje, maar dat is vooral ook om te kijken. Levert dat ook hoogwaardige Nederlandstalige data op die het model beter maakt? Ja dus. Je moet heel veel dingen uitproberen. Dus daar hebben we inderdaad ook mee geëxperimenteerd en daar ook een stukje van toegevoegd. En we hebben er ook softwarecode bij zitten. Allerlei onderzoeken laten ook zien dat je model wat beter functioneert als die ook heel veel programmeercode heeft gezien.

Lars Anderson 28:33

En hoe kom je aan die code? Want de Nederlandstalige artikelen, die snap ik. Die, die leveren wij bijvoorbeeld aan. Maar de code zonder dat daar dat je die in. Eigenlijk dat je die in licentie kunt gebruiken.

Saskia Lensink 28:45

Nou, we hebben juist heel goed gekeken naar welke data mogen we wel gebruiken en onze due diligence gedaan. Dus heel goed gecheckt welke licentie informatie zit daarop? Is die bekend en staat die ons toe om een model te maken dat we vervolgens ook mogen gaan exporteren? Dat zijn allemaal checks die we doorlopen. En voor die code zijn er heel veel datasets beschikbaar op het internet die expliciet als licentie hebben. Dit mag gebruikt worden voor dit soort doeleinden.

Lars Anderson 29:11

Ja, en van die 13,5 miljoen. Waar gaat nou het meeste geld naartoe? Wat is de verdeling aan rekenkracht, aan licentieovereenkomsten en hoe mensen die je betaalt die in jouw team zitten? Ik weet niet hoe groot jouw team is. Ik weet ook niet waar je die mensen vandaan hebt, die AI designers. Maar ze zien er allemaal slim uit op de site. Wat? Hoe? Wat? Wat kun je daarover vertellen?

Saskia Lensink 29:36

Ja, we hebben in deze fase allemaal mensen vanuit TNO, vanuit Surf en NFI bij het project aangehaakt. En ik denk dat we met een stuk of twintig à 25 mensen hieraan werken. Dat zijn niet alleen engineers, maar dat is bijvoorbeeld ook de juridische afdeling. Dat is onze marketing en communicatie sales team, onze business developers. Dus er zit een hele schil omheen. Dus die mensen, die liepen gelukkig al rond bij onze organisaties.

Lars Anderson 30:01

Die staan niet op de payroll En in de zin dat ze betaald worden door van die 13,5 miljoen.

Saskia Lensink 30:07

Daar worden ze voor betaald. Inderdaad, dat wel. En een gedeelte van de subsidie. Ik denk dat we zo'n 4 tot 5 miljoen hebben uitgegeven aan rekenkracht kosten.

Lars Anderson 30:15

Dat is de Snellius.

Saskia Lensink 30:16

Ja, dat zijn inderdaad kosten voor de Snellius. En dan. De rest gaat met name zitten in de personele kosten en hier en daar ook wat reiskosten die we hebben. Want we vertellen ons verhaal ook door heel Europa heen.

Philippe Remarque 30:28

Licenties zijn vooralsnog gratis en we gaan pas gaan pas rekening lopen als er ook echt serieus geld wordt verdiend. En dat verwachten wij ook niet zo snel.

Saskia Lensink 30:37

Dat klopt. Wij hebben geen boter bij de vis betaald. Dat is de aanpak die een aantal grote partijen wel kunnen doen. Dus die kunnen datasets afkopen. Dat is honderden miljoenen. Ja, dat geld hebben wij eenvoudigweg niet. Dus we moesten naar een ander model. En dat is inderdaad zodra wij inkomsten beginnen te genereren, dan vloeit er een stukje terug.

Lars Anderson 30:55

Ja, en kun je mij ook uitleggen? Want jullie, Volgens mij is het raamwerk, het framework waarop jullie werken, is van Llama 3, ontwikkeld door Meta en daarbovenop hebben jullie een foundation model getraind en via Snellius en alle data die wij hebben geleverd. Hoe? Hoe werken die twee samen en als. Als het gebaseerd is op dat Llama-model, wat eigenlijk open source is, maar toch ook voor een heel groot deel getraind is met, wat is het eigenlijk, gescrapet materiaal, Common Crawl-data. In hoeverre ben je dan nog zuiver?

Saskia Lensink 31:30

Goede vragen. Dat is daar denk ik belangrijk om het verschil duidelijk te maken tussen je recepten en je taart. En wat je bij veel initiatieven ziet is dat ze continuous pre-training doen of blijven doortrainen op een bestaand model. Dus ze pakken een bestaand model en dan gaan ze daarop verder doortrainen met hun eigen dataset. En dan heb je inderdaad het risico dat je alle juridische kwesties overerft.

Lars Anderson 31:56

Ja, precies.

Saskia Lensink 31:57

Dat hebben wij niet gedaan. Wij hebben alleen maar het recept genomen dat Meta heeft gebruikt om zijn modellen mee te trainen. Dat recept mag iedereen gebruiken. Als je een appeltaart wil bakken, dan kun je dat gewoon gebruiken. Maar we hebben het helemaal vanaf scratch, dus helemaal vanaf de grond af aan zelf opgebouwd. Dus we hebben dat hele fundament zelf gemaakt. En dat fundament is alleen maar gebouwd met data die je mag gebruiken. En inderdaad op basis van code en recepten die we mogen gebruiken.

Lars Anderson 32:24

Ja toch? Interessant hè, dat je dat soort.

Philippe Remarque 32:27

Nou ja, dat is wel echt zorgvuldig meegekeken. Ik zag dat er ook nog een gerenommeerd advocatenkantoor bij jullie betrokken is voor de juridische kant. En ja, zo'n serieuze partij.

Saskia Lensink 32:36

Absoluut. En dat heb je ook nodig, want je bent met iets heel nieuws bezig. Je hebt ook een flinke ambitie, hebben we met elkaar gesteld. En dan ook de ambitie. Laten we gewoon eens kijken hoe ver we kunnen komen als we binnen de wettelijke kaders blijven. En sommige kaders zijn vrij nieuw, of het is allemaal even een beetje spannend. En juist om te kunnen innoveren moet je wel een beetje de grenzen durven te verleggen. Dus we gaan zeker niet buiten de lijntjes kleuren, maar we gaan daar ook niet heel strak, heel voorzichtig niks uitproberen en dan heb je wel iemand nodig die daar echt vanuit autoriteit en ook vanuit heel veel ervaring met je mee kan kijken en op kan adviseren. Ja.

Lars Anderson 33:13

En waarom leid jij dit project? Wat? Wat maakt jou hier die ideale projectleider van? Vertel eens iets over je achtergrond.

Saskia Lensink 33:21

Ik ben taalwetenschap van achtergrond is. Taal is wel een beetje mijn ding.

Lars Anderson 33:25

Voor de taalmodellen ja, precies.

Saskia Lensink 33:26

Ja, en eigenlijk niet. Er is ook een bekende quote. Volgens mij kwam die bij IBM vandaan. Dus iedere keer als je een taalwetenschapper ontslaat, dan wordt je de taalmodel een beetje beter. Dus je moet je vooral niet laten beperken door de taalkundige inzichten. Nee, maar ik zonder grollen en grappen. Het is ook een beetje organisch zo gegaan. Natuurlijk altijd met taal en spraaktechnologie bezig geweest bij TNO. Ja, en toen we op het idee kwamen, dan moet ik met name even de collega's Helmer Smit en Olaf Fisker bedanken. We stonden bij het koffieapparaat, ChatGPT was overal aan het rondzingen, en toen zei die: ja, we moeten gewoon ook een Nederlands model gaan bouwen. Toen dacht ik eerst je bent gek. Nou, dan praten we iets verder en dacht ik ja verdorie, dit is eigenlijk wel een heel goed idee. Laten we kijken of we die subsidie binnen kunnen halen. Zo zijn we aan de slag gegaan. En juist omdat je vanaf het begin af aan betrokken bent en ook met die taal en spraaktechnologie als het veel hebt gedaan weet ik ook gewoon goed waar de pijnpunten zitten. Ook al jarenlang hadden we het gevoel ja, het werkt allemaal niet zo lekker voor het Nederlands. Het Engels gaat oké, maar Nederlands, terwijl je wel alle mogelijkheden ziet en wat die technologie kan gaan betekenen?

Philippe Remarque 34:36

Ja, maar dan is het ook kun je ons vast ook heel goed uitleggen wat het verschil is tussen een groot internationaal model. Dat vooral op Engelstalige teksten is getraind en een. En ja, jullie model, wat? Wat? Wat heel specifiek die Nederlandse input heeft. Want jullie hebben volgens mij onze twintig jaar artikelen ook nog wat zwaarder gewogen omdat daar, nou ja, de. Dat moet jij misschien zeggen, maar het schijnt van behoorlijke kwaliteit te zijn vergeleken met zomaar gescripte dingen van social media of zo.

Saskia Lensink 35:08

Zeker, En er zit ook geen social media data in ons model. Dus scrappen niet onrechtmatig. Maar wat de grap is en sowieso ook we hebben best wel wat kwaliteitsfilters aan het begin gezet, dus sommige social media zou je misschien mogen scrapen. Maar dan nog moet je afvragen of je dat wel echt in je model wil hebben. Of je een Reddit-thread erin wil, of een 4chan. Wij zeggen van doe maar niet. En wat we hebben gedaan? Jullie data heeft het model een aantal keer vaker gezien dan andere datasets. Juist ook om goed de Nederlandse taal en nuance en Nederlandse waarden mee te krijgen. En nieuwsfeiten, Die zijn ook heel belangrijk, want je wil ook graag dat het model een beetje kennis van de wereld heeft. Het zou heel raar zijn als het model straks niet weet wie de koning van Nederland is. Ja, dat, dat zou heel vreemd zijn. Dus dat wil je er heel graag in hebben. Dus daar hebben we ons hard voor gemaakt. En wat het verschil maakt, zeker toen we begonnen, is ook heel erg het beeld. Nou ja, jeetje, als je het model heel goed Nederlands wil laten maken, laten gebruiken dan. Dan moet je er ook voor zorgen dat je de goede, hoogwaardige Nederlandstalige data in stopt. Dus we zijn echt vanuit die overtuiging aan de slag gegaan.

Philippe Remarque 36:20

Wat betekent dat dan? Dat ik in de toekomst bij jullie en een betere Nederlandse zinnen krijg dan bij Chat, GPT of Gemini?

Saskia Lensink 36:30

Niet per se. Nee, dat is ja. Het is gewoon hoe het hoe het is. Die modellen die je net noemt, die zijn ook van hele hoge kwaliteit en die doen een aantal dingen heel goed. Zijn ook vlekkeloos Nederlands aan het produceren. Soms vraag je een beetje af of de tone of voice is de manier waarop ze zich presenteren wel heel erg passend is in de Nederlandse context. Het voordeel dat wij hebben is dat we dus gewoon hele ja, inderdaad nieuwsfeiten, maar ook best wel heel wat saaie ambtelijke documenten en zakelijke documenten met me meegegeven. Want we willen dat model juist ook in die contexten van waarde laten zijn. Dus het model hoeft niet een flitsende cv voor jou te kunnen schrijven, maar het moet wel in staat zijn om een aantal versnellingen in de arbeidsprocessen te kunnen realiseren.

Philippe Remarque 37:14

Ja, en het feit dat jullie heel veel Engels. Ook dat de trainingsdata dus eigenlijk nog meer dan Nederlands. Wat. Hoe? Hoe werkt dat dan op elkaar in? Waar heb je dat voor nodig dan?

Saskia Lensink 37:26

Ja, ze is inderdaad gewoon heel belangrijk dat je taalmodel voldoende teksten ziet om krachtig te kunnen zijn. Je moet gewoon simpelweg heel veel data aan dat model voeren. En we zagen geen enkel scenario voor ons waarbinnen Nederlandstalige data een voldoende grote hoeveelheid zou kunnen opleveren om een model te kunnen trainen dat enigszins bruikbaar is. We moesten daar gewoon ook op zoek naar andere databronnen. Daarbovenop ook in gesprek met mogelijke eindgebruikers. Dus ook heel duidelijk gebleken dat we in de Nederlandse zakelijke context niet alleen in het Nederlands opereren, maar ook heel veel in het Engels is ook gewoon heel nuttige taal om ook te hebben. Dus als GPT-NL geen Engels zou kunnen spreken, dan zou hij wellicht ook een stuk minder bruikbaar en nuttig zijn.

Philippe Remarque 38:09

Maar wij dachten dat dus het specifieke Nederlandse context dat. Dat is wel dus een extra pluspunt. Het is niet zozeer de formulering van het Nederlands, alswel gewoon de inhoud van de antwoorden misschien iets nauwkeuriger zijn, of iets meer op Nederlandse context. Ja, toepasselijk?

Saskia Lensink 38:26

Absoluut. En daar gaan we de komende tijd ook goed testen met verschillende partijen. Of we ook aan die beloften kunnen voldoen? Ja, maar dat is inderdaad wel echt het sterke vermoeden wat we nu hebben en wat we ook een beetje terugzien. Als we een aantal vragen stellen over de Nederlandse context, dan komen daar heel veel dingen op terug die inderdaad heel Nederlands aanvoelen. Hij weet wat een kring verjaardag is, hypotheekrenteaftrek, noem maar op en gewoon een zakelijke context, is het belangrijk dat hij de ins en outs van een aantal Nederlandse normen, waarden, maar ook afspraken kaders goed kent.

Lars Anderson 38:58

Ja, want wat ik veel heb gelezen bij die grote modellen van OpenAI en Gemini, is dat ze best wel veel een soort van human feedback loop nodig hebben. Human feedback reinforcement. Ik weet niet precies wat de wat de term daarvoor is. En is dat bij jullie ook sprake van Of is dat bij jullie minder omdat jullie min of meer een hogere kwaliteit data hebben?

Saskia Lensink 39:22

Tweeledig. Het is inderdaad een fase van de training waarin je een soort a b test met het model doet, dus dan laat je hem een aantal antwoorden genereren en dan kun je aan een mens, maar ook aan een model vragen Welke van deze antwoorden is beter? Dus mensen doen dat tegenwoordig met hulp van menselijke feedback. Ze doen het met hulp van AI. Feedback gaan wij ook verder integreren. Daarbij is wel belangrijk om te vertellen dat wij in de fase die daar net voor zit, ook met een aantal menselijke annotatoren hebben gewerkt. We hebben daar met een aantal partijen samengewerkt om ook datasets voor ons te laten maken, die relevant zijn voor de taken die wij graag willen uitvoeren. Dus we hebben ook een partij gevraagd om ons te helpen een spin AI met het maken van hoogwaardige samenvattingen of met versimpelde teksten. Of met Q&A, dus met feitenvragen en daar het juiste antwoord op, zodat we dat terug kunnen voeren aan het model. En we vonden het ook heel belangrijk om ten eerste met een Nederlandse partij samen te werken om ook de bedrijven in Nederland verder te kunnen stimuleren, maar tegelijkertijd ook om hele kwalitatief hoogwaardige data te maken en dat niet zomaar uit te besteden aan lagelonenlanden. Maar uiteindelijk zul je daar ook een stukje automatisering met AI in willen aanbrengen.

Lars Anderson 40:40

En. En nu wil ik graag een visuele weergave van hoe dat nou eigenlijk werkt. Dus je hebt. Je hebt je data bij elkaar. Ik zie dat voor me dat je een paar mapjes hebt staan op een harde schijf. Die heb je. Dat heb je allemaal bij elkaar 300 miljard of miljard parameters. Eigenlijk het minimum om een soort van ChatGPT-redeneermodel te krijgen. Dat is echt het minimum. En daarboven moet je gaan zitten als je echt zo'n heel groot model wil hebben. Je gaat naar Snellius, daar hang je je harde schijf aan. Ik stelde me maar zo voor en je drukt op de knop en je zegt van nou ga maar, ga maar lekker rekenen hoe Ja, jij was er bij. Maar hoe, wat, wat, hoe gebeurt dat? Hoe gaat dat? Wat? Wat? Wat zijn de stappen?

Saskia Lensink 41:19

Ja, een van de grootste stappen die beginnen al voordat je op die knop drukt. Ze hebben heel veel data binnengekregen. Die data, die moet je vervolgens verder gaan cureren, zoals wij het zeggen. Dus je wil daar bijvoorbeeld vloekwoorden uithalen. Je wil dat normaliseren, zodat daar geen gekke tekentjes tussen staan, omdat je een encoding error hebt dat je wel eens op websites ziet. Je wil daar ook bepaalde brackets van maken, Dus wat je net zei. Onze data is heel hoogwaardig, heeft het model vaker gezien. Ze hebben ook in die filters goed gekeken naar wat is dan kwalitatief hoogwaardige data. En die hebben dan ook een soort van vinkje meegegeven. En heel belangrijk alle privacygevoelige informatie eruit. Dat is cruciaal als je aan de AVG wil houden. Dus daar hebben we ook alle persoonsgegevens van niet publieke personen eruit gehaald.

Lars Anderson 42:11

Ook uit de nieuwsartikelen.

Saskia Lensink 42:13

Óók uit de nieuwsartikelen. Ja, dus.

Lars Anderson 42:14

Alle mensen die daar geïnterviewd worden, die haal je eruit. Alle namen.

Saskia Lensink 42:18

Ja, we halen daar vrijwel alles uit, behalve mensen die een eigen Wikipediapagina hebben. Dus we hebben daar gezegd publieke personen, die laten we in de data staan en dan alleen de informatie die over hun publieke rol gaat. En waarom? Het is wel heel belangrijk dat het model ook een stukje wereldkennis heeft. En als het model geeneens snapt wat een naam of adres is, dan wordt het heel lastig Als die niet weet wie de koning van Nederland is. Dan twijfelen we ernstig aan de bruikbaarheid van het model. En dan heb je heel veel CO2 de lucht in geschoten voor iets wat totaal nutteloos is. Dus dat, dat vonden we niet meer verantwoord of proportioneel.

Lars Anderson 42:53

Oké en dan? Dus dan heb je. Heb je de data, dan heb je alle data. Daar ben je al een paar maanden mee bezig lijkt mij om dat allemaal schoon te maken.

Saskia Lensink 43:01

En inderdaad, dat staat dan flink te ronken, ook op de Snellius overigens. En dan moet je die data om gaan zetten van taal naar cijfers. Ja, dat zijn. Ik kan zo'n machine alleen maar met cijfers rekenen.

Lars Anderson 43:12

Hij kan niet lezen, hij kan gewoon niet kan rekenen.

Saskia Lensink 43:14

Nee, nee, precies. Dus je doet een soort vertaalslag. Dus dan wordt mijn naam wordt ineens drie, vier, vijf, noem maar wat. Ja, en dat gooi je in de machine en dan gaat ie rekenen wat je hem laat doen. Je laat hem heel vaak door al die teksten heen lezen die hij heeft gezien.

Lars Anderson 43:28

Hij kent zelf die getalletjes toe, toch?

Saskia Lensink 43:30

Ja, ja, inderdaad, ja, het is iets wat we.

Philippe Remarque 43:33

Ook in staat.

Saskia Lensink 43:33

Zou moeten doen. Het is een heel interessant proces. Er zijn op YouTube heel veel leuke tutorials te zien die ook uitleggen wat daar precies achter zit, dus raad ik van harte aan. Maar het leuke is, dat model gaat dus langs al die cijfers en die gaat dan leren welke woorden of welke cijfers dus. En welke volgen heel vaak op elkaar. Dus als ik zeg de dan kan tafel kan daarna staan, maar dan kan de. Meisje Ja, dat is niet correct, dus dat. Dat leert hij dan af als het ware. En zo leert hij gaandeweg wat de distributionele kenmerken van taal zijn. Om eventjes heel technisch te maken. Dus welke woorden komen vaak na elkaar voor? Wat zijn logische patronen? Wat klinkt lekker Nederlands? Wat klinkt lekker Engels? Dat heeft hij dan heel goed geleerd. En dat is die eerste fase. Dat duurt een paar maanden, dus dan gaat hij de hele tijd over al die teksten heen en dan leert hij gewoon heel goed Nederlands en Engels.

Lars Anderson 44:23

Praten duurt een paar maanden om te rekenen. Dus die computer, die 88 GPU's op basis van die van die computerkracht, daar gaat hij de hele tijd doorheen. En dan gaat hij verbanden leggen en dat wordt steeds meer. Hij gaat al die neurale netwerken leggen en daarin ontstaat langzaamaan een soort van een klein modelletje, het eerste foundation modelletje. Oké, dus je hebt op die knop gedrukt. Je gaat rekenen. Wat ga je er dan ook naartoe? Ga je dan ook tussen die zoemende servers rondlopen omdat je denkt oh, ik wil weten hoe dit, hoe dit, hoe dit verder gaat?

Saskia Lensink 44:52

Ja, de ruimte is niet zomaar te betreden, maar ik heb er inderdaad wel eens een paar keer gestaan en ook die lampjes zien knipperen. Dat is dan heel geruststellend. Nee, kijk, uiteindelijk is het allemaal gewoon verbonden met netwerken. Dus onze mensen zitten gewoon van achter de laptop inderdaad Snellius in de gaten te houden. Ook wel leuk als je zo aan het trainen bent. Dan wil je ook in de gaten houden dat alles goed loopt. De hardware controleren, de status en ook traint het model nog wel de goede kant op. Dus we hadden een heel babysitschema, dus tot de avonduren weekend. Er was altijd wel iemand die de machines en de boel in de gaten hield.

Lars Anderson 45:23

Ja, want dan heb je een soort van dashboard. Je krijgt je van server om te checken hoe het, hoe het loopt en of alles draait.

Saskia Lensink 45:29

Ja, ja, dus dat houden we allemaal goed in de gaten. En dat, dat ging ook gewoon in de weekenden door. En natuurlijk ook tijdens de zomerperiode vond dit allemaal plaats. Dus het was ook even zoeken met elkaar wie is wanneer op vakantie? Maar daar heeft het team echt, ja heel enthousiast op de meest gekke uren heel hard aan gewerkt.

Lars Anderson 45:47

En wanneer is er dan een moment waarop iets of iemand of de computer aangeeft? We zijn er voor zoveel procent, want als je iets kopieert, dan zie je het. Het balkje loopt tot 100%. Maar hier, je kunt hem eindeloos laten rekenen.

Saskia Lensink 46:00

Ja, ja, je hebt een aantal indicatoren om te kijken. Is hij nog wel aan het leren? Dat noemen we bijvoorbeeld de loss. Dat zegt iets over: Hoe verbaasd is het model dat die bepaalde woordcombinaties tegenkomt? En je laat hem ook wat taken uitvoeren tussendoor en dan monitor je gewoon een beetje. Is hij nog op de juiste weg? Is hij nog dingen aan het leren? Zien we dat een bepaalde curve nog omlaag gaat? Zie je dat hij beter word op bepaalde taken? Ja. Nou, dat hebben we de hele tijd in de gaten gehouden en aan de andere kant was het ook gewoon heel praktisch. Ja, we hadden voor X aantal uren aan computers kunnen inkopen. Op een gegeven moment moet Snellius ook weer door andere gebruikers ingezet worden. Dus ja, je hebt ook maar een beperkte tijdslijn. Ja, op een gegeven moet je ook gewoon stoppen. Maar we zagen wel dat we op dit moment best wel heel veel uit de data hebben kunnen trekken. De hoeveelheid die we nu hebben.

Lars Anderson 46:51

Maar hoe zie je dat dan?

Saskia Lensink 46:52

Dat zien we echt aan die loss-curve. Dus we zien eigenlijk gewoon een lijntje die laat zien hoe verbaasd het model is over bepaalde woordcombinaties. Nou, als jij verbaasd bent dat als ik zeg de meisje, dan heb jij blijkbaar iets geleerd over Nederlands. Zo is dat voor zo'n model ook. En je kan die maten van verbazing. Dus dat model maakt een soort van inschattingen met Hoe waarschijnlijk is het dat ik deze woordcombinatie aantref? En als die inschattingen heel erg afwijken van wat je daadwerkelijk in taal ziet, dan gaat er iets mis. Want dan, dan heeft hij het gewoon nog niet zo goed geleerd. Dus dat is even hoog over wat er gebeurt. En we laten hem dus ook gewoon samenvattingen maken en dan meten we hoe goed die samenvattingen zijn. Ja.

Lars Anderson 47:36

En nu heb jij een subsidie geschreven en een aanvraag gedaan bij het ministerie van.

Saskia Lensink 47:41

Economische Zaken.

Lars Anderson 47:42

Economische Zaken.

Saskia Lensink 47:43

En Koninkrijksrelaties.

Lars Anderson 47:44

Is dat, was dat gewoon een open subsidie? Heb je gewoon gezegd van wij willen dit doen, we hebben geld nodig. Hoe, hoe werkt dat? Waar schrijf je op in?

Saskia Lensink 47:51

Ja, er zijn heel veel soorten subsidies en financieringsvormen en dit kwam toevallig voorbij. Niet helemaal toevallig, maar bij TNO hebben we natuurlijk heel veel ervaring met het samenwerken in Europees verband. Nederlands verband. Nationaal verband. Onderzoeksubsidies aanvragen? Ja. Publiek private samenwerkingen. Dus. Er is heel veel kennis in de organisatie over welke financieringsvormen er bestaan. En toen kwam dit langs. En dit leek ons echt een heel opportuun moment en een mooie subsidievorm. Zo'n faciliteit toegepast onderzoek. Dachten wij, zo'n faciliteit dat gaan we maken. Dat moet een taalmodel voor Nederland gaan worden.

Philippe Remarque 48:27

Je zei we reizen ook heel Europa rond om te vertellen hierover. Hoe is het in de rest van Europa? En ik? Ik hoorde over een project met. Met bibliotheken in een Scandinavisch land en ik weet niet meer Denemarken of Noorwegen. En ze zijn natuurlijk overal bezig, neem ik aan, Hoop ik.

Saskia Lensink 48:44

Gelukkig maar. Ja. Nee. Er gebeurt volop van alles en nog wat. Dus je hebt aan de ene kant een aantal grote private partijen. Denk aan. Mistral is een heel bekend succesvol voorbeeld. Er zijn ook veel trajecten waarbij men ook zijn eigen taal model maakt. In Polen zijn ze bezig in Noorwegen, ga zo maar door. En er zijn heel veel samenwerkingsverbanden, met name onderzoekstrajecten. Dus bijvoorbeeld een Horizon subsidie vanuit de Europese Unie, waarin ook heel veel universiteiten, onderzoeksinstituten en soms ook bedrijven de krachten bundelen om aan dit soort soevereine AI te werken. En we leren veel van elkaar.

Philippe Remarque 49:22

Ja, en hoe ver zijn ze daar al? Hebben ze daar al een werkend model?

Saskia Lensink 49:26

Ja, bijvoorbeeld. Kijk naar de Zwitsers, die hebben het Apertus-model uitgebracht. Die zijn heel ver. Dat model kun je nu ook gebruiken. Mistral is natuurlijk ook heel ver en het.

Lars Anderson 49:36

Model kan ik al gebruiken zelf.

Saskia Lensink 49:38

Oké, dat is inderdaad al beschikbaar en daar zie je dat er allerlei verschillende soorten modellen beginnen op te poppen. De een is wat verder in ontwikkeling dan de ander. Iedereen heeft ook een beetje een eigen strategie gekozen.

Lars Anderson 49:50

Waar zitten jullie ongeveer?

Saskia Lensink 49:52

Nou, we zijn nu met onze launching customers bezig, dus we hebben een beta versie.

Lars Anderson 49:56

Ja, en ik bedoel meer van in dat in die range zeg maar. Sommige zijn wat verder, sommige zijn wat, wat?

Saskia Lensink 50:02

Ja, sommige zijn bijvoorbeeld nog bezig met training of met verzamelen van data, of zijn bepaalde onderzoeken aan het doen. Hoe kun je van bestaande modellen dus de grondlaag die er al is, zo optimaal mogelijk betere modellen maken? Dus er zijn ook heel veel onderzoeksvragen en dingen waar we nog achter moeten komen, of waar we nu volop naar kijken met elkaar. Ja, maar.

Lars Anderson 50:21

Ik.

Saskia Lensink 50:21

Begrijp.

Lars Anderson 50:21

Dat er in Europa ook veel enthousiasme is voor GPT-NL.

Saskia Lensink 50:24

En ja, de grap is dat heel veel van de initiatieven die lopen zijn vaak geïnitieerd door onderzoeksinstituten of door universiteiten. Die zijn heel sterk in onderzoek doen en eerste stappen zetten in hun ontwikkelproces. En wij hebben ons vanaf het begin af aan ook wel heel erg gericht op de vraag ja, maar hoe bouw je nou duurzaam naar de toekomst toe? Iets dat kan blijven bestaan dus. En daarbij hebben we dus ook heel erg gekeken naar dat ecosysteem idee van ja, hoe zorg je ervoor dat je ook bijvoorbeeld data leveranciers erbij betrekt en niet alleen ervoor zorgt dat je op een eerlijke compensatie model uitkomt, maar ook incentives creëert om dit verder te kunnen laten groeien en. En dat. Dat vind men heel interessant om te zien. En uiteindelijk is en blijft het een vrij nieuwe wetenschap en technologie. Dus je leert sowieso heel veel van elkaar. Het is ook heel goed dat er meerdere initiatieven zijn waar heel veel onderzoek plaatsvindt. Want daar, daar leren we ontzettend veel van.

Philippe Remarque 51:19

Saskia zie ik nou ook, want wij, wij dachten we zien die Arms race in Amerika en ook met China en zo en dat gaat allemaal om gigantische modellen en zo. Maar. Maar kun je eigenlijk dus in ja een wat meer gedemocratiseerde wereld krijgen waar iedereen zijn eigen modellen heeft en. En de ene model is misschien wat beter in het één en ander model, wat beter in het andere, wat meer gaat lijken op een heleboel verschillende soorten auto's. Ze hebben allemaal vier wielen en rijden maar Ze zien. Ze zijn allemaal voor iets anders geschikt. Gaat het zo?

Saskia Lensink 51:50

Meer zijn is ook een teken van een gezonde markt, zou ik zeggen. Als je keuze hebt. Dat is ook een deel van die soevereiniteitsvraagstukken. Het gaat er niet alleen om dat je eigen spullen hebt, maar ook dat je keuze hebt. En ik? Ik zie het wel inderdaad gebeuren dat je meerdere krachtige modellen hebt die inzetbaar zijn voor andere doeleinden. Misschien in een bepaalde sector of misschien voor bepaalde taken net wat beter worden. Dus dat zou maar zo de uitkomst kunnen zijn. En ik denk dat we sowieso op meerdere modellen moeten blijven inzetten en daar ook gewoon echt een markt en een stukje concurrentie echt moeten toelaten.

Philippe Remarque 52:24

Want hier hebben we niet dat vervelende netwerkeffect van de social media, waar het heel moeilijk is om iets concurrerend neer te zetten omdat iedereen al op het bestaande platform zit en dat heb je, dat is hier het probleem helemaal niet.

Saskia Lensink 52:36

Nee, nee, want echt een model dat zo hoog compliant en soeverein is, daar zijn er maar weinig van. Ja, en we denken dat onze aanpak wat dat betreft erg uniek is.

Philippe Remarque 52:46

Ja. En overigens internationaal NDP nieuwsmedia krijgen ook heel veel bezoek en ook de Europese Commissie. Die heeft zich uitgebreid hierover geïnformeerd dat het toch ook al. En dat samenwerken met uitgevers om een licentie model te maken, Dat is wel iets wat voor het eerst in Nederland is gebeurd.

Saskia Lensink 53:03

Dus ja, voor het eerst in de wereld zelfs, hebben we gehoord. Dat is echt de eerste keer dat commerciële nieuwsmedia bedrijven de handen ineen hebben geslagen met een AI initiatief. Dus dit. Dit heeft echt wel veel effect. En we weten ook dat jullie veel telefoontjes krijgen dan met name jullie de NDP ook veel telefoontjes krijgen van de evenknieën uit Europa met jeetje, hoe hebben jullie dit gedaan en gaan we verder met elkaar Jullie.

Lars Anderson 53:26

Jullie stonden ergens een keer bij het koffiezetapparaat en jullie hadden toen een ideetje van dit moet wij doen. Maar ja, dat zei ik natuurlijk ook tegen Philippe of tegen iemand anders toen wij bij de koffie zon. Waarom bouwen wij niet zelf zo'n model? Ja, dan zitten we natuurlijk elkaar te kijken. Ja, dat kost natuurlijk weer niet. Hoeveel miljoen zouden wij voor 13,5 miljoen zo'n model hebben kunnen trainen? Of zit er bij jullie toch ook nog heel veel gunfactor in die wij niet als bedrijf hadden kunnen verwezenlijken of verwerven?

Saskia Lensink 53:54

Ja, het zit hem in meerdere dingen. Wat natuurlijk heel belangrijk is, is dat je de juiste mensen aan boord hebt. Daar hebben we natuurlijk ook heel veel geluk dat we een hele gemotiveerde, hele goede wetenschappers en engineers hebben rondlopen bij alle drie de instituten. Wat ook heel erg helpt is dat je dus al die supercomputer klaar hebt staan en daar ook gewoon snel met elkaar over kan schakelen. En. En een ander belangrijk punt is die cultuur is.

Lars Anderson 54:19

Niet van jullie.

Saskia Lensink 54:20

Die is niet van ons. Nee, maar we kunnen daar wel snel gebruik van maken. En de lijntjes zijn heel kort en dat maakt echt een verschil. Ja, en met.

Lars Anderson 54:26

Die en met die gunfactor zeg je eigenlijk we zijn een non-profit ja, waardoor we makkelijker verschillende concurrerende bedrijven of instellingen bij elkaar kunnen krijgen om iets weg te geven.

Saskia Lensink 54:36

Nou, dat helpt enorm dat je daar als neutrale partij inderdaad een governance kan gaan opzetten waarbij iedereen gaat profiteren en ook iedereen op dezelfde lijn kan krijgen. Is dat onmogelijk voor een commercieel bedrijf om te doen? Nee natuurlijk niet. Niks is onmogelijk. Maar we denken wel dat enorm geholpen heeft. En het opent ook veel deuren als je als TNO ergens staat. Dus we denken dat echt wel een hele grote doorslaggevende factor is geweest in deze fase.

Philippe Remarque 55:02

En is jullie verwachting dat de overheid het gebruik van jullie model verplicht gaat stellen? Nou, dat vind ik. In gevoelige zaken is dat misschien al zo en. Maar verwacht u ook dat? Ja, dat er een soort vorm van gedwongen afname, omdat jullie de enige Nederlandse model zijn dat op deze manier tot stand is gekomen?

Saskia Lensink 55:24

Dan gaan we niet klagen, maar misschien ook wel een beetje. Kijk, de keuzevrijheid blijft een heel belangrijk iets. Het houdt ons ook scherp als er andere modellen op de markt zijn, dwingt je ook om je middelen effectief in te zetten en zo goed mogelijk te worden. Het is nu natuurlijk al zo dat voor een aantal eindgebruiker een aantal use cases, er niet gewerkt mag worden met bestaande generatieve AI oplossingen. Voor die segmenten wil je al met een oplossing kunnen komen. Maar ik denk het, het is niet haalbaar om in deze fase al. Al het AI gebruik van bijvoorbeeld de publieke sector door GPT-NL te laten uitvoeren. Je moet je ook realistisch in zijn. We zijn nu bij een eerste stap. Het is nu voor een aantal gebruiken. Gaat het waarde toevoegen? Fit for purpose. Je hebt niet overal die Ferrari voor nodig, zeggen we vaak. Maar uiteindelijk wil je daar ook verder in gaan ontwikkelen en beter worden. Dus je kan niet van de één op andere dag ineens sommige modellen eruit gooien en overal GPT-NL laten draaien en denken dat alles wel goed komt. Je zal waarschijnlijk sowieso in de toekomst naar een realiteit toegaan waarin meerdere modellen naast elkaar bestaan en voor verschillende gebruik ingezet gaan worden. En het verschilt per organisatie of ze dat dan door één model laten doen, door meerdere modellen. En dat, dat hangt heel erg af van de doelen en het soort gebruik en het soort data dat daar doorheen gaat.

Philippe Remarque 56:48

Het zou dus ook naast elkaar kunnen. Zeker. Ja, dat is nu dezelfde organisatie.

Saskia Lensink 56:52

En dat is nu gewoon de realiteit. Ook voor de launching customers. Dat ze het model naast alle andere bestaande modellen inzetten.

Philippe Remarque 56:58

Dat begrijp ik. Ja. En wanneer gaan wij? Ga je gewone burgers gebruik van kunnen maken of gewoon checken of zie je, voorzie je dat nu helemaal niet?

Saskia Lensink 57:10

Nee, zeker niet op de korte termijn. Lange termijn is altijd moeilijk kijken, maar we hebben heel expliciet ook vanaf het begin af aan gezegd dit is echt voor zakelijk gebruik, niet voor de consumentenmarkt. En dat is een dusdanig grote opgave en daar zitten ook flink wat risico's aan. Ook de impact van AI op de maatschappij is flink groot. Wij moeten keuzes maken. We hebben 13,5 miljoen, we willen een bepaalde focus pakken en we willen vooral AI ontwikkelen die waarde kan toevoegen waar we echt iets aan hebben. En dat zien we op dit moment met name in die zakelijke markt daar. Daar zien we inderdaad die arbeidstekorten. De uitdagingen, daar kan AI echt een verschil maken en daar willen we graag een passend product voor maken.

Lars Anderson 57:54

En wanneer kunnen wij met het model werken? Wanneer kan ik aankloppen en zeggen Joh, we hebben nog wel een. We hebben een linkje nodig, een lijntje en we willen graag rekenen en willen het inpassen in onze, In onze tools en onze. Ook misschien aan de aan de aan de aan de klantenkant. Waar. Wanneer kunnen wij met jullie, met jullie modellen aan de slag?

Saskia Lensink 58:11

Nou zo snel mogelijk, maar dat kan al gewoon. Het kan al gewoon. Ja, tenminste, als jullie bij het launching team willen horen, bij onze launching customers. Die lijst zit bijna vol, dus we kunnen niet direct heel Nederland gaan bedienen.

Lars Anderson 58:22

Wij kunnen gewoon nog met jou bellen en zeggen we willen er nog bij.

Saskia Lensink 58:25

Ja dat kan.

Lars Anderson 58:26

Oh Philippe, ja we moeten even.

Philippe Remarque 58:29

We moeten launching customer worden.

Lars Anderson 58:31

Moet launching customer.

Saskia Lensink 58:31

Worden? Zeker? Ja dat kan, maar dan gaan we wel met jullie ook even kijken. Ja, maar dan gaan we wel heel eerlijk kijken. We hebben de beta versie en we willen er wel voor zorgen dat we in deze fase voor jullie al waarde kunnen toevoegen. Dus als jullie een hele complexe use case hebben waarin echt een heel ingewikkeld model nodig is, dan gaan we daar wel eerlijk op adviseren. Dus het is wel belangrijk dat we en ook met jullie kijken. Willen jullie ook dit initiatief verder ondersteunen en laten zien dat er commerciële tractie voor bestaat? Dus daar zijn we gewoon in gesprek. Maar we hebben ruimte nog.

Lars Anderson 59:03

Hoeveel weken hebben we nog?

Saskia Lensink 59:05

Nou, tot morgen.

Lars Anderson 59:06

Morgen.

Saskia Lensink 59:07

Ja. Ja. Snel hup. Nee, nee, maar er is nog wel eventjes tijd. We hebben wel gezegd we willen eigenlijk vóór de kerstvakantie alle handtekeningen rond. Nou, dan duren dingen natuurlijk net wat langer, maar er is niet heel veel tijd meer. Maar goed, dat betekent niet als je bij de launching ten hoort, dat je daarna heel lang moet wachten. Maar we hebben op dit moment ook nog beperkte capaciteit. We kunnen niet met honderd organisaties tegelijkertijd aan de slag en dan voor al die honderd dezelfde kwaliteit gaan bieden. En service en ondersteuning. Dat willen we echt gefaseerd aanpakken.

Lars Anderson 59:39

Ja, en dan nog even terugkomend op dat durfkapitaal of de investeringen, daar hebben we het nog niet over gehad verder. Die wil je nu. Je wil eigenlijk nieuwe rondes gaan creëren. Je wilt ook geld binnenhalen via die launching customers waarschijnlijk althans een eerste verdienmodel. Maar hoeveel geld heb je nodig denk jij voor jou het komende jaar of desnoods de komende drie jaar? Want ik zie in jullie in jullie ambitie dat jullie ook graag een image generatieve model zouden willen vormgeven.

Saskia Lensink 1:00:10

Nou, we willen voor image voorlopig even niet, maar we willen vooral spraak ook gaan toevoegen en die mogelijkheid verkennen. Allerbelangrijkst is ook dat we meer talen willen gaan toevoegen en de volgende productlijn, dus de volgende generatie modellen, ook een stukje groter maken. Een stukje krachtiger dus dat het niet alleen een aantal basistaken goed kan uitvoeren, maar meer dan dat.

Lars Anderson 1:00:30

Maar meer talen, Fries, Twents.

Saskia Lensink 1:00:33

Maar ook Duits.

Lars Anderson 1:00:34

Oh, die gaan.

Saskia Lensink 1:00:35

Noors, Zweeds, Spaans, Frans. Ja, we in Friesland.

Lars Anderson 1:00:39

Het is een grote vraag naar Tsjechisch, Pools.

Saskia Lensink 1:00:43

Nee, maar goed, daar, daar zitten zeker. En we hebben er nu al Fries in zitten. Het zit er al in ja. Onder andere dankzij Maarten van Rossem die dat een keer vroeg van joh, vergeet Friesland niet. En. En ook met de Friese Academie en een aantal instituten, daar hebben we er zeker voor gezorgd dat er Fries in zit. Maar je wil gewoon veel breder gaan trekken en veel meer talen gaan ondersteunen. Gaan we ook doen. Dus we zijn nu ook aan het kijken naar mogelijke financieringsvormen, maar wel op zo'n manier dat we de soevereiniteit gaan behouden. Ja, en dat, dat is een puzzel die we nu aan het leggen zijn.

Lars Anderson 1:01:13

Ja en. Kun je even expliciet maken wat je bedoeld met die soevereiniteit?

Saskia Lensink 1:01:17

Ja, dat is voor ons dus een exit richting een Amerikaan.

Philippe Remarque 1:01:22

Geen Solvinity.

Saskia Lensink 1:01:23

Nee, nee, nee, zeker niet. En dan is inderdaad de vraag welke investeerders passen bij dat beeld wat wij hebben? Ja, dat is gewoon een keiharde eis.

Lars Anderson 1:01:29

Ja. Philippe, Hoe? Ik vond het echt superleuk gesprek.

Philippe Remarque 1:01:34

Ja, ik, ik, ik vind het zo fascinerend project omdat ja ik, ik denk wij zijn. Wij zijn ons zo blind aan het staren op die. Op die grote ja, op die grote wapenwedloop aan de overkant van de oceaan. En intussen is die technologie ook hier gewoon te maken. Ja, weliswaar op een iets beperktere schaal, maar. Maar dat kan ook heel nuttig zijn voor bepaalde toepassingen en zo moet de AI zich natuurlijk ontwikkelen, waardoor het veel democratischer en meer concurrentie en we niet die enorme greep van die Amerikaanse big tech bedrijven hebben. En dus ik, ik, ik vind het wel echt een heel positieve ontwikkeling.

Lars Anderson 1:02:13

Goed, dit was de Media Innovatie podcast met onze gast Saskia Lensink, co-host Philippe Remarque, directeur journalistiek en ikzelf, Lars Anderson, manager innovatie bij DPG Media. Blijf luisteren en tot de volgende keer.