Verder dan het algoritme: Hoe kunstmatige intelligentiemodellen worden getraind en verfijnd
"Gegevens zijn de sleutel. De heilige graal van generatieve AI."- Hilary Packer, CTO van American Express. Het verzamelen van gegevens is goed voor 80% van de inspanning in AI-projecten. DeepSeek heeft de regels veranderd: inferentiekost 1/30 vergeleken met OpenAI. Dario Amodei: kosten dalen 4x per jaar. "Ik verwacht dat de kosten naar nul gaan"-CDO van Intuit. De combinatie van distillatie + RAG is waar de magie ligt voor de meeste bedrijven. De toekomst? Massa's specifieke, goedkope modellen geworteld in bedrijfsgegevens.

Hoe wordt een kunstmatige-intelligentiemodel getraind
Het trainen van modellen voor kunstmatige intelligentie is een van de complexere uitdagingen binnen de hedendaagse technologische ontwikkeling. Het is veel meer dan alleen een algoritmische kwestie: het effectief trainen van een model vereist een methodische, multidisciplinaire aanpak waarin data, datawetenschap, domeinkennis en software-engineering samenkomen. Zoals James Luke benadrukt in zijn baanbrekende boek "Beyond Algorithms: Delivering AI for Business", hangt het succes van een AI-implementatie veel meer af van datamanagement en systeemontwerp dan van de algoritmes zelf. Het landschap verandert snel, met innovaties zoals het DeepSeek-R1-model die kosten en toegankelijkheid opnieuw definiëren.
De basis: gegevensverzameling en -beheer
Kwaliteit in plaats van kwantiteit
In tegenstelling tot wat vaak wordt gedacht, is de hoeveelheid gegevens niet altijd de bepalende factor voor succes. De kwaliteit en representativiteit van de gegevens zijn veel belangrijker. In deze context is het cruciaal om verschillende bronnen te integreren:
- Eigen data: Op ethische wijze verzameld en geanonimiseerd uit bestaande implementaties
- Gelicentieerde data: Afkomstig van betrouwbare leveranciers die voldoen aan strenge kwaliteitsnormen
- Open-source datasets: Zorgvuldig gecontroleerd op diversiteit en nauwkeurigheid
- Synthetische data: Kunstmatig gegenereerd om hiaten op te vullen en privacyproblemen op te lossen
Deze integratie creëert een uitgebreide trainingsbasis die realistische scenario's weergeeft en tegelijkertijd ethische en privacystandaarden handhaaft.
De uitdaging van gegevensvoorbereiding
Het proces van 'data wrangling' vertegenwoordigt tot 80 procent van de inspanning die nodig is voor kunstmatige intelligentieprojecten. Deze fase omvat:
- Data-opschoning: Verwijderen van inconsistenties, duplicaten en uitschieters
- Datatransformatie: Omzetten naar formaten die geschikt zijn voor verwerking
- Data-integratie: Samenvoegen van verschillende bronnen die vaak onderling onverenigbare schema's en formaten gebruiken
- Omgaan met ontbrekende data: Strategieën zoals statistische imputatie of het gebruik van proxydata
Modelarchitectuur: juiste dimensionering
De keuze voor een modelarchitectuur moet worden bepaald door de specifieke aard van het op te lossen probleem en niet door persoonlijke neigingen of voorkeuren. Verschillende soorten problemen vereisen verschillende benaderingen:
- Op transformers gebaseerde taalmodellen voor taken die een diep taalbegrip vereisen
- Convolutionele neurale netwerken voor beeld- en patroonherkenning
- Grafische neurale netwerken voor de analyse van complexe relaties tussen entiteiten
- Reinforcement learning voor optimalisatie- en beslissingsvraagstukken
- Hybride architecturen die meerdere benaderingen combineren voor complexe use cases
Architecturale optimalisatie vereist een systematische evaluatie tussen verschillende configuraties, met een focus op het balanceren van prestaties en rekenkundige eisen, een aspect dat nog relevanter is geworden met de komst van modellen zoals DeepSeek-R1 die geavanceerde redeneermogelijkheden bieden tegen aanzienlijk lagere kosten.
Geavanceerde trainingsmethoden
Model destillatie
Distillatie heeft zich ontpopt als een bijzonder krachtig hulpmiddel in het huidige AI-ecosysteem. Dit proces maakt het mogelijk om kleinere, specifiekere modellen te maken die de redeneercapaciteiten van grotere, complexere modellen erven, zoals DeepSeek-R1.
Zoals blijkt uit het geval van DeepSeek, heeft het bedrijf zijn eigen redeneervermogen gedistilleerd naar verschillende kleinere modellen, waaronder open-source modellen uit de Llama-familie van Meta en de Qwen-familie van Alibaba. Deze kleinere modellen kunnen vervolgens worden geoptimaliseerd voor specifieke taken, wat de trend naar snelle, gespecialiseerde modellen versnelt.
Sam Witteveen, ontwikkelaar van machine learning, merkt op: "We beginnen een wereld binnen te gaan waarin mensen meerdere modellen gebruiken. Ze gebruiken niet altijd maar één model." Hieronder vallen ook goedkope gesloten modellen zoals Gemini Flash en GPT-4o Mini, die "zeer goed werken voor 80 procent van de use cases."
Multi-taak leren
In plaats van afzonderlijke modellen te trainen voor verwante vaardigheden, kunnen modellen dankzij multi-task learning kennis delen tussen verschillende functies:
- De modellen optimaliseren tegelijkertijd voor meerdere gerelateerde doelen
- De basisfunctionaliteiten profiteren van een bredere blootstelling aan verschillende taken
- De prestaties verbeteren over alle taken heen, vooral bij taken met beperkte data
- De rekenkundige efficiëntie neemt toe dankzij het delen van componenten
Supervised fine-tuning (SFT)
Voor bedrijven die actief zijn in zeer specifieke domeinen, waar informatie niet algemeen beschikbaar is op het web of in de boeken die doorgaans worden gebruikt voor het trainen van taalmodellen, is supervised fine-tuning (SFT) een effectieve optie.
DeepSeek liet zien dat het mogelijk is om goede resultaten te behalen met 'duizenden' vraag- en antwoorddatasets. IBM-ingenieur Chris Hay liet bijvoorbeeld zien hoe hij een klein model opzette met zijn eigen wiskundespecifieke datasets en extreem snelle antwoorden verkreeg die de prestaties van OpenAI's o1-model op dezelfde taken overtroffen.
Versterking leren (RL)
Bedrijven die een model willen trainen dat verder is afgestemd op specifieke voorkeuren - bijvoorbeeld om een chatbot voor klantenservice empathisch maar beknopt te maken - zullen technieken voor reinforcement learning (RL) willen implementeren. Deze aanpak is vooral nuttig als een bedrijf wil dat zijn chatbot zijn toon en aanbevelingen aanpast op basis van feedback van gebruikers.
Retrieval-Augmented Generation (RAG)
Voor de meeste bedrijven is Retrieval-Augmented Generation (RAG) de eenvoudigste en veiligste route. Het is een relatief ongecompliceerd proces waarmee organisaties hun modellen kunnen verankeren met bedrijfseigen gegevens in hun databases, zodat de output nauwkeurig en domeinspecifiek is.
Deze aanpak helpt ook om enkele van de hallucinatieproblemen van modellen zoals DeepSeek tegen te gaan, dat momenteel in 14% van de gevallen hallucineert, tegenover 8% bij het o3-model van OpenAI, volgens een studie van Vectara.
De combinatie van modeldistillatie en RAG is waar de magie voor de meeste bedrijven ligt, en is ongelooflijk eenvoudig te implementeren, zelfs voor mensen met beperkte vaardigheden in datawetenschap of programmeren.
Evaluatie en verfijning: verder dan nauwkeurigheidsmetingen
Effectieve AI wordt niet alleen gemeten in termen van ruwe nauwkeurigheid, maar vereist een uitgebreid evaluatiekader dat rekening houdt met:
- Functionele nauwkeurigheid: De frequentie waarmee het model correcte resultaten produceert
- Robuustheid: Consistentie van de prestaties bij wisselende input en omstandigheden
- Eerlijkheid: Consistente prestaties tussen verschillende gebruikersgroepen en scenario's
- Kalibratie: Overeenstemming tussen betrouwbaarheidsscores en werkelijke nauwkeurigheid
- Efficiëntie: Vereisten op het gebied van rekenkracht en geheugen
- Verklaarbaarheid: Transparantie van de besluitvormingsprocessen, een aspect waarin de gedistilleerde modellen van DeepSeek uitblinken door hun redeneerproces te tonen
De impact van de kostencurve
De meest directe impact van de release van DeepSeek is de agressieve prijsverlaging. De technologie-industrie verwachtte dat de kosten na verloop van tijd zouden dalen, maar weinigen voorzagen hoe snel dit zou gebeuren. DeepSeek toonde aan dat krachtige, open modellen zowel goedkoop als efficiënt kunnen zijn, waardoor mogelijkheden ontstaan voor wijdverspreide experimenten en kosteneffectieve implementatie.
Amr Awadallah, CEO van Vectara, benadrukte dit punt en merkte op dat het echte omslagpunt niet alleen de trainingskosten zijn, maar ook de inferentiekosten, die voor DeepSeek ongeveer 1/30e zijn van die van OpenAI's o1 of o3 modellen per inferentiekost per token. "De marges die OpenAI, Anthropic en Google Gemini hebben kunnen pakken, zullen nu met minstens 90 procent moeten worden verkleind, omdat ze niet concurrerend kunnen blijven met zulke hoge prijzen", aldus Awadallah.
En dat niet alleen, deze kosten zullen blijven dalen. Dario Amodei, CEO van Anthropic, verklaarde onlangs dat de kosten voor het ontwikkelen van modellen elk jaar ongeveer vier keer zo laag worden. Als gevolg daarvan zal het tarief dat LLM leveranciers in rekening brengen voor het gebruik ervan ook blijven dalen.
"Ik verwacht ten volle dat de kosten naar nul zullen dalen," zei Ashok Srivastava, CDO van Intuit, een bedrijf dat sterk heeft ingezet op AI in zijn belasting- en boekhoudsoftware zoals TurboTax en Quickbooks. "...en dat de latentie naar nul zal dalen. Ze zullen simpelweg basisfunctionaliteiten worden die we kunnen gebruiken."
Conclusie: De toekomst van zakelijke AI is open, betaalbaar en datagedreven
OpenAI's DeepSeek en Deep Research zijn meer dan alleen nieuwe tools in het AI arsenaal - het zijn tekenen van een diepgaande verandering waarbij bedrijven massa's speciaal gebouwde modellen zullen inzetten die extreem kosteneffectief en competent zijn en geworteld in de eigen gegevens en aanpak van het bedrijf.
Voor bedrijven is de boodschap duidelijk: de tools om krachtige, domeinspecifieke AI-toepassingen te bouwen, liggen binnen handbereik. Wie deze tools niet benut, loopt het risico achterop te raken. Maar echt succes komt voort uit hoe je data verzorgt, technieken zoals RAG en distillatie inzet en verder innoveert dan de pre-trainingsfase.
Zoals Packer van AmEx het verwoordde: bedrijven die hun gegevens op de juiste manier beheren, zullen degenen zijn die de volgende innovatiegolf op het gebied van AI zullen leiden.

Reacties
Nog geen reacties — start het gesprek.