Modelontwikkeling & fine-tuning

Maatwerk modeltraining en parameter-efficiënte fine-tuning die productiemodellen oplevert met de veiligheidsalignment intact en de regelgevingsdocumentatie inbegrepen.

De meeste fine-tuningprojecten mislukken voordat de training begint

De GPU-rekening is niet het dure onderdeel van enterprise fine-tuning. Een 7B-parametermodel wordt op één enkele A100 gefinetuned voor $100–$400 aan rekenkracht; een 70B-model kost $4,000–$9,750 per trainingsrun. Wat projecten om zeep helpt, is alles rondom de trainingslus: het cureren van duizenden domeinspecifieke voorbeelden, voorkomen dat het model vergeet wat het al weet, valideren dat de veiligheidsalignment de training heeft overleefd, kwantiseren voor productie-serving en het bouwen van de monitoringpijplijn die drift opvangt.

Gartner voorspelt dat tegen 2027, organisaties kleine, taakspecifieke AI-modellen drie keer vaker zullen gebruiken dan algemene LLM's. De verschuiving is al gaande: 68% van de ondernemingen die in 2024 modellen finetunden, meldde tot 3x verbetering in taaknauwkeurigheid. Maar de kloof tussen een notebook-experiment en een productie-implementatie is waar de meeste projecten vastlopen. Onze aanpak is om de volledige pijplijn te engineeren, niet alleen de trainingslus (een discipline die uitgebreid wordt beschreven in ons onderzoek naar het engineeren van systemen die verder gaan dan API-wrappers).

Wanneer fine-tuning de juiste keuze is (en wanneer niet)

Prompt engineering duurt uren. RAG duurt één tot vier weken. Fine-tuning duurt twee tot acht weken, inclusief datasetcreatie, training, veiligheidstests en productieharding. We beginnen elke opdracht met de beoordeling of fine-tuning daadwerkelijk nodig is.

Finetune wanneer:

  • het model nieuw gedrag of uitvoerformaten nodig heeft die prompting niet betrouwbaar kan produceren;
  • uw domein gespecialiseerde redeneerpatronen heeft die generieke modellen inconsistent verwerken;
  • u kostenefficiënte inferentie op schaal nodig heeft — een gefinetunede 7B tegen $0.20/M tokens vervangt een 70B tegen $2/M;
  • u agentic systemen bouwt waarbij de betrouwbaarheid van tool-calling van belang is — gefinetunede SLM's verbeterden het succes van tool-calls van 10% naar 79% in benchmarks (zie een werkende demo van zo'n agentic planningssysteem).

Finetune niet wanneer:

  • het probleem kennisophaling is (gebruik RAG);
  • de dataset minder dan 1,000 voorbeelden per taak bevat;
  • prompt engineering al een acceptabele nauwkeurigheid bereikt;
  • het basismodel sneller verandert dan uw hertrainingscadans.

Wanneer RAG het probleem oplost en fine-tuning alleen maar budget zou verspillen, is het onze aanpak om dat te zeggen voordat er training wordt ingepland, in plaats van u een project te verkopen dat u niet nodig heeft. Die eerlijkheid zit ingebakken in hoe we een opdracht afbakenen.

De frameworkkeuze doet ertoe

Het landschap van 2026 heeft zich geconsolideerd rond onderscheiden tools, die elk een ander probleem oplossen.

FrameworkBest voorBeperkingen / opmerkingen
UnslothSnelst op single-GPU-opstellingenOpen-sourceversie kan niet verder schalen dan één GPU; multi-GPU FSDP is voorbehouden aan de Pro-tier
AxolotlProductiestandaard voor multi-GPU-trainingYAML-gestuurde reproduceerbaarheid over A100- en H100-clusters
Hugging Face TRLWanneer de trainingsdoelstelling het belangrijkst isDPO, GRPO, PPO of elk RL-gebaseerd alignmentwerk
LLaMA-FactoryFine-tuning voor de eerste keer via web-UIToegankelijk, maar de meeste teams ontgroeien het snel
TorchTune (Meta)PyTorch-native integratieVoor het Meta-modelecosysteem

We maken onze keuze op basis van uw trainingsschaal, modelarchitectuur en doelstellingen. De meeste productie-implementaties gebruiken er meer dan één: Axolotl voor supervised fine-tuning, TRL voor voorkeursoptimalisatie en Unsloth voor snelle prototyping.

Veiligheidsalignment overleeft naïeve fine-tuning niet

Onderzoek van EMNLP 2024 toonde aan dat het finetunen van LLM's op nieuwe feitelijke kennis de neiging tot hallucineren vergroot. Los daarvan lieten onderzoekers van Princeton, Stanford, Virginia Tech en IBM zien dat standaard fine-tuning modellen in staat stelde de veiligheidstraining volledig te omzeilen. Onderzoek van ICLR 2026 heeft sindsdien aangetoond dat zorgvuldige hyperparameterafstemming deze risico's beperkt, maar standaard frameworkconfiguraties worden geleverd zonder beschermingen.

Het mechanisme: agressieve parameterupdates in de bovenste lagen overschrijven de features die verantwoordelijk zijn voor veiligheid. De keuze van de LoRA-rang is cruciaal — adapters met een hogere rang op attentielagen kunnen weigeringscircuits destabiliseren, en de veilige configuratie hangt af van de specifieke modelarchitectuur en taakdata.

Onze aanpak is om veiligheidsbehoudende pijplijnen te implementeren (mede gebaseerd op ons onderzoek naar AI-veiligheidsgovernance in de latente ruimte):

  • selectieve LoRA die kritieke circuits beschermt;
  • achtergehouden veiligheidsbenchmarks bij elk checkpoint;
  • vroegtijdig stoppen op basis van samengestelde metrieken die taakprestaties afwegen tegen het behoud van capaciteiten;
  • continue monitoring op alignmentdegradatie gedurende de hele training.

Datacuratie is het werkelijke knelpunt

GPU-uren zijn een begrotingspost. Datacuratie is het project:

  • materiedeskundigen (SME's) 5,000–50,000 hoogwaardige voorbeelden laten labelen;
  • annotatiegeschillen oplossen met inter-annotator agreement-metrieken;
  • MinHash/LSH-deduplicatie uitvoeren;
  • controle op contaminatie ten opzichte van evaluatiesets;
  • herkomst documenteren met datasheets.

RLAIF (met GPT-4 als labeler) verlaagt de kosten voor voorkeursdata, maar introduceert bias van het leraarmodel. Synthetische data via teacher-student-distillatie geeft trainingssets een vliegende start, hoewel de kwaliteit wordt begrensd door de capaciteiten van het leraarmodel.

Een opdracht wordt zo afgebakend dat deze het ontwerp van de datapijplijn, annotatieworkflows, kwaliteitsvalidatie en documentatie voor gereguleerde sectoren omvat: FDA-softwarevalidatie, validatierapporten voor financiële modellen en technische documentatie conform de EU AI Act met modelkaarten die voldoen aan de vereisten van Artikel 11(1).

Van training naar productie

Kwantisatie

Finetune in FP16, voeg de adapters samen en kwantiseer daarna. AWQ INT4 met de Marlin-kernel levert de beste verhouding tussen doorvoer en kwaliteit voor vLLM-serving (741 tok/s). GPTQ integreert met TensorRT-LLM en TGI. GGUF is native voor llama.cpp en Ollama. We stemmen de kwantisatie af op uw serving-stack.

Leverancier versus open source

OpenAI rekent ~$3/M tokens om GPT-4.1 te finetunen. Mistral's gefinetunede Small 3.1 tegen $0.20/M evenaart hun Large 3 tegen $2/M op smalle taken. Anthropic biedt geen publieke fine-tuning aan. Leverancier-API's werken voor snelle iteratie wanneer datagovernance infrastructuur van derden toestaat.

Open-sourcemodellen (Llama 3, Mistral, Qwen) met self-hosted training zijn de juiste keuze wanneer data op uw eigen infrastructuur moet blijven of regelgeving dat vereist. De meeste ondernemingen gebruiken beide.

Monitoring en hertraining

Productiemodellen driften. Onze aanpak is om pijplijnen te bouwen die de voorspellingskwaliteit volgen, data- en conceptdrift detecteren en hertraining activeren wanneer drempels worden overschreden. MLflow of Weights and Biases verzorgen de experimenttracking, terwijl modelregisters volledige herkomst bieden van trainingsdata tot geïmplementeerd artefact.

Post-training-alignment: verder dan SFT

De productiestandaard van 2026 is een modulaire pijplijn: SFT voor het volgen van instructies, DPO of SimPO voor voorkeursalignment en GRPO voor redeneren.

DPO verdrong RLHF PPO door het beloningsmodel te elimineren. SimPO verwijderde het referentiemodel en presteerde tegelijk 6.4 punten beter dan DPO op AlpacaEval 2. GRPO (van DeepSeek R1) gebruikt verifieerbare beloningen om redeneren te trainen via pure RL (een techniek die we verkennen in ons onderzoek naar graph reinforcement learning), met emergente zelfreflectie en verificatie. We implementeren deze met TRL, het framework dat de dynamiek van RL-training goed voor elkaar heeft.

Wat we leveren

Elke opdracht wordt zo afgebakend dat deze een implementeerbaar systeem oplevert:

  • het gefinetunede model met volledige modelkaarten;
  • de trainingspijplijn als reproduceerbare code met experimenttracking;
  • een evaluatiesuite die benchmarkt tegen het basismodel en alternatieven op nauwkeurigheid, latentie, robuustheid en kalibratie;
  • het gekwantiseerde implementatie-artefact met geoptimaliseerde serving-configuratie;
  • monitoringdashboards met driftdetectie en triggers voor hertraining;
  • voor gereguleerde sectoren, sectorspecifieke validatiedocumentatie (EU AI Act, FDA, validatie van financiële modellen).

De opdracht levert ook een eerlijke beoordeling op: of fine-tuning de juiste aanpak was, wat het model niet kan en waar het prestatieplafond ligt. Vooraf gedocumenteerde beperkingen besparen meer geld dan optimistische prognoses.

FAQ

Veelgestelde vragen

Hoeveel kost het om een 7B- versus een 70B-model te finetunen op onze domeindata?

GPU-rekenkracht voor een 7B-model bedraagt $100-$400 per trainingsiteratie op A100-infrastructuur, waarbij de totale projectkosten (inclusief datacuratie, evaluatie en implementatie) variëren van $500-$2,000 voor kleinschalige tot $5,000-$15,000 voor productiewaardige implementaties. Een 70B-model vereist 800-1,500 GPU-uren tegen $4,000-$9,750 per run, waarbij productieprojecten doorgaans in de range van $10,000-$50,000 vallen. De GPU-rekening is zelden de grootste begrotingspost. Datacuratie, annotatietijd van materiedeskundigen, veiligheidsvalidatie en regelgevingsdocumentatie overtreffen de rekenkosten vaak met een factor 2-5x. We bakenen af op basis van uw werkelijke taakcomplexiteit en datagereedheid, niet op modelgrootte alleen.

Wanneer moeten we finetunen versus RAG versus prompt engineering gebruiken?

Begin met de goedkoopste aanpak die het probleem oplost. Prompt engineering duurt uren en kost bijna niets. RAG duurt 1-4 weken en is de juiste keuze wanneer het model toegang nodig heeft tot actuele of bedrijfseigen kennis waarop het niet is getraind. Fine-tuning duurt 2-8 weken en is gerechtvaardigd wanneer het model nieuw gedrag, uitvoerformaten of domeinspecifiek redeneren moet leren dat prompting niet betrouwbaar kan produceren. De productiestandaard van 2026 is hybride: RAG levert actuele feiten, fine-tuning vormt het gedrag van het model en prompt engineering bewaakt de uitvoerkwaliteit. We beginnen elke opdracht met testen of de eenvoudigere aanpakken het probleem oplossen voordat we fine-tuning aanbevelen.

Welk fine-tuning-framework moeten we gebruiken: Axolotl, Unsloth of TRL?

Elk lost een ander probleem op. Unsloth is het snelst op single-GPU-opstellingen en uitstekend voor prototyping, maar multi-GPU FSDP is beperkt tot hun commerciële Pro-tier. Axolotl is de productiestandaard voor multi-GPU-training met YAML-gestuurde reproduceerbaarheid. TRL gebruikt u wanneer de trainingsdoelstelling het belangrijkst is, met name voor DPO, GRPO, PPO of elk reinforcement learning-alignmentwerk. De meeste productie-implementaties gebruiken er meer dan één: Axolotl voor supervised fine-tuning, TRL voor voorkeursoptimalisatie en Unsloth voor snelle experimentatie. We maken onze keuze op basis van uw trainingsschaal, modelarchitectuur en doelstellingen.

Hoe voorkomen we catastrofaal vergeten en veiligheidsdegradatie tijdens fine-tuning?

Standaard fine-tuning-configuraties worden geleverd zonder beschermingen tegen beide problemen. Onderzoek van EMNLP 2024 toonde aan dat finetunen op nieuwe feitelijke kennis de neiging tot hallucineren vergroot, en afzonderlijke studies lieten zien dat naïeve fine-tuning het veiligheidsweigeringsgedrag volledig kan uitschakelen. We implementeren veiligheidsbehoudende trainingspijplijnen: selectieve LoRA die kritieke modelcircuits beschermt, LoRA-rangkalibratie afgestemd op elke modelarchitectuur, achtergehouden veiligheidsbenchmarks bij elk trainingscheckpoint, vroegtijdig stoppen op basis van samengestelde metrieken die taakprestaties afwegen tegen het behoud van capaciteiten, en op schalingswetten gebaseerde leersnelheidsschema's die parameterverstoring in veiligheidskritieke lagen minimaliseren.

Wat is de minimale datasetgrootte die nodig is om een LLM effectief te finetunen?

1,000 hoogwaardige voorbeelden per taak is het praktische minimum voor supervised fine-tuning met LoRA. Onder die drempel domineert overfitting en bent u beter af met few-shot prompting of RAG. Kwaliteit telt meer dan kwantiteit: 2,000 zorgvuldig gecureerde voorbeelden met een hoge inter-annotator agreement presteren beter dan 20,000 ruizige voorbeelden. Voor voorkeursoptimalisatie (DPO/SimPO) heeft u ten minste 5,000-10,000 voorkeursparen nodig. Voor reinforcement learning met verifieerbare beloningen (GRPO) verschuift de vereiste van gelabelde data naar een betrouwbare verifier-functie. We beoordelen uw bestaande data-assets en ontwerpen de annotatiepijplijn om de kwaliteitsdrempel te halen die uw taak vereist.

Hoe finetunen we een model voor betrouwbare tool-calling in agentic workflows?

Kant-en-klare modellen hallucineren regelmatig toolparameters, selecteren verkeerde functies of falen bij reeksen van meerdere stappen. Finetunen op gestructureerde tool-calling-datasets heeft de slagingspercentages in benchmarks verbeterd van 10% naar 79%, en gefinetunede modellen tonen 57% hogere tool-call-beloningen op ongeziene scenario's in vergelijking met basismodellen. De aanpak omvat het cureren van tool-calling-trainingsdata met correcte functiesignaturen, parametertypen en ketens van meerdere stappen, gevolgd door finetunen met SFT en daarna reinforcement learning met uitvoeringsfeedback als beloningssignaal. We bouwen de trainingsdatapijplijn, trainen het model en valideren tegen uw werkelijke API-oppervlak vóór implementatie.

LoRA versus QLoRA versus volledige fine-tuning: welke aanpak voor onze use case?

Volledige fine-tuning werkt elke parameter bij en levert het hoogste plafond, maar vereist 8+ GPU's voor alles boven 7B parameters. LoRA bevriest het basismodel en traint kleine adaptermatrices, waardoor de trainbare parameters met 90%+ afnemen met minimaal kwaliteitsverlies bij productierang-instellingen van 64-128. QLoRA voegt 4-bit-kwantisatie van het bevroren basismodel toe, wat de VRAM met 33% verlaagt tegen een toename van 39% in trainingstijd. Voor de meeste enterprise-use-cases is LoRA op rang 64-128 de juiste standaard. QLoRA wanneer het GPU-geheugen werkelijk beperkt is. Volledige fine-tuning alleen wanneer u het rekenbudget heeft, de datasetgrootte die het rechtvaardigt (50,000+ voorbeelden) en een taak die aantoonbaar profiteert van het bijwerken van alle parameters.

Wat vereist naleving van de EU AI Act voor gefinetunede AI-modellen?

Als uw fine-tuning rekenkracht gebruikt die meer dan een derde van de oorspronkelijke trainingsrekenkracht van het model bedraagt (of een derde van 10^23 FLOPs als het origineel onbekend is), behandelt de EU AI Act u als een nieuwe GPAI-aanbieder met volledige nalevingsverplichtingen: technische documentatie, modelkaarten, samenvattingen van auteursrechtelijk beschermd materiaal en risicobeoordelingen. Volledige handhaving voor AI-systemen met een hoog risico begint op 2 augustus 2026, met boetes tot EUR 35 miljoen of 7% van de wereldwijde jaaromzet. De geharmoniseerde technische normen (CEN/CENELEC JTC 21) worden nog afgerond, met als streefdatum Q4 2026. We produceren modelkaarten en technische documentatie afgestemd op de vereisten van Artikel 11(1) en Bijlage IV, ontworpen om verdedigbaar te zijn onder de huidige kaders en aanpasbaar aan de definitieve normen.

Moeten we een open-sourcemodel finetunen of een fine-tuning-API van een leverancier gebruiken?

Leverancier-API's (OpenAI tegen ~$3/M tokens voor GPT-4.1-training, Google Vertex voor Gemini, Mistral tegen $0.20/M voor Small 3.1) zijn geschikt voor snelle iteratie wanneer datagovernance toestaat dat trainingsdata naar infrastructuur van derden wordt gestuurd. Open-sourcemodellen (Llama 3, Mistral, Qwen) met self-hosted training zijn de juiste keuze wanneer data op uw eigen infrastructuur moet blijven, u volledige controle over de trainingsdynamiek nodig heeft, of regelgeving dat vereist. De meeste enterprise-implementaties in 2026 gebruiken beide: leverancier-API's voor prototyping en baselines, open source voor productie waar datasoevereiniteit of kostenoptimalisatie van belang is. We helpen u deze beslissing te navigeren op basis van uw beperkingen, niet uit platformtrouw.

Hoe evalueren we of ons gefinetunede model daadwerkelijk beter is dan de basis?

Eenvoudige nauwkeurigheid op een achtergehouden testset is noodzakelijk maar niet voldoende. We bouwen evaluatiesuites die taakspecifieke prestaties meten met statistische significantietoetsing, behoud van algemene capaciteiten met achtergehouden benchmarks uit de capaciteitenset van het basismodel (om catastrofaal vergeten op te sporen), behoud van veiligheidsalignment met gestandaardiseerde veiligheidsbenchmarks, latentie en doorvoer onder productiebelasting, kalibratiekwaliteit (weet het model wat het niet weet), en prestaties uitgesplitst naar relevante subgroepen om bias op te sporen die door de trainingsdata is geïntroduceerd. De evaluatiesuite wordt met het model geleverd als reproduceerbare code, niet als een eenmalig rapport.

Bouw uw AI met vertrouwen.

Werk samen met een team met diepgaande ervaring in het bouwen van de volgende generatie enterprise-AI. Laat ons u helpen bij het ontwerpen, bouwen en implementeren van een AI-strategie waarop u kunt vertrouwen.

Veriprajna Deep Tech-adviesbureau is gespecialiseerd in het bouwen van veiligheidskritische AI-systemen voor de gezondheidszorg, de financiële sector en gereguleerde domeinen. Onze architecturen worden gevalideerd aan de hand van gevestigde protocollen met uitgebreide compliancedocumentatie.