Développement de modèles et fine-tuning
Entraînement de modèles sur mesure et fine-tuning efficace en paramètres qui livre des modèles prêts pour la production, avec alignement de sécurité préservé et documentation réglementaire incluse.
La plupart des projets de fine-tuning échouent avant même le début de l'entraînement
La facture GPU n'est pas la partie coûteuse du fine-tuning en entreprise. Un modèle de 7 milliards de paramètres se fine-tune sur un seul A100 pour $100–$400 en compute ; un modèle de 70 milliards coûte $4,000–$9,750 par cycle d'entraînement. Ce qui tue les projets, c'est tout ce qui entoure la boucle d'entraînement : constituer des milliers d'exemples spécifiques au domaine, empêcher le modèle d'oublier ce qu'il sait déjà, valider que l'alignement de sécurité a survécu à l'entraînement, quantifier pour le service en production et construire le pipeline de surveillance qui détecte la dérive.
Gartner prévoit que d'ici 2027, les organisations utiliseront des modèles d'IA petits et spécialisés trois fois plus que les LLM généralistes. Ce basculement est déjà en cours : 68 % des entreprises qui ont fine-tuné des modèles en 2024 ont signalé jusqu'à 3x d'amélioration de la précision des tâches. Mais c'est dans l'écart entre une expérience sur notebook et un déploiement en production que la plupart des projets s'enlisent. Notre approche consiste à concevoir l'ensemble du pipeline, pas seulement la boucle d'entraînement (une discipline détaillée dans notre recherche sur l'ingénierie de systèmes au-delà des wrappers d'API).
Quand le fine-tuning est le bon choix (et quand il ne l'est pas)
Le prompt engineering prend quelques heures. Le RAG prend une à quatre semaines. Le fine-tuning prend deux à huit semaines, y compris la création du jeu de données, l'entraînement, les tests de sécurité et le durcissement pour la production. Nous commençons chaque mission en évaluant si le fine-tuning est réellement nécessaire.
Faites du fine-tuning quand :
- le modèle a besoin d'un nouveau comportement ou de formats de sortie que le prompting ne peut pas produire de façon fiable ;
- votre domaine présente des schémas de raisonnement spécialisés que les modèles génériques gèrent de manière incohérente ;
- vous avez besoin d'une inférence économique à grande échelle — un modèle 7B fine-tuné à $0.20/M tokens remplace un 70B à $2/M ;
- vous construisez des systèmes agentiques où la fiabilité des appels d'outils est cruciale — des SLM fine-tunés ont amélioré le taux de réussite des appels d'outils de 10 % à 79 % dans des benchmarks (voir une démo fonctionnelle d'un tel système d'ordonnancement agentique).
Ne faites pas de fine-tuning quand :
- le problème est la récupération de connaissances (utilisez le RAG) ;
- le jeu de données compte moins de 1 000 exemples par tâche ;
- le prompt engineering atteint déjà une précision acceptable ;
- le modèle de base évolue plus vite que votre cadence de réentraînement.
Quand le RAG résout le problème et que le fine-tuning ne ferait que gaspiller du budget, notre approche consiste à le dire avant de cadrer tout entraînement plutôt que de vendre un projet dont vous n'avez pas besoin. Cette honnêteté est intégrée à notre façon de cadrer une mission.
Le choix du framework compte
Le paysage de 2026 s'est consolidé autour d'outils distincts, chacun résolvant un problème différent.
| Framework | Idéal pour | Contraintes / remarques |
|---|---|---|
| Unsloth | Le plus rapide sur des configurations mono-GPU | La version open source ne peut pas dépasser un seul GPU ; le FSDP multi-GPU est réservé à l'offre Pro |
| Axolotl | Standard de production pour l'entraînement multi-GPU | Reproductibilité pilotée par YAML sur les clusters A100 et H100 |
| Hugging Face TRL | Quand l'objectif d'entraînement prime avant tout | DPO, GRPO, PPO ou tout travail d'alignement basé sur le RL |
| LLaMA-Factory | Premier fine-tuning via une interface web | Accessible, mais la plupart des équipes s'en affranchissent rapidement |
| TorchTune (Meta) | Intégration native PyTorch | Pour l'écosystème de modèles Meta |
Nous choisissons en fonction de l'échelle de votre entraînement, de l'architecture du modèle et de vos objectifs. La plupart des déploiements en production en utilisent plusieurs : Axolotl pour le fine-tuning supervisé, TRL pour l'optimisation des préférences et Unsloth pour le prototypage rapide.
L'alignement de sécurité ne survit pas à un fine-tuning naïf
Une recherche présentée à EMNLP 2024 a démontré que le fine-tuning de LLM sur de nouvelles connaissances factuelles augmente la propension aux hallucinations. Par ailleurs, des chercheurs de Princeton, Stanford, Virginia Tech et IBM ont montré que le fine-tuning standard permettait aux modèles de contourner entièrement leur entraînement de sécurité. Des travaux présentés à ICLR 2026 ont depuis montré qu'un réglage soigneux des hyperparamètres atténue ces risques, mais les configurations par défaut des frameworks sont livrées sans protection.
Le mécanisme : des mises à jour agressives des paramètres dans les couches supérieures écrasent les caractéristiques responsables de la sécurité. Le choix du rang LoRA est critique — des adaptateurs de rang élevé sur les couches d'attention peuvent déstabiliser les circuits de refus, et la configuration sûre dépend de l'architecture spécifique du modèle et des données de la tâche.
Notre approche consiste à mettre en œuvre des pipelines préservant la sécurité (nourris par notre recherche sur la gouvernance de la sécurité de l'IA dans l'espace latent) :
- un LoRA sélectif protégeant les circuits critiques ;
- des benchmarks de sécurité réservés à chaque point de contrôle ;
- un arrêt précoce sur des métriques composites équilibrant la performance des tâches et la préservation des capacités ;
- une surveillance continue de la dégradation de l'alignement tout au long de l'entraînement.
La curation des données est le véritable goulot d'étranglement
Les heures GPU sont un poste budgétaire. La curation des données, c'est le projet :
- faire annoter par des experts métier 5 000 à 50 000 exemples de haute qualité ;
- résoudre les désaccords d'annotation à l'aide de métriques d'accord inter-annotateurs ;
- exécuter une déduplication MinHash/LSH ;
- vérifier la contamination par rapport aux jeux d'évaluation ;
- documenter la provenance avec des fiches de données.
Le RLAIF (en utilisant GPT-4 comme annotateur) réduit le coût des données de préférence mais introduit un biais du modèle enseignant. Les données synthétiques via la distillation enseignant-élève amorcent les jeux d'entraînement, bien que la qualité soit plafonnée par les capacités du modèle enseignant.
Une mission est cadrée pour couvrir la conception du pipeline de données, les flux d'annotation, la validation de la qualité et la documentation propre aux secteurs réglementés : validation logicielle FDA, rapports de validation de modèles financiers et documentation technique de l'EU AI Act avec des fiches de modèle conformes aux exigences de l'article 11(1).
De l'entraînement à la production
Quantification
Fine-tunez en FP16, fusionnez les adaptateurs, puis quantifiez. AWQ INT4 avec le kernel Marlin offre le meilleur rapport débit/qualité pour le service vLLM (741 tok/s). GPTQ s'intègre à TensorRT-LLM et TGI. GGUF est natif pour llama.cpp et Ollama. Nous adaptons la quantification à votre stack de service.
Fournisseur vs open source
OpenAI facture ~$3/M tokens pour fine-tuner GPT-4.1. Le Small 3.1 fine-tuné de Mistral à $0.20/M égale leur Large 3 à $2/M sur des tâches étroites. Anthropic ne propose pas de fine-tuning public. Les API des fournisseurs conviennent à une itération rapide lorsque la gouvernance des données autorise une infrastructure tierce.
Les modèles open source (Llama 3, Mistral, Qwen) avec un entraînement auto-hébergé sont le bon choix lorsque les données doivent rester sur votre infrastructure ou que des exigences réglementaires l'imposent. La plupart des entreprises utilisent les deux.
Surveillance et réentraînement
Les modèles en production dérivent. Notre approche consiste à construire des pipelines qui suivent la qualité des prédictions, détectent la dérive des données et des concepts, et déclenchent le réentraînement lorsque des seuils sont franchis. MLflow ou Weights and Biases gèrent le suivi des expériences, tandis que les registres de modèles assurent une traçabilité complète, des données d'entraînement à l'artefact déployé.
Alignement post-entraînement : au-delà du SFT
Le standard de production de 2026 est un pipeline modulaire : SFT pour le suivi des instructions, DPO ou SimPO pour l'alignement sur les préférences, et GRPO pour le raisonnement.
Le DPO a supplanté le RLHF PPO en éliminant le modèle de récompense. SimPO a supprimé le modèle de référence tout en surpassant le DPO de 6,4 points sur AlpacaEval 2. GRPO (issu de DeepSeek R1) utilise des récompenses vérifiables pour entraîner le raisonnement par du RL pur (une technique que nous explorons dans notre recherche sur l'apprentissage par renforcement sur graphes), avec une auto-réflexion et une vérification émergentes. Nous les mettons en œuvre avec TRL, le framework qui maîtrise bien les dynamiques d'entraînement en RL.
Ce que nous livrons
Chaque mission est cadrée pour produire un système déployable :
- le modèle fine-tuné avec des fiches de modèle complètes ;
- le pipeline d'entraînement sous forme de code reproductible avec suivi des expériences ;
- une suite d'évaluation comparant au modèle de base et à des alternatives sur la précision, la latence, la robustesse et la calibration ;
- l'artefact de déploiement quantifié avec une configuration de service optimisée ;
- des tableaux de bord de surveillance avec détection de dérive et déclencheurs de réentraînement ;
- pour les secteurs réglementés, une documentation de validation propre au secteur (EU AI Act, FDA, validation de modèles financiers).
La mission produit également une évaluation honnête : si le fine-tuning était la bonne approche, ce que le modèle ne peut pas faire et où se situe le plafond de performance. Des limites documentées d'emblée font économiser plus d'argent que des projections optimistes.
Développement de modèles et fine-tuning
L'IA pour la valorisation des matières et le tri des plastiques noirs | Veriprajna
Le pigment de noir de carbone absorbe la lumière proche infrarouge. Chaque barquette en PP noir, conteneur en PE et boîtier en ABS que votre trieur optique manque part au refus, puis en décharge. Nous concevons la couche de détection MWIR et d'IA en périphérie qui les récupère.
IA de planification des équipages aériens : une reprise IROPS qui fonctionne là où les solveurs traditionnels échouent | Veriprajna
IA de planification des équipages et reprise IROPS pour les compagnies aériennes de taille moyenne. Complétez Jeppesen ou IBS avec du ML qui gère les perturbations en cascade, les lacunes de suivi des équipages et l'exposition aux remboursements DOT.
Sécurité de l'IA en biosécurité pour la pharma et la biotech | Veriprajna
En 2022, Collaborations Pharmaceuticals a exécuté son modèle commercial de découverte de médicaments de novo avec la fonction de récompense inversée. En moins de six heures, il a produit 40 000 molécules candidates, dont des analogues du VX. C'était MegaSyn, un LSTM de l'ère 2019, tournant sur un seul poste de travail.
Explore Solution →Questions fréquentes
Combien coûte le fine-tuning d'un modèle 7B par rapport à un modèle 70B sur nos données de domaine ?
Le compute GPU pour un modèle 7B revient à $100-$400 par itération d'entraînement sur une infrastructure A100, le coût total du projet (incluant la curation des données, l'évaluation et le déploiement) allant de $500-$2,000 pour les petites échelles à $5,000-$15,000 pour les déploiements de qualité production. Un modèle 70B nécessite 800 à 1 500 heures GPU à $4,000-$9,750 par cycle, les projets de production se situant généralement dans la fourchette de $10,000-$50,000. La facture GPU est rarement le poste le plus important. La curation des données, le temps d'annotation des experts métier, la validation de sécurité et la documentation réglementaire dépassent souvent les coûts de compute d'un facteur de 2 à 5. Nous cadrons en fonction de la complexité réelle de votre tâche et de la maturité de vos données, et non de la seule taille du modèle.
Quand devrions-nous faire du fine-tuning plutôt que d'utiliser le RAG ou le prompt engineering ?
Commencez par l'approche la moins coûteuse qui résout le problème. Le prompt engineering prend quelques heures et ne coûte presque rien. Le RAG prend 1 à 4 semaines et constitue le bon choix lorsque le modèle a besoin d'accéder à des connaissances actuelles ou propriétaires sur lesquelles il n'a pas été entraîné. Le fine-tuning prend 2 à 8 semaines et se justifie lorsque le modèle doit apprendre un nouveau comportement, des formats de sortie ou un raisonnement spécifique au domaine que le prompting ne peut pas produire de façon fiable. Le standard de production de 2026 est hybride : le RAG fournit des faits actuels, le fine-tuning façonne le comportement du modèle et le prompt engineering contrôle la qualité de la sortie. Nous commençons chaque mission en testant si les approches plus simples résolvent le problème avant de recommander le fine-tuning.
Quel framework de fine-tuning devrions-nous utiliser : Axolotl, Unsloth ou TRL ?
Chacun résout un problème différent. Unsloth est le plus rapide sur des configurations mono-GPU et excellent pour le prototypage, mais le FSDP multi-GPU est limité à leur offre commerciale Pro. Axolotl est le standard de production pour l'entraînement multi-GPU avec une reproductibilité pilotée par YAML. TRL est ce que vous utilisez quand l'objectif d'entraînement prime avant tout, en particulier pour le DPO, le GRPO, le PPO ou tout travail d'alignement par apprentissage par renforcement. La plupart des déploiements en production en utilisent plusieurs : Axolotl pour le fine-tuning supervisé, TRL pour l'optimisation des préférences et Unsloth pour l'expérimentation rapide. Nous choisissons en fonction de l'échelle de votre entraînement, de l'architecture du modèle et de vos objectifs.
Comment prévenir l'oubli catastrophique et la dégradation de la sécurité pendant le fine-tuning ?
Les configurations de fine-tuning standard sont livrées sans protection contre l'un ou l'autre problème. Une recherche présentée à EMNLP 2024 a montré que le fine-tuning sur de nouvelles connaissances factuelles augmente la propension aux hallucinations, et des études distinctes ont démontré qu'un fine-tuning naïf peut désactiver entièrement le comportement de refus de sécurité. Nous mettons en œuvre des pipelines d'entraînement préservant la sécurité : un LoRA sélectif qui protège les circuits critiques du modèle, un calibrage du rang LoRA ajusté à chaque architecture de modèle, des benchmarks de sécurité réservés à chaque point de contrôle de l'entraînement, un arrêt précoce fondé sur des métriques composites équilibrant la performance des tâches et la préservation des capacités, et des programmes de taux d'apprentissage informés par les lois d'échelle qui minimisent la perturbation des paramètres dans les couches critiques pour la sécurité.
Quelle est la taille minimale de jeu de données nécessaire pour fine-tuner efficacement un LLM ?
1 000 exemples de haute qualité par tâche constituent le minimum pratique pour un fine-tuning supervisé avec LoRA. En dessous de ce seuil, le surapprentissage domine et vous avez tout intérêt à recourir au few-shot prompting ou au RAG. La qualité compte plus que la quantité : 2 000 exemples soigneusement sélectionnés avec un fort accord inter-annotateurs surpassent 20 000 exemples bruités. Pour l'optimisation des préférences (DPO/SimPO), il vous faut au moins 5 000 à 10 000 paires de préférence. Pour l'apprentissage par renforcement avec récompenses vérifiables (GRPO), l'exigence passe des données étiquetées à une fonction de vérification fiable. Nous évaluons vos actifs de données existants et concevons le pipeline d'annotation pour atteindre le seuil de qualité que votre tâche exige.
Comment fine-tuner un modèle pour des appels d'outils fiables dans des flux de travail agentiques ?
Les modèles prêts à l'emploi hallucinent fréquemment les paramètres d'outils, sélectionnent les mauvaises fonctions ou échouent sur des séquences multi-étapes. Le fine-tuning sur des jeux de données structurés d'appels d'outils a amélioré les taux de réussite de 10 % à 79 % dans des benchmarks, et les modèles fine-tunés affichent des récompenses d'appels d'outils supérieures de 57 % sur des scénarios inédits par rapport aux modèles de base. L'approche consiste à constituer des données d'entraînement d'appels d'outils avec des signatures de fonction correctes, des types de paramètres et des chaînes multi-étapes, puis à fine-tuner par SFT suivi d'apprentissage par renforcement en utilisant le retour d'exécution comme signal de récompense. Nous construisons le pipeline de données d'entraînement, entraînons le modèle et validons par rapport à votre surface d'API réelle avant le déploiement.
LoRA, QLoRA ou fine-tuning complet : quelle approche pour notre cas d'usage ?
Le fine-tuning complet met à jour chaque paramètre et offre le plafond le plus élevé mais nécessite plus de 8 GPU pour tout ce qui dépasse 7 milliards de paramètres. LoRA gèle le modèle de base et entraîne de petites matrices d'adaptation, réduisant les paramètres entraînables de plus de 90 % avec une perte de qualité minimale aux réglages de rang de production de 64 à 128. QLoRA ajoute une quantification 4 bits du modèle de base gelé, réduisant la VRAM de 33 % avec une augmentation de 39 % du temps d'entraînement. Pour la plupart des cas d'usage en entreprise, LoRA au rang 64-128 est le bon choix par défaut. QLoRA lorsque la mémoire GPU est réellement limitée. Le fine-tuning complet uniquement lorsque vous disposez du budget de compute, de la taille de jeu de données pour le justifier (plus de 50 000 exemples) et d'une tâche qui bénéficie manifestement de la mise à jour de tous les paramètres.
Qu'exige la conformité à l'EU AI Act pour les modèles d'IA fine-tunés ?
Si votre fine-tuning utilise un compute dépassant un tiers du compute d'entraînement du modèle d'origine (ou un tiers de 10^23 FLOPs si l'original est inconnu), l'EU AI Act vous considère comme un nouveau fournisseur de GPAI soumis à toutes les obligations de conformité : documentation technique, fiches de modèle, résumés des contenus protégés par le droit d'auteur et évaluations des risques. La pleine application pour les systèmes d'IA à haut risque débute le 2 août 2026, avec des amendes pouvant atteindre 35 millions EUR ou 7 % du chiffre d'affaires annuel mondial. Les normes techniques harmonisées (CEN/CENELEC JTC 21) sont encore en cours de finalisation, visées pour le T4 2026. Nous produisons des fiches de modèle et une documentation technique alignées sur les exigences de l'article 11(1) et de l'annexe IV, conçues pour être défendables sous les cadres actuels et adaptables aux normes finales.
Devrions-nous fine-tuner un modèle open source ou utiliser une API de fine-tuning d'un fournisseur ?
Les API des fournisseurs (OpenAI à ~$3/M tokens pour l'entraînement de GPT-4.1, Google Vertex pour Gemini, Mistral à $0.20/M pour Small 3.1) conviennent à une itération rapide lorsque la gouvernance des données autorise l'envoi de données d'entraînement à une infrastructure tierce. Les modèles open source (Llama 3, Mistral, Qwen) avec un entraînement auto-hébergé sont le bon choix lorsque les données doivent rester sur votre infrastructure, que vous avez besoin d'un contrôle total sur les dynamiques d'entraînement, ou que des exigences réglementaires l'imposent. La plupart des déploiements en entreprise en 2026 utilisent les deux : les API des fournisseurs pour le prototypage et les références, l'open source pour la production lorsque la souveraineté des données ou l'optimisation des coûts importe. Nous vous aidons à orienter cette décision en fonction de vos contraintes, et non d'une fidélité à une plateforme.
Comment évaluer si notre modèle fine-tuné est réellement meilleur que le modèle de base ?
La simple précision sur un jeu de test réservé est nécessaire mais pas suffisante. Nous construisons des suites d'évaluation qui mesurent la performance spécifique à la tâche avec des tests de signification statistique, la préservation des capacités générales à l'aide de benchmarks réservés issus de l'ensemble des capacités du modèle de base (pour détecter l'oubli catastrophique), le maintien de l'alignement de sécurité à l'aide de benchmarks de sécurité normalisés, la latence et le débit sous charge de production, la qualité de la calibration (le modèle sait-il ce qu'il ne sait pas) et la performance ventilée par sous-groupes pertinents pour détecter les biais introduits par les données d'entraînement. La suite d'évaluation est livrée avec le modèle sous forme de code reproductible, et non d'un rapport ponctuel.
Développez votre IA en toute confiance.
Collaborez avec une équipe forte d'une solide expérience dans la conception de la prochaine génération d'IA d'entreprise. Nous vous aidons à concevoir, développer et déployer une stratégie d'IA digne de confiance.
Veriprajna société de conseil en Deep Tech est spécialisée dans la conception de systèmes d'IA critiques pour la sûreté destinés aux secteurs de la santé, de la finance et de la réglementation. Nos architectures sont validées au regard de protocoles établis et accompagnées d'une documentation de conformité complète.