Sviluppo e Fine-Tuning di Modelli AI

Addestramento di modelli personalizzati e fine-tuning efficiente dei parametri che consegna modelli pronti per la produzione con l'allineamento di sicurezza intatto e la documentazione normativa inclusa.

La maggior parte dei progetti di fine-tuning fallisce prima ancora che inizi l'addestramento

La bolletta delle GPU non è la parte costosa del fine-tuning aziendale. Un modello da 7 miliardi di parametri si sottopone al fine-tuning su una singola A100 per $100–$400 in risorse di calcolo; un modello da 70 miliardi di parametri costa $4,000–$9,750 per ciclo di addestramento. Ciò che manda a monte i progetti è tutto quello che sta attorno al ciclo di addestramento: curare migliaia di esempi specifici del dominio, impedire che il modello dimentichi ciò che già sa, verificare che l'allineamento di sicurezza sia sopravvissuto all'addestramento, quantizzare per il serving in produzione e costruire la pipeline di monitoraggio che intercetta il drift.

Gartner prevede che entro il 2027, le organizzazioni utilizzeranno modelli di IA piccoli e specifici per attività tre volte più dei LLM generalisti. Il cambiamento è già in corso: il 68% delle aziende che ha sottoposto modelli a fine-tuning nel 2024 ha registrato un miglioramento fino a 3 volte nell'accuratezza delle attività. Ma è nel divario tra un esperimento su notebook e un'implementazione in produzione che la maggior parte dei progetti si arena. Il nostro approccio consiste nel progettare l'intera pipeline, non solo il ciclo di addestramento (una disciplina descritta in dettaglio in la nostra ricerca sulla progettazione di sistemi che vanno oltre i wrapper delle API).

Quando il fine-tuning è la scelta giusta (e quando non lo è)

Il prompt engineering richiede ore. Il RAG richiede da una a quattro settimane. Il fine-tuning richiede da due a otto settimane, comprese la creazione del dataset, l'addestramento, i test di sicurezza e l'hardening per la produzione. Iniziamo ogni incarico valutando se il fine-tuning sia effettivamente necessario.

Effettua il fine-tuning quando:

  • il modello ha bisogno di nuovi comportamenti o formati di output che il prompting non è in grado di produrre in modo affidabile;
  • il tuo dominio presenta schemi di ragionamento specializzati che i modelli generici gestiscono in modo incoerente;
  • hai bisogno di un'inferenza economicamente efficiente su larga scala — un modello da 7 miliardi di parametri sottoposto a fine-tuning a $0.20/M di token sostituisce uno da 70 miliardi a $2/M;
  • stai costruendo sistemi di agentic AI in cui l'affidabilità delle chiamate agli strumenti è cruciale — gli SLM sottoposti a fine-tuning hanno migliorato il tasso di successo delle chiamate agli strumenti dal 10% al 79% nei benchmark (vedi una demo funzionante di uno di questi sistemi agentici di pianificazione).

Non effettuare il fine-tuning quando:

  • il problema è il recupero della conoscenza (usa il RAG);
  • il dataset contiene meno di 1,000 esempi per attività;
  • il prompt engineering raggiunge già un'accuratezza accettabile;
  • il modello di base cambia più velocemente della tua cadenza di riaddestramento.

Quando il RAG risolve il problema e il fine-tuning non farebbe che sprecare budget, il nostro approccio è dirlo prima di dimensionare qualsiasi addestramento, anziché venderti un progetto di cui non hai bisogno. Questa onestà è parte integrante del modo in cui definiamo un incarico.

La scelta del framework è importante

Il panorama del 2026 si è consolidato attorno a strumenti distinti, ciascuno dei quali risolve un problema diverso.

FrameworkIdeale perVincoli / note
UnslothIl più veloce su configurazioni a GPU singolaLa versione open-source non può scalare oltre una GPU; l'FSDP multi-GPU è riservato al piano Pro
AxolotlStandard di produzione per l'addestramento multi-GPURiproducibilità basata su YAML tra cluster A100 e H100
Hugging Face TRLQuando l'obiettivo di addestramento conta più di ogni altra cosaDPO, GRPO, PPO o qualsiasi lavoro di allineamento basato su RL
LLaMA-FactoryFine-tuning per la prima volta tramite interfaccia webAccessibile, ma la maggior parte dei team lo supera rapidamente
TorchTune (Meta)Integrazione nativa con PyTorchPer l'ecosistema di modelli Meta

Effettuiamo la selezione in base alla scala del tuo addestramento, all'architettura del modello e agli obiettivi. La maggior parte delle implementazioni in produzione ne utilizza più di uno: Axolotl per il fine-tuning supervisionato, TRL per l'ottimizzazione delle preferenze e Unsloth per la prototipazione rapida.

L'allineamento di sicurezza non sopravvive a un fine-tuning ingenuo

Una ricerca presentata a EMNLP 2024 ha dimostrato che il fine-tuning dei LLM su nuove conoscenze fattuali aumenta la propensione alle allucinazioni. Separatamente, ricercatori di Princeton, Stanford, Virginia Tech e IBM hanno dimostrato che il fine-tuning standard consentiva ai modelli di aggirare completamente l'addestramento sulla sicurezza. Una ricerca presentata a ICLR 2026 ha poi mostrato che un'attenta messa a punto degli iperparametri mitiga questi rischi, ma le configurazioni predefinite dei framework vengono rilasciate senza protezioni.

Il meccanismo: aggiornamenti aggressivi dei parametri negli strati superiori sovrascrivono le caratteristiche responsabili della sicurezza. La scelta del rango LoRA è fondamentale — gli adattatori di rango più elevato sugli strati di attenzione possono destabilizzare i circuiti di rifiuto, e la configurazione sicura dipende dalla specifica architettura del modello e dai dati dell'attività.

Il nostro approccio consiste nell'implementare pipeline che preservano la sicurezza (basate su la nostra ricerca sulla governance della sicurezza dell'IA nello spazio latente):

  • LoRA selettivo che protegge i circuiti critici;
  • benchmark di sicurezza riservati a ogni checkpoint;
  • arresto anticipato su metriche composite che bilanciano le prestazioni sulle attività con la conservazione delle capacità;
  • monitoraggio continuo del degrado dell'allineamento durante tutto l'addestramento.

La cura dei dati è il vero collo di bottiglia

Le ore di GPU sono una voce di costo. La cura dei dati è il progetto:

  • far etichettare agli esperti di dominio (SME) 5,000–50,000 esempi di alta qualità;
  • risolvere i disaccordi di annotazione con metriche di concordanza tra annotatori;
  • eseguire la deduplicazione MinHash/LSH;
  • verificare la contaminazione rispetto ai set di valutazione;
  • documentare la provenienza con datasheet.

L'RLAIF (che utilizza GPT-4 come etichettatore) riduce i costi per i dati di preferenza ma introduce un bias del modello insegnante. I dati sintetici tramite distillazione insegnante-studente avviano i set di addestramento, anche se la qualità è limitata dalle capacità del modello insegnante.

Un incarico è dimensionato per coprire la progettazione della pipeline dei dati, i flussi di lavoro di annotazione, la validazione della qualità e la documentazione per i settori regolamentati: validazione del software FDA, report di validazione dei modelli finanziari e documentazione tecnica ai sensi dell'EU AI Act con model card conformi ai requisiti dell'Articolo 11(1).

Dall'addestramento alla produzione

Quantizzazione

Effettua il fine-tuning in FP16, unisci gli adattatori, poi quantizza. AWQ INT4 con il kernel Marlin offre il miglior rapporto throughput/qualità per il serving vLLM (741 tok/s). GPTQ si integra con TensorRT-LLM e TGI. GGUF è nativo per llama.cpp e Ollama. Adattiamo la quantizzazione al tuo stack di serving.

Vendor rispetto a open-source

OpenAI applica ~$3/M di token per il fine-tuning di GPT-4.1. Il modello Small 3.1 di Mistral sottoposto a fine-tuning a $0.20/M eguaglia il loro Large 3 a $2/M su attività ristrette. Anthropic non offre un fine-tuning pubblico. Le API dei vendor funzionano per un'iterazione rapida quando la governance dei dati consente l'uso di infrastrutture di terze parti.

I modelli open-source (Llama 3, Mistral, Qwen) con addestramento self-hosted sono la scelta giusta quando i dati devono rimanere sulla tua infrastruttura o quando i requisiti normativi lo impongono. La maggior parte delle aziende utilizza entrambi.

Monitoraggio e riaddestramento

I modelli in produzione vanno soggetti a drift. Il nostro approccio consiste nel costruire pipeline che monitorano la qualità delle previsioni, rilevano il drift dei dati e dei concetti e attivano il riaddestramento quando vengono superate le soglie. MLflow o Weights and Biases gestiscono il tracciamento degli esperimenti, con registri dei modelli che forniscono la tracciabilità completa dai dati di addestramento all'artefatto distribuito.

Allineamento post-addestramento: oltre l'SFT

Lo standard di produzione del 2026 è una pipeline modulare: SFT per il rispetto delle istruzioni, DPO o SimPO per l'allineamento delle preferenze e GRPO per il ragionamento.

Il DPO ha soppiantato l'RLHF PPO eliminando il modello di ricompensa. SimPO ha rimosso il modello di riferimento superando al contempo il DPO di 6,4 punti su AlpacaEval 2. GRPO (da DeepSeek R1) utilizza ricompense verificabili per addestrare il ragionamento attraverso l'RL puro (una tecnica che esploriamo in la nostra ricerca sul reinforcement learning su grafi), con auto-riflessione e verifica emergenti. Implementiamo questi metodi utilizzando TRL, il framework che gestisce correttamente le dinamiche di addestramento RL.

Cosa forniamo

Ogni incarico è dimensionato per produrre un sistema pronto per l'implementazione:

  • il modello sottoposto a fine-tuning con model card complete;
  • la pipeline di addestramento come codice riproducibile con tracciamento degli esperimenti;
  • una suite di valutazione che effettua il benchmark rispetto al modello di base e alle alternative su accuratezza, latenza, robustezza e calibrazione;
  • l'artefatto di deployment quantizzato con configurazione di serving ottimizzata;
  • dashboard di monitoraggio con rilevamento del drift e trigger di riaddestramento;
  • per i settori regolamentati, documentazione di validazione specifica per settore (EU AI Act, FDA, validazione dei modelli finanziari).

L'incarico produce anche una valutazione onesta: se il fine-tuning fosse l'approccio giusto, cosa il modello non è in grado di fare e dove si colloca il limite massimo delle prestazioni. Limitazioni documentate fin dall'inizio fanno risparmiare più denaro delle proiezioni ottimistiche.

FAQ

Domande Frequenti

Quanto costa effettuare il fine-tuning di un modello da 7 miliardi rispetto a uno da 70 miliardi di parametri sui nostri dati di dominio?

Il calcolo su GPU per un modello da 7 miliardi di parametri costa $100-$400 per iterazione di addestramento su infrastruttura A100, con costi totali del progetto (inclusi cura dei dati, valutazione e deployment) che vanno da $500-$2,000 per implementazioni su piccola scala a $5,000-$15,000 per implementazioni di livello produttivo. Un modello da 70 miliardi di parametri richiede 800-1,500 ore di GPU a $4,000-$9,750 per esecuzione, con progetti di produzione tipicamente nell'ordine di $10,000-$50,000. La bolletta delle GPU è raramente la voce di costo più consistente. La cura dei dati, il tempo di annotazione degli esperti di dominio, la validazione della sicurezza e la documentazione normativa spesso superano i costi di calcolo di 2-5 volte. Effettuiamo il dimensionamento in base alla complessità effettiva della tua attività e alla prontezza dei dati, non solo alle dimensioni del modello.

Quando conviene effettuare il fine-tuning, usare il RAG o il prompt engineering?

Inizia con l'approccio più economico che risolve il problema. Il prompt engineering richiede ore e costa quasi nulla. Il RAG richiede 1-4 settimane ed è la scelta giusta quando il modello ha bisogno di accedere a conoscenze attuali o proprietarie su cui non è stato addestrato. Il fine-tuning richiede 2-8 settimane ed è giustificato quando il modello deve apprendere nuovi comportamenti, formati di output o ragionamenti specifici del dominio che il prompting non è in grado di produrre in modo affidabile. Lo standard di produzione del 2026 è ibrido: il RAG fornisce fatti attuali, il fine-tuning plasma il comportamento del modello e il prompt engineering controlla la qualità dell'output. Iniziamo ogni incarico verificando se gli approcci più semplici risolvono il problema prima di raccomandare il fine-tuning.

Quale framework di fine-tuning dovremmo usare: Axolotl, Unsloth o TRL?

Ciascuno risolve un problema diverso. Unsloth è il più veloce su configurazioni a GPU singola ed è ottimo per la prototipazione, ma l'FSDP multi-GPU è limitato al loro piano commerciale Pro. Axolotl è lo standard di produzione per l'addestramento multi-GPU con riproducibilità basata su YAML. TRL è quello che si usa quando l'obiettivo di addestramento conta più di ogni altra cosa, in particolare per DPO, GRPO, PPO o qualsiasi lavoro di allineamento basato sul reinforcement learning. La maggior parte delle implementazioni in produzione ne utilizza più di uno: Axolotl per il fine-tuning supervisionato, TRL per l'ottimizzazione delle preferenze e Unsloth per la sperimentazione rapida. Effettuiamo la selezione in base alla scala del tuo addestramento, all'architettura del modello e agli obiettivi.

Come possiamo prevenire il forgetting catastrofico e il degrado della sicurezza durante il fine-tuning?

Le configurazioni standard di fine-tuning vengono rilasciate senza protezioni contro nessuno dei due problemi. Una ricerca presentata a EMNLP 2024 ha mostrato che il fine-tuning su nuove conoscenze fattuali aumenta la propensione alle allucinazioni, e studi separati hanno dimostrato che un fine-tuning ingenuo può disabilitare completamente il comportamento di rifiuto per la sicurezza. Implementiamo pipeline di addestramento che preservano la sicurezza: LoRA selettivo che protegge i circuiti critici del modello, calibrazione del rango LoRA adattata a ciascuna architettura del modello, benchmark di sicurezza riservati a ogni checkpoint di addestramento, arresto anticipato basato su metriche composite che bilanciano le prestazioni sulle attività con la conservazione delle capacità, e programmi di learning rate informati dalle leggi di scala che minimizzano la perturbazione dei parametri negli strati critici per la sicurezza.

Qual è la dimensione minima del dataset necessaria per effettuare il fine-tuning di un LLM in modo efficace?

1,000 esempi di alta qualità per attività è il minimo pratico per il fine-tuning supervisionato con LoRA. Al di sotto di questa soglia, l'overfitting domina ed è preferibile ricorrere al few-shot prompting o al RAG. La qualità conta più della quantità: 2,000 esempi accuratamente curati con un'elevata concordanza tra annotatori superano 20,000 esempi rumorosi. Per l'ottimizzazione delle preferenze (DPO/SimPO), servono almeno 5,000-10,000 coppie di preferenze. Per il reinforcement learning con ricompense verificabili (GRPO), il requisito si sposta dai dati etichettati a una funzione di verifica affidabile. Valutiamo le risorse di dati esistenti e progettiamo la pipeline di annotazione per raggiungere la soglia di qualità richiesta dalla tua attività.

Come possiamo effettuare il fine-tuning di un modello per chiamate agli strumenti affidabili nei flussi di lavoro agentici?

I modelli pronti all'uso spesso allucinano i parametri degli strumenti, selezionano funzioni errate o falliscono le sequenze multi-step. Il fine-tuning su dataset strutturati di chiamate agli strumenti ha migliorato i tassi di successo dal 10% al 79% nei benchmark, e i modelli sottoposti a fine-tuning mostrano ricompense per le chiamate agli strumenti superiori del 57% su scenari mai visti rispetto ai modelli di base. L'approccio prevede la cura dei dati di addestramento per le chiamate agli strumenti con firme di funzione corrette, tipi di parametri e catene multi-step, seguita dal fine-tuning con SFT e poi dal reinforcement learning utilizzando il feedback di esecuzione come segnale di ricompensa. Costruiamo la pipeline dei dati di addestramento, addestriamo il modello e lo validiamo rispetto alla tua effettiva superficie API prima del deployment.

LoRA, QLoRA o fine-tuning completo: quale approccio per il nostro caso d'uso?

Il fine-tuning completo aggiorna ogni parametro e offre il tetto più alto, ma richiede più di 8 GPU per qualsiasi cosa superiore ai 7 miliardi di parametri. LoRA congela il modello di base e addestra piccole matrici di adattamento, riducendo i parametri addestrabili di oltre il 90% con una perdita minima di qualità con impostazioni di rango di produzione di 64-128. QLoRA aggiunge la quantizzazione a 4 bit del modello di base congelato, riducendo la VRAM del 33% con un aumento del 39% dei tempi di addestramento. Per la maggior parte dei casi d'uso aziendali, LoRA con rango 64-128 è l'impostazione predefinita giusta. QLoRA quando la memoria della GPU è realmente limitata. Il fine-tuning completo solo quando disponi del budget di calcolo, della dimensione del dataset che lo giustifica (oltre 50,000 esempi) e di un'attività che trae dimostrabilmente beneficio dall'aggiornamento di tutti i parametri.

Cosa richiede la conformità all'EU AI Act per i modelli di IA sottoposti a fine-tuning?

Se il tuo fine-tuning utilizza risorse di calcolo che superano un terzo del calcolo di addestramento del modello originale (o un terzo di 10^23 FLOP se l'originale è sconosciuto), l'EU AI Act ti tratta come un nuovo fornitore di GPAI con pieni obblighi di conformità: documentazione tecnica, model card, sintesi dei materiali protetti da copyright e valutazioni dei rischi. La piena applicazione per i sistemi di IA ad alto rischio inizia il 2 agosto 2026, con sanzioni fino a 35 milioni di EUR o il 7% del fatturato annuo globale. Gli standard tecnici armonizzati (CEN/CENELEC JTC 21) sono ancora in fase di finalizzazione, con obiettivo il quarto trimestre del 2026. Produciamo model card e documentazione tecnica allineate ai requisiti dell'Articolo 11(1) e dell'Allegato IV, progettate per essere difendibili nell'ambito dei quadri normativi attuali e adattabili agli standard definitivi.

Dovremmo effettuare il fine-tuning di un modello open-source o usare un'API di fine-tuning di un vendor?

Le API dei vendor (OpenAI a ~$3/M di token per l'addestramento di GPT-4.1, Google Vertex per Gemini, Mistral a $0.20/M per Small 3.1) sono la scelta giusta per un'iterazione rapida quando la governance dei dati consente di inviare i dati di addestramento a infrastrutture di terze parti. I modelli open-source (Llama 3, Mistral, Qwen) con addestramento self-hosted sono la scelta giusta quando i dati devono rimanere sulla tua infrastruttura, hai bisogno del pieno controllo sulle dinamiche di addestramento o i requisiti normativi lo impongono. La maggior parte delle implementazioni aziendali nel 2026 utilizza entrambi: API dei vendor per la prototipazione e i riferimenti di base, open-source per la produzione dove contano la sovranità dei dati o l'ottimizzazione dei costi. Ti aiutiamo a orientarti in questa decisione in base ai tuoi vincoli, non alla fedeltà a una piattaforma.

Come valutiamo se il nostro modello sottoposto a fine-tuning è effettivamente migliore di quello di base?

La semplice accuratezza su un set di test riservato è necessaria ma non sufficiente. Costruiamo suite di valutazione che misurano le prestazioni specifiche dell'attività con test di significatività statistica, la conservazione delle capacità generali utilizzando benchmark riservati dall'insieme delle capacità del modello di base (intercettando il forgetting catastrofico), il mantenimento dell'allineamento di sicurezza utilizzando benchmark di sicurezza standardizzati, la latenza e il throughput sotto carico di produzione, la qualità della calibrazione (il modello sa cosa non sa), e le prestazioni disaggregate tra i sottogruppi rilevanti per intercettare il bias introdotto dai dati di addestramento. La suite di valutazione viene fornita con il modello come codice riproducibile, non come report una tantum.

Costruisci la tua IA con fiducia.

Collabora con un team che vanta una profonda esperienza nella creazione della prossima generazione di IA aziendale. Lascia che ti aiutiamo a progettare, sviluppare e implementare una strategia di IA di cui ti puoi fidare.

Veriprajna società di consulenza Deep Tech è specializzata nella creazione di sistemi di IA safety-critical per i settori sanitario, finanziario e regolamentato. Le nostre architetture sono validate rispetto a protocolli consolidati con una documentazione di conformità completa.