Desarrollo de Modelos y Ajuste Fino
Entrenamiento de modelos a medida y ajuste fino eficiente en parámetros que lleva a producción modelos con la alineación de seguridad intacta y la documentación regulatoria incluida.
La mayoría de los proyectos de ajuste fino fracasan antes de que empiece el entrenamiento
La factura de GPU no es la parte cara del ajuste fino empresarial. Un modelo de 7B parámetros se ajusta en una sola A100 por 100-400 USD en cómputo; un modelo de 70B cuesta 4000-9750 USD por ejecución de entrenamiento. Lo que mata los proyectos es todo lo que rodea al bucle de entrenamiento: curar miles de ejemplos específicos del dominio, evitar que el modelo olvide lo que ya sabe, validar que la alineación de seguridad sobrevivió al entrenamiento, cuantizar para el servicio en producción y construir la canalización de monitorización que detecta la deriva.
Gartner predice que para 2027, las organizaciones usarán modelos de IA pequeños y específicos por tarea tres veces más que los LLM de propósito general. El cambio ya está en marcha: el 68% de las empresas que ajustaron modelos en 2024 reportaron hasta 3 veces de mejora en la precisión de las tareas. Pero la brecha entre un experimento en cuaderno y un despliegue en producción es donde se estancan la mayoría de los proyectos. Nuestro enfoque consiste en diseñar la canalización completa, no solo el bucle de entrenamiento (una disciplina detallada en nuestra investigación sobre la ingeniería de sistemas más allá de los envoltorios de API).
Cuándo el ajuste fino es la decisión correcta (y cuándo no lo es)
La ingeniería de prompts tarda horas. RAG tarda de una a cuatro semanas. El ajuste fino tarda de dos a ocho semanas, incluida la creación del conjunto de datos, el entrenamiento, las pruebas de seguridad y el endurecimiento para producción. Comenzamos cada proyecto evaluando si el ajuste fino es realmente necesario.
Haga ajuste fino cuando:
- el modelo necesita un nuevo comportamiento o formatos de salida que los prompts no pueden producir de forma fiable;
- su dominio tiene patrones de razonamiento especializados que los modelos genéricos manejan de forma inconsistente;
- necesita una inferencia rentable a escala: un modelo de 7B ajustado a 0,20 USD/M de tokens reemplaza a uno de 70B a 2 USD/M;
- está construyendo sistemas agénticos donde la fiabilidad de la invocación de herramientas importa: los SLM ajustados mejoraron el éxito de la invocación de herramientas del 10% al 79% en las pruebas de referencia (véase una demostración funcional de uno de esos sistemas agénticos de programación).
No haga ajuste fino cuando:
- el problema es la recuperación de conocimiento (use RAG);
- el conjunto de datos tiene menos de 1000 ejemplos por tarea;
- la ingeniería de prompts ya logra una precisión aceptable;
- el modelo base cambia más rápido que su cadencia de reentrenamiento.
Cuando RAG resuelve el problema y el ajuste fino solo desperdiciaría presupuesto, nuestro enfoque consiste en decirlo antes de dimensionar cualquier entrenamiento, en lugar de vender un proyecto que no necesita. Esa honestidad está integrada en cómo dimensionamos un proyecto.
La elección del marco de trabajo importa
El panorama de 2026 se ha consolidado en torno a herramientas diferenciadas, cada una de las cuales resuelve un problema distinto.
| Marco de trabajo | Mejor para | Restricciones / notas |
|---|---|---|
| Unsloth | El más rápido en configuraciones de una sola GPU | La versión de código abierto no puede escalar más allá de una GPU; el FSDP multi-GPU está reservado para el nivel Pro |
| Axolotl | Estándar de producción para el entrenamiento multi-GPU | Reproducibilidad basada en YAML en clústeres de A100 y H100 |
| Hugging Face TRL | Cuando el objetivo de entrenamiento es lo más importante | DPO, GRPO, PPO o cualquier trabajo de alineación basado en RL |
| LLaMA-Factory | Ajuste fino por primera vez a través de una interfaz web | Accesible, pero la mayoría de los equipos lo superan rápidamente |
| TorchTune (Meta) | Integración nativa con PyTorch | Para el ecosistema de modelos de Meta |
Elegimos en función de su escala de entrenamiento, la arquitectura del modelo y los objetivos. La mayoría de los despliegues en producción usan más de uno: Axolotl para el ajuste fino supervisado, TRL para la optimización de preferencias y Unsloth para el prototipado rápido.
La alineación de seguridad no sobrevive a un ajuste fino ingenuo
La investigación de EMNLP 2024 demostró que ajustar los LLM con nuevo conocimiento factual aumenta la propensión a la alucinación. Por separado, investigadores de Princeton, Stanford, Virginia Tech e IBM mostraron que el ajuste fino estándar permitía a los modelos eludir por completo el entrenamiento de seguridad. Desde entonces, la investigación de ICLR 2026 ha mostrado que un ajuste cuidadoso de los hiperparámetros mitiga estos riesgos, pero las configuraciones predeterminadas de los marcos de trabajo se distribuyen sin protecciones.
El mecanismo: las actualizaciones agresivas de parámetros en las capas superiores sobrescriben las características responsables de la seguridad. La selección del rango de LoRA es crítica: los adaptadores de mayor rango en las capas de atención pueden desestabilizar los circuitos de rechazo, y la configuración segura depende de la arquitectura específica del modelo y de los datos de la tarea.
Nuestro enfoque consiste en implementar canalizaciones que preservan la seguridad (fundamentadas en nuestra investigación sobre la gobernanza de la seguridad de la IA en el espacio latente):
- LoRA selectivo que protege los circuitos críticos;
- pruebas de referencia de seguridad reservadas en cada punto de control;
- detención temprana basada en métricas compuestas que equilibran el rendimiento de la tarea frente a la preservación de las capacidades;
- monitorización continua de la degradación de la alineación a lo largo de todo el entrenamiento.
La curación de datos es el verdadero cuello de botella
Las horas de GPU son una partida presupuestaria. La curación de datos es el proyecto:
- conseguir que los expertos en la materia etiqueten de 5000 a 50 000 ejemplos de alta calidad;
- resolver los desacuerdos de anotación con métricas de acuerdo entre anotadores;
- ejecutar la deduplicación MinHash/LSH;
- verificar la contaminación frente a los conjuntos de evaluación;
- documentar la procedencia con hojas de datos.
El RLAIF (usando GPT-4 como etiquetador) reduce el costo de los datos de preferencia, pero introduce el sesgo del modelo maestro. Los datos sintéticos mediante destilación maestro-estudiante impulsan los conjuntos de entrenamiento, aunque la calidad está limitada por las capacidades del modelo maestro.
Un proyecto se dimensiona para cubrir el diseño de la canalización de datos, los flujos de trabajo de anotación, la validación de calidad y la documentación para sectores regulados: la validación de software de la FDA, los informes de validación de modelos financieros y la documentación técnica de la Ley de IA de la UE con fichas de modelo que cumplen los requisitos del Artículo 11(1).
Del entrenamiento a la producción
Cuantización
Haga el ajuste fino en FP16, fusione los adaptadores y luego cuantice. AWQ INT4 con el kernel Marlin ofrece la mejor relación rendimiento-calidad para el servicio con vLLM (741 tok/s). GPTQ se integra con TensorRT-LLM y TGI. GGUF es nativo para llama.cpp y Ollama. Adaptamos la cuantización a su pila de servicio.
Proveedor frente a código abierto
OpenAI cobra ~3 USD/M de tokens por el ajuste fino de GPT-4.1. El Small 3.1 ajustado de Mistral a 0,20 USD/M iguala a su Large 3 a 2 USD/M en tareas específicas. Anthropic no ofrece ajuste fino público. Las API de proveedores funcionan para una iteración rápida cuando la gobernanza de datos permite el uso de infraestructura de terceros.
Los modelos de código abierto (Llama 3, Mistral, Qwen) con entrenamiento autoalojado son la opción adecuada cuando los datos deben permanecer en su infraestructura o cuando los requisitos regulatorios lo exigen. La mayoría de las empresas usan ambos.
Monitorización y reentrenamiento
Los modelos en producción se desvían. Nuestro enfoque consiste en construir canalizaciones que rastrean la calidad de las predicciones, detectan la deriva de datos y de concepto, y activan el reentrenamiento cuando se cruzan los umbrales. MLflow o Weights and Biases se encargan del seguimiento de experimentos, con registros de modelos que proporcionan el linaje completo desde los datos de entrenamiento hasta el artefacto desplegado.
Alineación posentrenamiento: más allá del SFT
El estándar de producción de 2026 es una canalización modular: SFT para el seguimiento de instrucciones, DPO o SimPO para la alineación de preferencias y GRPO para el razonamiento.
El DPO desplazó al RLHF PPO al eliminar el modelo de recompensa. SimPO eliminó el modelo de referencia mientras superaba al DPO en 6,4 puntos en AlpacaEval 2. GRPO (de DeepSeek R1) usa recompensas verificables para entrenar el razonamiento mediante RL puro (una técnica que exploramos en nuestra investigación sobre el aprendizaje por refuerzo en grafos), con autorreflexión y verificación emergentes. Implementamos estos métodos usando TRL, el marco de trabajo que acierta con la dinámica del entrenamiento por RL.
Lo que entregamos
Cada proyecto se dimensiona para producir un sistema desplegable:
- el modelo ajustado con fichas de modelo completas;
- la canalización de entrenamiento como código reproducible con seguimiento de experimentos;
- un conjunto de evaluación que compara el rendimiento frente al modelo base y las alternativas en cuanto a precisión, latencia, robustez y calibración;
- el artefacto de despliegue cuantizado con una configuración de servicio optimizada;
- paneles de monitorización con detección de deriva y activadores de reentrenamiento;
- para sectores regulados, documentación de validación específica del sector (Ley de IA de la UE, FDA, validación de modelos financieros).
El proyecto también produce una evaluación honesta: si el ajuste fino era el enfoque adecuado, qué no puede hacer el modelo y dónde se sitúa el techo de rendimiento. Las limitaciones documentadas de antemano ahorran más dinero que las proyecciones optimistas.
Desarrollo de Modelos y Ajuste Fino
IA para la recuperación de materiales y la clasificación de plásticos negros | Veriprajna
El pigmento de negro de carbón absorbe la luz del infrarrojo cercano. Cada bandeja de PP negro, recipiente de PE y carcasa de ABS que su clasificador óptico no detecta acaba en el rechazo y, después, en el vertedero. Nosotros construimos la capa de detección MWIR e IA en el borde que lo recupera.
IA para la Programación de Tripulaciones Aéreas: Recuperación de IROPS que Funciona Cuando los Solucionadores Heredados Fallan | Veriprajna
IA para la programación de tripulaciones aéreas y la recuperación de IROPS para aerolíneas medianas. Aumente Jeppesen o IBS con ML que gestiona interrupciones en cascada, brechas en el seguimiento de tripulaciones y la exposición a reembolsos del DOT.
Seguridad de IA para Bioseguridad en Farma y Biotecnología | Veriprajna
En 2022, Collaborations Pharmaceuticals ejecutó su modelo comercial de descubrimiento de fármacos de novo con la función de recompensa invertida. En menos de seis horas generó 40.000 moléculas candidatas, incluidos análogos del VX. Eso fue MegaSyn, una LSTM de la época de 2019, ejecutándose en una sola estación de trabajo.
Explore Solution →Preguntas Frecuentes
¿Cuánto cuesta ajustar un modelo de 7B frente a uno de 70B con los datos de nuestro dominio?
El cómputo de GPU para un modelo de 7B ronda los 100-400 USD por iteración de entrenamiento en infraestructura A100, con costos totales del proyecto (incluida la curación de datos, la evaluación y el despliegue) que van de 500-2000 USD para escala pequeña a 5000-15 000 USD para despliegues de nivel de producción. Un modelo de 70B requiere de 800 a 1500 horas de GPU a 4000-9750 USD por ejecución, con proyectos de producción típicamente en el rango de 10 000-50 000 USD. La factura de GPU rara vez es la partida más grande. La curación de datos, el tiempo de anotación de los expertos en la materia, la validación de seguridad y la documentación regulatoria a menudo superan los costos de cómputo de 2 a 5 veces. Dimensionamos en función de la complejidad real de su tarea y de la preparación de sus datos, no solo del tamaño del modelo.
¿Cuándo deberíamos hacer ajuste fino frente a usar RAG o ingeniería de prompts?
Empiece con el enfoque más económico que resuelva el problema. La ingeniería de prompts tarda horas y no cuesta casi nada. RAG tarda de 1 a 4 semanas y es la opción correcta cuando el modelo necesita acceso a conocimiento actual o propietario con el que no fue entrenado. El ajuste fino tarda de 2 a 8 semanas y se justifica cuando el modelo necesita aprender un nuevo comportamiento, formatos de salida o razonamiento específico del dominio que los prompts no pueden producir de forma fiable. El estándar de producción de 2026 es híbrido: RAG entrega hechos actuales, el ajuste fino da forma al comportamiento del modelo y la ingeniería de prompts controla la calidad de la salida. Comenzamos cada proyecto probando si los enfoques más sencillos resuelven el problema antes de recomendar el ajuste fino.
¿Qué marco de ajuste fino deberíamos usar: Axolotl, Unsloth o TRL?
Cada uno resuelve un problema distinto. Unsloth es el más rápido en configuraciones de una sola GPU y excelente para el prototipado, pero el FSDP multi-GPU está limitado a su nivel comercial Pro. Axolotl es el estándar de producción para el entrenamiento multi-GPU con reproducibilidad basada en YAML. TRL es lo que se usa cuando el objetivo de entrenamiento es lo más importante, particularmente para DPO, GRPO, PPO o cualquier trabajo de alineación por aprendizaje por refuerzo. La mayoría de los despliegues en producción usan más de uno: Axolotl para el ajuste fino supervisado, TRL para la optimización de preferencias y Unsloth para la experimentación rápida. Elegimos en función de su escala de entrenamiento, la arquitectura del modelo y los objetivos.
¿Cómo evitamos el olvido catastrófico y la degradación de la seguridad durante el ajuste fino?
Las configuraciones estándar de ajuste fino se distribuyen sin protecciones contra ninguno de los dos problemas. La investigación de EMNLP 2024 mostró que el ajuste fino con nuevo conocimiento factual aumenta la propensión a la alucinación, y estudios independientes demostraron que un ajuste fino ingenuo puede desactivar por completo el comportamiento de rechazo de seguridad. Implementamos canalizaciones de entrenamiento que preservan la seguridad: LoRA selectivo que protege los circuitos críticos del modelo, calibración del rango de LoRA ajustada a cada arquitectura de modelo, pruebas de referencia de seguridad reservadas en cada punto de control del entrenamiento, detención temprana basada en métricas compuestas que equilibran el rendimiento de la tarea frente a la preservación de las capacidades, y programaciones de la tasa de aprendizaje fundamentadas en leyes de escalado que minimizan la perturbación de parámetros en las capas críticas para la seguridad.
¿Cuál es el tamaño mínimo de conjunto de datos necesario para ajustar un LLM de forma eficaz?
1000 ejemplos de alta calidad por tarea es el mínimo práctico para el ajuste fino supervisado con LoRA. Por debajo de ese umbral, el sobreajuste domina y le conviene más el prompting de pocos ejemplos o RAG. La calidad importa más que la cantidad: 2000 ejemplos cuidadosamente curados con un alto acuerdo entre anotadores superan a 20 000 ejemplos ruidosos. Para la optimización de preferencias (DPO/SimPO), necesita al menos de 5000 a 10 000 pares de preferencia. Para el aprendizaje por refuerzo con recompensas verificables (GRPO), el requisito pasa de los datos etiquetados a una función de verificación fiable. Evaluamos sus activos de datos existentes y diseñamos la canalización de anotación para alcanzar el umbral de calidad que su tarea requiere.
¿Cómo ajustamos un modelo para una invocación de herramientas fiable en flujos de trabajo agénticos?
Los modelos listos para usar con frecuencia alucinan los parámetros de las herramientas, seleccionan funciones incorrectas o fallan en las secuencias de múltiples pasos. El ajuste fino con conjuntos de datos estructurados de invocación de herramientas ha mejorado las tasas de éxito del 10% al 79% en las pruebas de referencia, y los modelos ajustados muestran recompensas de invocación de herramientas un 57% más altas en escenarios no vistos en comparación con los modelos base. El enfoque implica curar datos de entrenamiento de invocación de herramientas con firmas de función correctas, tipos de parámetros y cadenas de múltiples pasos, y luego hacer el ajuste fino con SFT seguido de aprendizaje por refuerzo usando la retroalimentación de ejecución como señal de recompensa. Construimos la canalización de datos de entrenamiento, entrenamos el modelo y lo validamos frente a su superficie de API real antes del despliegue.
LoRA frente a QLoRA frente a ajuste fino completo: ¿qué enfoque para nuestro caso de uso?
El ajuste fino completo actualiza todos los parámetros y ofrece el techo más alto, pero requiere más de 8 GPU para cualquier cosa por encima de 7B parámetros. LoRA congela el modelo base y entrena pequeñas matrices adaptadoras, reduciendo los parámetros entrenables en más del 90% con una pérdida de calidad mínima en configuraciones de rango de producción de 64-128. QLoRA añade la cuantización de 4 bits del modelo base congelado, recortando la VRAM en un 33% con un aumento del 39% en el tiempo de entrenamiento. Para la mayoría de los casos de uso empresariales, LoRA con rango 64-128 es la opción predeterminada correcta. QLoRA cuando la memoria de la GPU está genuinamente limitada. El ajuste fino completo solo cuando dispone del presupuesto de cómputo, el tamaño del conjunto de datos que lo justifique (más de 50 000 ejemplos) y una tarea que se beneficie de forma demostrable de actualizar todos los parámetros.
¿Qué exige el cumplimiento de la Ley de IA de la UE para los modelos de IA ajustados?
Si su ajuste fino usa un cómputo que supera un tercio del cómputo de entrenamiento del modelo original (o un tercio de 10^23 FLOPs si el original es desconocido), la Ley de IA de la UE lo trata como un nuevo proveedor de GPAI con obligaciones de cumplimiento completas: documentación técnica, fichas de modelo, resúmenes de material protegido por derechos de autor y evaluaciones de riesgo. La aplicación plena para los sistemas de IA de alto riesgo comienza el 2 de agosto de 2026, con multas de hasta 35 millones EUR o el 7% de la facturación anual global. Las normas técnicas armonizadas (CEN/CENELEC JTC 21) aún se están finalizando, con un objetivo del cuarto trimestre de 2026. Producimos fichas de modelo y documentación técnica alineadas con los requisitos del Artículo 11(1) y del Anexo IV, diseñadas para ser defendibles bajo los marcos actuales y adaptables a las normas finales.
¿Deberíamos ajustar un modelo de código abierto o usar una API de ajuste fino de un proveedor?
Las API de proveedores (OpenAI a ~3 USD/M de tokens para el entrenamiento de GPT-4.1, Google Vertex para Gemini, Mistral a 0,20 USD/M para Small 3.1) son la opción adecuada para una iteración rápida cuando la gobernanza de datos permite enviar datos de entrenamiento a infraestructura de terceros. Los modelos de código abierto (Llama 3, Mistral, Qwen) con entrenamiento autoalojado son la opción adecuada cuando los datos deben permanecer en su infraestructura, necesita control total sobre la dinámica del entrenamiento o los requisitos regulatorios lo exigen. La mayoría de los despliegues empresariales en 2026 usan ambos: las API de proveedores para el prototipado y las líneas base, y el código abierto para la producción donde importa la soberanía de los datos o la optimización de costos. Le ayudamos a navegar esta decisión en función de sus restricciones, no de la lealtad a una plataforma.
¿Cómo evaluamos si nuestro modelo ajustado es realmente mejor que el base?
La simple precisión en un conjunto de prueba reservado es necesaria pero no suficiente. Construimos conjuntos de evaluación que miden el rendimiento específico de la tarea con pruebas de significancia estadística, la preservación de las capacidades generales usando pruebas de referencia reservadas del conjunto de capacidades del modelo base (detectando el olvido catastrófico), la retención de la alineación de seguridad usando pruebas de referencia de seguridad estandarizadas, la latencia y el rendimiento bajo carga de producción, la calidad de la calibración (¿sabe el modelo lo que no sabe?) y el rendimiento desagregado entre subgrupos relevantes para detectar el sesgo introducido por los datos de entrenamiento. El conjunto de evaluación se entrega con el modelo como código reproducible, no como un informe único.
Construya su IA con confianza.
Colabore con un equipo que cuenta con amplia experiencia en la creación de la próxima generación de IA empresarial. Permítanos ayudarle a diseñar, construir e implementar una estrategia de IA en la que pueda confiar.
Veriprajna consultora de Deep Tech está especializada en la creación de sistemas de IA críticos para la seguridad en los sectores de salud, finanzas y ámbitos regulatorios. Nuestras arquitecturas se validan conforme a protocolos establecidos, con documentación de cumplimiento integral.