Protección del ciclo de vida de Machine Learning contra modelos maliciosos y despliegues Shadow
El descubrimiento de más de 100 modelos con puertas traseras en Hugging Face expuso lo que los ingenieros de Deep AI ya sabían: la cadena de suministro de ML es el componente más vulnerable y menos gobernado de la infraestructura empresarial. Este whitepaper presenta el diseño de ingeniería para una resiliencia de IA respaldada por hardware y criptográficamente verificable.
Mientras el mercado persigue servicios de wrappers de LLM, una vulnerabilidad sistémica empeora en los cimientos. Los pesos de los modelos de IA son blobs binarios opacos donde el comportamiento malicioso se oculta en millones de parámetros – invisible para la revisión de código tradicional.
Los modelos en repositorios públicos no solo fallan – están armados. La serialización Pickle permite la ejecución de código arbitrario en el instante en que un desarrollador ejecuta torch.load(), estableciendo shells inversas hacia la infraestructura controlada por el atacante.
El 90% del uso de IA empresarial ocurre fuera de la supervisión de TI. Los desarrolladores descargan modelos no verificados de repositorios públicos, pegan código propietario en herramientas públicas y evaden el análisis de composición de software (SCA) – creando puertas traseras persistentes e invisibles.
A pesar de las directrices NIST AI 100-2, solo el 17% de las organizaciones cuenta con controles de seguridad de IA automatizados. La brecha entre los documentos de políticas y la seguridad operativa es donde prosperan los atacantes – explotando la falsa sensación de preparación de la industria.
No todos los formatos de serialización son iguales. La dependencia de la industria en Pickle creó una vulnerabilidad de máquina virtual basada en pila. Los formatos más nuevos reducen el riesgo – pero ninguno es inmune. Haga clic en cada formato para explorar.
Pickle implementa una máquina virtual basada en pila que puede ejecutar funciones arbitrarias de Python durante la deserialización. Funciones como os.system() o subprocess.run() pueden inyectarse directamente en el proceso de unpickling.
Este es el formato más común para modelos heredados de PyTorch y scikit-learn. La flexibilidad que hizo popular a Pickle es exactamente lo que constituye una falla de seguridad crítica.
Un marco de cinco fases para modelar cómo los atacantes dirigen sus objetivos hacia sistemas de Machine Learning. Haga clic en cada etapa para comprender la mecánica de la amenaza y las contramedidas de ingeniería necesarias.
Los atacantes escanean repositorios públicos de modelos, configuraciones de CI/CD y árboles de dependencias para identificar puntos de entrada. Analizan qué frameworks utilizan las organizaciones, qué modelos descargan y qué formatos de serialización esperan sus pipelines.
Identificación de organizaciones que descargan tipos de modelos específicos para crear cargas útiles dirigidas a sus frameworks y formatos.
Análisis de archivos requirements.txt e imágenes Docker publicados para hallar versiones de frameworks vulnerables a explotación.
Registro centralizado de activos de IA con hub privado de modelos. Todas las descargas de modelos externos se registran, versionan y canalizan mediante un pipeline de evaluación automatizado.
El envenenamiento de datos implanta puertas traseras latentes que son invisibles para los benchmarks y resistentes a la dilución con datos limpios. Tan solo 250 documentos envenenados pueden comprometer permanentemente un modelo de 13 mil millones de parámetros. Estos «agentes durmientes» se activan solo al encontrar un token disparador específico.
Una vez que aparecen 50-100 apariciones del disparador durante el entrenamiento, la puerta trasera queda codificada permanentemente en el espacio de pesos. Añadir millones de muestras limpias no sobrescribe la asociación aprendida entre disparador y respuesta.
Visualice cómo interactúan el tamaño del corpus de entrenamiento y la tasa de veneno
Tasa de éxito simulada de puerta trasera según el número de muestras envenenadas (basado en umbrales de investigación publicados)
La gobernanza de los activos de IA está en crisis. La brecha entre las políticas y la seguridad operativa representa una tormenta perfecta de vulnerabilidad, fallas de cumplimiento y riesgo competitivo.
Tasas de implementación de controles NIST AI 100-2 en empresas, 2025
Estime la exposición de su organización frente al uso no gestionado de IA
«Muchas organizaciones equiparan tener un documento de políticas con contar con seguridad operativa. Sin embargo, sin una aplicación automatizada ni barreras técnicas, los empleados continuarán priorizando la conveniencia sobre la seguridad. La política no es protección.»
— Whitepaper de seguridad de IA de Veriprajna, 2025
Tratar los modelos de IA como código ejecutable potencialmente malicioso. Una arquitectura «Secure by Design» en toda la cadena de suministro de Machine Learning.
Los SBOM tradicionales rastrean librerías. La IA requiere un ML-BOM que capture la procedencia del modelo, el linaje del dataset y la metodología de entrenamiento – impulsado por los perfiles de IA CycloneDX y SPDX 3.0.
Los pesos de los modelos representan tanto propiedad intelectual como artefactos binarios de alto riesgo. La PKI para modelos de ML ya no es opcional – las firmas respaldadas por HSM garantizan que solo los modelos autorizados lleguen a producción.
El análisis estático es la primera línea. El Análisis Profundo de Código (DCA) construye un gráfico de software que mapea el flujo de entrada a través de ejecutores de LLM hasta las shells del sistema. La monitorización en tiempo de ejecución detecta activaciones de envenenamiento en producción.
Para finanzas, salud y defensa: Entornos de Ejecución Segura (TEE) respaldados por hardware protegen los datos en uso. Los pesos de los modelos y los prompts se descifran exclusivamente dentro de enclaves aislados – invisibles incluso para administradores de nube con privilegios de root.
Atestación mutua: el proveedor del modelo verifica un TEE auténtico, el usuario final verifica software aprobado. Fundamento de Zero Trust.
Desde la ingesta de modelos hasta la inferencia en producción, cada fase está gobernada por verificación criptográfica, monitoreo conductual y aislamiento Zero Trust.
Todos los modelos externos se dirigen a una cuarentena aislada. Sin conexión directa del hub a producción.
Escaneo profundo de bytecode. Validación de formato. Análisis de opcodes de Pickle. Conversión a SafeTensors.
Pruebas dinámicas en contenedores aislados. Monitoreo de tráfico saliente, llamadas al sistema (syscalls) y salidas anómalas.
Firma respaldada por HSM. Generación de ML-BOM. Registro en el inventario corporativo de activos de IA.
Controlador de admisión + TEE + capa de guardrails + validación continua de salidas.
Los sistemas de IA se construyen y despliegan a través de los mismos pipelines de CI/CD atacados en la cadena de suministro de código abierto. Si un modelo es seguro pero su entorno de ejecución en Python está comprometido, el sistema es vulnerado. Si la imagen del contenedor de entrenamiento está alterada, los pesos dejan de ser confiables.
Cualquier dicotomía entre «Activos de software» y «Activos de IA» es una brecha peligrosa que los atacantes explotarán.
El formato de serialización Pickle de Python – utilizado por PyTorch y scikit-learn – implementa una máquina virtual basada en pila que puede ejecutar código arbitrario durante la deserialización. Al manipular el método __reduce__, los atacantes inyectan shells inversas que se activan en el momento en que un desarrollador ejecuta torch.load(). Los investigadores de JFrog encontraron más de 100 modelos armados de este tipo en Hugging Face. Escáneres estáticos como PickleScan presentan una tasa de falsos positivos del 96% con 3 evasiones zero-day conocidas, haciendo que la detección no sea confiable.
Tan solo 250 documentos envenenados – que representan apenas el 0,00016% del corpus de entrenamiento – pueden comprometer permanentemente un modelo de 13 mil millones de parámetros. Una vez que se registran unas 50 apariciones del disparador durante el entrenamiento, la puerta trasera se codifica de forma permanente en el espacio de pesos. Añadir millones de muestras limpias posteriormente no sobrescribe la asociación aprendida entre disparador y respuesta. Estos «agentes durmientes» superan todos los benchmarks estándar y se activan solo al detectar un token disparador específico.
Un ML-BOM (Machine Learning Bill of Materials) extiende los SBOM tradicionales para capturar la procedencia del modelo, el linaje de datos, la metodología de entrenamiento, las dependencias de frameworks y las atestaciones criptográficas – impulsado por perfiles de IA de CycloneDX y SPDX 3.0. Permite un parcheo rápido de vulnerabilidades cuando se descubren CVEs en PyTorch u otras dependencias. Combinado con firmas criptográficas respaldadas por HSM, garantiza que solo los modelos autorizados con firmas válidas lleguen a producción, mientras que el motor de inferencia rechaza cualquier modelo con una firma inválida.
La diferencia entre «operar con suerte» y una resiliencia verificable radica en una única decisión arquitectónica.
Veriprajna diseña la transición desde un frágil Shadow AI hacia un stack de Deep AI criptográficamente seguro y respaldado por hardware – haciendo que el despliegue de IA sea predecible, auditable y seguro.
Informe técnico completo: Taxonomía de ataques de serialización, defensas de la Kill Chain de IA, especificación de ML-BOM, arquitectura de firma criptográfica, patrones de despliegue de computación confidencial, guía de implementación de NIST AI 100-2.