Evaluación de seguridad y endurecimiento
Vulneramos los sistemas de IA como lo hacen los atacantes reales para luego endurecerlos frente a las vías de ataque que descubrimos, desde la extracción de modelos hasta el compromiso de la cadena de suministro.
Nuestro enfoque consiste en vulnerar los sistemas de IA del mismo modo que lo hacen los atacantes reales, para luego endurecerlos frente a las vías de ataque que descubre una evaluación — desde la extracción de modelos hasta el compromiso de la cadena de suministro. Las pruebas de penetración tradicionales cubren sus API, infraestructura y flujos de autenticación, pero nunca comprueban si un atacante puede robar su modelo ajustado, introducir una puerta trasera en su cadena de dependencias o secuestrar su canalización de RAG. Esa metodología de evaluación debe diseñarse específicamente para los modos en que fallan los sistemas de IA.
Superficies de ataque que su equipo de seguridad nunca ha probado
Las pruebas de penetración tradicionales cubren sus API, su infraestructura y sus flujos de autenticación. No evalúan si un atacante puede extraer su modelo ajustado mediante 50,000 consultas cuidadosamente estructuradas. No detectan si un adaptador LoRA en su cadena de dependencias de HuggingFace introdujo una puerta trasera hace tres meses. No evalúan si su canalización de RAG ejecutará instrucciones incrustadas en un documento recuperado. Estas son las vías de ataque que realmente comprometen los sistemas de IA en producción.
Estos no son riesgos teóricos de ponencias en conferencias. Protect AI descubrió 352,000 archivos sospechosos en 51,700 modelos en HuggingFace en abril de 2025. Los ataques habilitados por IA aumentaron un 89% interanual, con un 97% de las organizaciones vulneradas careciendo de controles de acceso básicos en sus sistemas de IA. El ataque a la cadena de suministro de Mercor a principios de 2026 comprometió a miles de empresas a través de una única dependencia de código abierto.
Qué probamos realmente — y qué pasan por alto la mayoría de las evaluaciones
Estructuramos las evaluaciones en torno al marco MITRE ATLAS , que ahora cataloga 84 técnicas en 16 tácticas dirigidas específicamente a sistemas de IA. Pero un marco es un mapa, no una prueba. Nuestra metodología está diseñada para ejecutar los ataques que cataloga, no solo para marcarlos en una lista de verificación.
Despliegues de LLM e inyección de prompts
Probamos la inyección indirecta de prompts a través de cada vía de ingesta: recuperación de RAG, salidas de herramientas, documentos cargados por usuarios y contenido de correo electrónico suministrado a los agentes. La inyección directa acapara los titulares, pero Anthropic descartó por completo su métrica de inyección directa en febrero de 2026 porque la inyección indirecta a través del contexto de recuperación es lo que realmente vulnera los sistemas en producción. También probamos la manipulación en múltiples turnos, la extracción de prompts del sistema y los modos de fallo específicos de cualquier pila de guardrails que tenga implementada.
Seguridad a nivel de modelo
Evaluamos el riesgo de extracción ejecutando campañas de consultas estructuradas contra su API y midiendo qué parte del comportamiento del modelo puede replicar un atacante. Evaluamos la robustez adversarial tanto con métodos basados en gradientes (cuando tenemos acceso al modelo) como con ataques de caja negra basados en transferencia (cómo operan los atacantes reales). Auditamos su canalización de entrenamiento en busca de vulnerabilidades de envenenamiento de datos, comprobando tanto sus datos de entrenamiento directos como las dependencias ascendentes que los alimentan (detallado en nuestra investigación sobre la protección de empresas frente al envenenamiento de modelos).
Integridad de la cadena de suministro
Rastreamos cada artefacto de modelo hasta su origen: pesos preentrenados, conjuntos de datos de ajuste fino, capas de adaptadores y versiones del marco de servicio. Comprobamos vulnerabilidades conocidas en su infraestructura de ML — PyTorch, vLLM y Triton Inference Server tuvieron CVE en 2025–2026 — y verificamos que la serialización de sus modelos utilice formatos seguros. Los $12 mil millones en pérdidas por modelos de ML comprometidos en 2025 procedieron abrumadoramente de ataques a la cadena de suministro, no de la explotación directa de modelos (consulte nuestra investigación sobre la seguridad del ciclo de vida de la cadena de suministro de ML).
Sistemas agénticos
Probamos la superficie de ataque que el Top 10 de IA agéntica de OWASP define: secuestro de objetivos, uso indebido de herramientas, abuso de identidad, envenenamiento de memoria y fallos en cascada en flujos de trabajo multiagente. La crisis de OpenClaw en 2026 — en la que 21,000+ instancias de un agente de IA con 135,000 estrellas quedaron expuestas a vulnerabilidades críticas — demostró lo que sucede cuando los agentes se entregan sin estas pruebas (detallado en nuestra investigación sobre la protección de la frontera humano-IA).
Endurecimiento que transforma cómo opera su sistema
Una evaluación sin remediación es un PDF costoso. Nuestro enfoque integra los controles de endurecimiento directamente en su sistema.
- Defensa en la capa de inferencia: detección de anomalías en consultas que identifica el tráfico con patrones de extracción — cobertura sistemática de entradas, sondeo de límites y barridos programáticos de paráfrasis — y lo distingue del uso legítimo. Las canalizaciones de validación de entradas se ajustan a su modelo de amenazas específico, no a filtros regex genéricos que pasan por alto ataques semánticos y bloquean consultas legítimas.
- Endurecimiento de la cadena de suministro: canalizaciones de verificación de modelos que comprueban la procedencia de artefactos, validan formatos de serialización, escanean en busca de patrones maliciosos conocidos y aplican requisitos de firma antes de que cualquier artefacto de modelo entre en su canalización de despliegue — además de una monitorización de dependencias que detecta paquetes ascendentes comprometidos antes de que lleguen a producción.
- Endurecimiento de sistemas agénticos: límites de privilegios en torno al acceso a herramientas, validación de salidas entre los pasos del agente y monitorización del comportamiento que detecta cuándo el patrón de ejecución de un agente difiere de su flujo de trabajo previsto.
Su SIEM fue diseñado para detectar anomalías en el comportamiento humano. Un agente que ejecuta 10,000 consultas en secuencia parece normal para esos sistemas, incluso cuando opera bajo el control de un atacante.
Cuándo no necesita esto
Si utiliza una API gestionada (OpenAI, Anthropic, Google) sin ajuste fino, sin RAG, sin uso de herramientas y sin datos sensibles en los prompts, su riesgo de seguridad se limita a la gestión de claves de API y el tratamiento de datos. Una revisión estándar de seguridad de aplicaciones cubre eso — no necesita una evaluación específica de IA.
Si su modelo es un clasificador simple que se ejecuta internamente sin una API orientada al exterior y sin una canalización de reentrenamiento, su superficie de ataque es limitada y una breve revisión del modelo de amenazas es proporcionada. Realizar pruebas completas de robustez adversarial en un clasificador de sentimientos interno detrás de un cortafuegos equivale a gastar $30,000 para proteger un riesgo de $500.
Decimos esto con total claridad porque la credibilidad importa más que los ingresos. Las organizaciones que necesitan este trabajo saben quiénes son: cualquiera que disponga de modelos ajustados, canalizaciones de RAG que procesen contenido externo, sistemas agénticos con acceso a herramientas, modelos en sectores regulados o sistemas de IA que tomen decisiones con consecuencias financieras o de seguridad.
La presión regulatoria es real y tiene plazos
La aplicación de la Ley de IA de la UE comienza en agosto de 2026. Los sistemas de IA de alto riesgo requieren una gestión de riesgos documentada, pruebas de robustez técnica y controles de gobernanza de datos. El incumplimiento conlleva multas de hasta el 7% de la facturación anual global o EUR 35 millones. El NIST publicó su Perfil del Marco de Ciberseguridad para IA en diciembre de 2025, asignando los riesgos específicos de la IA a los controles del CSF 2.0. Estos marcos ahora están apareciendo en los requisitos de adquisiciones y en las revisiones de riesgos a nivel de junta directiva.
El desafío es que ningún marco por sí solo cubre todo. Mapeamos los hallazgos de su evaluación a cualquier marco que sus reguladores, auditores y clientes requieran — generando evidencia que satisface los requisitos de cumplimiento porque proviene de pruebas reales, no de ejercicios de marcar casillas.
| Marco | Qué proporciona |
|---|---|
| MITRE ATLAS | Mapea técnicas de ataque |
| OWASP LLM Top 10 | Categoriza clases de vulnerabilidades |
| NIST AI RMF | Proporciona estructura de gobernanza |
| ISO 42001 | Gestiona sistemas de gestión |
| Ley de IA de la UE | Impone obligaciones legales |
Herramientas de plataforma frente a evaluación personalizada
Las plataformas automatizadas de seguridad de IA (HiddenLayer, Mindgard, Giskard) ejecutan patrones de ataque conocidos a escala. Son útiles para pruebas continuas de regresión después de una evaluación inicial, pero no sustituyen a la evaluación inicial en sí misma. Un escáner no comprende su lógica de negocio, no sabe qué salidas del modelo conllevan consecuencias críticas para la seguridad y no puede evaluar si su modelo de amenazas coincide con su arquitectura de despliegue real.
Utilizamos estas herramientas donde aportan valor. El red teaming automatizado continuo pertenece a su canalización de CI/CD una vez que hemos establecido qué probar. Pero las vías de ataque más importantes en su sistema específico requieren a alguien que comprenda tanto los modos de fallo de la IA como su contexto operativo para encontrarlas.
Para las organizaciones que operan con múltiples proveedores de IA (OpenAI, Anthropic, Google, modelos de código abierto), evaluamos los límites de seguridad de cada proveedor de forma independiente y probamos los puntos de integración por donde fluyen los datos entre ellos. La superficie de ataque de una pila de múltiples proveedores no es la suma del riesgo de cada proveedor: es la capa de interacción, donde las suposiciones sobre las garantías de seguridad de un proveedor se desmoronan en el traspaso hacia otro.
Puntos clave
- Los sistemas de IA fallan de maneras que las pruebas de penetración estándar nunca contemplan: extracción de modelos, adaptadores LoRA envenenados, inyección indirecta de prompts y secuestro de objetivos agénticos.
- Evaluamos a través de cuatro superficies — despliegues de LLM, seguridad a nivel de modelo, cadena de suministro y sistemas agénticos — estructuradas según MITRE ATLAS (84 técnicas, 16 tácticas), pero impulsadas por ataques reales, no por listas de verificación.
- La evaluación incluye la remediación: endurecimiento en la capa de inferencia, la cadena de suministro y los sistemas agénticos integrado en su sistema, no entregado como un PDF.
- Mapeamos los hallazgos con MITRE ATLAS, OWASP LLM Top 10, NIST AI RMF, ISO 42001 y la Ley de IA de la UE, cuya aplicación comienza en agosto de 2026 con multas de hasta el 7% de la facturación o EUR 35 millones.
- No todos los despliegues necesitan esto. Las API gestionadas y los clasificadores internos sencillos no lo requieren; los modelos ajustados, el RAG con contenido externo, los agentes que utilizan herramientas y la IA regulada o crítica para la seguridad sí lo necesitan.
Evaluación de seguridad y endurecimiento
VerSeguridad de la Cadena de Suministro de IA & Integridad de Modelos | Veriprajna
Consultoría en seguridad de la cadena de suministro de IA. Construimos pipelines de evaluación de modelos, arquitectura de ML-BOM y gobernanza de IA en la sombra para CISOs en empresas reguladas. Conforme con NIST AI 100-2 y la Ley de IA de la UE.
VerDetección de deepfakes empresariales y prevención de fraude en videollamadas | Veriprajna
En febrero de 2024, los atacantes utilizaron deepfakes generados por IA de todo un equipo directivo para robar 25,6 millones de dólares a Arup en una sola videollamada. Desde enero de 2026, las pólizas estándar de ciberseguro excluyen explícitamente el fraude con deepfakes.
VerDetección de Contenido Sintético y Reseñas Falsas | Veriprajna
Sistemas de IA personalizados que detectan reseñas falsas, contenido sintético y fraude coordinado en todas las plataformas donde aparece su marca. Diseñados para la nueva realidad de aplicación normativa de la FTC.
Preguntas Frecuentes
¿Cuánto cuesta una evaluación de seguridad específica de IA?
Las evaluaciones de seguridad de IA suelen oscilar entre $15,000 para una revisión acotada de aplicaciones LLM y más de $80,000 para un proyecto completo de red teaming que cubra ataques a nivel de modelo, auditoría de la cadena de suministro y pruebas de sistemas agénticos. Las tarifas de consultoría del mercado intermedio se sitúan entre $1,500 y $3,500 por día de consultor, mientras que las firmas boutique de primer nivel cobran entre $4,000 y $7,000 por día. El alcance adecuado depende de su arquitectura de despliegue: una llamada a una API gestionada sin ajuste fino requiere muchas menos pruebas que un modelo ajustado que alimenta flujos de trabajo agénticos con acceso a herramientas.
¿Qué prueba una evaluación de seguridad de IA que una prueba de penetración convencional no evalúa?
Las pruebas de penetración tradicionales cubren puntos de conexión de API, autenticación, infraestructura y lógica de aplicaciones. Las evaluaciones de seguridad de IA añaden vectores de ataque específicos de modelos: diseño de entradas adversariales, extracción de modelos mediante campañas de consultas estructuradas, detección de envenenamiento de datos de entrenamiento, inyección de prompts (tanto directa como indirecta a través de la recuperación de RAG), integridad de la cadena de suministro para artefactos de modelos y, en sistemas agénticos, secuestro de objetivos, uso indebido de herramientas y escalada de privilegios a través de flujos de trabajo de múltiples pasos. Estas vías de ataque requieren una metodología específica de ML que los marcos convencionales de pentesting no contemplan.
¿Puede alguien realmente robar nuestro modelo ajustado a través de la API?
Sí. Los ataques de extracción de modelos replican el comportamiento del modelo mediante consultas sistemáticas. Para clasificadores con ajuste fino, unos pocos miles de consultas pueden generar una copia funcionalmente equivalente. Para modelos de lenguaje grandes, la extracción total es más compleja, pero la extracción parcial del comportamiento del ajuste fino es totalmente viable. El tráfico de consultas de tipo scraping alcanzó una mediana del 20% del tráfico global de API en 2025-2026. Las defensas incluyen análisis de patrones de consultas que va más allá de la simple limitación de velocidad, huellas conductuales de patrones de extracción y marcas de agua, aunque los métodos actuales de marcado de agua pueden eliminarse mediante paráfrasis de la salida.
¿Necesitamos pruebas de seguridad de IA para cumplir con la Ley de IA de la UE?
Si su sistema de IA se califica como de alto riesgo según la Ley de IA de la UE, sí. El Artículo 15 exige medidas de ciberseguridad y robustez técnica, cuya aplicación comienza en agosto de 2026 con multas de hasta el 7% de la facturación anual global o EUR 35 millones. El NIST publicó su Perfil del Marco de Ciberseguridad para IA en diciembre de 2025, que asigna riesgos específicos de IA a los controles CSF 2.0 y se referencia cada vez más en los requisitos de adquisición. Las pruebas de seguridad reales generan evidencia de cumplimiento que las auditorías de listas de verificación no pueden proporcionar, porque los reguladores y los tribunales evalúan si los controles se probaron realmente, no solo si se documentaron.
¿Cómo protegemos nuestra canalización de RAG frente a la inyección indirecta de prompts?
La inyección indirecta de prompts a través del contenido recuperado es el vector de ataque a LLM dominante en entornos de producción. Anthropic descartó por completo su métrica de inyección directa en febrero de 2026 debido a que la inyección indirecta constituye la amenaza de mayor relevancia operativa. La defensa requiere controles por capas: separar el contenido recuperado de las instrucciones del sistema en la ventana de contexto, utilizar un modelo secundario para evaluar el contenido recuperado antes de que llegue al modelo principal, validación de salidas que detecte comportamientos de seguimiento de instrucciones desencadenados por la recuperación y monitorización continua en busca de patrones de respuesta anómalos. Ninguna defensa aislada es suficiente. Las tasas de éxito de la inyección de prompts oscilan entre el 50% y el 84% según la configuración del sistema, razón por la cual la defensa en profundidad es el único enfoque viable.
¿Qué marco de seguridad de IA debemos seguir: MITRE ATLAS, OWASP o NIST AI RMF?
Cumplen diferentes propósitos y la mayoría de las organizaciones necesitan elementos de los tres. MITRE ATLAS (84 técnicas, 16 tácticas a febrero de 2026) mapea métodos de ataque específicos y es el marco adecuado para estructurar evaluaciones técnicas. El Top 10 de LLM de OWASP categoriza clases de vulnerabilidades y orienta sobre qué probar. NIST AI RMF proporciona una estructura de gobernanza a través de sus pilares Govern, Map, Measure y Manage, y se utiliza cada vez más como criterio de contratación. ISO 42001 gestiona la certificación de sistemas de gestión. La Ley de IA de la UE impone obligaciones legales con plazos definidos. Mapeamos los hallazgos de la evaluación a cualquier marco que exijan sus reguladores, auditores y clientes.
¿Qué debe cubrir nuestra evaluación de seguridad de IA para IA agéntica con uso de herramientas?
La IA agéntica introduce una superficie de ataque que las pruebas estáticas de LLM omiten por completo. OWASP publicó su Top 10 para Aplicaciones Agénticas en diciembre de 2025, que abarca secuestro de objetivos, uso indebido de herramientas, abuso de identidad, envenenamiento de memoria y fallos en cascada. La evaluación debe comprobar si un atacante puede redirigir los objetivos del agente mediante entradas manipuladas, elevar permisos de herramientas más allá del alcance previsto, envenenar la memoria persistente para influir en acciones futuras y encadenar fallos a través de flujos de trabajo multiagente. Sus herramientas de SIEM y EDR existentes fueron diseñadas para detectar anomalías en el comportamiento humano. Un agente que ejecuta 10,000 consultas en secuencia parece normal para estos sistemas incluso bajo el control de un atacante.
¿Cómo verificamos que los modelos de HuggingFace no tengan puertas traseras?
Protect AI identificó 352,000 archivos sospechosos en 51,700 modelos en HuggingFace en abril de 2025. La verificación requiere comprobar el formato de serialización (Safetensors frente a pickle, que permite la ejecución de código arbitrario), escanear en busca de patrones maliciosos conocidos en los pesos del modelo y archivos de configuración, verificar la procedencia mediante firmas y validación de hashes, y probar el comportamiento del modelo frente a patrones desencadenantes asociados con la activación de puertas traseras. Los adaptadores LoRA maliciosos son un vector en aumento porque son pequeños y fáciles de distribuir. La verificación de la cadena de suministro debe automatizarse en su canalización de despliegue de modelos, no realizarse manualmente en el momento de la descarga.
¿Cuál es la diferencia entre adquirir una plataforma de seguridad de IA y contratar consultores?
Las plataformas de seguridad de IA como HiddenLayer, Mindgard y Giskard automatizan patrones de ataque conocidos a escala. Son valiosas para pruebas de regresión continuas en su canalización de CI/CD. No sustituyen la evaluación inicial porque no pueden comprender su contexto empresarial, evaluar qué salidas de modelos conllevan consecuencias críticas para la seguridad ni descubrir nuevas vías de ataque específicas de su arquitectura. El enfoque adecuado utiliza ambos: consultores para identificar su superficie de amenaza real, establecer qué es lo importante y construir controles de endurecimiento, y luego herramientas de plataforma para pruebas automatizadas continuas contra la línea base establecida por la evaluación.
Construya su IA con confianza.
Colabore con un equipo que cuenta con amplia experiencia en la creación de la próxima generación de IA empresarial. Permítanos ayudarle a diseñar, construir e implementar una estrategia de IA en la que pueda confiar.
Veriprajna consultora de Deep Tech está especializada en la creación de sistemas de IA críticos para la seguridad en los sectores de salud, finanzas y ámbitos regulatorios. Nuestras arquitecturas se validan conforme a protocolos establecidos, con documentación de cumplimiento integral.