Sistemas de IA
Seguridad de agentes de IA: herramientas, permisos y cadena de suministro de modelos
La seguridad de agentes de IA consiste en limitar lo que puede hacer un agente y saber de qué está hecho: da a cada agente solo las herramientas y los permisos que necesita su tarea, exige que una persona apruebe las acciones destructivas, trata cada documento y cada resultado de una herramienta como una entrada no fiable, y mantén un inventario de los modelos, conjuntos de datos y software de los que depende.
Plan gratuito, sin tarjeta.
¿Qué es una lista de materiales de IA (AI bill of materials)?
Una lista de materiales de software (SBOM) enumera los paquetes de una aplicación. Una lista de materiales de IA (AI bill of materials) amplía ese registro a las partes específicas de la IA: los modelos, sus versiones y orígenes, los conjuntos de datos usados para entrenarlos o ajustarlos, y el software que los sirve. Dos formatos del sector lo admiten. CycloneDX añadió una lista de materiales de aprendizaje automático (ML-BOM) en la versión 1.5, publicada en junio de 2023, y SPDX 3.0 incluye un perfil de IA y un perfil de conjuntos de datos (Dataset).
Sea cual sea el formato, los campos útiles son los mismos: de dónde viene cada modelo, qué revisión exacta ejecutas, un hash que demuestre que no ha cambiado, su licencia y sus condiciones de uso, los conjuntos de datos que hay detrás, cuando se conocen, y las bibliotecas y el entorno de ejecución que necesita. Ese registro es lo que te permite responder, el día en que se descubre que un modelo o una biblioteca está comprometido, si tu producto está afectado. Hoy KROMSE no genera una lista de materiales de IA; está en la hoja de ruta que verás más abajo.
Cómo acotar las herramientas y los permisos de un agente
Un agente es un modelo que puede llamar a herramientas: leer archivos, consultar bases de datos, enviar mensajes, ejecutar comandos. El OWASP Top 10 for LLM Applications llama al riesgo resultante «agencia excesiva» (excessive agency) y lo atribuye a tres causas: funcionalidad excesiva, permisos excesivos y autonomía excesiva. Cada una tiene un antídoto directo: menos herramientas, credenciales más acotadas y una persona en el circuito para las acciones importantes.
- Da a cada agente solo las herramientas que necesita su tarea y deja fuera las de uso general, como el acceso sin restricciones a una shell.
- Usa credenciales separadas y de alcance reducido para cada agente, de solo lectura siempre que sea posible.
- Ejecuta las acciones en el contexto, y con los permisos, del usuario en cuyo nombre actúa el agente.
- Exige que una persona apruebe las acciones destructivas o irreversibles: borrar datos, enviar mensajes, hacer pagos, desplegar.
- Registra cada llamada a una herramienta con sus entradas, para poder rastrear y revisar las acciones.
- Limita cuántas acciones puede realizar un agente y a qué ritmo.
Inyección de prompts a través de herramientas y documentos
La inyección de prompts es una entrada que cambia lo que hace un modelo de formas que sus creadores no pretendían. OWASP distingue la inyección directa, que escribe el usuario, de la indirecta, en la que el modelo recibe instrucciones de contenido externo, como un sitio web o un archivo. Para un agente con herramientas, la inyección indirecta es el riesgo mayor: el atacante no necesita acceder al agente, solo que el agente lea algo que ha escrito, como una página web, un correo electrónico o una incidencia.
OWASP señala que no está claro que existan métodos de prevención infalibles, así que la defensa es la contención. Mantén el contenido no fiable claramente separado de las instrucciones, deja los secretos fuera del contexto del modelo, valida lo que produce el modelo antes de que otro sistema actúe en consecuencia y asegúrate de que una instrucción inyectada no pueda desencadenar una acción que una persona no haya aprobado. Si un agente lee contenido público, da por hecho que parte de él es hostil.
Archivos de modelo inseguros y la cadena de suministro de modelos
Los pesos de un modelo son archivos, y algunos formatos de archivo pueden ejecutar código al cargarse. El formato pickle de Python, que la documentación de Hugging Face describe como el formato por defecto de los pesos de modelos de PyTorch, permite ejecutar código arbitrario durante la carga, así que abrir un modelo serializado con pickle de una fuente no fiable equivale a ejecutar un programa no fiable. Safetensors es un formato para almacenar tensores diseñado como alternativa segura a pickle.
Trata los modelos y los conjuntos de datos como dependencias. Descárgalos de fuentes de confianza, fija la revisión exacta en lugar de un nombre que puede cambiar, verifica los hashes y da preferencia a formatos que no puedan ejecutar código. Unos datos de entrenamiento o un modelo preentrenado manipulados pueden cambiar el comportamiento de formas que las pruebas no revelan; el Reglamento de Inteligencia Artificial de la UE (AI Act) cita el envenenamiento de datos y el envenenamiento de modelos entre los ataques que deben abordar, cuando proceda, las medidas de los sistemas de IA de alto riesgo. Las bibliotecas que cargan y sirven modelos necesitan las mismas comprobaciones de vulnerabilidades que cualquier otro paquete.
¿Qué normas de la UE afectan a los productos de IA?
Dos reglamentos pueden aplicarse al mismo producto de IA. El Reglamento de Inteligencia Artificial, Reglamento (UE) 2024/1689, regula los sistemas de IA según su nivel de riesgo; su artículo 15 exige que los sistemas de IA de alto riesgo alcancen un nivel adecuado de precisión, solidez y ciberseguridad. El Reglamento de Ciberresiliencia (Cyber Resilience Act, CRA), Reglamento (UE) 2024/2847, fija requisitos de ciberseguridad para los productos con elementos digitales. Según el artículo 12 del CRA, un producto incluido en su ámbito de aplicación que sea un sistema de IA de alto riesgo se considera conforme con los requisitos de ciberseguridad del Reglamento de IA cuando cumple los requisitos esenciales del CRA y así se demuestra en la declaración UE de conformidad.
Que se aplique uno u otro reglamento depende de qué es el producto, quién lo introduce en el mercado y cómo se usa, y KROMSE no lo decide. La base es la misma en ambos: conocer tus componentes, gestionar las vulnerabilidades, restringir lo que pueden hacer las partes automatizadas del sistema y conservar la evidencia.
Disponible hoy en KROMSE
Hoy KROMSE comprueba el software que rodea a tu modelo, no el modelo en sí.
- Enumera los componentes de la aplicación que llama al modelo o lo sirve, y contrasta sus lockfiles con OSV.dev, incluidas las bibliotecas de aprendizaje automático y de agentes que declara.
- Marca como críticas las dependencias que figuran en la base de datos OpenSSF Malicious Packages.
- Detecta con Gitleaks credenciales subidas al repositorio, como claves de API, en el código del commit analizado; los valores se enmascaran y nunca se almacenan.
- Análisis de código fuente para 11 lenguajes, entre ellos Python, TypeScript, JavaScript y Go.
- Analiza imágenes de contenedor de un registro accesible desde internet en busca de vulnerabilidades, configuraciones incorrectas y secretos, y comprueba configuraciones incorrectas en Terraform y Dockerfiles.
- Exporta un SBOM CycloneDX JSON y otro SPDX JSON en cada análisis. Enumeran paquetes de software, no modelos ni conjuntos de datos.
Próximamente
En la hoja de ruta, todavía no disponible. Las fechas son objetivos, no promesas; esta página cambia el mismo día en que una funcionalidad está operativa.
- Próximamente · T1 2027Seguridad de agentes y modelos de IA. KROMSE generará una lista de materiales de IA (AI bill of materials), revisará las herramientas y los permisos que pueden usar tus agentes y detectará archivos de modelo inseguros.
- Próximamente · T4 2026 (noviembre)Plugin para agentes de programación. Un plugin para agentes de programación con IA comprobará cada paquete que proponga el agente antes de que entre en el código, incluidos los paquetes que no existen o que se publicaron hace solo unos días.
- Próximamente · T1 2027 (enero)Módulo del Reglamento de IA de la UE. Un módulo del Reglamento de IA de la UE añadirá un inventario de sistemas de IA, la clasificación de riesgos y documentación para que la complete una persona.
Preguntas frecuentes
¿Qué es la seguridad de agentes de IA?
Es la práctica de limitar lo que puede hacer un agente de IA y saber de qué está construido. En la práctica, eso significa herramientas y credenciales con el mínimo privilegio, aprobación humana para las acciones destructivas, tratar los documentos y los resultados de las herramientas como entradas no fiables, formatos seguros de archivos de modelo y un inventario de los modelos, conjuntos de datos y software de los que depende el agente.
¿Qué diferencia hay entre un SBOM y una lista de materiales de IA?
Un SBOM enumera los componentes de software de un producto, como los paquetes y sus versiones. Una lista de materiales de IA añade las partes específicas de la IA: los modelos, sus orígenes y revisiones, los conjuntos de datos y cómo se usaron. CycloneDX lo admite mediante su ML-BOM, añadido en la versión 1.5, y SPDX mediante los perfiles de IA y de conjuntos de datos de SPDX 3.0.
¿Son peligrosos los archivos de modelo pickle?
Pueden serlo. Cargar un archivo pickle puede ejecutar código arbitrario, así que un modelo en formato pickle de una fuente no fiable debe tratarse como un programa no fiable. Da preferencia a formatos diseñados para no ejecutar código, como safetensors, carga modelos solo de fuentes de confianza, fija la revisión exacta y verifica su hash.
¿Cómo protejo un agente de IA frente a la inyección de prompts?
Da por hecho que ocurrirá y contenla. Separa el contenido no fiable de las instrucciones, deja los secretos fuera del contexto del modelo, da al agente solo las herramientas y los permisos que necesita, valida sus resultados antes de que otros sistemas actúen en consecuencia y exige que una persona apruebe las acciones de alto impacto. OWASP señala que puede que no exista una prevención infalible.
¿KROMSE analiza modelos o agentes de IA?
No. KROMSE comprueba el software que rodea al modelo: dependencias, paquetes maliciosos, secretos subidos al repositorio, código fuente, imágenes de contenedor y archivos de infraestructura. Hoy no inspecciona archivos de modelo, no genera una lista de materiales de IA ni revisa los permisos de los agentes. Esas funciones están en la hoja de ruta.
Guías relacionadas
Fuentes
- CycloneDX: Machine Learning Bill of Materials (ML-BOM)
- CycloneDX: anuncio de la versión 1.5
- Especificación SPDX 3.0.1: perfil de IA
- OWASP Top 10 for LLM Applications 2025: LLM01 Prompt Injection
- OWASP Top 10 for LLM Applications 2025: LLM06 Excessive Agency
- Documentación de Hugging Face Hub: análisis de archivos pickle
- Hugging Face: documentación de Safetensors
- Reglamento (UE) 2024/1689 (Reglamento de Inteligencia Artificial)
- Reglamento (UE) 2024/2847 (Reglamento de Ciberresiliencia)