
Protege Tus Sistemas Asistidos por IA Contra Ataques. Este libro aborda los aspectos técnicos de la ciberseguridad aplicada a aplicaciones con inteligencia artificial: desde inyección de instrucciones hasta fuga de datos y envenenamiento de modelos.

El usuario aprende a modelar la frontera de confianza, distinguir inyección directa e indirecta y medir cómo herramientas, permisos y multimodalidad convierten texto hostil en impacto.
Construir un modelo de amenaza que separe instrucciones confiables de datos no confiables antes de analizar una aplicación con LLM.
Distinguir una inyección directa de un jailbreak y diseñar controles que reduzcan su impacto.
Detectar el patrón de inyección indirecta cuando un LLM consume documentos, páginas, correos o contenido recuperado.
Evaluar cómo permisos, herramientas y entradas multimodales convierten una prompt injection en impacto real.
El usuario identifica datos sensibles en contexto, RAG y modelos, separa secretos del system prompt y diseña controles contra runtime leakage, training data extraction y membership inference.
Identificar qué datos sensibles pueden entrar al contexto del modelo, al RAG o a las herramientas y limitar su exposición.
Evitar que secretos, permisos o controles críticos dependan de la confidencialidad del system prompt.
Distinguir memorización, extracción de datos de entrenamiento y membership inference para evaluar riesgo de privacidad.
Aplicar una estrategia de prevención de fugas basada en minimización de datos, redacción, aislamiento y controles de acceso.
El usuario amenaza los pipelines de datos, distingue poisoning indiscriminado, dirigido y backdoors, y protege knowledge bases mediante provenance, versionado y controles de ingestión.
Reconocer cómo datos manipulados durante entrenamiento o adaptación pueden degradar o redirigir el comportamiento de un modelo.
Diferenciar degradación indiscriminada, poisoning dirigido y backdoor poisoning para diseñar pruebas específicas.
Evaluar cómo documentos envenenados pueden manipular retrieval y generación sin reentrenar el LLM.
Implementar controles de procedencia, versionado y cuarentena que permitan detectar y revertir poisoning.
El usuario convierte el threat model en una arquitectura defensiva con input, retrieval, output y execution guardrails, validación determinística, least privilege y testing adversarial.
Diseñar una capa de validación de entrada que detecte prompt attacks, PII y formatos no permitidos antes de invocar el modelo.
Implementar controles entre la búsqueda y el LLM para validar qué conocimiento recuperado puede entrar al contexto.
Validar y sanear la salida del LLM antes de mostrarla, almacenarla o convertirla en comandos para otros sistemas.
Integrar input, retrieval, output y execution guardrails con mínimo privilegio, aprobación humana, logging y pruebas adversariales.