
Creación Visual, Audio y Modelos Multimodales. Este libro aborda los modelos de difusión y las arquitecturas multimodales que procesan texto, imágenes, audio y video simultáneamente. Explica la ciencia detrás de la síntesis visual y sonora.

Construyes una comprensión operativa del proceso directo, el denoising aprendido y las decisiones de muestreo.
Explicar y calcular conceptualmente el proceso directo de difusión que mezcla una muestra con ruido gaussiano según un calendario de ruido.
Describir cómo el modelo aprende el proceso inverso estimando ruido, señal o una parametrización equivalente en cada paso.
Comparar muestreo DDPM y DDIM y decidir cuándo reducir pasos de inferencia sin confundir entrenamiento con sampler.
Ubicas encoder, latente, denoiser y condicionamiento textual, y distingues U-Net de Diffusion Transformers.
Explicar cómo un autoencoder comprime una imagen y por qué la difusión latente reduce el costo respecto de operar directamente en píxeles.
Comparar U-Net y Diffusion Transformer como arquitecturas que implementan la función de denoising.
Explicar cómo embeddings de texto condicionan el denoising mediante cross-attention sin asumir que texto e imagen son el mismo tensor latente.
Aprendes a distinguir embeddings compartidos de fusión multimodal y a conectar texto, imagen, audio y video.
Explicar cómo el aprendizaje contrastivo coloca texto e imagen semánticamente relacionados cerca en un espacio de embeddings.
Explicar cómo AudioCLIP e ImageBind alinean múltiples modalidades y qué significa realmente compartir un espacio de embeddings.
Distinguir entre alineación de embeddings y fusión de tokens o features para razonamiento audiovisual.
Dominas guidance, condiciones espaciales, imágenes de referencia y máscaras para controlar qué cambia y qué se preserva.
Aplicar classifier-free guidance para comprender el compromiso entre fuerza del condicionamiento, diversidad y posibles artefactos.
Usar conceptualmente condiciones espaciales como bordes, profundidad, segmentación o pose para controlar la composición de un modelo de difusión.
Comparar inpainting, edición guiada por imagen y control de atención para modificar regiones o atributos conservando contexto.
Integras los mecanismos técnicos en pipelines de diseño, síntesis de audio, análisis/generación de video y orquestación multimodal.
Construir un flujo de diseño visual que combine prompt, referencia espacial, generación, evaluación y edición localizada.
Explicar cómo difusión puede sintetizar formas de onda o audio latente y cómo texto u otras representaciones condicionan voz, música y efectos.
Separar comprensión audiovisual de generación de video y explicar cómo se modelan temporalidad, audio y condicionamiento.
Integrar generación visual, audio, análisis multimodal y controles en un pipeline con entradas, decisiones, métricas y puntos de revisión.