
Aprende cómo un LLM convierte texto en tokens, vectores, atención y predicciones, y por qué puede generar respuestas útiles, costosas o equivocadas. El curso combina intuición técnica y aplicación práctica para diseñar, evaluar y usar modelos de lenguaje con criterio.

El usuario aprende cómo una frase se transforma en piezas numéricas y representaciones útiles antes de entrar al Transformer.
Convertir una frase humana en una secuencia de tokens y explicar por qué eso cambia costo, contexto y errores.
Explicar cómo un token se convierte en vector y cómo la cercanía vectorial captura patrones de uso.
Distinguir entre cercanía semántica simple y representación contextual profunda dentro de un LLM.
Explicar por qué el Transformer necesita información posicional para distinguir secuencias con las mismas piezas.
El usuario desarma el bloque Transformer: Q, K, V, múltiples cabezas, capas, encoder-decoder y generación causal.
Calcular intuitivamente Query, Key y Value para explicar cómo un token decide qué información tomar del contexto.
Explicar por qué dividir la atención en cabezas permite capturar relaciones distintas en la misma frase.
Identificar el papel de feed-forward, conexiones residuales y normalización dentro de una capa Transformer.
Diferenciar self-attention de encoder-decoder attention y explicar cuándo conviene una arquitectura encoder-decoder.
Explicar cómo la máscara causal permite entrenar y usar modelos autoregresivos tipo GPT.
El usuario distingue preentrenamiento, escalamiento, fine-tuning, instruction tuning y RLHF como etapas con objetivos diferentes.
Describir el preentrenamiento como optimización sobre grandes corpus y distinguir objetivos autoregresivos y enmascarados.
Explicar las leyes de escalamiento (Scaling Laws) y cómo equilibrar parámetros con volumen de datos de entrenamiento.
Distinguir fine-tuning supervisado, instruction tuning y adaptación de dominio.
Explicar el pipeline de RLHF y sus límites como mecanismo de alineación con humanos.
El usuario aplica el conocimiento técnico para manejar prompts, alucinaciones, RAG, ventana de contexto y latencia.
Diagnosticar cuellos de botella por tamaño de ventana de contexto, pérdida de atención intermedia (lost-in-the-middle) y latencia.
Decidir la arquitectura adecuada según variabilidad de datos, requerimientos de formato y costo operativo.
Ensamblar el mapa técnico operativo completo de un LLM conectando tokenización, embeddings, atención, decodificación y evaluación.