Syllabus
Identificación del curso
Nombre: Fundamentos de Transformers Subtítulo de trabajo: Atención, geometría y modelos autoregresivos desde cero Unidad académica: Curso abierto Modalidad: Curso formativo con notebooks técnicos, visualizaciones y proyecto final Nivel sugerido: Estudiantes universitarios con bases iniciales en programación, álgebra lineal, probabilidad y aprendizaje automático Producto final: Mini modelo autoregresivo tipo decoder, explicado y analizado críticamente
Descripción
Este curso estudia los componentes internos de un Transformer decoder desde una ruta gradual: representación discreta del texto, embeddings, posición, formas tensoriales, atención, Q/K/V, self-attention, máscara causal, multi-head attention, residuales, LayerNorm, MLP, bloque decoder, mini-GPT, entrenamiento autoregresivo y generación.
El curso no busca entrenar un modelo competitivo ni sustituir cursos sobre ChatGPT, prompting, RAG, agentes, LoRA, QLoRA o ajuste de modelos grandes. Su valor es formativo: permitir que el estudiante entienda cómo se construyen las operaciones fundamentales antes de usar abstracciones de alto nivel.
Propósito académico
Formar estudiantes capaces de explicar e implementar los componentes centrales de un Transformer decoder, conectando cada concepto con una ecuación, una forma tensorial, una operación en PyTorch, una visualización y una interpretación crítica.
Resultados de aprendizaje
Al completar la ruta, el estudiante estará en capacidad de:
- formular el lenguaje como secuencia discreta y problema de predicción autoregresiva;
- construir tokenización simple, vocabulario, codificación y batches
x/y; - interpretar embeddings como una tabla entrenable y no como coordenadas inherentes de los índices;
- explicar por qué se requiere información posicional;
- manipular formas tensoriales usadas en atención y proyecciones lineales;
- derivar atención como mezcla ponderada mediante Q, K y V;
- implementar self-attention por producto punto escalado;
- aplicar máscara causal y explicar su relación con predicción del siguiente token;
- distinguir multi-head attention como división de canales, no de tokens;
- explicar residuales, LayerNorm y MLP por posición;
- integrar un bloque Transformer decoder reutilizable;
- construir un mini-GPT desde cero;
- entrenar con cross-entropy y analizar validación, sobreajuste y escala;
- comparar estrategias de generación y sus límites;
- presentar un proyecto final reproducible con análisis técnico.
Prerrequisitos
Se espera que el estudiante tenga:
- programación básica en Python;
- manejo inicial de notebooks Jupyter;
- álgebra lineal elemental: vectores, matrices, producto punto y formas;
- probabilidad básica: distribuciones categóricas, logaritmos y softmax;
- nociones iniciales de aprendizaje automático: parámetros, pérdida, gradiente y entrenamiento.
No se asume dominio avanzado de PyTorch ni de Transformers. El curso introduce esos elementos de forma progresiva, pero exige lectura técnica y ejecución cuidadosa.
Principio pedagógico
Cada notebook técnico debe sostener esta cadena:
concepto -> ecuación -> tensor -> código ->
visualización -> interpretación crítica
El notebook 00_presentacion_del_curso.ipynb cumple una función distinta: presentar el curso mediante el audio de bienvenida, ubicar la motivación y mostrar la ruta antes de entrar en materia técnica.
Estructura temática
Módulo 0. Presentación del curso
Notebook:
00_presentacion_del_curso.ipynb
Propósito: introducir la motivación del curso, su alcance, la función de los Transformers en la inteligencia artificial moderna y el mapa general de la ruta.
Módulo 1. Secuencias y representación discreta
Notebooks: 01 a 05
01_el_problema_de_modelar_secuencias.ipynb02_tokens_vocabulario_y_batches.ipynb03_embeddings_y_geometria_de_tokens.ipynb04_posicion_y_orden_en_secuencias.ipynb05_tensores_del_transformer.ipynb
Temas: secuencias discretas, objetivo autoregresivo, tokens, vocabulario, batches, embeddings, posición y formas tensoriales.
Módulo 2. Atención y Q/K/V
Notebooks: 06 a 10
06_atencion_como_mezcla_ponderada.ipynb07_queries_keys_y_values.ipynb08_self_attention_matricial.ipynb09_atencion_causal.ipynb10_multi_head_attention.ipynb
Temas: mezcla ponderada, consultas, llaves, valores, producto punto escalado, máscara causal y atención con múltiples cabezas.
Módulo 3. Decoder y mini-GPT
Notebooks: 11 a 13
11_residuales_layernorm_y_mlp.ipynb12_bloque_transformer_decoder.ipynb13_mini_gpt_desde_cero.ipynb
Temas: conexiones residuales, normalización, MLP por posición, bloque decoder y arquitectura autoregresiva mínima.
Módulo 4. Entrenamiento, generación y límites
Notebooks: 14 a 16
14_entrenamiento_autoregresivo.ipynb15_generacion_interpretacion_y_limites.ipynb16_proyecto_final.ipynb
Temas: cross-entropy, validación, sobreajuste, generación, temperatura, top-k, top-p, mapas de atención, repetición, memorización, límites y entrega integradora.
Evaluación formativa sugerida
La evaluación debe priorizar comprensión, trazabilidad y análisis crítico. Se recomienda:
| Componente | Peso sugerido | Evidencia |
|---|---|---|
| Ejecución y anotación de notebooks | 25% | Notebooks ejecutados, observaciones y anotaciones de verificación |
| Interpretación matemática y tensorial | 25% | Explicación de ecuaciones, formas, Q/K/V, logits y pérdidas |
| Implementación mínima | 20% | Componentes construidos en PyTorch sin ocultarlos tras APIs de alto nivel |
| Análisis de generación y límites | 15% | Comparación de estrategias, fallos y riesgos de sobreinterpretación |
| Proyecto final | 15% | Entrega reproducible con explicación técnica y defensa conceptual |
Restricciones conceptuales
- No convertir el curso en una introducción a ChatGPT.
- No usar Hugging Face como dependencia central.
- No ocultar atención detrás de APIs de alto nivel.
- No presentar generaciones pequeñas como evidencia de inteligencia general.
- No interpretar mapas de atención como explicación semántica completa.
- Mantener explícita la relación entre forma tensorial y significado conceptual.
Cierre esperado
Al finalizar, el estudiante debe poder defender la cadena:
texto -> tokens -> embeddings -> posición -> atención ->
bloque decoder -> mini-GPT -> entrenamiento -> generación -> límites
El resultado esperado no es un modelo útil a escala real, sino criterio técnico para comprender, implementar y evaluar componentes fundamentales de los Transformers autoregresivos.