Este curso guía al estudiante desde el problema de representar secuencias discretas hasta la construcción de un mini modelo autoregresivo tipo decoder. Cada unidad conecta concepto, ecuación, forma tensorial, código, visualización e interpretación crítica.
Audiencia
Estudiantes universitarios con bases iniciales en programación. Personas con nociones básicas de álgebra lineal, probabilidad y aprendizaje automático. Aprendices que quieren entender Transformers por dentro antes de usar APIs de alto nivel.
Qué aprenderás
Formular el lenguaje como una secuencia discreta y un problema de predicción autoregresiva.
Construir tokenización simple, vocabulario, codificación y batches x/y.
Interpretar embeddings, posiciones y formas tensoriales dentro de un Transformer.
Implementar atención, self-attention, máscara causal y multi-head attention en PyTorch.
Integrar residuales, LayerNorm, MLP y bloques decoder en un mini-GPT.
Entrenar, generar texto y analizar límites sin sobreinterpretar resultados pequeños.