para estudiantespara docentespara institucionespara comunidades
OpenCourses.AI
Explorar
Volver al cursoRecursos del curso

Syllabus

Fundamentos de Transformers

Descargar

Syllabus

Identificación del curso

Nombre: Fundamentos de Transformers Subtítulo de trabajo: Atención, geometría y modelos autoregresivos desde cero Unidad académica: Curso abierto Modalidad: Curso formativo con notebooks técnicos, visualizaciones y proyecto final Nivel sugerido: Estudiantes universitarios con bases iniciales en programación, álgebra lineal, probabilidad y aprendizaje automático Producto final: Mini modelo autoregresivo tipo decoder, explicado y analizado críticamente

Descripción

Este curso estudia los componentes internos de un Transformer decoder desde una ruta gradual: representación discreta del texto, embeddings, posición, formas tensoriales, atención, Q/K/V, self-attention, máscara causal, multi-head attention, residuales, LayerNorm, MLP, bloque decoder, mini-GPT, entrenamiento autoregresivo y generación.

El curso no busca entrenar un modelo competitivo ni sustituir cursos sobre ChatGPT, prompting, RAG, agentes, LoRA, QLoRA o ajuste de modelos grandes. Su valor es formativo: permitir que el estudiante entienda cómo se construyen las operaciones fundamentales antes de usar abstracciones de alto nivel.

Propósito académico

Formar estudiantes capaces de explicar e implementar los componentes centrales de un Transformer decoder, conectando cada concepto con una ecuación, una forma tensorial, una operación en PyTorch, una visualización y una interpretación crítica.

Resultados de aprendizaje

Al completar la ruta, el estudiante estará en capacidad de:

  • formular el lenguaje como secuencia discreta y problema de predicción autoregresiva;
  • construir tokenización simple, vocabulario, codificación y batches x/y;
  • interpretar embeddings como una tabla entrenable y no como coordenadas inherentes de los índices;
  • explicar por qué se requiere información posicional;
  • manipular formas tensoriales usadas en atención y proyecciones lineales;
  • derivar atención como mezcla ponderada mediante Q, K y V;
  • implementar self-attention por producto punto escalado;
  • aplicar máscara causal y explicar su relación con predicción del siguiente token;
  • distinguir multi-head attention como división de canales, no de tokens;
  • explicar residuales, LayerNorm y MLP por posición;
  • integrar un bloque Transformer decoder reutilizable;
  • construir un mini-GPT desde cero;
  • entrenar con cross-entropy y analizar validación, sobreajuste y escala;
  • comparar estrategias de generación y sus límites;
  • presentar un proyecto final reproducible con análisis técnico.

Prerrequisitos

Se espera que el estudiante tenga:

  • programación básica en Python;
  • manejo inicial de notebooks Jupyter;
  • álgebra lineal elemental: vectores, matrices, producto punto y formas;
  • probabilidad básica: distribuciones categóricas, logaritmos y softmax;
  • nociones iniciales de aprendizaje automático: parámetros, pérdida, gradiente y entrenamiento.

No se asume dominio avanzado de PyTorch ni de Transformers. El curso introduce esos elementos de forma progresiva, pero exige lectura técnica y ejecución cuidadosa.

Principio pedagógico

Cada notebook técnico debe sostener esta cadena:

concepto -> ecuación -> tensor -> código ->
visualización -> interpretación crítica

El notebook 00_presentacion_del_curso.ipynb cumple una función distinta: presentar el curso mediante el audio de bienvenida, ubicar la motivación y mostrar la ruta antes de entrar en materia técnica.

Estructura temática

Módulo 0. Presentación del curso

Notebook:

  • 00_presentacion_del_curso.ipynb

Propósito: introducir la motivación del curso, su alcance, la función de los Transformers en la inteligencia artificial moderna y el mapa general de la ruta.

Módulo 1. Secuencias y representación discreta

Notebooks: 01 a 05

  • 01_el_problema_de_modelar_secuencias.ipynb
  • 02_tokens_vocabulario_y_batches.ipynb
  • 03_embeddings_y_geometria_de_tokens.ipynb
  • 04_posicion_y_orden_en_secuencias.ipynb
  • 05_tensores_del_transformer.ipynb

Temas: secuencias discretas, objetivo autoregresivo, tokens, vocabulario, batches, embeddings, posición y formas tensoriales.

Módulo 2. Atención y Q/K/V

Notebooks: 06 a 10

  • 06_atencion_como_mezcla_ponderada.ipynb
  • 07_queries_keys_y_values.ipynb
  • 08_self_attention_matricial.ipynb
  • 09_atencion_causal.ipynb
  • 10_multi_head_attention.ipynb

Temas: mezcla ponderada, consultas, llaves, valores, producto punto escalado, máscara causal y atención con múltiples cabezas.

Módulo 3. Decoder y mini-GPT

Notebooks: 11 a 13

  • 11_residuales_layernorm_y_mlp.ipynb
  • 12_bloque_transformer_decoder.ipynb
  • 13_mini_gpt_desde_cero.ipynb

Temas: conexiones residuales, normalización, MLP por posición, bloque decoder y arquitectura autoregresiva mínima.

Módulo 4. Entrenamiento, generación y límites

Notebooks: 14 a 16

  • 14_entrenamiento_autoregresivo.ipynb
  • 15_generacion_interpretacion_y_limites.ipynb
  • 16_proyecto_final.ipynb

Temas: cross-entropy, validación, sobreajuste, generación, temperatura, top-k, top-p, mapas de atención, repetición, memorización, límites y entrega integradora.

Evaluación formativa sugerida

La evaluación debe priorizar comprensión, trazabilidad y análisis crítico. Se recomienda:

ComponentePeso sugeridoEvidencia
Ejecución y anotación de notebooks25%Notebooks ejecutados, observaciones y anotaciones de verificación
Interpretación matemática y tensorial25%Explicación de ecuaciones, formas, Q/K/V, logits y pérdidas
Implementación mínima20%Componentes construidos en PyTorch sin ocultarlos tras APIs de alto nivel
Análisis de generación y límites15%Comparación de estrategias, fallos y riesgos de sobreinterpretación
Proyecto final15%Entrega reproducible con explicación técnica y defensa conceptual

Restricciones conceptuales

  • No convertir el curso en una introducción a ChatGPT.
  • No usar Hugging Face como dependencia central.
  • No ocultar atención detrás de APIs de alto nivel.
  • No presentar generaciones pequeñas como evidencia de inteligencia general.
  • No interpretar mapas de atención como explicación semántica completa.
  • Mantener explícita la relación entre forma tensorial y significado conceptual.

Cierre esperado

Al finalizar, el estudiante debe poder defender la cadena:

texto -> tokens -> embeddings -> posición -> atención ->
bloque decoder -> mini-GPT -> entrenamiento -> generación -> límites

El resultado esperado no es un modelo útil a escala real, sino criterio técnico para comprender, implementar y evaluar componentes fundamentales de los Transformers autoregresivos.