GPT, LLaMA, Claude — todo LLM moderno
Transformers solo-decodificador apilan 32-100 capas de atención multi-cabeza enmascarada + MLP. Cada token de cada capa es un promedio ponderado softmax de tokens previos — esa es toda la arquitectura.
Nombra las cosas pensando en quien lee, no en quien escribe.
Nombra las cosas pensando en quien lee, no en quien escribe.
Fundamentos de Deep Learning
La atención potencia todo transformer moderno — la arquitectura detrás de GPT, Claude, BERT. En su núcleo es una búsqueda con pesos suaves en un almacén clave-valor aprendido.
Atención = softmax sobre productos escalados, luego suma ponderada de valores.
Sin atención, no hay transformers. RNN y CNN seguirían siendo state of the art.
La atención potencia todo transformer moderno — la arquitectura detrás de GPT, Claude, BERT. En su núcleo es una búsqueda con pesos suaves en un almacén clave-valor aprendido.
Tres conjuntos de vectores: consultas , claves , valores . Cada consulta computa similitud con cada clave; softmax da una distribución; el promedio ponderado de valores es la salida.
¿Por qué ? . Sin escalar, dimensiones grandes saturan el softmax. Con , varianza siempre.
Multi-cabeza replica la operación veces con proyecciones distintas. Cada cabeza atiende un patrón distinto.
La atención es equivariante a permutaciones (no tiene orden — codificaciones posicionales lo arreglan) y cuadrática (). Sub-cuadrática (FlashAttention, Mamba) es tema activo.
Ejemplo trabajado — una consulta: , claves , valores , . Salida .
Python (in browser)
Esperado: Each row of weights sums to 1; output is shape (4, 8)
Python runs entirely in your browser via Pyodide (~6 MB on first Run, cached after).
Python (in browser)
Esperado: Lower-triangular weight matrix — token i never attends to j>i
Python runs entirely in your browser via Pyodide (~6 MB on first Run, cached after).
Ejemplo trabajado — varianza: , sin escalar std , con escalar std .
Transformers solo-decodificador apilan 32-100 capas de atención multi-cabeza enmascarada + MLP. Cada token de cada capa es un promedio ponderado softmax de tokens previos — esa es toda la arquitectura.
Corta una imagen en parches 16×16, trata cada uno como token, aplica atención. Iguala a CNNs en ImageNet a gran escala y es la backbone de SAM, DINO, CLIP.
T5, el Transformer original y BART usan cross-attention con queries del decodificador y keys/values del codificador — el mecanismo detrás de traducción y resumen.
Stable Diffusion, Imagen y DALL·E usan bloques de atención dentro del U-Net de denoising. La cross-attention desde embeddings de texto las hace condicionables por prompt.
Pon a prueba tu comprensión. Puntos por acierto + racha + velocidad.
3 preguntas rápidas. Acertá 2 para marcar esta lección como completada.