Un nuevo sitio web de explicaciones está guiando a los lectores a través de cómo funcionan realmente los modelos Transformer, paso a paso.
El sitio, Transformer Explainer, toma un modelo de 124 millones de parámetros y lo descompone en sus partes principales: embedding, atención y la capa MLP. El recorrido está construido alrededor del modelo GPT-2 (small), que el explicador utiliza como punto de partida para comprender los conceptos básicos de los Transformers generadores de texto.
Aquí está la estructura básica de un Transformer, según lo plantea el explicador:
Componentes Clave
El explicador identifica tres partes clave de todo Transformer generador de texto:
- Embedding, donde las indicaciones de texto se convierten en vectores numéricos que el modelo puede comprender.
- Bloque Transformer, el bloque de construcción fundamental que procesa los datos de entrada.
- Probabilidades de Salida, donde el modelo transforma los embeddings procesados en probabilidades para el siguiente token.
Tokenización
El explicador ilustra cómo las indicaciones como «La visualización de datos permite a los usuarios» se descomponen en piezas más pequeñas llamadas tokens. Los tokens pueden ser palabras completas o partes de palabras. El explicador señala que el vocabulario de GPT-2 tiene 50,257 tokens únicos.
Atención y la Capa MLP
El bloque Transformer es donde el modelo realiza su trabajo. Incluye el mecanismo de atención y la capa MLP. El mecanismo de atención permite que los tokens se comuniquen entre sí, capturando información contextual y relaciones entre palabras. La capa MLP refina la representación de cada token de forma independiente.
El explicador explica paso a paso el mecanismo de autoatención multi-cabeza, mostrando cómo el vector de incrustación de cada token se transforma en vectores de Consulta (Q), Clave (K) y Valor (V). También explica que el mecanismo de autoatención se deriva al multiplicar la matriz de incrustación de entrada con matrices de peso aprendidas.
Los Números Detrás del Modelo
La decisión del explicador de basarse en GPT-2 (pequeño) fue deliberada. No es el modelo Transformer más reciente ni más potente, pero comparte los mismos componentes y principios arquitectónicos que se encuentran en los modelos más avanzados en la actualidad. Los 124 millones de parámetros son menores que los modelos que realmente ejecutan la generación de texto en internet hoy en día, lo que lo convierte en un punto de entrada accesible.
El explicador también señala que los vectores de incrustación se almacenan en una matriz de forma (50,257, 768), que contiene aproximadamente 39 millones de parámetros. Esa matriz permite al modelo asignar significado semántico a cada token, con tokens similares ubicados cerca unos de otros en el espacio de alta dimensión y los disímiles más separados.
Dependencia a Largo Alcance
El explicador hace un punto claro: el mecanismo de autoatención es la innovación central de los Transformers. Permite al modelo procesar secuencias completas y capturar dependencias a largo alcance de manera más efectiva que arquitecturas anteriores.
Eso vale la pena repetirlo. El mecanismo de atención no es una pequeña modificación. Es la razón por la que los Transformers se han convertido en la arquitectura preferida para los modelos de aprendizaje profundo, impulsando modelos generadores de texto como GPT de OpenAI, Llama de Meta y Gemini de Google.
El explicador también explica el proceso de entrenamiento. Describe cómo el modelo aprende su propia matriz de codificación posicional desde cero, integrándola directamente en el proceso de entrenamiento.
Hechos Clave
- Modelo: GPT-2 (pequeño), 124 millones de parámetros
- Vocabulario: 50,257 tokens únicos
- Matriz de incrustación: (50,257, 768), aproximadamente 39 millones de parámetros
- Bloques Transformer: 12
- Ejemplo de tokenización: «La visualización de datos permite a los usuarios»
El explicador está desempeñando una función: hacer accesibles los mecanismos internos de los Transformers. Es una pieza de comunicación técnica sólida y bien estructurada.
También, por diseño, es incompleto. El explicador omite por completo la cuestión de los datos de entrenamiento, y ese es el punto. El explicador se enfoca en cómo el modelo procesa la información, no de dónde proviene esa información. Esa es una elección razonable para una guía paso a paso, pero también es una laguna que el explicador mismo deja sin llenar.
Vea el video en torno al cual se construye la historia en poloclub.github.io.
Recibe El Cuaderno.
Las mejores historias del día y cada veredicto nuevo, en español claro, en tu correo a las siete. Un correo al día, nada más.

