Cómo Funcionan los Grandes Modelos de Lenguaje (LLM)
Guía visual interactiva que explica paso a paso la arquitectura interna de un modelo de lenguaje Transformer: desde la tokenización de texto y embeddings vectoriales hasta la autoatención y generación autorregresiva de tokens.
✏️ Entrada
Escribe o selecciona un texto de ejemplo para comenzar el proceso completo
Bienvenido a ExploraModelo
Descubre cómo funcionan los modelos de lenguaje paso a paso. Escribe una frase y observa el proceso completo desde la entrada hasta la generación de texto.
Paso 1 de 7
Arquitectura de Transformers: Fundamentos Teóricos de los LLMs
Los Modelos de Lenguaje Grande (LLM) contemporáneos operan sobre el principio de atención propio de la arquitectura Transformer ("Attention Is All You Need", Vaswani et al., 2017). A través de múltiples capas de atención multicabezal (Multi-Head Self-Attention) y redes prealimentadas (Feed-Forward Networks), el modelo procesa secuencias de texto capturando dependencias semánticas globales de largo alcance.
1. Tokenización y Espacio Vectorial
El texto plano es segmentado en unidades mínimas o subpalabras mediante algoritmos de Byte-Pair Encoding (BPE) o WordPiece. Cada token se proyecta a un vector continuo en un espacio latente de alta dimensionalidad enriquecido con codificación posicional.
2. Mecanismo de Autoatención
Cada token genera vectores de consulta (Query), clave (Key) y valor (Value). La puntuación de atención calcula la compatibilidad entre pares de tokens: Attention(Q, K, V) = softmax((Q K^T) / √d_k) V, permitiendo contextualizar palabras polisémicas dinámicamente.
3. Inferencia Autorregresiva
La cabeza lineal de salida proyecta los estados ocultos al vocabulario completo. Aplicando softmax, se obtiene una distribución de probabilidad condicional P(w_t | w_1...w_t-1), prediciendo y concatenando un token a la vez de forma continua.

