🧠
Simulador Arquitectónico

Cómo Funcionan los Grandes Modelos de Lenguaje (LLM)

Guía visual interactiva que explica paso a paso la arquitectura interna de un modelo de lenguaje Transformer: desde la tokenización de texto y embeddings vectoriales hasta la autoatención y generación autorregresiva de tokens.

✏️ Entrada

Escribe o selecciona un texto de ejemplo para comenzar el proceso completo

✏️

Bienvenido a ExploraModelo

Descubre cómo funcionan los modelos de lenguaje paso a paso. Escribe una frase y observa el proceso completo desde la entrada hasta la generación de texto.

0 / 50 tokens
0 / 200
O selecciona un ejemplo

🎯Ejemplos rápidos:

Paso 1 de 7

Arquitectura de Transformers: Fundamentos Teóricos de los LLMs

Los Modelos de Lenguaje Grande (LLM) contemporáneos operan sobre el principio de atención propio de la arquitectura Transformer ("Attention Is All You Need", Vaswani et al., 2017). A través de múltiples capas de atención multicabezal (Multi-Head Self-Attention) y redes prealimentadas (Feed-Forward Networks), el modelo procesa secuencias de texto capturando dependencias semánticas globales de largo alcance.

1. Tokenización y Espacio Vectorial

El texto plano es segmentado en unidades mínimas o subpalabras mediante algoritmos de Byte-Pair Encoding (BPE) o WordPiece. Cada token se proyecta a un vector continuo en un espacio latente de alta dimensionalidad enriquecido con codificación posicional.

2. Mecanismo de Autoatención

Cada token genera vectores de consulta (Query), clave (Key) y valor (Value). La puntuación de atención calcula la compatibilidad entre pares de tokens: Attention(Q, K, V) = softmax((Q K^T) / √d_k) V, permitiendo contextualizar palabras polisémicas dinámicamente.

3. Inferencia Autorregresiva

La cabeza lineal de salida proyecta los estados ocultos al vocabulario completo. Aplicando softmax, se obtiene una distribución de probabilidad condicional P(w_t | w_1...w_t-1), prediciendo y concatenando un token a la vez de forma continua.