Tokenización Explicada: De Tokens a Resultados
Por Wendy Frey
Antes de que un modelo de lenguaje grande pueda generar algo útil, debe hacer algo mucho más simple primero: descomponer su texto.
Ese proceso se llama tokenización, y es una de las partes más importantes, y más pasadas por alto, de cómo funcionan los sistemas de IA modernos.
La mayoría de las personas piensa que los modelos leen palabras. No lo hacen.
Leen tokens: pequeños fragmentos de texto que pueden representar palabras completas, partes de palabras, puntuación, espacios o incluso símbolos individuales. Esos tokens se convierten luego en identificadores numéricos que el modelo puede procesar internamente.
Entender la tokenización ayuda a explicar muchas cosas:
- por qué las indicaciones cuestan dinero
- por qué las ventanas de contexto tienen límites
- por qué algunos idiomas son más costosos que otros
- por qué los modelos a veces se comportan de maneras extrañas
La tokenización se sitúa al inicio de la tubería de IA, y da forma silenciosa a todo lo que viene después.
¿Qué es un token?
Un token es la unidad más pequeña de texto con la que un modelo trabaja.
No siempre es lo mismo que una palabra.
Por ejemplo:
| Texto | Posible división de tokens |
|---|---|
| hola | hola |
| tokenización | token + ización |
| increíble | in + cre + íble |
| 2026! | 202 + 6 +! |
Esto importa porque los modelos cuentan tokens, no palabras.
Una oración que parece corta puede usar más tokens de lo esperado, especialmente con palabras poco comunes, código, emojis o idiomas que no son inglés.
Cómo funciona la tokenización
A un alto nivel, la tokenización sigue una tubería simple.
Paso 1: Dividir el texto
El tokenizador descompone el texto en bruto en fragmentos basándose en sus reglas de vocabulario.
Los LLM modernos generalmente dependen de la tokenización de subpalabras, no de la tokenización de palabras completas.
Esto les da flexibilidad para manejar:
- palabras raras
- errores tipográficos
- nombres
- entrada multilingüe
- código
Paso 2: Convertir tokens en IDs
Cada token se mapea a un número dentro del vocabulario del modelo.
Ejemplo:
| Token | ID de Token |
|---|---|
| El | 791 |
| modelo | 4382 |
| funciona | 2921 |
El modelo nunca “ve” el texto directamente. Solo ve estas representaciones numéricas.
Esa es la conexión entre el lenguaje humano y la computación neuronal.
Paso 3: Convertir IDs en embeddings
Después de que se crean los IDs de los tokens, se transforman en embeddings vectoriales.
Aquí es donde comienza a surgir el significado.
En este punto:
- los tokens similares pueden ocupar posiciones cercanas en el espacio vectorial
- las relaciones entre conceptos se vuelven medibles
- el contexto comienza a importar
La tokenización introduce los datos en el sistema. Los embeddings los hacen interpretables.
Por qué la tokenización de subpalabras se volvió estándar
Los sistemas NLP más antiguos a menudo dividían el texto por palabras.
Eso funcionó, hasta que se encontraron con palabras que nunca habían visto antes.
Los LLM modernos generalmente utilizan métodos como Byte Pair Encoding (BPE) o estrategias de subpalabras similares.
BPE funciona al fusionar repetidamente patrones de caracteres frecuentes en unidades reutilizables. Esto mejora la compresión y la eficiencia del vocabulario.
Por qué los modelos de subpalabras son mejores
| Método | Problema principal |
|---|---|
| A nivel de palabra | Demasiadas palabras desconocidas |
| A nivel de carácter | Muy lento, muy largo |
| A nivel de subpalabra | Mejor equilibrio de flexibilidad y eficiencia |
Por eso, la mayoría de los modelos modernos utilizan alguna versión de la tokenización de subpalabras.
Por qué la tokenización afecta el costo
Aquí es donde la tokenización se vuelve práctica.
La mayoría de las API de IA cobran en función de:
- tokens de entrada
- tokens de salida
Eso significa que la tokenización afecta directamente el precio.
Por ejemplo:
| Tipo de entrada | Densidad aproximada de tokens |
|---|---|
| Inglés simple | Bajo |
| Código | Medio-alto |
| Texto legal | Alto |
| Chino/Japonés | A menudo más alto |
| Texto con muchos emojis | Sorprendentemente alto |
Dos indicaciones con la misma cantidad de caracteres pueden tener conteos de tokens muy diferentes.
Este es uno de los impulsores ocultos de costos más comunes en los sistemas de IA en producción.
Por qué la tokenización afecta el comportamiento del modelo
La tokenización también explica muchos comportamientos “extraños” de los modelos.
Por ejemplo:
- por qué los modelos tienen problemas con el conteo de letras
- por qué las palabras raras se comportan de manera impredecible
- por qué los cambios de formato pueden afectar las salidas
- por qué el orden de las indicaciones importa
Un modelo no piensa en letras o gramática de la misma manera en que lo hacen los humanos. Predice secuencias de tokens.
Esa diferencia crea muchas de las rarezas que los usuarios notan.
Las discusiones comunitarias a menudo señalan la estructura de los tokens como una razón por la que los modelos fallan en el razonamiento a nivel de caracteres.
Los tokens se convierten en salidas
Una vez que la entrada es tokenizada:
- Los tokens van al transformador
- El modelo predice el próximo token
- Ese token se añade
- El proceso se repite
Esto continúa hasta que:
- aparece un token de detención
- se alcanza el límite de tokens
- el sistema interrumpe la generación
Esto significa que la generación de IA es fundamentalmente un bucle de predicción token por token, no un razonamiento a nivel de oración.
Conclusión final
La tokenización parece un pequeño detalle técnico, pero da forma a casi todo en los sistemas LLM modernos.
Afecta:
- costo
- velocidad
- límites de contexto
- rendimiento multilingüe
- comportamiento del modelo
- calidad de salida
Si estás construyendo con IA, entender la tokenización te brinda una intuición mucho mejor sobre por qué los sistemas se comportan de la manera en que lo hacen.
Antes de que existan embeddings, transformadores o salidas, existen tokens.
Y todo comienza ahí.
Un diseño de indicaciones cuidadoso, opciones de vocabulario y presupuestos de tokens ayudan a asegurar que tu uso de tokens y los conteos de tokens se alineen con tus objetivos de costo y calidad. La recompensa es menos completaciones inesperadas, menores costos de API y modelos que entienden mejor la forma en que tus usuarios escriben.




