Tokenización Explicada: De Tokens a Resultados

Blog

Por Wendy Frey

26702eff-dbff-43b4-a5fb-fb97eab89247-1200x600.webp Antes de que un modelo de lenguaje grande pueda generar algo útil, debe hacer algo mucho más simple primero: descomponer su texto.

Ese proceso se llama tokenización, y es una de las partes más importantes, y más pasadas por alto, de cómo funcionan los sistemas de IA modernos.

La mayoría de las personas piensa que los modelos leen palabras. No lo hacen.

Leen tokens: pequeños fragmentos de texto que pueden representar palabras completas, partes de palabras, puntuación, espacios o incluso símbolos individuales. Esos tokens se convierten luego en identificadores numéricos que el modelo puede procesar internamente.

Entender la tokenización ayuda a explicar muchas cosas:

  • por qué las indicaciones cuestan dinero
  • por qué las ventanas de contexto tienen límites
  • por qué algunos idiomas son más costosos que otros
  • por qué los modelos a veces se comportan de maneras extrañas

La tokenización se sitúa al inicio de la tubería de IA, y da forma silenciosa a todo lo que viene después.

¿Qué es un token?

Un token es la unidad más pequeña de texto con la que un modelo trabaja.

No siempre es lo mismo que una palabra.

Por ejemplo:

TextoPosible división de tokens
holahola
tokenizacióntoken + ización
increíblein + cre + íble
2026!202 + 6 +!

Esto importa porque los modelos cuentan tokens, no palabras.

Una oración que parece corta puede usar más tokens de lo esperado, especialmente con palabras poco comunes, código, emojis o idiomas que no son inglés.

Cómo funciona la tokenización

A un alto nivel, la tokenización sigue una tubería simple.

Paso 1: Dividir el texto

El tokenizador descompone el texto en bruto en fragmentos basándose en sus reglas de vocabulario.

Los LLM modernos generalmente dependen de la tokenización de subpalabras, no de la tokenización de palabras completas.

Esto les da flexibilidad para manejar:

  • palabras raras
  • errores tipográficos
  • nombres
  • entrada multilingüe
  • código

Paso 2: Convertir tokens en IDs

Cada token se mapea a un número dentro del vocabulario del modelo.

Ejemplo:

TokenID de Token
El791
modelo4382
funciona2921

El modelo nunca “ve” el texto directamente. Solo ve estas representaciones numéricas.

Esa es la conexión entre el lenguaje humano y la computación neuronal.

Paso 3: Convertir IDs en embeddings

Después de que se crean los IDs de los tokens, se transforman en embeddings vectoriales.

Aquí es donde comienza a surgir el significado.

En este punto:

  • los tokens similares pueden ocupar posiciones cercanas en el espacio vectorial
  • las relaciones entre conceptos se vuelven medibles
  • el contexto comienza a importar

La tokenización introduce los datos en el sistema. Los embeddings los hacen interpretables.

Por qué la tokenización de subpalabras se volvió estándar

Los sistemas NLP más antiguos a menudo dividían el texto por palabras.

Eso funcionó, hasta que se encontraron con palabras que nunca habían visto antes.

Los LLM modernos generalmente utilizan métodos como Byte Pair Encoding (BPE) o estrategias de subpalabras similares.

BPE funciona al fusionar repetidamente patrones de caracteres frecuentes en unidades reutilizables. Esto mejora la compresión y la eficiencia del vocabulario.

Por qué los modelos de subpalabras son mejores

MétodoProblema principal
A nivel de palabraDemasiadas palabras desconocidas
A nivel de carácterMuy lento, muy largo
A nivel de subpalabraMejor equilibrio de flexibilidad y eficiencia

Por eso, la mayoría de los modelos modernos utilizan alguna versión de la tokenización de subpalabras.

Por qué la tokenización afecta el costo

Aquí es donde la tokenización se vuelve práctica.

La mayoría de las API de IA cobran en función de:

  • tokens de entrada
  • tokens de salida

Eso significa que la tokenización afecta directamente el precio.

Por ejemplo:

Tipo de entradaDensidad aproximada de tokens
Inglés simpleBajo
CódigoMedio-alto
Texto legalAlto
Chino/JaponésA menudo más alto
Texto con muchos emojisSorprendentemente alto

Dos indicaciones con la misma cantidad de caracteres pueden tener conteos de tokens muy diferentes.

Este es uno de los impulsores ocultos de costos más comunes en los sistemas de IA en producción.

Por qué la tokenización afecta el comportamiento del modelo

La tokenización también explica muchos comportamientos “extraños” de los modelos.

Por ejemplo:

  • por qué los modelos tienen problemas con el conteo de letras
  • por qué las palabras raras se comportan de manera impredecible
  • por qué los cambios de formato pueden afectar las salidas
  • por qué el orden de las indicaciones importa

Un modelo no piensa en letras o gramática de la misma manera en que lo hacen los humanos. Predice secuencias de tokens.

Esa diferencia crea muchas de las rarezas que los usuarios notan.

Las discusiones comunitarias a menudo señalan la estructura de los tokens como una razón por la que los modelos fallan en el razonamiento a nivel de caracteres.

Los tokens se convierten en salidas

Una vez que la entrada es tokenizada:

  1. Los tokens van al transformador
  2. El modelo predice el próximo token
  3. Ese token se añade
  4. El proceso se repite

Esto continúa hasta que:

  • aparece un token de detención
  • se alcanza el límite de tokens
  • el sistema interrumpe la generación

Esto significa que la generación de IA es fundamentalmente un bucle de predicción token por token, no un razonamiento a nivel de oración.

Conclusión final

La tokenización parece un pequeño detalle técnico, pero da forma a casi todo en los sistemas LLM modernos.

Afecta:

  • costo
  • velocidad
  • límites de contexto
  • rendimiento multilingüe
  • comportamiento del modelo
  • calidad de salida

Si estás construyendo con IA, entender la tokenización te brinda una intuición mucho mejor sobre por qué los sistemas se comportan de la manera en que lo hacen.

Antes de que existan embeddings, transformadores o salidas, existen tokens.

Y todo comienza ahí.

Un diseño de indicaciones cuidadoso, opciones de vocabulario y presupuestos de tokens ayudan a asegurar que tu uso de tokens y los conteos de tokens se alineen con tus objetivos de costo y calidad. La recompensa es menos completaciones inesperadas, menores costos de API y modelos que entienden mejor la forma en que tus usuarios escriben.

Plantillas virales

Explora nuestras plantillas virales con IA y aplícalas a tus fotos.

Explorar plantillas