Tokenisation expliquée: Des tokens aux sorties

Blog

Par Wendy Frey

26702eff-dbff-43b4-a5fb-fb97eab89247-1200x600.webp Avant qu’un grand modèle de langue puisse générer quoi que ce soit d'utile, il doit d'abord faire quelque chose de beaucoup plus simple: décomposer votre texte.

Ce processus s'appelle tokenisation, et c’est l’une des parties les plus importantes, et souvent les plus négligées, de la façon dont fonctionnent les systèmes d'IA modernes.

La plupart des gens pensent que les modèles lisent des mots. Ce n'est pas le cas.

Ils lisent des tokens: de petits morceaux de texte qui peuvent représenter des mots entiers, des parties de mots, de la ponctuation, des espaces, ou même des symboles individuels. Ces tokens sont ensuite convertis en identifiants numériques que le modèle peut traiter en interne.

Comprendre la tokenisation aide à expliquer beaucoup de choses:

  • pourquoi les invites coûtent de l'argent
  • pourquoi les fenêtres de contexte ont des limites
  • pourquoi certaines langues sont plus coûteuses que d'autres
  • pourquoi les modèles agissent parfois de manière étrange

La tokenisation se situe au tout début du pipeline de l'IA, et elle façonne discrètement tout ce qui vient après.

Qu'est-ce qu'un token?

Un token est la plus petite unité de texte avec laquelle un modèle fonctionne.

Il n'est pas toujours identique à un mot.

Par exemple:

TexteDivision possible en tokens
hellohello
tokenisationtoken + isation
incroyablein + croy + able
2026!202 + 6 +!

Cela est important car les modèles comptent les tokens, pas les mots.

Une phrase qui paraît courte peut utiliser plus de tokens que prévu, surtout avec des mots peu courants, du code, des emojis, ou des langues autres que l'anglais.

Comment fonctionne la tokenisation

À un niveau élevé, la tokenisation suit un pipeline simple.

Étape 1: Diviser le texte

Le tokenizer décompose le texte brut en morceaux en fonction de ses règles de vocabulaire.

Les LLM modernes s'appuient généralement sur la tokenisation par sous-mots, et non sur la tokenisation par mots entiers.

Cela leur donne la flexibilité de gérer:

  • des mots rares
  • des fautes de frappe
  • des noms
  • des entrées multilingues
  • du code

Étape 2: Convertir des tokens en identifiants

Chaque token correspond à un nombre dans le vocabulaire du modèle.

Exemple:

TokenIdentifiant de token
The791
model4382
works2921

Le modèle ne « voit » jamais le texte directement. Il ne voit que ces représentations numériques.

C’est le pont entre le langage humain et la computation neurale.

Étape 3: Convertir les identifiants en embeddings

Après que les identifiants de tokens ont été créés, ils sont transformés en embeddings vectoriels.

C’est là que le sens commence à émerger.

À ce stade:

  • des tokens similaires peuvent occuper des positions voisines dans l'espace vectoriel
  • les relations entre les concepts deviennent mesurables
  • le contexte commence à avoir de l'importance

La tokenisation permet d'introduire les données dans le système. Les embeddings les rendent interprétables.

Pourquoi la tokenisation par sous-mots est devenue standard

Les anciens systèmes de NLP coupaient souvent le texte par mots.

Cela fonctionnait, jusqu'à ce qu'ils rencontrent des mots qu'ils n'avaient jamais vus auparavant.

Les LLM modernes utilisent généralement des méthodes comme Byte Pair Encoding (BPE) ou des stratégies par sous-mots similaires.

Le BPE fonctionne en fusionnant à plusieurs reprises des motifs de caractères fréquents en unités réutilisables. Cela améliore la compression et l'efficacité du vocabulaire.

Pourquoi les modèles par sous-mots sont meilleurs

MéthodeProblème principal
Niveau des motsTrop de mots inconnus
Niveau des caractèresTrop lent, trop long
Niveau des sous-motsMeilleur équilibre entre flexibilité et efficacité

C’est pourquoi la plupart des modèles modernes utilisent une version de la tokenisation par sous-mots.

Pourquoi la tokenisation affecte le coût

C'est ici que la tokenisation devient pratique.

La plupart des API d'IA facturent en fonction de:

  • tokens d'entrée
  • tokens de sortie

Cela signifie que la tokenisation affecte directement le prix.

Par exemple:

Type d'entréeDensité approximative des tokens
Anglais simpleFaible
CodeMoyenne à élevée
Texte juridiqueÉlevée
Chinois/JaponaisSouvent plus élevée
Texte chargé en emojisSurprenamment élevé

Deux invites avec le même nombre de caractères peuvent avoir des comptes de tokens très différents.

C’est l'un des moteurs de coût cachés les plus courants dans les systèmes d'IA en production.

Pourquoi la tokenisation affecte le comportement des modèles

La tokenisation explique également de nombreux comportements « étranges » des modèles.

Par exemple:

  • pourquoi les modèles ont du mal avec le comptage de lettres
  • pourquoi les mots rares se comportent de manière imprévisible
  • pourquoi des changements de formatage peuvent affecter les sorties
  • pourquoi l'ordre des invites compte

Un modèle ne pense pas en lettres ou en grammaire comme le font les humains. Il prédit des séquences de tokens.

Cette différence crée bon nombre des bizarreries que les utilisateurs remarquent.

Les discussions communautaires pointent souvent la structure des tokens comme l'une des raisons pour lesquelles les modèles échouent dans le raisonnement au niveau des caractères.

Les tokens deviennent des sorties

Une fois que l'entrée est tokenisée:

  1. Les tokens vont dans le transformeur
  2. Le modèle prédit le token suivant
  3. Ce token est ajouté
  4. Le processus se répète

Cela continue jusqu'à ce que:

  • un token d'arrêt apparaisse
  • la limite de tokens soit atteinte
  • le système interrompe la génération

Cela signifie que la génération par l'IA est fondamentalement une boucle de prédiction par token, pas un raisonnement au niveau des phrases.

Conclusion finale

La tokenisation peut sembler un petit détail technique, mais elle façonne presque tout dans les systèmes LLM modernes.

Elle affecte:

  • le coût
  • la vitesse
  • les limites de contexte
  • la performance multilingue
  • le comportement du modèle
  • la qualité de sortie

Si vous construisez avec l'IA, comprendre la tokenisation vous donne une bien meilleure intuition sur les raisons pour lesquelles les systèmes se comportent comme ils le font.

Avant qu'il y ait des embeddings, des transformeurs ou des sorties, il y a des tokens.

Et tout commence là.

Modèles viraux

Découvrez nos modèles viraux IA et appliquez-les à vos photos.

Découvrir les modèles