Tokenisation expliquée: Des tokens aux sorties
Par Wendy Frey
Avant qu’un grand modèle de langue puisse générer quoi que ce soit d'utile, il doit d'abord faire quelque chose de beaucoup plus simple: décomposer votre texte.
Ce processus s'appelle tokenisation, et c’est l’une des parties les plus importantes, et souvent les plus négligées, de la façon dont fonctionnent les systèmes d'IA modernes.
La plupart des gens pensent que les modèles lisent des mots. Ce n'est pas le cas.
Ils lisent des tokens: de petits morceaux de texte qui peuvent représenter des mots entiers, des parties de mots, de la ponctuation, des espaces, ou même des symboles individuels. Ces tokens sont ensuite convertis en identifiants numériques que le modèle peut traiter en interne.
Comprendre la tokenisation aide à expliquer beaucoup de choses:
- pourquoi les invites coûtent de l'argent
- pourquoi les fenêtres de contexte ont des limites
- pourquoi certaines langues sont plus coûteuses que d'autres
- pourquoi les modèles agissent parfois de manière étrange
La tokenisation se situe au tout début du pipeline de l'IA, et elle façonne discrètement tout ce qui vient après.
Qu'est-ce qu'un token?
Un token est la plus petite unité de texte avec laquelle un modèle fonctionne.
Il n'est pas toujours identique à un mot.
Par exemple:
| Texte | Division possible en tokens |
|---|---|
| hello | hello |
| tokenisation | token + isation |
| incroyable | in + croy + able |
| 2026! | 202 + 6 +! |
Cela est important car les modèles comptent les tokens, pas les mots.
Une phrase qui paraît courte peut utiliser plus de tokens que prévu, surtout avec des mots peu courants, du code, des emojis, ou des langues autres que l'anglais.
Comment fonctionne la tokenisation
À un niveau élevé, la tokenisation suit un pipeline simple.
Étape 1: Diviser le texte
Le tokenizer décompose le texte brut en morceaux en fonction de ses règles de vocabulaire.
Les LLM modernes s'appuient généralement sur la tokenisation par sous-mots, et non sur la tokenisation par mots entiers.
Cela leur donne la flexibilité de gérer:
- des mots rares
- des fautes de frappe
- des noms
- des entrées multilingues
- du code
Étape 2: Convertir des tokens en identifiants
Chaque token correspond à un nombre dans le vocabulaire du modèle.
Exemple:
| Token | Identifiant de token |
|---|---|
| The | 791 |
| model | 4382 |
| works | 2921 |
Le modèle ne « voit » jamais le texte directement. Il ne voit que ces représentations numériques.
C’est le pont entre le langage humain et la computation neurale.
Étape 3: Convertir les identifiants en embeddings
Après que les identifiants de tokens ont été créés, ils sont transformés en embeddings vectoriels.
C’est là que le sens commence à émerger.
À ce stade:
- des tokens similaires peuvent occuper des positions voisines dans l'espace vectoriel
- les relations entre les concepts deviennent mesurables
- le contexte commence à avoir de l'importance
La tokenisation permet d'introduire les données dans le système. Les embeddings les rendent interprétables.
Pourquoi la tokenisation par sous-mots est devenue standard
Les anciens systèmes de NLP coupaient souvent le texte par mots.
Cela fonctionnait, jusqu'à ce qu'ils rencontrent des mots qu'ils n'avaient jamais vus auparavant.
Les LLM modernes utilisent généralement des méthodes comme Byte Pair Encoding (BPE) ou des stratégies par sous-mots similaires.
Le BPE fonctionne en fusionnant à plusieurs reprises des motifs de caractères fréquents en unités réutilisables. Cela améliore la compression et l'efficacité du vocabulaire.
Pourquoi les modèles par sous-mots sont meilleurs
| Méthode | Problème principal |
|---|---|
| Niveau des mots | Trop de mots inconnus |
| Niveau des caractères | Trop lent, trop long |
| Niveau des sous-mots | Meilleur équilibre entre flexibilité et efficacité |
C’est pourquoi la plupart des modèles modernes utilisent une version de la tokenisation par sous-mots.
Pourquoi la tokenisation affecte le coût
C'est ici que la tokenisation devient pratique.
La plupart des API d'IA facturent en fonction de:
- tokens d'entrée
- tokens de sortie
Cela signifie que la tokenisation affecte directement le prix.
Par exemple:
| Type d'entrée | Densité approximative des tokens |
|---|---|
| Anglais simple | Faible |
| Code | Moyenne à élevée |
| Texte juridique | Élevée |
| Chinois/Japonais | Souvent plus élevée |
| Texte chargé en emojis | Surprenamment élevé |
Deux invites avec le même nombre de caractères peuvent avoir des comptes de tokens très différents.
C’est l'un des moteurs de coût cachés les plus courants dans les systèmes d'IA en production.
Pourquoi la tokenisation affecte le comportement des modèles
La tokenisation explique également de nombreux comportements « étranges » des modèles.
Par exemple:
- pourquoi les modèles ont du mal avec le comptage de lettres
- pourquoi les mots rares se comportent de manière imprévisible
- pourquoi des changements de formatage peuvent affecter les sorties
- pourquoi l'ordre des invites compte
Un modèle ne pense pas en lettres ou en grammaire comme le font les humains. Il prédit des séquences de tokens.
Cette différence crée bon nombre des bizarreries que les utilisateurs remarquent.
Les discussions communautaires pointent souvent la structure des tokens comme l'une des raisons pour lesquelles les modèles échouent dans le raisonnement au niveau des caractères.
Les tokens deviennent des sorties
Une fois que l'entrée est tokenisée:
- Les tokens vont dans le transformeur
- Le modèle prédit le token suivant
- Ce token est ajouté
- Le processus se répète
Cela continue jusqu'à ce que:
- un token d'arrêt apparaisse
- la limite de tokens soit atteinte
- le système interrompe la génération
Cela signifie que la génération par l'IA est fondamentalement une boucle de prédiction par token, pas un raisonnement au niveau des phrases.
Conclusion finale
La tokenisation peut sembler un petit détail technique, mais elle façonne presque tout dans les systèmes LLM modernes.
Elle affecte:
- le coût
- la vitesse
- les limites de contexte
- la performance multilingue
- le comportement du modèle
- la qualité de sortie
Si vous construisez avec l'IA, comprendre la tokenisation vous donne une bien meilleure intuition sur les raisons pour lesquelles les systèmes se comportent comme ils le font.
Avant qu'il y ait des embeddings, des transformeurs ou des sorties, il y a des tokens.
Et tout commence là.




