Tokenization Uitleg: Van Tokens naar Outputs

Blog

Door Wendy Frey

26702eff-dbff-43b4-a5fb-fb97eab89247-1200x600.webp Voordat een groot taalmodel iets nuttigs kan genereren, moet het iets veel eenvoudiger doen: je tekst splitsen.

Dat proces heet tokenisatie, en het is een van de belangrijkste, en vaak over het hoofd gezien, onderdelen van hoe moderne AI-systemen werken.

De meeste mensen denken dat modellen woorden lezen. Dat doen ze niet.

Ze lezen tokens: kleine stukjes tekst die volledige woorden, delen van woorden, interpunctie, spaties of zelfs individuele symbolen kunnen vertegenwoordigen. Die tokens worden vervolgens omgezet in numerieke ID's die het model intern kan verwerken.

Tokenisatie begrijpen helpt veel dingen te verklaren:

  • waarom prompts geld kosten
  • waarom contextvensters limieten hebben
  • waarom sommige talen duurder zijn dan andere
  • waarom modellen soms vreemd gedrag vertonen

Tokenisatie ligt aan het begin van de AI-pijplijn, en het vormt stilletjes alles wat daarna komt.

Wat is een token?

Een token is de kleinste eenheid van tekst waarmee een model werkt.

Het is niet altijd hetzelfde als een woord.

Bijvoorbeeld:

TekstMogelijke token split
hallohallo
tokenisatietoken + isatie
ongelofelijkon + gelov + elijk
2026!202 + 6 +!

Dit is belangrijk omdat modellen tokens tellen, geen woorden.

Een kortuitziende zin kan meer tokens gebruiken dan verwacht, vooral met ongebruikelijke woorden, code, emoji's of niet-Engelse talen.

Hoe tokenisatie werkt

Op hoog niveau volgt tokenisatie een eenvoudige pijplijn.

Stap 1: Splits de tekst

De tokenizer splitst ruwe tekst in stukken op basis van zijn vocabulaire regels.

Moderne LLM’s vertrouwen meestal op subword tokenisatie, niet op volledige woord tokenisatie.

Dit geeft hen de flexibiliteit om:

  • zeldzame woorden
  • typfouten
  • namen
  • meertalige invoer
  • code

Stap 2: Zet tokens om in ID's

Elk token is gekoppeld aan een nummer in de vocabulaire van het model.

Voorbeeld:

TokenToken ID
De791
model4382
werkt2921

Het model “ziet” de tekst nooit direct. Het ziet alleen deze numerieke representaties.

Dat is de brug tussen menselijke taal en neurale berekening.

Stap 3: Zet ID's om in embeddings

Nadat token-ID's zijn gemaakt, worden ze omgevormd tot vector embeddings.

Dit is waar betekenis begint te ontstaan.

Op dit punt:

  • kunnen vergelijkbare tokens nabijgelegen posities in de vectorruimte innemen
  • worden relaties tussen concepten meetbaar
  • begint context belangrijk te worden

Tokenisatie krijgt de gegevens in het systeem. Embeddings maken het interpreteerbaar.

Waarom subword tokenisatie standaard werd

Oudere NLP-systemen splitsten vaak tekst op basis van woorden.

Dat werkte, totdat ze woorden tegenkwamen die ze nooit eerder hadden gezien.

Moderne LLM’s gebruiken meestal methoden zoals Byte Pair Encoding (BPE) of vergelijkbare subword strategieën.

BPE werkt door frequente karakterpatronen steeds opnieuw samen te voegen tot herbruikbare eenheden. Dit verbetert de compressie en vocabulaire efficiëntie.

Waarom subword modellen beter zijn

MethodeHoofdprobleem
Woord-niveauTe veel onbekende woorden
Karakter-niveauTe langzaam, te lang
Subwoord-niveauBeste balans tussen flexibiliteit en efficiëntie

Dit is waarom de meeste moderne modellen een versie van subword tokenisatie gebruiken.

Waarom tokenisatie kosten beïnvloedt

Hier wordt tokenisatie praktisch.

De meeste AI-API's brengen kosten in rekening op basis van:

  • invoertokens
  • uitvoertokens

Dat betekent dat tokenisatie direct invloed heeft op de prijs.

Bijvoorbeeld:

Invoer typeBenaderende token dichtheid
Eenvoudig EngelsLaag
CodeMiddel, hoog
Wettelijke tekstHoog
Chinees/JapansVaak hoger
Emoji-rijke tekstVerrassend hoog

Twee prompts met hetzelfde aantal tekens kunnen heel verschillende token-aantallen hebben.

Dit is een van de meest voorkomende verborgen kostenfactoren in AI-systemen in productie.

Waarom tokenisatie modelgedrag beïnvloedt

Tokenisatie verklaart ook veel “vreemde” model gedragingen.

Bijvoorbeeld:

  • waarom modellen moeite hebben met lettertelling
  • waarom zeldzame woorden onvoorspelbaar gedrag vertonen
  • waarom formatwijzigingen de uitvoer kunnen beïnvloeden
  • waarom de volgorde van prompts belangrijk is

Een model denkt niet in letters of grammatica zoals mensen dat doen. Het voorspelt tokenreeksen.

Dat verschil creëert veel van de eigenaardigheden die gebruikers opmerken.

Discussies in de gemeenschap wijzen vaak op tokenstructuur als een reden waarom modellen falen in redeneervaardigheden op teken-niveau.

Tokens worden outputs

Zodra de invoer is getokeniseerd:

  1. Tokens gaan naar de transformer
  2. Het model voorspelt de volgende token
  3. Die token wordt toegevoegd
  4. Het proces herhaalt zich

Dit gaat door totdat:

  • een stoptoken verschijnt
  • de tokenlimiet is bereikt
  • het systeem de generatie onderbreekt

Dit betekent dat AI-generatie fundamenteel een token-voor-token voorspellingslus is, geen redenering op zinsniveau.

Laatste conclusie

Tokenisatie lijkt een klein technisch detail, maar het vormt bijna alles in moderne LLM-systemen.

Het beïnvloedt:

  • kosten
  • snelheid
  • contextlimieten
  • meertalige prestaties
  • modelgedrag
  • uitvoerkwaliteit

Als je met AI bouwt, geeft het begrijpen van tokenisatie je een veel beter inzicht in waarom systemen zich gedragen zoals ze doen.

Voordat er embeddings, transformers of outputs zijn, zijn er tokens.

En alles begint daar.

Zorgvuldige promptontwerp, vocabulairekeuzes en tokenbudgettering helpen ervoor te zorgen dat je tokengebruik en tokenaantallen in overeenstemming zijn met je kosten- en kwaliteitsdoelen. De beloning is minder onverwachte voltozingen, lagere API-kosten, en modellen die beter begrijpen hoe jouw gebruikers schrijven.

Virale sjablonen

Ontdek onze virale AI-sjablonen en pas ze toe op je foto's.

Sjablonen ontdekken