Tokenizace vysvětlena: Od tokenů k výstupům
Autor: Wendy Frey

Než velký jazykový model dokáže generovat něco užitečného, musí nejprve udělat něco mnohem jednoduššího: rozdělit váš text.
Ten proces se nazývá tokenizace, a je to jedna z nejdůležitějších, a nejvíce opomíjených, částí toho, jak moderní AI systémy fungují.
Většina lidí si myslí, že modely čtou slova. Nečtou.
Čtou tokeny: malé úseky textu, které mohou představovat celá slova, části slov, interpunkci, mezery nebo dokonce jednotlivé symboly. Tyto tokeny jsou poté převedeny na číselné ID, která model zpracovává interně.
Pochopení tokenizace pomáhá vysvětlit řadu věcí:
- proč dotazy stojí peníze
- proč mají kontextová okna omezení
- proč jsou některé jazyky dražší než jiné
- proč se modely někdy chovají zvláštně
Tokenizace se nachází na úplném začátku AI pipeline, a tiše formuje vše, co následuje.
Co je to token?
Token je nejmenší jednotka textu, se kterou model pracuje.
Není to vždy to samé jako slovo.
Například:
| Text | Možné rozdělení tokenů |
|---|---|
| hello | hello |
| tokenization | token + ization |
| unbelievable | un + believ + able |
| 2026! | 202 + 6 +! |
To je důležité, protože modely počítají tokeny, ne slova.
Krátká věta může používat více tokenů, než se očekávalo, zejména s neobvyklými slovy, kódem, emoji nebo jazykem, který není angličtinou.
Jak funguje tokenizace
Na vysoké úrovni tokenizace následuje jednoduchou pipeline.
Krok 1: Rozdělení textu
Tokenizátor rozděluje surový text na kusy na základě svých pravidel slovní zásoby.
Moderní LLM obvykle spoléhají na tokenizaci subslov, ne tokenizaci celých slov.
To jim dává flexibilitu při zpracování:
- vzácných slov
- překlepů
- jmen
- vícejazyčného vstupu
- kódu
Krok 2: Převod tokenů na ID
Každý token odpovídá číslu uvnitř slovní zásoby modelu.
Příklad:
| Token | Token ID |
|---|---|
| The | 791 |
| model | 4382 |
| works | 2921 |
Model nikdy „nevidí“ text přímo. Vidí pouze tyto číselné reprezentace.
To je most mezi lidským jazykem a neuronovým výpočtem.
Krok 3: Převod ID na embeddings
Po vytvoření token ID jsou převedena na vektorové embeddings.
Tady začíná vyvstávat význam.
V tomto bodě:
- podobné tokeny mohou zaujímat blízké pozice ve vektorovém prostoru
- vztahy mezi pojmy se stávají měřitelnými
- kontext začíná mít význam
Tokenizace dostává data do systému. Embeddings činí data interpretovatelnými.
Proč se tokenizace stala standardem subslov
Starší systémy NLP často rozdělovaly text podle slov.
To fungovalo, dokud nenarazily na slova, která nikdy předtím neviděly.
Moderní LLM obvykle používají metody jako Byte Pair Encoding (BPE) nebo podobné strategie subslov.
BPE funguje tak, že opakovaně slučuje časté vzory znaků do znovu použitelných jednotek. To zlepšuje kompresi a efektivitu slovní zásoby.
Proč jsou modely subslov lepší
| Metoda | Hlavní problém |
|---|---|
| Word-level | Příliš mnoho neznámých slov |
| Character-level | Příliš pomalé, příliš dlouhé |
| Subword-level | Nejlepší rovnováha flexibility a efektivity |
To je důvod, proč většina moderních modelů používá nějakou verzi tokenizace subslov.
Proč tokenizace ovlivňuje náklady
Tady se tokenizace stává praktickou.
Většina AI API účtuje na základě:
- vstupních tokenů
- výstupních tokenů
To znamená, že tokenizace přímo ovlivňuje cenu.
Například:
| Typ vstupu | Přibližná hustota tokenů |
|---|---|
| Jednoduchá angličtina | Nízká |
| Kód | Střední, vysoká |
| Právní text | Vysoká |
| Čínština/Japonština | Často vyšší |
| Text s mnoha emoji | Překvapivě vysoká |
Dva dotazy se stejným počtem znaků mohou mít velmi odlišný počet tokenů.
To je jedno z nejběžnějších skrytých faktorů nákladů v produkčních AI systémech.
Proč tokenizace ovlivňuje chování modelu
Tokenizace také vysvětluje mnoho „podivných“ chování modelu.
Například:
- proč mají modely problémy s počítáním písmen
- proč se vzácná slova chovají nepředvídatelně
- proč změny formátování mohou ovlivnit výstupy
- proč má pořadí dotazů význam
Model nemyslí v písmenech nebo gramatice tak, jak to dělají lidé. Predikuje sekvence tokenů.
Ten rozdíl vytváří mnoho zvláštností, které uživatelé zaznamenávají.
Diskuze v komunitě často ukazují na strukturu tokenů jako jeden z důvodů, proč modely selhávají v dedukci na úrovni znaků.
Tokeny se stávají výstupy
Jakmile je vstup tokenizován:
- Tokeny vstupují do transformátoru
- Model predikuje další token
- Ten token se připojí
- Proces se opakuje
Toto pokračuje, dokud:
- se neobjeví stop token
- není dosaženo limitu tokenů
- systém nepřeruší generaci
To znamená, že generace AI je v zásadě cyklus predikce tokenů, nikoliv dedukce na úrovni vět.
Závěrečné shrnutí
Tokenizace vypadá jako malý technický detail, ale formuje téměř vše v moderních LLM systémech.
Ovlivňuje:
- náklady
- rychlost
- limity kontextu
- vícejazyčnou výkonnost
- chování modelu
- kvalitu výstupu
Pokud stavíte s AI, pochopení tokenizace vám dává mnohem lepší intuici pro to, proč se systémy chovají tak, jak se chovají.
Než existují embeddings, transformátory nebo výstupy, existují tokeny.
A všechno začíná tam.
Pečlivé navrhování dotazů, volby slovní zásoby a rozpočtování tokenů pomáhají zajistit, že vaše používání tokenů a počty tokenů odpovídají vašim nákladovým a kvalitativním cílům. Výsledkem jsou méně neočekávané dokončení, nižší náklady na API a modely, které lépe rozumí způsobu, jakým vaši uživatelé píší.




