Tokenizácia vysvetlená: Od Tokenov po Výstupy
Autor: Wendy Frey
Predtým, než môže veľký jazykový model generovať niečo užitočné, musí najprv vykonať niečo oveľa jednoduchšie: roztrhnúť váš text na kusy.
Ten proces sa nazýva tokenizácia, a je to jedna z najdôležitejších, a najčastejšie prehliadaných, súčastí toho, ako moderné AI systémy fungujú.
Väčšina ľudí si myslí, že modely čítajú slová. Nečítajú.
Čítajú tokeny: malé úseky textu, ktoré môžu predstavovať celé slová, časti slov, interpunkciu, medzery alebo dokonca jednotlivé symboly. Tieto tokeny sú následne prevedené na číselné ID, ktoré model môže spracovávať interne.
Pochopenie tokenizácie pomáha vysvetliť veľa vecí:
- prečo sú požiadavky spojené s nákladmi
- prečo majú kontextové okná obmedzenia
- prečo sú niektoré jazyky drahšie ako iné
- prečo sa modely niekedy správajú zvláštne
Tokenizácia sedí na úplnom začiatku AI pipeline, a potichu formuje všetko, čo prichádza po nej.
Čo je token?
Token je najmenšia jednotka textu, s ktorou model pracuje.
Nemože to byť vždy to isté ako slovo.
Napríklad:
| Text | Možné rozdelenie tokenov |
|---|---|
| hello | hello |
| tokenizácia | token + izácia |
| neuveriteľné | ne + uver +iteľné |
| 2026! | 202 + 6 +! |
To je dôležité, pretože modely počítajú tokeny, nie slová.
Krátka veta môže použiť viac tokenov ako sa očakávalo, najmä s nezvyčajnými slovami, kódmi, emoji alebo neanglickými jazykmi.
Ako funguje tokenizácia
Na vysokej úrovni, tokenizácia sleduje jednoduchú pipeline.
Krok 1: Rozdelenie textu
Tokenizer rozdeľuje surový text na kusy na základe svojich pravidiel slovníka.
Moderné LLM obvykle spoliehajú na subslovnú tokenizáciu, nie na plnú slovenú tokenizáciu.
To im dáva flexibilitu pri spracovaní:
- nezvyčajných slov
- preklepov
- mien
- viacjazyčných vstupov
- kódu
Krok 2: Prevod tokenov na ID
Každý token sa mapuje na číslo vo vnútri slovníka modelu.
Príklad:
| Token | Token ID |
|---|---|
| The | 791 |
| model | 4382 |
| works | 2921 |
Model nikdy „nevidí“ text priamo. Vidí iba tieto numerické reprezentácie.
To je most medzi ľudským jazykom a neurálnym spracovaním.
Krok 3: Prevod ID na embeddings
Akonáhle sú token ID vytvorené, sú transformované na vektorové embeddings.
Tu sa začína objavovať význam.
V tejto fáze:
- podobné tokeny môžu obsadzovať blízke pozície vo vektorovom priestore
- vzťahy medzi konceptmi sa stávajú merateľnými
- kontext začína byť dôležitý
Tokenizácia dostáva dáta do systému. Embeddings robia dáta zrozumiteľnými.
Prečo sa subslovná tokenizácia stala štandarde
Staršie NLP systémy často rozdeľovali text podľa slov.
To fungovalo, až kým nenarazili na slová, ktoré nikdy predtým nevideli.
Moderné LLM obvykle používajú metódy ako Byte Pair Encoding (BPE) alebo podobné subslovné stratégie.
BPE funguje tak, že opakovane spája časté vzory znakov do znovu použiteľných jednotiek. To zlepšuje kompresiu a efektivitu slovníka.
Prečo sú subslovné modely lepšie
| Metóda | Hlavný problém |
|---|---|
| Úroveň slova | Príliš veľa neznámych slov |
| Úroveň znaku | Príliš pomalé, príliš dlhé |
| Úroveň subslova | Najlepšia rovnováha flexibility a efektivity |
To je dôvod, prečo väčšina moderných modelov používa nejakú verziu subslovnej tokenizácie.
Prečo tokenizácia ovplyvňuje náklady
Tu sa tokenizácia stáva praktickou.
Väčšina AI API účtuje na základe:
- vstupných tokenov
- výstupných tokenov
To znamená, že tokenizácia priamo ovplyvňuje cenu.
Príklad:
| Typ vstupu | Približná hustota tokenov |
|---|---|
| Jednoduchá angličtina | Nízka |
| Kód | Stredne-vysoká |
| Právny text | Vysoký |
| Čínsky/Japonský | Často vyšší |
| Text bohatý na emoji | Prekvapivo vysoký |
Dve požiadavky s rovnakým počtom znakov môžu mať veľmi rôznu počet tokenov.
To je jeden z najbežnejších skrytých faktorov nákladov v produkčných AI systémoch.
Prečo tokenizácia ovplyvňuje správanie modelu
Tokenizácia tiež vysvetľuje mnohé „zvláštne“ správanie modelu.
Napríklad:
- prečo modely bojujú s počítaním písmen
- prečo sa nezvyčajné slová správajú nepredvídateľne
- prečo môžu zmeny formátovania ovplyvniť výstupy
- prečo záleží na poradí požiadaviek
Model nemyslí v písmenách alebo gramatike tak, ako to robia ľudia. Predpovedá sekvencie tokenov.
Tento rozdiel vytvára mnohé osobitosti, ktoré používatelia spoznajú.
Diskusie v komunitách často poukazujú na štruktúru tokenov ako na jeden z dôvodov, prečo modely zlyhávajú pri uvažovaní na úrovni písmen.
Tokeny sa stávajú výstupmi
Akonáhle je vstup tokenizovaný:
- Tokeny idú do transformátora
- Model predpovedá ďalší token
- Ten token sa pridá
- Proces sa opakuje
To pokračuje, kým:
- sa objaví stop token
- sa dosiahne limit tokenov
- systém preruší generáciu
To znamená, že AI generácia je v zásade cyklus predpovedania token po tokene, nie uvažovanie na úrovni viet.
Záverečné zhrnutie
Tokenizácia vyzerá ako malý technický detail, ale formuje takmer všetko v moderných LLM systémoch.
Ovlplyvňuje:
- náklady
- rýchlosť
- limity kontextu
- viacjazyčný výkon
- správanie modelu
- kvalitu výstupu
Ak budujete s AI, pochopenie tokenizácie vám dáva omnoho lepšiu intuíciu o tom, prečo sa systémy správajú tak, ako sa správajú.
Predtým, ako vzniknú embeddings, transformátory alebo výstupy, existujú tokeny.
A všetko začína tam.
Starostlivé navrhovanie požiadaviek, voľby slovníka a rozpočet na tokeny pomáhajú zabezpečiť, že vaše využitie tokenov a počty tokenov sú v súlade s vašimi cieľmi nákladov a kvality. Výsledkom sú menej neočakávané dokončenia, nižšie náklady na API a modely, ktoré lepšie rozumejú spôsobu, akým vaši používatelia píšu.




