Objašnjenje tokenizacije: Od tokena do izlaza
Autor: Wendy Frey
Prije nego što veliki jezični model može generirati nešto korisno, prvo mora učiniti nešto mnogo jednostavnije: razbiti vaš tekst.
Taj proces se naziva tokenizacija, i to je jedan od najvažnijih, i najčešće zanemarenih, dijelova načina na koji moderni AI sustavi rade.
Većina ljudi misli da modeli čitaju riječi. Ne čitaju.
Oni čitaju tokene: male dijelove teksta koji mogu predstavljati cijele riječi, dijelove riječi, interpunkciju, razmake ili čak pojedinačne simbole. Ti se tokeni zatim pretvaraju u numeričke identifikatore koje model može obraditi interno.
Razumijevanje tokenizacije pomaže objasniti mnogo toga:
- zašto ispisi koštaju novac
- zašto kontekstni prozori imaju ograničenja
- zašto su neki jezici skuplji od drugih
- zašto se modeli ponekad ponašaju na čudne načine
Tokenizacija se nalazi na samom početku AI procesa, i tiho oblikuje sve što dolazi nakon.
Što je token?
a token je najmanja jedinica teksta s kojom model radi.
To nije uvijek isto što i riječ.
Na primjer:
| Tekst | Moguće podjele tokena |
|---|---|
| hello | hello |
| tokenizacija | token + izacija |
| nevjerojatno | ne + vjer + atno |
| 2026! | 202 + 6 +! |
To je važno jer modeli broje tokene, a ne riječi.
Kratka rečenica može koristiti više tokena nego što se očekuje, posebno s neobičnim riječima, kodom, emotikonima ili neengleskim jezicima.
Kako tokenizacija funkcionira
Na visokom nivou, tokenizacija slijedi jednostavnu liniju.
Korak 1: Podijelite tekst
Tokenizator razbija sirovi tekst u komade na temelju svojih pravila vokabulara.
Moderni LLM-ovi obično se oslanjaju na tokenizaciju podriječi, a ne na punu tokenizaciju riječi.
To im daje fleksibilnost da se nose s:
- rijetkim riječima
- tipfelers
- imenima
- višejezičnim unosom
- kodom
Korak 2: Pretvorite tokene u ID-eve
Svaki token je povezan s brojem unutar vokabulara modela.
Primjer:
| Token | ID tokena |
|---|---|
| The | 791 |
| model | 4382 |
| works | 2921 |
Model nikada ne „vidi“ tekst izravno. Vidite samo te numeričke reprezentacije.
To je most između ljudskog jezika i neuronske računice.
Korak 3: Pretvorite ID-eve u ugradnje
Nakon što su ID-evi tokena stvoreni, pretvaraju se u vektorske ugrađivanja.
Tu počinje nastajati značenje.
U ovoj fazi:
- slični tokeni mogu zauzimati susjedne pozicije u vektorskom prostoru
- odnosi između koncepta postaju mjerljivi
- kontekst počinje biti važan
Tokenizacija unosi podatke u sustav. Ugradnje ih čine razumljivima.
Zašto je tokenizacija podriječi postala standard
Stariji NLP sustavi često su dijelili tekst prema riječima.
To je funkcioniralo, sve dok nisu naišli na riječi koje nikada nisu vidjeli prije.
Moderni LLM-ovi obično koriste metode poput Byte Pair Encoding (BPE) ili slične strategije podriječi.
BPE djeluje tako da neprekidno spaja česte uzorke znakova u ponovno upotrebljive jedinice. To poboljšava kompresiju i učinkovitost vokabulara.
Zašto su modeli podriječi bolji
| Metoda | Glavni problem |
|---|---|
| Riječna | Previše nepoznatih riječi |
| Karakterna | Previše sporo, predugo |
| Podriječna | Najbolja ravnoteža fleksibilnosti i učinkovitosti |
Zato većina modernih modela koristi neku verziju tokenizacije podriječi.
Zašto tokenizacija utječe na troškove
Tu tokenizacija postaje praktična.
Većina AI API-ja naplaćuje na temelju:
- ulaznih tokena
- izlaznih tokena
To znači da tokenizacija izravno utječe na cijenu.
Na primjer:
| Vrsta unosa | Približna gustoća tokena |
|---|---|
| Jednostavni engleski | Niska |
| Kod | Srednja, visoka |
| Pravni tekst | Visoka |
| Kineski/Japanski | Često viša |
| Tekst bogat emotikonima | Iznenađujuće visoka |
Dva ispisa s istim brojem znakova mogu imati vrlo različit broj tokena.
Ovo je jedan od najčešćih skrivenih troškova u proizvodnim AI sustavima.
Zašto tokenizacija utječe na ponašanje modela
Tokenizacija također objašnjava mnoge „čudne“ ponašanje modela.
Na primjer:
- zašto se modeli bore s brojanjem slova
- zašto rijetke riječi ponašaju nepredvidivo
- zašto promjene u formatu mogu utjecati na izlaze
- zašto redoslijed ispisa ima značaj
Model ne razmišlja u slovima ili gramatici na način na koji ljudi rade. Predviđa sekvence tokena.
Ta razlika stvara mnoge karakteristike koje korisnici primjećuju.
Rasprave u zajednici često ukazuju na strukturu tokena kao jedan od razloga zašto modeli ne uspijevaju u rezonovanju na razini znakova.
Tokeni postaju izlazi
Jednom kada je unos tokeniziran:
- Tokeni idu u transformator
- Model predviđa sljedeći token
- Taj token se pridodaje
- Proces se ponavlja
To se nastavlja dok ne:
- se pojavi stop token
- se dostigne limit tokena
- sustav prekine generiranje
To znači da je generacija AI u osnovi petlja predikcije po tokenu, a ne rezoniranje na razini rečenice.
Konačna poruka
Tokenizacija izgleda kao mala tehnička pojedinost, ali oblikuje gotovo sve u modernim LLM sustavima.
Utječe na:
- troškove
- brzinu
- ograničenja konteksta
- višejezičnu učinkovitost
- ponašanje modela
- kvalitetu izlaza
Ako gradite s AI-jem, razumijevanje tokenizacije daje vam puno bolju intuiciju zašto se sustavi ponašaju onako kako se ponašaju.
Prije nego što postoje ugradnje, transformatori ili izlazi, postoje tokeni.
I sve počinje tamo.
Pažljivo dizajniranje ispisa, odabir vokabulara i proračun tokena pomažu osigurati da vaša upotreba tokena i brojevi tokena budu u skladu s vašim ciljevima troškova i kvalitete. Odsjek su manji neočekivani dovršeci, niži troškovi API-ja i modeli koji bolje razumiju način na koji vaši korisnici pišu.




