Objašnjenje tokenizacije: Od tokena do izlaza
Аутор: Wendy Frey
Pre nego što veliki jezički model može da generiše bilo šta korisno, prvo mora da uradi nešto mnogo jednostavnije: da razbije vaš tekst.
Taj proces se zove tokenizacija, i to je jedan od najvažnijih, i najviše zanemarenih, delova načina na koji moderni AI sistemi funkcionišu.
Većina ljudi misli da modeli čitaju reči. Oni to ne rade.
Oni čitaju tokene: male delove teksta koji mogu predstavljati pune reči, delove reči, interpunkciju, razmake, ili čak pojedinačne simbole. Ti tokene se zatim pretvaraju u numeričke ID-ove koje model može interno procesuirati.
Razumevanje tokenizacije pomaže da se objasni mnogo stvari:
- zašto upiti koštaju novac
- zašto kontekstualni prozori imaju ograničenja
- zašto su neki jezici skuplji od drugih
- zašto se modeli ponekad ponašaju na čudan način
Tokenizacija se nalazi na samom početku AI procesa, i tiho oblikuje sve što dolazi posle.
Šta je token?
Token je najmanja jedinica teksta sa kojom model radi.
On nije uvek isto što i reč.
Na primer:
| Tekst | Moguće podela tokena |
|---|---|
| hello | hello |
| tokenization | token + ization |
| unbelievable | un + believ + able |
| 2026! | 202 + 6 +! |
Ovo je važno jer modeli broje tokene, a ne reči.
Kratka rečenica može upotrebljavati više tokena nego što se očekuje, posebno sa neobičnim rečima, kodom, emoji-jem, ili jezicima koji nisu engleski.
Kako funkcioniše tokenizacija
Na visokom nivou, tokenizacija sledi jednostavan proces.
Korak 1: Podeli tekst
Tokenizator razbija sirovi tekst na delove prema pravilima svog rečnika.
Moderni LLM-ovi obično se oslanjaju na tokenizaciju podreči, a ne na tokenizaciju punih reči.
Ovo im daje fleksibilnost da obrade:
- retke reči
- greške u kucanju
- imena
- višejezički unos
- kod
Korak 2: Pretvori tokene u ID-ove
Svaki token se mapira na broj unutar rečnika modela.
Primer:
| Token | Token ID |
|---|---|
| The | 791 |
| model | 4382 |
| works | 2921 |
Model nikada ne „vidi“ tekst direktno. On samo vidi ove numeričke reprezentacije.
To je most između ljudskog jezika i neuronske obrade.
Korak 3: Pretvori ID-ove u vektorske reprezentacije
Nakon što su ID-ovi tokena kreirani, oni se transformišu u vektorske reprezentacije.
Ovde počinje da se pojavljuje značenje.
U ovom trenutku:
- slični tokeni mogu zauzimati bliske pozicije u vektorskom prostoru
- odnosi između koncepta postaju merljivi
- kontekst počinje da ima značaj
Tokenizacija dovodi podatke u sistem. Vektorske reprezentacije ih čine razumljivim.
Zašto je tokenizacija podreči postala standard
Stariji NLP sistemi često dele tekst po rečima.
To je funkcionisalo, dok nisu naleteli na reči koje nikada nisu videle pre.
Moderni LLM-ovi obično koriste metode kao što su Byte Pair Encoding (BPE) ili slične strategije podreči.
BPE funkcioniše tako što ponovo spaja učestale obrazce karaktera u ponovo upotrebljive jedinice. Ovo poboljšava kompresiju i efikasnost rečnika.
Zašto su modeli podreči bolji
| Metod | Glavni problem |
|---|---|
| Po rečima | Previše nepoznatih reči |
| Po karakterima | Previše sporo, predugo |
| Po podrečima | Najbolja ravnoteža fleksibilnosti i efikasnosti |
To je razlog zašto većina modernih modela koristi neku verziju tokenizacije podreči.
Zašto tokenizacija utiče na troškove
Ovo je mesto gde tokenizacija postaje praktična.
Većina AI API-ja naplaćuje na osnovu:
- ulaznih tokena
- izlaznih tokena
To znači da tokenizacija direktno utiče na cenu.
Na primer:
| Tip unosa | Približna gustina tokena |
|---|---|
| Jednostavni engleski | Niska |
| Kod | Srednja, visoka |
| Pravna tekst | Visoka |
| Kineski/Japanski | Često viša |
| Tekst bogat emoji-jem | Iznenađujuće visoka |
Dva upita sa istim brojem karaktera mogu imati vrlo različit broj tokena.
Ovo je jedan od najčešćih skrivenih uzroka troškova u produkcionim AI sistemima.
Zašto tokenizacija utiče na ponašanje modela
Tokenizacija takođe objašnjava mnoge „čudne“ ponašanja modela.
Na primer:
- zašto modeli imaju problema sa brojanjem slova
- zašto neobične reči nepredvidivo reaguju
- zašto promene u formatu mogu uticati na izlaze
- zašto redosled upita ima značaj
Model ne razmišlja o slovima ili gramatici na način na koji to čine ljudi. On predviđa sekvence tokena.
Ta razlika stvara mnoge neobičnosti koje korisnici primećuju.
Diskusije u zajednici često ukazuju na strukturu tokena kao jedan od razloga zašto modeli ne uspevaju u razmišljanju na znakovnom nivou.
Tokene postaju izlazi
Kada je ulaz tokenizovan:
- Tokene idu u transformator
- Model predviđa sledeći token
- Taj token se dodaje
- Proces se ponavlja
Ovo se nastavlja dok ne:
- se pojavi stop token
- se dostigne limit tokena
- sistem prekine generaciju
To znači da generacija AI suštinski predstavlja petlju predikcije tokena, a ne razmišljanje na nivou rečenica.
Konačna poruka
Tokenizacija izgleda kao mali tehnički detalj, ali oblikuje gotovo sve u modernim LLM sistemima.
Ona utiče na:
- troškove
- brzinu
- ograničenja konteksta
- višejezičke performanse
- ponašanje modela
- kvalitet izlaza
Ako gradite sa AI, razumevanje tokenizacije daje vam mnogo bolju intuiciju o tome zašto sistemi funkcionišu onako kako to čine.
Pre nego što postoje reprezentacije, transformatori, ili izlazi, postoje tokeni.
I sve počinje tu.
Pažljivo dizajniranje upita, izbor rečnika i planiranje tokena pomažu da se osigura da vaša upotreba tokena i brojevi tokena budu u skladu sa vašim ciljevima troškova i kvaliteta. Isplata je manje neočekivanih završetaka, niži API troškovi, i modeli koji bolje razumeju način na koji vaši korisnici pišu.




