Objašnjenje tokenizacije: Od tokena do izlaza

Blog

Аутор: Wendy Frey

26702eff-dbff-43b4-a5fb-fb97eab89247-1200x600.webp Pre nego što veliki jezički model može da generiše bilo šta korisno, prvo mora da uradi nešto mnogo jednostavnije: da razbije vaš tekst.

Taj proces se zove tokenizacija, i to je jedan od najvažnijih, i najviše zanemarenih, delova načina na koji moderni AI sistemi funkcionišu.

Većina ljudi misli da modeli čitaju reči. Oni to ne rade.

Oni čitaju tokene: male delove teksta koji mogu predstavljati pune reči, delove reči, interpunkciju, razmake, ili čak pojedinačne simbole. Ti tokene se zatim pretvaraju u numeričke ID-ove koje model može interno procesuirati.

Razumevanje tokenizacije pomaže da se objasni mnogo stvari:

  • zašto upiti koštaju novac
  • zašto kontekstualni prozori imaju ograničenja
  • zašto su neki jezici skuplji od drugih
  • zašto se modeli ponekad ponašaju na čudan način

Tokenizacija se nalazi na samom početku AI procesa, i tiho oblikuje sve što dolazi posle.

Šta je token?

Token je najmanja jedinica teksta sa kojom model radi.

On nije uvek isto što i reč.

Na primer:

TekstMoguće podela tokena
hellohello
tokenizationtoken + ization
unbelievableun + believ + able
2026!202 + 6 +!

Ovo je važno jer modeli broje tokene, a ne reči.

Kratka rečenica može upotrebljavati više tokena nego što se očekuje, posebno sa neobičnim rečima, kodom, emoji-jem, ili jezicima koji nisu engleski.

Kako funkcioniše tokenizacija

Na visokom nivou, tokenizacija sledi jednostavan proces.

Korak 1: Podeli tekst

Tokenizator razbija sirovi tekst na delove prema pravilima svog rečnika.

Moderni LLM-ovi obično se oslanjaju na tokenizaciju podreči, a ne na tokenizaciju punih reči.

Ovo im daje fleksibilnost da obrade:

  • retke reči
  • greške u kucanju
  • imena
  • višejezički unos
  • kod

Korak 2: Pretvori tokene u ID-ove

Svaki token se mapira na broj unutar rečnika modela.

Primer:

TokenToken ID
The791
model4382
works2921

Model nikada ne „vidi“ tekst direktno. On samo vidi ove numeričke reprezentacije.

To je most između ljudskog jezika i neuronske obrade.

Korak 3: Pretvori ID-ove u vektorske reprezentacije

Nakon što su ID-ovi tokena kreirani, oni se transformišu u vektorske reprezentacije.

Ovde počinje da se pojavljuje značenje.

U ovom trenutku:

  • slični tokeni mogu zauzimati bliske pozicije u vektorskom prostoru
  • odnosi između koncepta postaju merljivi
  • kontekst počinje da ima značaj

Tokenizacija dovodi podatke u sistem. Vektorske reprezentacije ih čine razumljivim.

Zašto je tokenizacija podreči postala standard

Stariji NLP sistemi često dele tekst po rečima.

To je funkcionisalo, dok nisu naleteli na reči koje nikada nisu videle pre.

Moderni LLM-ovi obično koriste metode kao što su Byte Pair Encoding (BPE) ili slične strategije podreči.

BPE funkcioniše tako što ponovo spaja učestale obrazce karaktera u ponovo upotrebljive jedinice. Ovo poboljšava kompresiju i efikasnost rečnika.

Zašto su modeli podreči bolji

MetodGlavni problem
Po rečimaPreviše nepoznatih reči
Po karakterimaPreviše sporo, predugo
Po podrečimaNajbolja ravnoteža fleksibilnosti i efikasnosti

To je razlog zašto većina modernih modela koristi neku verziju tokenizacije podreči.

Zašto tokenizacija utiče na troškove

Ovo je mesto gde tokenizacija postaje praktična.

Većina AI API-ja naplaćuje na osnovu:

  • ulaznih tokena
  • izlaznih tokena

To znači da tokenizacija direktno utiče na cenu.

Na primer:

Tip unosaPribližna gustina tokena
Jednostavni engleskiNiska
KodSrednja, visoka
Pravna tekstVisoka
Kineski/JapanskiČesto viša
Tekst bogat emoji-jemIznenađujuće visoka

Dva upita sa istim brojem karaktera mogu imati vrlo različit broj tokena.

Ovo je jedan od najčešćih skrivenih uzroka troškova u produkcionim AI sistemima.

Zašto tokenizacija utiče na ponašanje modela

Tokenizacija takođe objašnjava mnoge „čudne“ ponašanja modela.

Na primer:

  • zašto modeli imaju problema sa brojanjem slova
  • zašto neobične reči nepredvidivo reaguju
  • zašto promene u formatu mogu uticati na izlaze
  • zašto redosled upita ima značaj

Model ne razmišlja o slovima ili gramatici na način na koji to čine ljudi. On predviđa sekvence tokena.

Ta razlika stvara mnoge neobičnosti koje korisnici primećuju.

Diskusije u zajednici često ukazuju na strukturu tokena kao jedan od razloga zašto modeli ne uspevaju u razmišljanju na znakovnom nivou.

Tokene postaju izlazi

Kada je ulaz tokenizovan:

  1. Tokene idu u transformator
  2. Model predviđa sledeći token
  3. Taj token se dodaje
  4. Proces se ponavlja

Ovo se nastavlja dok ne:

  • se pojavi stop token
  • se dostigne limit tokena
  • sistem prekine generaciju

To znači da generacija AI suštinski predstavlja petlju predikcije tokena, a ne razmišljanje na nivou rečenica.

Konačna poruka

Tokenizacija izgleda kao mali tehnički detalj, ali oblikuje gotovo sve u modernim LLM sistemima.

Ona utiče na:

  • troškove
  • brzinu
  • ograničenja konteksta
  • višejezičke performanse
  • ponašanje modela
  • kvalitet izlaza

Ako gradite sa AI, razumevanje tokenizacije daje vam mnogo bolju intuiciju o tome zašto sistemi funkcionišu onako kako to čine.

Pre nego što postoje reprezentacije, transformatori, ili izlazi, postoje tokeni.

I sve počinje tu.

Pažljivo dizajniranje upita, izbor rečnika i planiranje tokena pomažu da se osigura da vaša upotreba tokena i brojevi tokena budu u skladu sa vašim ciljevima troškova i kvaliteta. Isplata je manje neočekivanih završetaka, niži API troškovi, i modeli koji bolje razumeju način na koji vaši korisnici pišu.

Вирусни шаблони

Истражи наше вирусне AI шаблоне и примени их на своје фотографије.

Истражи шаблоне