Objašnjenje tokenizacije: Od tokena do izlaza

Blog

Autor: Wendy Frey

26702eff-dbff-43b4-a5fb-fb97eab89247-1200x600.webp Prije nego što veliki jezični model može generirati nešto korisno, prvo mora učiniti nešto mnogo jednostavnije: razbiti vaš tekst.

Taj proces se naziva tokenizacija, i to je jedan od najvažnijih, i najčešće zanemarenih, dijelova načina na koji moderni AI sustavi rade.

Većina ljudi misli da modeli čitaju riječi. Ne čitaju.

Oni čitaju tokene: male dijelove teksta koji mogu predstavljati cijele riječi, dijelove riječi, interpunkciju, razmake ili čak pojedinačne simbole. Ti se tokeni zatim pretvaraju u numeričke identifikatore koje model može obraditi interno.

Razumijevanje tokenizacije pomaže objasniti mnogo toga:

  • zašto ispisi koštaju novac
  • zašto kontekstni prozori imaju ograničenja
  • zašto su neki jezici skuplji od drugih
  • zašto se modeli ponekad ponašaju na čudne načine

Tokenizacija se nalazi na samom početku AI procesa, i tiho oblikuje sve što dolazi nakon.

Što je token?

a token je najmanja jedinica teksta s kojom model radi.

To nije uvijek isto što i riječ.

Na primjer:

TekstMoguće podjele tokena
hellohello
tokenizacijatoken + izacija
nevjerojatnone + vjer + atno
2026!202 + 6 +!

To je važno jer modeli broje tokene, a ne riječi.

Kratka rečenica može koristiti više tokena nego što se očekuje, posebno s neobičnim riječima, kodom, emotikonima ili neengleskim jezicima.

Kako tokenizacija funkcionira

Na visokom nivou, tokenizacija slijedi jednostavnu liniju.

Korak 1: Podijelite tekst

Tokenizator razbija sirovi tekst u komade na temelju svojih pravila vokabulara.

Moderni LLM-ovi obično se oslanjaju na tokenizaciju podriječi, a ne na punu tokenizaciju riječi.

To im daje fleksibilnost da se nose s:

  • rijetkim riječima
  • tipfelers
  • imenima
  • višejezičnim unosom
  • kodom

Korak 2: Pretvorite tokene u ID-eve

Svaki token je povezan s brojem unutar vokabulara modela.

Primjer:

TokenID tokena
The791
model4382
works2921

Model nikada ne „vidi“ tekst izravno. Vidite samo te numeričke reprezentacije.

To je most između ljudskog jezika i neuronske računice.

Korak 3: Pretvorite ID-eve u ugradnje

Nakon što su ID-evi tokena stvoreni, pretvaraju se u vektorske ugrađivanja.

Tu počinje nastajati značenje.

U ovoj fazi:

  • slični tokeni mogu zauzimati susjedne pozicije u vektorskom prostoru
  • odnosi između koncepta postaju mjerljivi
  • kontekst počinje biti važan

Tokenizacija unosi podatke u sustav. Ugradnje ih čine razumljivima.

Zašto je tokenizacija podriječi postala standard

Stariji NLP sustavi često su dijelili tekst prema riječima.

To je funkcioniralo, sve dok nisu naišli na riječi koje nikada nisu vidjeli prije.

Moderni LLM-ovi obično koriste metode poput Byte Pair Encoding (BPE) ili slične strategije podriječi.

BPE djeluje tako da neprekidno spaja česte uzorke znakova u ponovno upotrebljive jedinice. To poboljšava kompresiju i učinkovitost vokabulara.

Zašto su modeli podriječi bolji

MetodaGlavni problem
RiječnaPreviše nepoznatih riječi
KarakternaPreviše sporo, predugo
PodriječnaNajbolja ravnoteža fleksibilnosti i učinkovitosti

Zato većina modernih modela koristi neku verziju tokenizacije podriječi.

Zašto tokenizacija utječe na troškove

Tu tokenizacija postaje praktična.

Većina AI API-ja naplaćuje na temelju:

  • ulaznih tokena
  • izlaznih tokena

To znači da tokenizacija izravno utječe na cijenu.

Na primjer:

Vrsta unosaPribližna gustoća tokena
Jednostavni engleskiNiska
KodSrednja, visoka
Pravni tekstVisoka
Kineski/JapanskiČesto viša
Tekst bogat emotikonimaIznenađujuće visoka

Dva ispisa s istim brojem znakova mogu imati vrlo različit broj tokena.

Ovo je jedan od najčešćih skrivenih troškova u proizvodnim AI sustavima.

Zašto tokenizacija utječe na ponašanje modela

Tokenizacija također objašnjava mnoge „čudne“ ponašanje modela.

Na primjer:

  • zašto se modeli bore s brojanjem slova
  • zašto rijetke riječi ponašaju nepredvidivo
  • zašto promjene u formatu mogu utjecati na izlaze
  • zašto redoslijed ispisa ima značaj

Model ne razmišlja u slovima ili gramatici na način na koji ljudi rade. Predviđa sekvence tokena.

Ta razlika stvara mnoge karakteristike koje korisnici primjećuju.

Rasprave u zajednici često ukazuju na strukturu tokena kao jedan od razloga zašto modeli ne uspijevaju u rezonovanju na razini znakova.

Tokeni postaju izlazi

Jednom kada je unos tokeniziran:

  1. Tokeni idu u transformator
  2. Model predviđa sljedeći token
  3. Taj token se pridodaje
  4. Proces se ponavlja

To se nastavlja dok ne:

  • se pojavi stop token
  • se dostigne limit tokena
  • sustav prekine generiranje

To znači da je generacija AI u osnovi petlja predikcije po tokenu, a ne rezoniranje na razini rečenice.

Konačna poruka

Tokenizacija izgleda kao mala tehnička pojedinost, ali oblikuje gotovo sve u modernim LLM sustavima.

Utječe na:

  • troškove
  • brzinu
  • ograničenja konteksta
  • višejezičnu učinkovitost
  • ponašanje modela
  • kvalitetu izlaza

Ako gradite s AI-jem, razumijevanje tokenizacije daje vam puno bolju intuiciju zašto se sustavi ponašaju onako kako se ponašaju.

Prije nego što postoje ugradnje, transformatori ili izlazi, postoje tokeni.

I sve počinje tamo.

Pažljivo dizajniranje ispisa, odabir vokabulara i proračun tokena pomažu osigurati da vaša upotreba tokena i brojevi tokena budu u skladu s vašim ciljevima troškova i kvalitete. Odsjek su manji neočekivani dovršeci, niži troškovi API-ja i modeli koji bolje razumiju način na koji vaši korisnici pišu.

Virusni predlošci

Istraži naše virusne AI predloške i primijeni ih na svoje fotografije.

Istraži predloške