Pagpapaliwanag sa Tokenization: Mula sa Mga Token hanggang sa Mga Output
Ni Wendy Frey
Bago makagawa ang isang malaking modelo ng wika ng anumang kapaki-pakinabang, kailangan muna nitong gawin ang isang mas simpleng bagay: hatiin ang iyong teksto.
Ang proseso na ito ay tinatawag na tokenization, at isa ito sa pinakamahalaga, at pinakamadalas na hindi napapansin, na bahagi kung paano gumagana ang mga modernong sistema ng AI.
Karamihan sa mga tao ay iniisip na ang mga modelo ay nagbabasa ng mga salita. Hindi sila.
Nagbabasa sila ng mga token: maliliit na bahagi ng teksto na maaaring kumatawan sa buong mga salita, bahagi ng mga salita, bantas, espasyo, o kahit mga indibidwal na simbolo. Ang mga token na ito ay pagkatapos ay kinoconvert sa mga numerikal na ID na maaaring iproseso ng modelo sa loob.
Ang pag-unawa sa tokenization ay nakakatulong upang ipaliwanag ang maraming bagay:
- bakit may bayad ang mga prompt
- bakit may mga limitasyon ang mga context window
- bakit ang ilang wika ay mas mahal kaysa sa iba
- bakit minsang kumikilos ang mga modelo sa kakaibang paraan
Ang tokenization ay nakaupo sa pinakasimula ng AI pipeline, at tahimik nitong hinuhubog ang lahat ng sumusunod.
Ano ang token?
Ang token ay ang pinakamaliit na yunit ng teksto na ginagamit ng modelo.
Ito ay hindi palaging pareho sa isang salita.
Halimbawa:
| Teksto | Posibleng paghahati ng token |
|---|---|
| hello | hello |
| tokenization | token + ization |
| unbelievable | un + believ + able |
| 2026! | 202 + 6 +! |
Mahalaga ito dahil ang mga modelo ay nagbibilang ng mga token, hindi mga salita.
Ang isang maikling pangungusap ay maaaring gumamit ng mas maraming token kaysa sa inaasahan, lalo na sa mga hindi pangkaraniwang salita, code, emoji, o mga di-Ingles na wika.
Paano gumagana ang tokenization
Sa mataas na antas, ang tokenization ay sumusunod sa isang simpleng pipeline.
Hakbang 1: Hatiin ang teksto
Ang tokenizer ay naghahati ng raw text sa mga piraso batay sa mga patakaran ng bokabularyo nito.
Ang mga makabagong LLM ay karaniwang umaasa sa subword tokenization, hindi buong-salitang tokenization.
Ito ay nagbibigay sa kanila ng kakayahang hawakan ang:
- mga bihirang salita
- mga typographical errors
- mga pangalan
- multilinggwal na input
- code
Hakbang 2: I-convert ang mga token sa mga ID
Bawat token ay tumutugma sa isang numero sa loob ng bokabularyo ng modelo.
Halimbawa:
| Token | Token ID |
|---|---|
| The | 791 |
| model | 4382 |
| works | 2921 |
Hindi kailanman “nakikita” ng modelo ang teksto nang direkta. Nakikita lamang nito ang mga numerikal na representasyon na ito.
Iyon ang tulay sa pagitan ng wika ng tao at neural computation.
Hakbang 3: I-convert ang mga ID sa embeddings
Matapos malikha ang mga token ID, sila ay binabago sa vector embeddings.
Dito nagsisimula ang pagbuo ng kahulugan.
Sa puntong ito:
- ang mga katulad na token ay maaaring tum occupy ng mga kalapit na posisyon sa vector space
- ang mga relasyon sa pagitan ng mga konsepto ay nagiging nasusukat
- nagsisimulang maging mahalaga ang konteksto
Ang tokenization ay nagdadala ng data sa sistema. Ang embeddings ay ginagawang maaaring maunawaan.
Bakit naging pamantayan ang subword tokenization
Ang mga mas matatandang sistema ng NLP ay madalas na naghahati ng teksto batay sa mga salita.
Umubra ito, hanggang sa nakatagpo sila ng mga salitang hindi pa nila nakita.
Ang mga modernong LLM ay karaniwang gumagamit ng mga pamamaraan tulad ng Byte Pair Encoding (BPE) o katulad na mga subword strategies.
Ang BPE ay gumagana sa pamamagitan ng paulit-ulit na pagsasama ng mga madalas na pattern ng karakter sa mga magagamit na yunit. Ito ay nagpapabuti sa compression at kahusayan ng bokabularyo.
Bakit mas mabuti ang mga subword model
| Pamamaraan | Pangunahing problema |
|---|---|
| Word-level | Sobrang daming hindi kilalang salita |
| Character-level | Napakabagal, napakatagal |
| Subword-level | Pinakamagandang balanse ng kakayahang umangkop at kahusayan |
Ito ang dahilan kung bakit karamihan sa mga modernong modelo ay gumagamit ng ilang bersyon ng subword tokenization.
Bakit nakakaapekto ang tokenization sa gastos
Dito nagiging praktikal ang tokenization.
Karamihan sa mga API ng AI ay naniningil batay sa:
- mga input token
- mga output token
Ibig sabihin, ang tokenization ay direktang nakakaapekto sa presyo.
Halimbawa:
| Uri ng Input | Tinatayang densidad ng token |
|---|---|
| Simpleng Ingles | Mababa |
| Code | Katamtaman, mataas |
| Legal na teksto | Mataas |
| Tsino/Hapones | Madalas na mas mataas |
| Teksto na maraming emoji | Sa nakakagulat na mataas |
Ang dalawang prompt na may parehong bilang ng karakter ay maaaring magkaroon ng magkaibang bilang ng token.
Ito ang isa sa mga pinakamadalas na nakatagong sanhi ng gastos sa mga sistema ng produksyon ng AI.
Bakit nakakaapekto ang tokenization sa ugali ng modelo
Ang tokenization ay nagpapaliwanag din ng maraming “weird” na pag-uugali ng modelo.
Halimbawa:
- bakit nahihirapan ang mga modelo sa pagbibilang ng letra
- bakit ang mga bihirang salita ay kumikilos nang hindi inaasahan
- bakit ang mga pagbabago sa format ay maaaring makaapekto sa mga output
- bakit mahalaga ang pagkakasunod-sunod ng prompt
Ang isang modelo ay hindi nag-iisip sa mga letra o gramatika tulad ng ginagawa ng mga tao. Naghuhula ito ng mga sequence ng token.
Ang pagkakaibang iyon ay nagbubunga ng maraming mga quirks na napapansin ng mga gumagamit.
Madalas na tumutok ang mga talakayan sa komunidad sa istruktura ng token bilang isang dahilan kung bakit nabibigo ang mga modelo sa reasoning sa antas ng karakter.
Ang mga token ay nagiging outputs
Kapag ang input ay na-tokenize:
- Pumasok ang mga token sa transformer
- Nahuhulaan ng modelo ang susunod na token
- Idinadagdag ang token na iyon
- Nauulit ang proseso
Patuloy ito hanggang:
- lumabas ang isang stop token
- maabot ang limitasyon ng token
- ang sistema ay nagtutuloy ng pagbuo
Ibig sabihin, ang pagbuo ng AI ay sa batayang token-by-token prediction loop, hindi reasoning sa antas ng pangungusap.
Huling takeaway
Tila isang maliit na teknikal na detalye ang tokenization, ngunit hinuhubog nito ang halos lahat sa mga modernong sistema ng LLM.
Nakakaapekto ito sa:
- gastos
- bilis
- limitasyon ng konteksto
- pagganap sa multilinggwal
- ugali ng modelo
- kalidad ng output
Kung ikaw ay bumubuo gamit ang AI, ang pag-unawa sa tokenization ay nagbibigay sa iyo ng mas mahusay na intuwisyon kung bakit kumikilos ang mga sistema sa paraang ginagawa nila.
Bago magkaroon ng embeddings, transformers, o outputs, naroon ang mga token.
At doon nagsisimula ang lahat.
Ang maingat na disenyo ng prompt, mga pagpipilian sa bokabularyo, at pagbu-budget ng token ay tumutulong upang matiyak na ang iyong paggamit ng token at bilang ng token ay tumutugma sa iyong mga layunin sa gastos at kalidad. Ang resulta ay mas kaunting hindi inaasahang mga komplemento, mas mababang mga gastos sa API, at mga modelong mas mahusay na nakakaunawa sa paraan ng pagsusulat ng iyong mga gumagamit.




