Tokeniseerimise Selgitamine: Toodetest Tooted
Autor: Wendy Frey
Enne kui suur keelemudel suudab genereerida midagi kasulikku, peab ta kõigepealt tegema midagi palju lihtsamat: jagama teie teksti osadeks.
Seda protsessi nimetatakse tokeniseerimiseks ja see on üks tähtsamaid, ja kõige unustatumaid, osi, kuidas tänapäeva tehisintellekti süsteemid töötavad.
Enamik inimesi arvab, et mudelid loevad sõnu. Nad ei loe.
Nad loevad token’e: väikeseid tekstiosakesi, mis võivad esindada täis sõnu, sõnade osi, kirjavahemärke, tühikuid või isegi individuaalseid sümboleid. Need tokenid muudetakse seejärel numbriliseks ID-ks, mida mudel saab sisemiselt töödelda.
Tokeniseerimise mõistmine aitab selgitada paljusid asju:
- miks käsud maksavad raha
- miks konteksti akendel on piirangud
- miks mõned keeled on kallimad kui teised
- miks mudelid käituvad mõnikord kummaliselt
Tokeniseerimine asub AI torustiku alguses, ja see kujundab vaikselt kõike, mis tuleb pärast.
Mis on token?
Token on väikseim tekstielement, millega mudel töötab.
See ei ole alati sama mis sõna.
Näiteks:
| Tekst | Võimalik tokeni jagamine |
|---|---|
| tere | tere |
| tokeniseerimine | token + ise |
| uskumatult | usk + matu + lt |
| 2026! | 202 + 6 +! |
See on oluline, kuna mudelid loevad token’e, mitte sõnu.
Lühiulev lause võib kasutada rohkem token’e kui oodatud, eriti ebatavaliste sõnade, koodi, emotikonide või mitte-ingliskeelsete keelte puhul.
Kuidas tokeniseerimine töötab
Kõrgel tasemel järgib tokeniseerimine lihtsat protsessi.
1. samm: Jagage tekst
Tokeniseerija jagab toore teksti osadeks, tuginedes oma sõnavara reeglitele.
Tänapäeva LLM-id tuginevad tavaliselt alam-sõna tokeniseerimisele, mitte täissõna tokeniseerimisele.
See annab neile paindlikkuse tegeleda:
- haruldaste sõnadega
- trükivigadega
- nimedega
- mitmekeelse sisendiga
- koodiga
2. samm: Muutke token’id ID-deks
Iga token vastab numbrile mudeli sõnavaras.
Näide:
| Token | Token ID |
|---|---|
| The | 791 |
| mudel | 4382 |
| töötab | 2921 |
Mudel ei „näe“ teksti otse. Ta näeb ainult neid numbrilisi esindusi.
See on sild inimkeele ja närvilise arvutamise vahel.
3. samm: Muutke ID-d embeddideks
Pärast token ID-de loomist muudetakse need vektorembeddings'iks.
Siin hakkab tähendus esile kerkima.
Sel hetkel:
- sarnased token’id võivad asuda vektorruumis lähedastes positsioonides
- kontseptide vahelised suhted muutuvad mõõdetavaks
- kontekst hakkab looma
Tokeniseerimine toob andmed süsteemi. Embeddings muudavad selle tõlgendatavaks.
Miks alam-sõna tokeniseerimine sai standardiks
Vanemad NLP süsteemid jagasid sageli teksti sõnade järgi.
See töötas, kuni nad kohtasid sõnu, mida nad kunagi varem näinud ei olnud.
Tänapäeva LLM-id kasutavad tavaliselt meetodeid nagu Byte Pair Encoding (BPE) või sarnaseid alam-sõna strateegiaid.
BPE töötab, sulandades pidevalt sagedased tähemärkimustrid taaskasutatavateks üksusteks. See parandab kompressiooni ja sõnavara efektiivsust.
Miks alam-sõna mudelid on paremad
| Meetod | Peamine probleem |
|---|---|
| Sõna-tasand | Liiga palju tundmatuid sõnu |
| Tähemärgi-tasand | Liialt aeglane, liiga pikk |
| Alam-sõna-tasand | Parim tasakaal paindlikkuse ja efektiivsuse vahel |
Seetõttu kasutavad enamik kaasaegseid mudeleid mõnda alam-sõna tokeniseerimise varianti.
Miks tokeniseerimine mõjutab hinda
Siin muutub tokeniseerimine praktiliseks.
Enamik AI API-sid arveldab sisend-token'ite ning väljund-token'ite alusel.
See tähendab, et tokeniseerimine mõjutab otseselt hinda.
Näiteks:
| Sisendi tüüp | Umbes tokeni tihedus |
|---|---|
| Lihtne inglise keel | Madal |
| Kood | Keskmine, kõrge |
| Õiguslik tekst | Kõrge |
| Hiina/Japani | Tihti kõrgem |
| Emoji-tiheda tekst | Üllatavalt kõrge |
Kaks käsu, millel on sama tähemärkide arv, võivad omada väga erinevat tokenite arvu.
See on üks kõige levinumaid varjatud kuludrivereid tootmis AI süsteemides.
Miks tokeniseerimine mõjutab mudeli käitumist
Tokeniseerimine selgitab ka paljusid „kummalisi“ mudeli käitumisi.
Näiteks:
- miks mudelid teevad raskusi tähtede arvutamisega
- miks haruldased sõnad käituvad ettearvamatult
- miks formaadi muutused võivad mõjutada väljundeid
- miks käsu järjekord on oluline
Mudel ei mõtle tähtedes ega grammatikas nii nagu inimesed. See ennustab token'i järjestusi.
See erinevus loob palju neist veidratest omadustest, mida kasutajad täheldavad.
Kogukonna arutelud viitavad sageli token-struktuurile kui ühele põhjusest, miks mudelid ebaõnnestuvad tähe-tasandi põhjendustes.
Tokenid muutuvad väljunditeks
Kui sisend on tokeniseeritud:
- Token'id lähevad transformeerijasse
- Mudel ennustab järgmist token'it
- See token lisatakse
- Protsess kordub
See jätkub kuni:
- peatustoken ilmub
- tokeni piirang saavutatakse
- süsteem katkestab genereerimise
See tähendab, et AI genereerimine on põhimõtteliselt token’i kaupa ennustusloop, mitte lause-tasandi põhjendus.
Lõpp kokkuvõte
Tokeniseerimine näeb välja nagu väike tehniline detail, kuid see kujundab peaaegu kõike tänapäeva LLM süsteemides.
See mõjutab:
- hinda
- kiirus
- konteksti piirangud
- mitmekeelsust
- mudeli käitumist
- väljundi kvaliteeti
Kui ehitate AI-d, annab tokeniseerimise mõistmine teile palju parema arusaamise, miks süsteemid käituvad just nii nagu nad käituvad.
Enne kui on embeddid, transformeerijad või väljundid, on olemas token’id.
Ja kõik algab sellest.
Hoolikas käsu kujundamine, sõnavara valikud ja tokenite eelarve aitavad tagada, et teie tokenite kasutamine ja tokenite arv vastavad teie kulu ja kvaliteedi eesmärkidele. Tulu on vähem ootamatuid täiendusi, madalamad API kulud ja mudelid, mis mõistavad paremini teie kasutajate kirjutamisviisi.




