Tokenisaatio selitetty: Tokenista tuloksiin

Blog

Kirjoittaja: Wendy Frey

26702eff-dbff-43b4-a5fb-fb97eab89247-1200x600.webp

Ennen kuin suuri kielimalli voi luoda mitään hyödyllistä, sen on ensin tehtävä jotain paljon yksinkertaisempaa: hajottaa tekstisi osiin.

Tuota prosessia kutsutaan tokenisaatioksi, ja se on yksi tärkeimmistä, ja eniten huomiotta jääneistä, osista, kuinka nykyaikaiset tekoälyjärjestelmät toimivat.

Useimmat ihmiset ajattelevat, että mallit lukevat sanoja. Ne eivät lue.

Ne lukevat token-eja: pieniä tekstinpätkiä, jotka voivat edustaa täysiä sanoja, osia sanoista, välimerkkejä, tyhjiä tiloja tai jopa yksittäisiä symboleja. Nämä tokenit muunnetaan sitten numeerisiksi ID-sarakkeiksi, joita malli voi käsitellä sisäisesti.

Tokenisaation ymmärtäminen auttaa selittämään monia asioita:

  • miksi kehot maksavat rahaa
  • miksi kontekstitila on rajallinen
  • miksi jotkut kielet ovat kalliimpia kuin toiset
  • miksi mallit käyttäytyvät joskus kummallisesti

Tokenisaatio sijaitsee tekoälyputken aivan alussa, ja se muotoilee hiljaa kaikkea, mikä tulee sen jälkeen.

Mikä on token?

Token on pienin tekstiyksikkö, jonka malli käsittelee.

Se ei aina ole sama kuin sana.

Esimerkiksi:

TekstiMahdollinen token-jako
hellohello
tokenisaatiotoken + isaatio
uskomatonusko + maton
2026!202 + 6 +!

Tämä on tärkeää, koska mallit laskevat tokeneita, eivät sanoja.

Lyhyen näköinen lause voi käyttää enemmän tokeneita kuin odotettiin, erityisesti epätavallisten sanojen, koodin, emojeiden tai ei-englanninkielisten kielten yhteydessä.

Kuinka tokenisaatio toimii

Yleisesti ottaen tokenisaatio seuraa yksinkertaista putkea.

Vaihe 1: Hajota teksti

Tokenisoija hajottaa raakatekstin palasiksi sen sanaston sääntöjen perusteella.

Nykyaikaiset LLM:t perustuivat yleensä osasanayhdistelmään, eivät täydellisten sanojen tokenisaatioon.

Tämä antaa niille joustavuutta käsitellä:

  • harvinaisia sanoja
  • kirjoitusvirheitä
  • nimiä
  • monikielistä syötettä
  • koodia

Vaihe 2: Muunna tokenit ID:iksi

Jokainen token kartoittaa numeron mallin sanastossa.

Esimerkki:

TokenToken ID
The791
malli4382
toimii2921

Malli ei koskaan "näe" tekstiä suoraan. Se näkee vain nämä numeeriset esitykset.

Se on silta ihmiskielen ja hermoprosessoinnin välillä.

Vaihe 3: Muunna ID:t upotuksiksi

Kun token ID:t on luotu, ne muunnetaan vektoripesukseksi.

Tässä vaiheessa merkitys alkaa nousta esiin.

Tässä vaiheessa:

  • samanlaiset tokenit voivat olla lähellä toisiaan vektoritilassa
  • käsitteiden väliset suhteet tulevat mitattaviksi
  • konteksti alkaa olla tärkeää

Tokenisaatio saa tiedot järjestelmään. Upotukset tekevät siitä tulkittavaa.

Miksi osasanat tokenisaatio tuli standardiksi

Vanhemmat NLP-järjestelmät hajottivat usein tekstiä sanoiksi.

Se toimi, kunnes ne kohtasivat sanoja, joita ne eivät olleet koskaan nähneet aiemmin.

Nykyaikaiset LLM:t käyttävät yleensä menetelmiä, kuten Byte Pair Encoding (BPE) tai muita osasanastrategioita.

BPE toimii toistamalla usein esiintyviä merkkikuvioita yhdistämällä ne uudelleen käytettäviksi yksiköiksi. Tämä parantaa pakkausta ja sanaston tehokkuutta.

Miksi osasanamallit ovat parempia

MenetelmäPääongelma
Sanojen tasoLiian monta tuntematonta sanaa
MerkkitasoLiian hidas, liian pitkä
Osasanojen tasoParas tasapaino joustavuuden ja tehokkuuden välillä

Tämä on syy, miksi useimmat nykyaikaiset mallit käyttävät jonkinlaista osasanat tokenisaatiota.

Miksi tokenisaatio vaikuttaa kustannuksiin

Täällä tokenisaatio tulee käytännölliseksi.

Useimmat tekoäly-API:t veloittavat perustuen:

  • syöttötokeneihin
  • lähtötokeneihin

Se tarkoittaa, että tokenisaatio vaikuttaa suoraan hintaan.

Esimerkiksi:

Syötteen tyyppiArvioitu tokenitiheys
Yksinkertainen englantiAlhainen
KoodiKeskimääräinen, korkea
OikeustekstiKorkea
Kiina/JapaniUsein korkea
Emojikylläinen tekstiYllättävän korkea

Kaksi kehotusta, joissa on sama merkki määrä, voivat sisältää hyvin erilaisia tokenimäärät.

Tämä on yksi yleisimmistä piilotetuista kustannustekijöistä tuotantotason tekoälyjärjestelmissä.

Miksi tokenisaatio vaikuttaa mallin käyttäytymiseen

Tokenisaatio selittää myös monia “kummallisia” mallin käyttäytymisiä.

Esimerkiksi:

  • miksi mallit kamppailevat kirjainten laskennassa
  • miksi harvinaiset sanat käyttäytyvät arvaamattomasti
  • miksi muotoilumuutokset voivat vaikuttaa tuloksiin
  • miksi kehotusjärjestys on tärkeää

Malli ei ajattele kirjaimilla tai kieliopilla samalla tavalla kuin ihmiset. Se ennustaa token-jonoja.

Tämä ero luo monia käyttäjien huomaamia outouksia.

Yhteisökeskustelut viittaavat usein token-rakenteeseen yhtenä syynä siihen, miksi mallit epäonnistuvat kirjaintason päättelyssä.

Tokenit muuttuvat tuloksiksi

Kun syöte on tokenisoitu:

  1. Tokenit menevät transformerin läpi
  2. Malli ennustaa seuraavan tokenin
  3. Tämä token lisätään
  4. Prosessi toistuu

Tämä jatkuu, kunnes:

  • stoppitoken ilmestyy
  • tokenraja saavutetaan
  • järjestelmä keskeyttää luomisen

Tämä tarkoittaa, että tekoälyn luominen on perustaltaan token-kerrallaan ennustussilmukka, ei lauseen tason päättelyä.

Viimeinen oivallus

Tokenisaatio näyttää pieneltä tekniseltä yksityiskohdalta, mutta se muokkaa lähes kaikkea nykyaikaisissa LLM-järjestelmissä.

Se vaikuttaa:

  • kustannuksiin
  • nopeuteen
  • kontekstitajoihin
  • monikielisiin suorituksiin
  • mallin käyttäytymiseen
  • tulosten laatuun

Jos rakennat tekoälyn kanssa, tokenisaation ymmärtäminen antaa sinulle paljon paremman intuitiivisen käsityksen siitä, miksi järjestelmät käyttäytyvät niin kuin ne tekevät.

Ennen kuin on upotuksia, transformereita tai tuloksia, on tokeneita.

Ja kaikki alkaa siitä.

Huolellinen kehotussuunnittelu, sanastovalinnat ja token-budjetointi auttavat varmistamaan, että token-käyttösi ja token-määräsi vastaavat kustannus- ja laatutavoitteitasi. Tuloksena on vähemmän odottamattomia lopetuksia, alhaisemmat API-kustannukset ja mallit, jotka ymmärtävät paremmin käyttäjiesi kirjoitustavan.

Viraalit mallit

Tutustu viraaleihin AI-malleihimme ja käytä niitä omissa kuvissasi.

Tutustu malleihin