Tokeniseerimise Selgitamine: Toodetest Tooted

Blog

Autor: Wendy Frey

26702eff-dbff-43b4-a5fb-fb97eab89247-1200x600.webp Enne kui suur keelemudel suudab genereerida midagi kasulikku, peab ta kõigepealt tegema midagi palju lihtsamat: jagama teie teksti osadeks.

Seda protsessi nimetatakse tokeniseerimiseks ja see on üks tähtsamaid, ja kõige unustatumaid, osi, kuidas tänapäeva tehisintellekti süsteemid töötavad.

Enamik inimesi arvab, et mudelid loevad sõnu. Nad ei loe.

Nad loevad token’e: väikeseid tekstiosakesi, mis võivad esindada täis sõnu, sõnade osi, kirjavahemärke, tühikuid või isegi individuaalseid sümboleid. Need tokenid muudetakse seejärel numbriliseks ID-ks, mida mudel saab sisemiselt töödelda.

Tokeniseerimise mõistmine aitab selgitada paljusid asju:

  • miks käsud maksavad raha
  • miks konteksti akendel on piirangud
  • miks mõned keeled on kallimad kui teised
  • miks mudelid käituvad mõnikord kummaliselt

Tokeniseerimine asub AI torustiku alguses, ja see kujundab vaikselt kõike, mis tuleb pärast.

Mis on token?

Token on väikseim tekstielement, millega mudel töötab.

See ei ole alati sama mis sõna.

Näiteks:

TekstVõimalik tokeni jagamine
teretere
tokeniseeriminetoken + ise
uskumatultusk + matu + lt
2026!202 + 6 +!

See on oluline, kuna mudelid loevad token’e, mitte sõnu.

Lühiulev lause võib kasutada rohkem token’e kui oodatud, eriti ebatavaliste sõnade, koodi, emotikonide või mitte-ingliskeelsete keelte puhul.

Kuidas tokeniseerimine töötab

Kõrgel tasemel järgib tokeniseerimine lihtsat protsessi.

1. samm: Jagage tekst

Tokeniseerija jagab toore teksti osadeks, tuginedes oma sõnavara reeglitele.

Tänapäeva LLM-id tuginevad tavaliselt alam-sõna tokeniseerimisele, mitte täissõna tokeniseerimisele.

See annab neile paindlikkuse tegeleda:

  • haruldaste sõnadega
  • trükivigadega
  • nimedega
  • mitmekeelse sisendiga
  • koodiga

2. samm: Muutke token’id ID-deks

Iga token vastab numbrile mudeli sõnavaras.

Näide:

TokenToken ID
The791
mudel4382
töötab2921

Mudel ei „näe“ teksti otse. Ta näeb ainult neid numbrilisi esindusi.

See on sild inimkeele ja närvilise arvutamise vahel.

3. samm: Muutke ID-d embeddideks

Pärast token ID-de loomist muudetakse need vektorembeddings'iks.

Siin hakkab tähendus esile kerkima.

Sel hetkel:

  • sarnased token’id võivad asuda vektorruumis lähedastes positsioonides
  • kontseptide vahelised suhted muutuvad mõõdetavaks
  • kontekst hakkab looma

Tokeniseerimine toob andmed süsteemi. Embeddings muudavad selle tõlgendatavaks.

Miks alam-sõna tokeniseerimine sai standardiks

Vanemad NLP süsteemid jagasid sageli teksti sõnade järgi.

See töötas, kuni nad kohtasid sõnu, mida nad kunagi varem näinud ei olnud.

Tänapäeva LLM-id kasutavad tavaliselt meetodeid nagu Byte Pair Encoding (BPE) või sarnaseid alam-sõna strateegiaid.

BPE töötab, sulandades pidevalt sagedased tähemärkimustrid taaskasutatavateks üksusteks. See parandab kompressiooni ja sõnavara efektiivsust.

Miks alam-sõna mudelid on paremad

MeetodPeamine probleem
Sõna-tasandLiiga palju tundmatuid sõnu
Tähemärgi-tasandLiialt aeglane, liiga pikk
Alam-sõna-tasandParim tasakaal paindlikkuse ja efektiivsuse vahel

Seetõttu kasutavad enamik kaasaegseid mudeleid mõnda alam-sõna tokeniseerimise varianti.

Miks tokeniseerimine mõjutab hinda

Siin muutub tokeniseerimine praktiliseks.

Enamik AI API-sid arveldab sisend-token'ite ning väljund-token'ite alusel.

See tähendab, et tokeniseerimine mõjutab otseselt hinda.

Näiteks:

Sisendi tüüpUmbes tokeni tihedus
Lihtne inglise keelMadal
KoodKeskmine, kõrge
Õiguslik tekstKõrge
Hiina/JapaniTihti kõrgem
Emoji-tiheda tekstÜllatavalt kõrge

Kaks käsu, millel on sama tähemärkide arv, võivad omada väga erinevat tokenite arvu.

See on üks kõige levinumaid varjatud kuludrivereid tootmis AI süsteemides.

Miks tokeniseerimine mõjutab mudeli käitumist

Tokeniseerimine selgitab ka paljusid „kummalisi“ mudeli käitumisi.

Näiteks:

  • miks mudelid teevad raskusi tähtede arvutamisega
  • miks haruldased sõnad käituvad ettearvamatult
  • miks formaadi muutused võivad mõjutada väljundeid
  • miks käsu järjekord on oluline

Mudel ei mõtle tähtedes ega grammatikas nii nagu inimesed. See ennustab token'i järjestusi.

See erinevus loob palju neist veidratest omadustest, mida kasutajad täheldavad.

Kogukonna arutelud viitavad sageli token-struktuurile kui ühele põhjusest, miks mudelid ebaõnnestuvad tähe-tasandi põhjendustes.

Tokenid muutuvad väljunditeks

Kui sisend on tokeniseeritud:

  1. Token'id lähevad transformeerijasse
  2. Mudel ennustab järgmist token'it
  3. See token lisatakse
  4. Protsess kordub

See jätkub kuni:

  • peatustoken ilmub
  • tokeni piirang saavutatakse
  • süsteem katkestab genereerimise

See tähendab, et AI genereerimine on põhimõtteliselt token’i kaupa ennustusloop, mitte lause-tasandi põhjendus.

Lõpp kokkuvõte

Tokeniseerimine näeb välja nagu väike tehniline detail, kuid see kujundab peaaegu kõike tänapäeva LLM süsteemides.

See mõjutab:

  • hinda
  • kiirus
  • konteksti piirangud
  • mitmekeelsust
  • mudeli käitumist
  • väljundi kvaliteeti

Kui ehitate AI-d, annab tokeniseerimise mõistmine teile palju parema arusaamise, miks süsteemid käituvad just nii nagu nad käituvad.

Enne kui on embeddid, transformeerijad või väljundid, on olemas token’id.

Ja kõik algab sellest.

Hoolikas käsu kujundamine, sõnavara valikud ja tokenite eelarve aitavad tagada, et teie tokenite kasutamine ja tokenite arv vastavad teie kulu ja kvaliteedi eesmärkidele. Tulu on vähem ootamatuid täiendusi, madalamad API kulud ja mudelid, mis mõistavad paremini teie kasutajate kirjutamisviisi.

Viraalsed mallid

Avasta meie viraalseid AI-malle ja rakenda neid oma fotodele.

Avasta malle