Tokenizācija skaidrota: no tokeniem līdz iznākumiem

Blog

Autors: Wendy Frey

26702eff-dbff-43b4-a5fb-fb97eab89247-1200x600.webp Pirms liels valodas modelis var radīt kaut ko noderīgu, tam vispirms jāveic kaut kas daudz vienkāršāks: jāsašķeļ jūsu teksts.

Šo procesu sauc par tokenizāciju, un tas ir viens no vissvarīgākajiem, un visbiežāk novērtētajiem, aspektiem, kā mūsdienu AI sistēmas darbojas.

Lielākā daļa cilvēku domā, ka modeļi lasa vārdus. Viņi nē.

Viņi lasa tokenus: mazas teksta daļas, kas var pārstāvēt pilnus vārdus, daļas no vārdiem, pieturzīmes, atstarpes vai pat individuālus simbolus. Šie tokeni tiek pārvērsti skaitliskajos ID, ko modelis var apstrādāt iekšēji.

Izpratne par tokenizāciju palīdz izskaidrot daudz lietu:

  • kāpēc uzvedne maksā naudu
  • kāpēc konteksta logiem ir ierobežojumi
  • kāpēc dažas valodas ir dārgākas par citām
  • kāpēc modeļi dažreiz uzvedas dīvaini

Tokenizācija atrodas AI cauruļvada pašā sākumā, un tā klusām ietekmē visu, kas notiek pēc tam.

Kas ir tokens?

Tokens ir vissmvcārīgākais teksta elements, ar kuru modelis strādā.

Tas nav vienmēr tas pats, kas vārds.

Piemēram:

TekstsIespējamais tokenu splits
hellohello
tokenizācijatoken + izācija
unbelievablene + tic +ams
2026!202 + 6 +!

Tas ir svarīgi, jo modeļi skaita tokenus, nevis vārdus.

Īsi izskatīgs teikums var izmantot vairāk tokenu, nekā gaidīts, īpaši ar retiem vārdiem, kodu, emocijzīmēm vai neangļu valodām.

Kā darbojas tokenizācija

Augstā līmenī tokenizācija seko vienkāršai shēmai.

1. solis: Sašķelt tekstu

Tokenizators sašķeļ izejas tekstu fragmentos, balstoties uz tā vārdnīcas noteikumiem.

Mūsdienu LLM parasti balstās uz apakštokenizāciju, nevis pilnu vārdu tokenizāciju.

Tas dod tām elastību apstrādāt:

  • retus vārdus
  • kļūdas
  • nosaukumus
  • daudzvalodu ieeju
  • kodu

2. solis: Pārvērst tokenus par ID

Katrs tokens attiecina uz numuru modeļa vārdnīcā.

Piemērs:

TokensTokenu ID
The791
modelis4382
darbojas2921

Modelis nekad “neredz” tekstu tieši. Tas redz tikai šos skaitliskos attēlojumus.

Tas ir tilts starp cilvēku valodu un neironu skaitļošanu.

3. solis: Pārvērst ID par iekapsulējumiem

Pēc tokenu ID izveides tie tiek pārveidoti par vektoru iekapsulējumiem.

Šeit sāk parādīties nozīme.

Šajā posmā:

  • līdzīgi tokeni var ieņemt blakus esošas pozīcijas vektoru telpā
  • attiecības starp konceptiem kļūst mērogojamas
  • konteksts sāk iegūt nozīmi

Tokenizācija ienodrošina datu iekļaušanu sistēmā. Iekapsulējumi padara to interpretējamu.

Kāpēc apakštokenizācija kļuva par standartu

Vecākās NLP sistēmas bieži dalīja tekstu pa vārdiem.

Tas strādāja, līdz tie sasniedza vārdus, ko tie nekad nebija redzējuši.

Mūsdienu LLM parasti izmanto metodes kā Byte Pair Encoding (BPE) vai līdzīgas apakštokenizācijas stratēģijas.

BPE darbojas, atkārtoti apvienojot bieži sastopamas rakstzīmju shēmas atkārtoti lietojamos elementos. Tas uzlabo kompresiju un vārdnīcas efektivitāti.

Kāpēc apakštokenu modeļi ir labāki

MetodeGalvenā problēma
Vārdu līmenisPārāk daudz nezināmu vārdu
Rakstzīmju līmenisPārāk lēni, pārāk garš
Apakštokenu līmenisLabākais līdzsvars starp elastību un efektivitāti

Tāpēc lielākā daļa mūsdienu modeļu izmanto kaut kādu apakštokenizācijas versiju.

Kāpēc tokenizācija ietekmē izmaksas

Šeit tokenizācija kļūst praktiska.

Lielākā daļa AI API iekasē maksu, pamatojoties uz:

  • ievades tokeniem
  • izejas tokeniem

Tas nozīmē, ka tokenizācija tieši ietekmē cenu.

Piemēram:

Ievades veidsAptuvenā tokenu blīvuma
Vienkārša angļu valodaZema
KodsVidēja, augsta
Juridiskais tekstsAugsta
Ķīniešu/Japāņu valodaBieži augstāka
Emocijzīmju bagāts tekstsPārsteidzoši augsts

Divas uzvednes ar to pašu rakstzīmju skaitu var būt ļoti atšķirīgas tokenu skaitā.

Tas ir viens no visbiežāk sastopamajiem slēptajiem izmaksu virzītājiem ražošanas AI sistēmās.

Kāpēc tokenizācija ietekmē modeļa uzvedību

Tokenizācija arī izskaidro daudz “dīvaino” modeļa uzvedību.

Piemēram:

  • kāpēc modeļi cīnās ar rakstzīmju skaitīšanu
  • kāpēc reti vārdi uzvedas neprognozējami
  • kāpēc formatēšanas izmaiņas var ietekmēt izejas
  • kāpēc uzvednes kārtība ir svarīga

Modelis nedomā burtos vai gramatikā tā, kā cilvēciskie. Tas paredz tokenu secības.

Šī atšķirība rada daudz no dīvainībām, ko lietotāji pamanīt.

Kopienas diskusijas bieži norāda uz tokenu struktūru kā vienu iemeslu, kāpēc modeļi nespēj izprast rakstzīmju līmeņa racionālo domāšanu.

Tokeni kļūst par izejām

Kad ievade ir tokenizēta:

  1. Tokeni nonāk transformerī
  2. Modelis paredz nākamo tokenu
  3. Šis token tiek pievienots
  4. Process atkārtojas

Tas turpinās līdz:

  • parādās apstāšanās tokens
  • tiek sasniegts tokenu limits
  • sistēma pārtrauc ģenerēšanu

Tas nozīmē, ka AI ģenerēšana ir pamatā tokenu-pēc-tokena paredzēšanas cikls, nevis teikumu līmeņa racionāla domāšana.

Galvenā doma

Tokenizācija izskatās kā neliela tehniska detaļa, bet tā veido gandrīz visu mūsdienu LLM sistēmās.

Tā ietekmē:

  • izmaksas
  • ātrumu
  • konteksta ierobežojumus
  • daudzvalodu veiktspēju
  • modeļa uzvedību
  • izejas kvalitāti

Ja jūs veidojat ar AI, izpratne par tokenizāciju sniedz jums labāku intuitīvu sapratni par to, kāpēc sistēmas uzvedas tā, kā tās dara.

Pirms pastāv iekapsulējumi, transformatori vai izejas, pastāv tokeni.

Un viss sākas no turienes.

Rūpīga uzvedņu dizaina, vārdnīcas izvēļu un tokenu budžeta izveide palīdz nodrošināt, ka jūsu tokenu izmantošana un tokenu skaits saskan ar jūsu izmaksu un kvalitātes mērķiem. Samaksa ir mazāk negaidītu pabeigumu, zemākas API izmaksas un modeļi, kas labāk saprot, kā jūsu lietotāji raksta.

Virālas veidnes

Iepazīstiet mūsu virālās AI veidnes un pielietojiet tās saviem foto.

Skatīt veidnes