Tokenizácia vysvetlená: Od Tokenov po Výstupy

Blog

Autor: Wendy Frey

26702eff-dbff-43b4-a5fb-fb97eab89247-1200x600.webp Predtým, než môže veľký jazykový model generovať niečo užitočné, musí najprv vykonať niečo oveľa jednoduchšie: roztrhnúť váš text na kusy.

Ten proces sa nazýva tokenizácia, a je to jedna z najdôležitejších, a najčastejšie prehliadaných, súčastí toho, ako moderné AI systémy fungujú.

Väčšina ľudí si myslí, že modely čítajú slová. Nečítajú.

Čítajú tokeny: malé úseky textu, ktoré môžu predstavovať celé slová, časti slov, interpunkciu, medzery alebo dokonca jednotlivé symboly. Tieto tokeny sú následne prevedené na číselné ID, ktoré model môže spracovávať interne.

Pochopenie tokenizácie pomáha vysvetliť veľa vecí:

  • prečo sú požiadavky spojené s nákladmi
  • prečo majú kontextové okná obmedzenia
  • prečo sú niektoré jazyky drahšie ako iné
  • prečo sa modely niekedy správajú zvláštne

Tokenizácia sedí na úplnom začiatku AI pipeline, a potichu formuje všetko, čo prichádza po nej.

Čo je token?

Token je najmenšia jednotka textu, s ktorou model pracuje.

Nemože to byť vždy to isté ako slovo.

Napríklad:

TextMožné rozdelenie tokenov
hellohello
tokenizáciatoken + izácia
neuveriteľnéne + uver +iteľné
2026!202 + 6 +!

To je dôležité, pretože modely počítajú tokeny, nie slová.

Krátka veta môže použiť viac tokenov ako sa očakávalo, najmä s nezvyčajnými slovami, kódmi, emoji alebo neanglickými jazykmi.

Ako funguje tokenizácia

Na vysokej úrovni, tokenizácia sleduje jednoduchú pipeline.

Krok 1: Rozdelenie textu

Tokenizer rozdeľuje surový text na kusy na základe svojich pravidiel slovníka.

Moderné LLM obvykle spoliehajú na subslovnú tokenizáciu, nie na plnú slovenú tokenizáciu.

To im dáva flexibilitu pri spracovaní:

  • nezvyčajných slov
  • preklepov
  • mien
  • viacjazyčných vstupov
  • kódu

Krok 2: Prevod tokenov na ID

Každý token sa mapuje na číslo vo vnútri slovníka modelu.

Príklad:

TokenToken ID
The791
model4382
works2921

Model nikdy „nevidí“ text priamo. Vidí iba tieto numerické reprezentácie.

To je most medzi ľudským jazykom a neurálnym spracovaním.

Krok 3: Prevod ID na embeddings

Akonáhle sú token ID vytvorené, sú transformované na vektorové embeddings.

Tu sa začína objavovať význam.

V tejto fáze:

  • podobné tokeny môžu obsadzovať blízke pozície vo vektorovom priestore
  • vzťahy medzi konceptmi sa stávajú merateľnými
  • kontext začína byť dôležitý

Tokenizácia dostáva dáta do systému. Embeddings robia dáta zrozumiteľnými.

Prečo sa subslovná tokenizácia stala štandarde

Staršie NLP systémy často rozdeľovali text podľa slov.

To fungovalo, až kým nenarazili na slová, ktoré nikdy predtým nevideli.

Moderné LLM obvykle používajú metódy ako Byte Pair Encoding (BPE) alebo podobné subslovné stratégie.

BPE funguje tak, že opakovane spája časté vzory znakov do znovu použiteľných jednotiek. To zlepšuje kompresiu a efektivitu slovníka.

Prečo sú subslovné modely lepšie

MetódaHlavný problém
Úroveň slovaPríliš veľa neznámych slov
Úroveň znakuPríliš pomalé, príliš dlhé
Úroveň subslovaNajlepšia rovnováha flexibility a efektivity

To je dôvod, prečo väčšina moderných modelov používa nejakú verziu subslovnej tokenizácie.

Prečo tokenizácia ovplyvňuje náklady

Tu sa tokenizácia stáva praktickou.

Väčšina AI API účtuje na základe:

  • vstupných tokenov
  • výstupných tokenov

To znamená, že tokenizácia priamo ovplyvňuje cenu.

Príklad:

Typ vstupuPribližná hustota tokenov
Jednoduchá angličtinaNízka
KódStredne-vysoká
Právny textVysoký
Čínsky/JaponskýČasto vyšší
Text bohatý na emojiPrekvapivo vysoký

Dve požiadavky s rovnakým počtom znakov môžu mať veľmi rôznu počet tokenov.

To je jeden z najbežnejších skrytých faktorov nákladov v produkčných AI systémoch.

Prečo tokenizácia ovplyvňuje správanie modelu

Tokenizácia tiež vysvetľuje mnohé „zvláštne“ správanie modelu.

Napríklad:

  • prečo modely bojujú s počítaním písmen
  • prečo sa nezvyčajné slová správajú nepredvídateľne
  • prečo môžu zmeny formátovania ovplyvniť výstupy
  • prečo záleží na poradí požiadaviek

Model nemyslí v písmenách alebo gramatike tak, ako to robia ľudia. Predpovedá sekvencie tokenov.

Tento rozdiel vytvára mnohé osobitosti, ktoré používatelia spoznajú.

Diskusie v komunitách často poukazujú na štruktúru tokenov ako na jeden z dôvodov, prečo modely zlyhávajú pri uvažovaní na úrovni písmen.

Tokeny sa stávajú výstupmi

Akonáhle je vstup tokenizovaný:

  1. Tokeny idú do transformátora
  2. Model predpovedá ďalší token
  3. Ten token sa pridá
  4. Proces sa opakuje

To pokračuje, kým:

  • sa objaví stop token
  • sa dosiahne limit tokenov
  • systém preruší generáciu

To znamená, že AI generácia je v zásade cyklus predpovedania token po tokene, nie uvažovanie na úrovni viet.

Záverečné zhrnutie

Tokenizácia vyzerá ako malý technický detail, ale formuje takmer všetko v moderných LLM systémoch.

Ovlplyvňuje:

  • náklady
  • rýchlosť
  • limity kontextu
  • viacjazyčný výkon
  • správanie modelu
  • kvalitu výstupu

Ak budujete s AI, pochopenie tokenizácie vám dáva omnoho lepšiu intuíciu o tom, prečo sa systémy správajú tak, ako sa správajú.

Predtým, ako vzniknú embeddings, transformátory alebo výstupy, existujú tokeny.

A všetko začína tam.

Starostlivé navrhovanie požiadaviek, voľby slovníka a rozpočet na tokeny pomáhajú zabezpečiť, že vaše využitie tokenov a počty tokenov sú v súlade s vašimi cieľmi nákladov a kvality. Výsledkom sú menej neočakávané dokončenia, nižšie náklady na API a modely, ktoré lepšie rozumejú spôsobu, akým vaši používatelia píšu.

Virálne šablóny

Preskúmaj naše virálne AI šablóny a použi ich na svoje fotky.

Preskúmať šablóny