Tokenizace vysvětlena: Od tokenů k výstupům

Blog

Autor: Wendy Frey

26702eff-dbff-43b4-a5fb-fb97eab89247-1200x600.webp

Než velký jazykový model dokáže generovat něco užitečného, musí nejprve udělat něco mnohem jednoduššího: rozdělit váš text.

Ten proces se nazývá tokenizace, a je to jedna z nejdůležitějších, a nejvíce opomíjených, částí toho, jak moderní AI systémy fungují.

Většina lidí si myslí, že modely čtou slova. Nečtou.

Čtou tokeny: malé úseky textu, které mohou představovat celá slova, části slov, interpunkci, mezery nebo dokonce jednotlivé symboly. Tyto tokeny jsou poté převedeny na číselné ID, která model zpracovává interně.

Pochopení tokenizace pomáhá vysvětlit řadu věcí:

  • proč dotazy stojí peníze
  • proč mají kontextová okna omezení
  • proč jsou některé jazyky dražší než jiné
  • proč se modely někdy chovají zvláštně

Tokenizace se nachází na úplném začátku AI pipeline, a tiše formuje vše, co následuje.

Co je to token?

Token je nejmenší jednotka textu, se kterou model pracuje.

Není to vždy to samé jako slovo.

Například:

TextMožné rozdělení tokenů
hellohello
tokenizationtoken + ization
unbelievableun + believ + able
2026!202 + 6 +!

To je důležité, protože modely počítají tokeny, ne slova.

Krátká věta může používat více tokenů, než se očekávalo, zejména s neobvyklými slovy, kódem, emoji nebo jazykem, který není angličtinou.

Jak funguje tokenizace

Na vysoké úrovni tokenizace následuje jednoduchou pipeline.

Krok 1: Rozdělení textu

Tokenizátor rozděluje surový text na kusy na základě svých pravidel slovní zásoby.

Moderní LLM obvykle spoléhají na tokenizaci subslov, ne tokenizaci celých slov.

To jim dává flexibilitu při zpracování:

  • vzácných slov
  • překlepů
  • jmen
  • vícejazyčného vstupu
  • kódu

Krok 2: Převod tokenů na ID

Každý token odpovídá číslu uvnitř slovní zásoby modelu.

Příklad:

TokenToken ID
The791
model4382
works2921

Model nikdy „nevidí“ text přímo. Vidí pouze tyto číselné reprezentace.

To je most mezi lidským jazykem a neuronovým výpočtem.

Krok 3: Převod ID na embeddings

Po vytvoření token ID jsou převedena na vektorové embeddings.

Tady začíná vyvstávat význam.

V tomto bodě:

  • podobné tokeny mohou zaujímat blízké pozice ve vektorovém prostoru
  • vztahy mezi pojmy se stávají měřitelnými
  • kontext začíná mít význam

Tokenizace dostává data do systému. Embeddings činí data interpretovatelnými.

Proč se tokenizace stala standardem subslov

Starší systémy NLP často rozdělovaly text podle slov.

To fungovalo, dokud nenarazily na slova, která nikdy předtím neviděly.

Moderní LLM obvykle používají metody jako Byte Pair Encoding (BPE) nebo podobné strategie subslov.

BPE funguje tak, že opakovaně slučuje časté vzory znaků do znovu použitelných jednotek. To zlepšuje kompresi a efektivitu slovní zásoby.

Proč jsou modely subslov lepší

MetodaHlavní problém
Word-levelPříliš mnoho neznámých slov
Character-levelPříliš pomalé, příliš dlouhé
Subword-levelNejlepší rovnováha flexibility a efektivity

To je důvod, proč většina moderních modelů používá nějakou verzi tokenizace subslov.

Proč tokenizace ovlivňuje náklady

Tady se tokenizace stává praktickou.

Většina AI API účtuje na základě:

  • vstupních tokenů
  • výstupních tokenů

To znamená, že tokenizace přímo ovlivňuje cenu.

Například:

Typ vstupuPřibližná hustota tokenů
Jednoduchá angličtinaNízká
KódStřední, vysoká
Právní textVysoká
Čínština/JaponštinaČasto vyšší
Text s mnoha emojiPřekvapivě vysoká

Dva dotazy se stejným počtem znaků mohou mít velmi odlišný počet tokenů.

To je jedno z nejběžnějších skrytých faktorů nákladů v produkčních AI systémech.

Proč tokenizace ovlivňuje chování modelu

Tokenizace také vysvětluje mnoho „podivných“ chování modelu.

Například:

  • proč mají modely problémy s počítáním písmen
  • proč se vzácná slova chovají nepředvídatelně
  • proč změny formátování mohou ovlivnit výstupy
  • proč má pořadí dotazů význam

Model nemyslí v písmenech nebo gramatice tak, jak to dělají lidé. Predikuje sekvence tokenů.

Ten rozdíl vytváří mnoho zvláštností, které uživatelé zaznamenávají.

Diskuze v komunitě často ukazují na strukturu tokenů jako jeden z důvodů, proč modely selhávají v dedukci na úrovni znaků.

Tokeny se stávají výstupy

Jakmile je vstup tokenizován:

  1. Tokeny vstupují do transformátoru
  2. Model predikuje další token
  3. Ten token se připojí
  4. Proces se opakuje

Toto pokračuje, dokud:

  • se neobjeví stop token
  • není dosaženo limitu tokenů
  • systém nepřeruší generaci

To znamená, že generace AI je v zásadě cyklus predikce tokenů, nikoliv dedukce na úrovni vět.

Závěrečné shrnutí

Tokenizace vypadá jako malý technický detail, ale formuje téměř vše v moderních LLM systémech.

Ovlivňuje:

  • náklady
  • rychlost
  • limity kontextu
  • vícejazyčnou výkonnost
  • chování modelu
  • kvalitu výstupu

Pokud stavíte s AI, pochopení tokenizace vám dává mnohem lepší intuici pro to, proč se systémy chovají tak, jak se chovají.

Než existují embeddings, transformátory nebo výstupy, existují tokeny.

A všechno začíná tam.

Pečlivé navrhování dotazů, volby slovní zásoby a rozpočtování tokenů pomáhají zajistit, že vaše používání tokenů a počty tokenů odpovídají vašim nákladovým a kvalitativním cílům. Výsledkem jsou méně neočekávané dokončení, nižší náklady na API a modely, které lépe rozumí způsobu, jakým vaši uživatelé píší.

Virální šablony

Prozkoumej naše virální AI šablony a použij je na svoje fotky.

Prozkoumat šablony