Tokenizacja wyjaśniona: od tokenów do wyników

Blog

Autor: Wendy Frey

26702eff-dbff-43b4-a5fb-fb97eab89247-1200x600.webp

Zanim duży model językowy będzie mógł wygenerować coś użytecznego, musi najpierw zrobić coś znacznie prostszego: rozbić twój tekst na części.

Ten proces nazywa się tokenizacją i jest jednym z najważniejszych, i najczęściej ignorowanych, elementów działania nowoczesnych systemów AI.

Większość ludzi uważa, że modele odczytują słowa. Tak nie jest.

Odczytują tokeny: małe fragmenty tekstu, które mogą reprezentować pełne słowa, części słów, interpunkcję, spacje, a nawet pojedyncze symbole. Te tokeny są następnie przekształcane w numeryczne identyfikatory, które model może przetwarzać wewnętrznie.

Zrozumienie tokenizacji pomaga wyjaśnić wiele rzeczy:

  • dlaczego podpowiedzi kosztują pieniądze
  • dlaczego okna kontekstowe mają ograniczenia
  • dlaczego niektóre języki są droższe od innych
  • dlaczego modele czasami zachowują się dziwnie

Tokenizacja znajduje się na samym początku procesu AI, a cicho kształtuje wszystko, co przychodzi później.

Co to jest token?

Token to najmniejsza jednostka tekstu, z którą pracuje model.

Nie zawsze jest to to samo, co słowo.

Na przykład:

TekstMożliwe podziały tokenów
hellohello
tokenizacjatoken + izacja
niewiarygodnynie + wiara + godny
2026!202 + 6 +!

To ma znaczenie, ponieważ modele liczą tokeny, a nie słowa.

Krótko wyglądające zdanie może używać więcej tokenów niż się spodziewasz, zwłaszcza przy rzadkich słowach, kodach, emoji czy językach niena angielskich.

Jak działa tokenizacja

Na wysokim poziomie tokenizacja podąża prostym procesem.

Krok 1: Podział tekstu

Tokenizator dzieli surowy tekst na fragmenty na podstawie zasad słownikowych.

Nowoczesne LLM-y najczęściej opierają się na tokenizacji podwyrazowej, a nie na tokenizacji pełnowerbalnej.

Daje to im elastyczność w radzeniu sobie z:

  • rzadkimi słowami
  • literówkami
  • nazwami
  • wielojęzycznym wejściem
  • kodem

Krok 2: Przekształcanie tokenów w identyfikatory

Każdy token jest mapowany na liczbę w słowniku modelu.

Przykład:

TokenIdentyfikator tokena
The791
model4382
works2921

Model nigdy nie „widzi” tekstu bezpośrednio. Widziany są tylko te numeryczne reprezentacje.

To jest most łączący ludzką mowę z obliczeniami neuronowymi.

Krok 3: Przekształcanie identyfikatorów w osadzenia

Po utworzeniu identyfikatorów tokenów są one przekształcane w osadzenia wektorowe.

To tutaj zaczyna się pojawiać znaczenie.

Na tym etapie:

  • podobne tokeny mogą zajmować bliskie pozycje w przestrzeni wektorowej
  • relacje między pojęciami stają się mierzalne
  • kontekst zaczyna mieć znaczenie

Tokenizacja wprowadza dane do systemu. Osadzenia sprawiają, że są one interpretowalne.

Dlaczego tokenizacja podwyrazowa stała się standardem

Starsze systemy NLP często dzieliły tekst według słów.

To działało, dopóki nie napotykano słów, których nigdy wcześniej nie widziały.

Nowoczesne LLM-y zazwyczaj korzystają z metod takich jak Byte Pair Encoding (BPE) lub podobnych strategii podwyrazowych.

BPE działa poprzez wielokrotne łączenie częstych wzorców znaków w jednostki wielokrotnego użytku. To poprawia kompresję i wydajność słownika.

Dlaczego modele podwyrazowe są lepsze

MetodaGłówny problem
Poziom słowaZbyt wiele nieznanych słów
Poziom znakuZbyt wolno, zbyt długo
Poziom podwyrazuNajlepszy balans elastyczności i wydajności

Dlatego większość nowoczesnych modeli używa jakiejś wersji tokenizacji podwyrazowej.

Dlaczego tokenizacja wpływa na koszty

Tutaj tokenizacja staje się praktyczna.

Większość interfejsów API AI nalicza opłaty na podstawie:

  • tokenów wejściowych
  • tokenów wyjściowych

Oznacza to, że tokenizacja bezpośrednio wpływa na cenę.

Na przykład:

Typ wejściaPrzypadkowa gęstość tokenów
Prosty angielskiNiska
KodŚrednio-wysoka
Tekst prawnyWysoka
Chiński/JapońskiCzęsto wyższa
Tekst z dużą ilością emojiZaskakująco wysoka

Dwie podpowiedzi o tej samej liczbie znaków mogą mieć bardzo różne liczby tokenów.

To jeden z najczęstszych ukrytych czynników kosztów w produkcyjnych systemach AI.

Dlaczego tokenizacja wpływa na zachowanie modelu

Tokenizacja wyjaśnia także wiele „dziwnych” zachowań modeli.

Na przykład:

  • dlaczego modele mają trudności z liczeniem liter
  • dlaczego rzadkie słowa zachowują się w sposób nieprzewidywalny
  • dlaczego zmiany formatowania mogą wpływać na wyniki
  • dlaczego kolejność podpowiedzi ma znaczenie

Model nie myśli w literach ani gramatykę tak, jak ludzie. Przewiduje sekwencje tokenów.

Ta różnica tworzy wiele osobliwości, które zauważają użytkownicy.

Dyskusje w społeczności często wskazują na strukturę tokenów jako jeden z powodów, dla których modele nie radzą sobie z rozumowaniem na poziomie liter.

Tokeny stają się wynikami

Gdy wejście jest tokenizowane:

  1. Tokeny trafiają do transformera
  2. Model przewiduje następny token
  3. Ten token jest dodawany
  4. Proces się powtarza

Następuje to aż:

  • pojawi się token zatrzymania
  • osiągnięty zostanie limit tokenów
  • system przerwie generację

To oznacza, że generacja AI ma zasadniczo postać pętli przewidywania tokenów, a nie rozumowania na poziomie zdań.

Ostateczna konkluzja

Tokenizacja wygląda na niewielki detal techniczny, ale kształtuje prawie wszystko we współczesnych systemach LLM.

Wpływa na:

  • koszty
  • prędkość
  • ograniczenia kontekstowe
  • wydajność wielojęzyczną
  • zachowanie modelu
  • jakość wyników

Jeśli budujesz z AI, zrozumienie tokenizacji daje ci znacznie lepszą intuicję o tym, dlaczego systemy zachowują się w taki, a nie inny sposób.

Zanim pojawią się osadzenia, transformatory czy wyniki, są tokeny.

I wszystko zaczyna się tam.

Staranna konstrukcja podpowiedzi, wybór słownictwa i budżetowanie tokenów pomagają zapewnić, że twoje wykorzystanie tokenów i liczba tokenów będą zgodne z twoimi celami kosztowymi i jakościowymi. Korzyścią są mniej niespodziewane zakończenia, niższe koszty API i modele, które lepiej rozumieją, w jaki sposób piszą twoi użytkownicy.

Wirusowe szablony

Odkryj nasze wirusowe szablony AI i zastosuj je do swoich zdjęć.

Odkryj szablony