Обяснение на токенизация: От токени до изходи

Blog

От Wendy Frey

26702eff-dbff-43b4-a5fb-fb97eab89247-1200x600.webp Преди голям езиков модел да може да генерира нещо полезно, той трябва да направи нещо много по-просто първо: да разчупи текста ви.

Този процес се нарича токенизация, и е една от най-важните, и най-пренебрегваните, части от начина, по който работят съвременните AI системи.

Повечето хора мислят, че моделите четат думи. Те не четат.

Те четат токени: малки парчета текст, които могат да представляват цели думи, части от думи, пунктуация, интервали или дори индивидуални символи. Тези токени след това се преобразуват в числови идентификатори, които моделът може да обработва вътрешно.

Разбирането на токенизацията помага да се обяснят много неща:

  • защо подканите струват пари
  • защо контекстните прозорци имат ограничения
  • защо някои езици са по-скъпи от други
  • защо моделите понякога се държат странно

Токенизацията седи в самото начало на AI веригата, и тихо оформя всичко, което идва след нея.

Какво е токен?

Токенът е най-малката единица текст, с която работи моделът.

Той не винаги е същият като дума.

Например:

ТекстВъзможно разделяне на токени
hellohello
токенизациятокен + аизация
невярноне + вярвай + о
2026!202 + 6 +!

Това е важно, защото моделите броят токени, а не думи.

Кратко изглеждащо изречение може да използва повече токени, отколкото се очаква, особено с необичайни думи, код, емоджита или неанглийски езици.

Как работи токенизацията

На високо ниво, токенизацията следва прост поток.

Стъпка 1: Разделяне на текста

Токенизаторът разчупва оригиналния текст на парчета въз основа на правилата на неговия лексикон.

Съвременните LLM обикновено разчитат на поддухова токенизация, а не на токенизация по пълни думи.

Това им дава гъвкавост да се справят с:

  • редки думи
  • грешки в писането
  • имена
  • многоезичен вход
  • код

Стъпка 2: Преобразуване на токени в идентификатори

Всеки токен се свързва с число в лексикона на модела.

Пример:

ТокенID на токен
The791
model4382
works2921

Моделът никога не „вижда“ текста директно. Той вижда само тези числови представяния.

Това е мостът между човешкия език и невронната обработка.

Стъпка 3: Преобразуване на ID в векторални представяния

След като ID на токените бъдат създадени, те се преобразуват в векторални представяния.

Тук започва да излиза значението.

В този момент:

  • подобни токени могат да заемат близки позиции в векторалното пространство
  • отношенията между концепциите стават измерими
  • контекстът започва да има значение

Токенизацията въвежда данните в системата. Векторалните представяния ги правят интерпретируеми.

Защо поддуховата токенизация стана стандарт

По-старите NLP системи често разделят текста по думи.

Това работеше, докато не срещнаха думи, които никога не бяха виждали преди.

Съвременните LLM обикновено използват методи като Byte Pair Encoding (BPE) или подобни стратегии за поддухова токенизация.

BPE работи, като многократно обединява често срещани модели от символи в преизползваеми единици. Това подобрява компресията и ефективността на лексикона.

Защо поддунховите модели са по-добри

МетодОсновен проблем
Ниво на думиПрекалено много непознати думи
Ниво на символиПрекалено бавно, прекалено дълго
Ниво на поддуховеНай-добро съотношение между гъвкавост и ефективност

Затова повечето съвременни модели използват някаква версия на поддухова токенизация.

Защо токенизацията влияе на разходите

Тук токенизацията става практична.

Повечето AI API таксуват на базата на:

  • входни токени
  • изходни токени

Това означава, че токенизацията пряко влияе на цената.

Например:

Тип входПриблизителна плътност на токените
Проста английска речНиска
КодСредно-висока
Юридически текстВисока
Китайски/ЯпонскиЧесто по-висока
Текст с много емоджитаУчудващо висока

Две подканите с един и същ брой знаци могат да имат много различен брой токени.

Това е един от най-разпространените невидими фактори за разходите в производствените AI системи.

Защо токенизацията влияе на поведението на модела

Токенизацията също така обяснява много „странни“ поведения на модела.

Например:

  • защо моделите се затрудняват с броенето на букви
  • защо редките думи имат непредсказуемо поведение
  • защо промените в форматирането могат да повлияят на изходите
  • защо редът на подканите има значение

Моделът не мисли в букви или граматика, както го правят хората. Той предсказва последователности от токени.

Тази разлика създава много от странностите, които потребителите забелязват.

Общностните дискусии често указват на структурата на токените като една от причините моделите да не успяват в разсъждения на ниво букви.

Токените стават изходи

След като входът е токениран:

  1. Токените влизат в трансформатора
  2. Моделът предсказва следващия токен
  3. Този токен се добавя
  4. Процесът се повтаря

Това продължава, докато:

  • се появи спирачен токен
  • се достигне лимит на токените
  • системата прекъсне генерирането

Това означава, че AI генерирането е по същество предсказание токен по токен, а не разсъждение на ниво изречение.

Заключение

Токенизацията изглежда като малък технически детайл, но оформя почти всичко в съвременните LLM системи.

Тя влияе на:

  • разходи
  • скорост
  • ограничения на контекста
  • многоезична производителност
  • поведение на модела
  • качество на изхода

Ако строите с AI, разбирането на токенизацията ви дава много по-добра интуиция защо системите се държат по начина, по който го правят.

Преди да има векторални представяния, трансформатори или изходи, има токени.

И всичко започва оттам.

Внимателното проектиране на подканите, изборът на лексикон и бюджетът за токени помагат да се осигури, че използването и броят на токените съответстват на вашите цели за разходи и качество. Резултатът е по-малко неочаквани завършвания, по-ниски разходи за API и модели, които по-добре разбират начина, по който вашите потребители пишат.

Вирусни шаблони

Разгледай нашите вирусни AI шаблони и ги приложи към своите снимки.

Разгледай шаблоните