Токенізація пояснена: від токенів до виходів

Blog

Автор: Wendy Frey

26702eff-dbff-43b4-a5fb-fb97eab89247-1200x600.webp Перед тим, як велика мовна модель зможе згенерувати щось корисне, їй спочатку потрібно зробити дещо набагато простіше: розбити ваш текст на частини.

Цей процес називається токенізацією, і це один із найважливіших, і найбільш недооцінених, аспектів того, як працюють сучасні AI системи.

Більшість людей вважають, що моделі читають слова. Вони цього не роблять.

Вони читають токени: маленькі частини тексту, які можуть представляти повні слова, частини слів, пунктуацію, пробіли або навіть окремі символи. Ці токени потім перетворюються на числові ідентифікатори, які модель може обробляти всередині.

Розуміння токенізації допомагає пояснити багато речей:

  • чому підказки коштують грошей
  • чому контекстні вікна мають обмеження
  • чому деякі мови коштують дорожче за інші
  • чому моделі іноді поводяться дивно

Токенізація займає перше місце в AI-ланцюгу, і вона тихо формує все, що йде далі.

Що таке токен?

Токен, це найменша одиниця тексту, з якою працює модель.

Це не завжди те ж саме, що слово.

Наприклад:

ТекстМожливий розподіл токенів
hellohello
tokenizationtoken + ization
unbelievableun + believ + able
2026!202 + 6 +!

Це важливо, оскільки моделі рахують токени, а не слова.

Коротке речення може використовувати більше токенів, ніж очікувалося, особливо з незвичними словами, кодом, емодзі або неанглійськими мовами.

Як працює токенізація

На високому рівні токенізація слідує простому сценарію.

Крок 1: Розділити текст

Токенізатор розбиває сирий текст на частини відповідно до своїх правил словника.

Сучасні LLM зазвичай покладаються на токенізацію підсловами, а не на токенізацію повними словами.

Це надає їм гнучкість для роботи з:

  • рідкісними словами
  • помилками
  • іменами
  • багатомовним входом
  • кодом

Крок 2: Перетворити токени на ID

Кожен токен відповідає числу всередині словника моделі.

Приклад:

ТокенІдентифікатор токена
The791
model4382
works2921

Модель ніколи безпосередньо не «бачить» текст. Вона бачить лише ці числові уявлення.

Це місток між людською мовою і нейронними обчисленнями.

Крок 3: Перетворити ID на embeddings

Після створення ідентифікаторів токенів їх перетворюють на векторні вбудування.

Ось тут починає з'являтися значення.

На цьому етапі:

  • подібні токени можуть займати сусідні позиції у векторному просторі
  • взаємозв’язки між концепціями стають вимірюваними
  • контекст починає мати значення

Токенізація вводить дані в систему. Вбудування робить їх інтерпретованими.

Чому токенізація підсловами стала стандартом

Старі системи NLP часто розділяли текст за словами.

Це працювало, поки вони не натрапили на слова, яких ніколи раніше не бачили.

Сучасні LLM зазвичай використовують методи, такі як Byte Pair Encoding (BPE) або подібні стратегії підсловів.

BPE працює, повторно об’єднуючи часті патерни символів у повторно використовувані одиниці. Це покращує стиснення і ефективність словника.

Чому моделі підсловів кращі

МетодОсновна проблема
Рівень слівЗанадто багато невідомих слів
Рівень символівЗанадто повільно, занадто довго
Рівень підслівНайкращий баланс гнучкості та ефективності

Ось чому більшість сучасних моделей використовують якусь версію токенізації підсловами.

Чому токенізація впливає на вартість

Ось тут токенізація стає практичною.

Більшість AI API виставляють рахунки на основі:

  • вхідних токенів
  • вихідних токенів

Це означає, що токенізація безпосередньо впливає на ціну.

Наприклад:

Тип введенняПриблизна щільність токенів
Простий англійськийНизька
КодСередня-висока
Юридичний текстВисока
Китайська/японськаЧасто вища
Текст з емодзіНесподівано висока

Дві підказки з однаковою кількістю символів можуть мати дуже різну кількість токенів.

Це один з найпоширеніших прихованих витрат у системах AI в виробництві.

Чому токенізація впливає на поведінку моделі

Токенізація також пояснює багато «дивних» поведінкових проявів моделі.

Наприклад:

  • чому моделі важко рахувати букви
  • чому рідкісні слова поводяться непередбачувано
  • чому зміни форматування можуть впливати на виходи
  • чому порядок підказок важливий

Модель не думає буквами або граматикою так, як це роблять люди. Вона прогнозує послідовності токенів.

Ця відмінність створює багато дивацтв, які помічають користувачі.

Обговорення в спільноті часто вказують на структуру токенів як на одну з причин, чому моделі не справляються з логікою на рівні символів.

Токени стають виходами

Щойно введення токенізовано:

  1. Токени входять у трансформер
  2. Модель прогнозує наступний токен
  3. Цей токен додається
  4. Процес повторюється

Це триває доти:

  • не з’являється токен зупинки
  • не досягається межа токенів
  • система не перериває генерацію

Це означає, що генерування AI, це по суті цикл прогнозування токенів, а не міркування на рівні речень.

Остаточний висновок

Токенізація виглядає як дрібна технічна деталь, але вона формує майже все в сучасних системах LLM.

Вона впливає на:

  • вартість
  • швидкість
  • обмеження контексту
  • багатомовну продуктивність
  • поведінку моделі
  • якість виходу

Якщо ви створюєте на основі AI, розуміння токенізації дає вам значно кращу інтуїцію щодо того, чому системи поводяться так, як вони поводяться.

Перед вбудуваннями, трансформерами або виходами, є токени.

І все починається звідти.

Увага до дизайну підказок, вибору словника та бюджету токенів допоможе забезпечити, щоб ваше використання токенів і їх кількість відповідали вашим цілям з витрат і якості.

Вірусні шаблони

Досліджуй наші вірусні AI-шаблони та застосовуй їх до своїх фото.

Переглянути шаблони