Токенізація пояснена: від токенів до виходів
Автор: Wendy Frey
Перед тим, як велика мовна модель зможе згенерувати щось корисне, їй спочатку потрібно зробити дещо набагато простіше: розбити ваш текст на частини.
Цей процес називається токенізацією, і це один із найважливіших, і найбільш недооцінених, аспектів того, як працюють сучасні AI системи.
Більшість людей вважають, що моделі читають слова. Вони цього не роблять.
Вони читають токени: маленькі частини тексту, які можуть представляти повні слова, частини слів, пунктуацію, пробіли або навіть окремі символи. Ці токени потім перетворюються на числові ідентифікатори, які модель може обробляти всередині.
Розуміння токенізації допомагає пояснити багато речей:
- чому підказки коштують грошей
- чому контекстні вікна мають обмеження
- чому деякі мови коштують дорожче за інші
- чому моделі іноді поводяться дивно
Токенізація займає перше місце в AI-ланцюгу, і вона тихо формує все, що йде далі.
Що таке токен?
Токен, це найменша одиниця тексту, з якою працює модель.
Це не завжди те ж саме, що слово.
Наприклад:
| Текст | Можливий розподіл токенів |
|---|---|
| hello | hello |
| tokenization | token + ization |
| unbelievable | un + believ + able |
| 2026! | 202 + 6 +! |
Це важливо, оскільки моделі рахують токени, а не слова.
Коротке речення може використовувати більше токенів, ніж очікувалося, особливо з незвичними словами, кодом, емодзі або неанглійськими мовами.
Як працює токенізація
На високому рівні токенізація слідує простому сценарію.
Крок 1: Розділити текст
Токенізатор розбиває сирий текст на частини відповідно до своїх правил словника.
Сучасні LLM зазвичай покладаються на токенізацію підсловами, а не на токенізацію повними словами.
Це надає їм гнучкість для роботи з:
- рідкісними словами
- помилками
- іменами
- багатомовним входом
- кодом
Крок 2: Перетворити токени на ID
Кожен токен відповідає числу всередині словника моделі.
Приклад:
| Токен | Ідентифікатор токена |
|---|---|
| The | 791 |
| model | 4382 |
| works | 2921 |
Модель ніколи безпосередньо не «бачить» текст. Вона бачить лише ці числові уявлення.
Це місток між людською мовою і нейронними обчисленнями.
Крок 3: Перетворити ID на embeddings
Після створення ідентифікаторів токенів їх перетворюють на векторні вбудування.
Ось тут починає з'являтися значення.
На цьому етапі:
- подібні токени можуть займати сусідні позиції у векторному просторі
- взаємозв’язки між концепціями стають вимірюваними
- контекст починає мати значення
Токенізація вводить дані в систему. Вбудування робить їх інтерпретованими.
Чому токенізація підсловами стала стандартом
Старі системи NLP часто розділяли текст за словами.
Це працювало, поки вони не натрапили на слова, яких ніколи раніше не бачили.
Сучасні LLM зазвичай використовують методи, такі як Byte Pair Encoding (BPE) або подібні стратегії підсловів.
BPE працює, повторно об’єднуючи часті патерни символів у повторно використовувані одиниці. Це покращує стиснення і ефективність словника.
Чому моделі підсловів кращі
| Метод | Основна проблема |
|---|---|
| Рівень слів | Занадто багато невідомих слів |
| Рівень символів | Занадто повільно, занадто довго |
| Рівень підслів | Найкращий баланс гнучкості та ефективності |
Ось чому більшість сучасних моделей використовують якусь версію токенізації підсловами.
Чому токенізація впливає на вартість
Ось тут токенізація стає практичною.
Більшість AI API виставляють рахунки на основі:
- вхідних токенів
- вихідних токенів
Це означає, що токенізація безпосередньо впливає на ціну.
Наприклад:
| Тип введення | Приблизна щільність токенів |
|---|---|
| Простий англійський | Низька |
| Код | Середня-висока |
| Юридичний текст | Висока |
| Китайська/японська | Часто вища |
| Текст з емодзі | Несподівано висока |
Дві підказки з однаковою кількістю символів можуть мати дуже різну кількість токенів.
Це один з найпоширеніших прихованих витрат у системах AI в виробництві.
Чому токенізація впливає на поведінку моделі
Токенізація також пояснює багато «дивних» поведінкових проявів моделі.
Наприклад:
- чому моделі важко рахувати букви
- чому рідкісні слова поводяться непередбачувано
- чому зміни форматування можуть впливати на виходи
- чому порядок підказок важливий
Модель не думає буквами або граматикою так, як це роблять люди. Вона прогнозує послідовності токенів.
Ця відмінність створює багато дивацтв, які помічають користувачі.
Обговорення в спільноті часто вказують на структуру токенів як на одну з причин, чому моделі не справляються з логікою на рівні символів.
Токени стають виходами
Щойно введення токенізовано:
- Токени входять у трансформер
- Модель прогнозує наступний токен
- Цей токен додається
- Процес повторюється
Це триває доти:
- не з’являється токен зупинки
- не досягається межа токенів
- система не перериває генерацію
Це означає, що генерування AI, це по суті цикл прогнозування токенів, а не міркування на рівні речень.
Остаточний висновок
Токенізація виглядає як дрібна технічна деталь, але вона формує майже все в сучасних системах LLM.
Вона впливає на:
- вартість
- швидкість
- обмеження контексту
- багатомовну продуктивність
- поведінку моделі
- якість виходу
Якщо ви створюєте на основі AI, розуміння токенізації дає вам значно кращу інтуїцію щодо того, чому системи поводяться так, як вони поводяться.
Перед вбудуваннями, трансформерами або виходами, є токени.
І все починається звідти.
Увага до дизайну підказок, вибору словника та бюджету токенів допоможе забезпечити, щоб ваше використання токенів і їх кількість відповідали вашим цілям з витрат і якості.




