Објаснување на токенизацијата: Од токени до излезни податоци
Автор: Wendy Frey

Поради тоа што големата јазична структура не може да генерира ништо корисно, прво мора да направи нешто многу попросто: да го крши текстот.
Тоа го нарекуваме токенизација, и тоа е еден од најважните, а истовремено и најзаборавените, делови од тоа како функционираат модерните АИ системи.
Повеќето луѓе мислат дека моделите читаат зборови. Не читаат.
Тие читаат токени: мали парчиња текст кои можат да претставуваат целосни зборови, делови од зборови, интерпункција, размак или дури и поединечни симболи. Тие токени потоа се конвертираат во бројни ИД-а кои моделот може да ги обработува внатрешно.
Разбирањето на токенизацијата помага да се објаснат многу работи:
- зошто упатствата чинат пари
- зошто прозорците на контекстот имаат лимити
- зошто некои јазици се поскапи од други
- зошто моделите понекогаш се однесуваат чудно
Токенизацијата се наоѓа на самиот почеток на АИ цевководот, и потивано го обликува сè што доаѓа потоа.
Што е токен?
Токенот е најмалата единица текст со која моделот работи.
Тој не е секогаш ист како збор.
На пример:
| Текст | Можно деление на токени |
|---|---|
| hello | hello |
| токенизација | токен + изација |
| неверојатно | не + веројат + но |
| 2026! | 202 + 6 +! |
Ова е важно бидејќи моделите броят токени, а не зборови.
Кратка реченица може да користи повеќе токени од очекуваното, особено со невообичаени зборови, код, емојис или не-англиски јазици.
Како функционира токенизацијата
На високо ниво, токенизацијата следи едноставен цевковод.
Чекор 1: Поделете го текстот
Токенизаторот го дели суровиот текст на парчиња врз основа на правилата на неговиот речник.
Современите LLM-ови обично се потпираат на токенизација на подзборови, а не на токенизација на целосни зборови.
Ова им дава флексибилност да се справат со:
- ретки зборови
- типографски грешки
- имиња
- многујазичен влез
- код
Чекор 2: Претворете ги токените во ИД
Секој токен се мапира на број во речникот на моделот.
Пример:
| Токен | ИД на токен |
|---|---|
| The | 791 |
| модел | 4382 |
| работи | 2921 |
Моделот никогаш „не гледа“ текстот директно. Тој само ги гледа овие нумерички претстави.
Тоа е мостот помеѓу човечкиот јазик и неуронската пресметка.
Чекор 3: Претворете ги ИД-ите во векторски вметнувања
Откако ќе се создадат ИД-ите на токените, тие се трансформираат во векторски вметнувања.
Тука почнува да се појавува значењето.
Во овој момент:
- сличните токени можат да заземат блиски положби во векторскиот простор
- релациите помеѓу концептите стануваат мерливи
- контекстот почнува да има значење
Токенизацијата ги става податоците во системот. Вметнувањата ги прават интерпретабилни.
Зошто токенизацијата на подзборови стана стандард
Постарите NLP системи често ја делат текстот по зборови.
Тоа функционираше, додека не наидоа на зборови кои никогаш не ги виделе порано.
Современите LLM-ови обично користат методи како Byte Pair Encoding (BPE) или слични стратегии за подзборови.
BPE работи така што повторно ги спојува честите шаблони на карактери во повторно употребливи единици. Ова го подобрува компресирањето и ефикасноста на речникот.
Зошто моделите на подзборови се подобри
| Метод | Главен проблем |
|---|---|
| Ниво на збор | Премногу непознати зборови |
| Ниво на карактер | Премногу бавно, премногу долго |
| Ниво на подзбор | Најдобра рамнотежа на флексибилност и ефикасност |
Ова е причината зошто повечето современи модели користат некоја верзија на токенизација на подзборови.
Зошто токенизацијата влијае на цената
Тука токенизацијата станува практична.
Повеќето АИ API-ја наплатуваат на основа на:
- влезни токени
- излезни токени
Тоа значи дека токенизацијата директно влијае на цената.
На пример:
| Тип на влез | Приближна густина на токени |
|---|---|
| Обичен англиски | Ниска |
| Код | Средно-висока |
| Правен текст | Висока |
| Кинески/Јапонски | Често повисока |
| Текст со многу емоији | Изненадувачки висока |
Две упатства со ист број на знаци можат да имаат многу различен број на токени.
Ова е едно од најчестите сокриени причинители за трошоци во производните АИ системи.
Зошто токенизацијата влијае на однесувањето на моделот
Токенизацијата исто така објаснува многу "чудни" однесувања на моделите.
На пример:
- зошто моделите имаат проблем со бројот на букви
- зошто ретките зборови се однесуваат непредвидливо
- зошто промените во формата можат да влијаат на излезите
- зошто редоследот на упатствата е важен
Моделот не размислува во букви или граматика на начини на кои луѓето размислуваат. Тој предвидува секвенци на токени.
Таа разлика создава многу од чудесните работи кои корисниците ги забележуваат.
Дискусиите во заедницата често укажуваат на структурата на токените како една причина модели да не успеваат во размислувањето на ниво на букви.
Токени стануваат излези
Откако влезот е токенизиран:
- Токените влегуваат во трансформаторот
- Моделот предвидува следниот токен
- Тој токен се додава
- Процесот се повторува
Ова продолжува дотогаш:
- додека не се појави токен за укинување
- додека не се достигне лимитот на токени
- додека системот не прекине генерирање
Ова значи дека генерирањето на АИ е основно предвидување токен по токен, а не размислување на ниво на реченица.
Завршна заклучок
Токенизацијата изгледа како мал технички детал, но ги обликува речиси сè во модерните LLM системи.
Тоа влијае на:
- цена
- брзина
- ограничувања на контекстот
- многујазична перформанса
- однесување на моделот
- квалитет на излезот
Ако градење со АИ, разбирањето на токенизацијата ви дава многу подобра интуиција зошто системите се однесуваат на начин на кој го прават.
Пред да постојат вметнувања, трансформатори или изводи, постојат токени.
И сè започнува таму.
Внимателниот дизајн на упатства, избор на речник и буџетирање на токени помагаат да се осигура дека вашата употреба на токени и бројот на токени се совпаѓаат со вашите цели за трошоци и квалитет. Резултатот е помалку неочекувани завршетоци, пониски трошоци на API и модели кои подобро го разбираат начин на кој вашите корисници пишуваат.




