Токенизация туралы түсінік: Токендерден шығысқа
Автор: Wendy Frey

Үлкен тілдік модельдер пайдалы нәрсе жасаудан бұрын, бірінші кезекте, мәтініңізді бөлшектеуі керек.
Бұл процесс токенизация деп аталады, және ол қазіргі заманғы ИИ жүйелерінің жұмыс істеудің маңызды әрі көп назардан тыс қалған бөліктерінің бірі.
Көптеген адамдар модельдер сөздерді оқиды деп ойлайды. Олар оқымайды.
Олар токендерді оқиды: толық сөздерді, сөз бөліктерін, тыныс белгілерін, бос орындарды немесе тіпті жеке таңбаларды білдіретін мәтіннің шағын бөліктері. Бұл токендер кейін модельдің ішкі өңдеуіне арналған сандық идентификаторларға (ID) түрлендіріледі.
Токенизацияны түсіну көптеген нәрселерді түсіндіруге көмектеседі:
- неге промпттар ақша тұрады
- неге контекстік терезелер шектелген
- неге кейбір тілдер басқаларға қарағанда қымбат
- неге модельдер кейде таңғажайып әрекет етеді
Токенизация ИИ құбырының басында орналасқан, және ол кейінгі барлық нәрселерді үнсіз түрде қалыптастырады.
Токен дегеніміз не?
Токен, модельдің жұмыс істейтін мәтіннің ең кішкентай бірлігі.
Ол әрқашан сөзбен бірдей емес.
Мысалы:
| Мәтін | Мүмкін токен бөлу |
|---|---|
| hello | hello |
| токенизация | токен + изация |
| сенбейтін | сен + бе + йтін |
| 2026! | 202 + 6 +! |
Бұл маңызды, себебі модельдер токендерді, сөздерді емес, санайды.
Көрінісі қысқа болатын сөйлем, әсіресе сирек кездесетін сөздер, код, эмодзилер немесе ағылшын тілінен басқа тілдермен күткеннен көп токендерді пайдалануы мүмкін.
Токенизация қалай жұмыс істейді
Жоғарғы деңгейде токенизация қарапайым құбырды ұстанады.
1-қадам: Мәтінді бөлу
Токенизатор шикі мәтінді оның сөздік ережелеріне негізделген бөліктерге бөледі.
Заманауи LLM-дер көбінесе субсөздік токенизацияны қолданады, толық сөздік токенизацияны емес.
Бұл оларға:
- сирек сөздер
- түзетілмеген жазулар
- есімдер
- көптілді енгізу
- кодты
жөндеуге икемділік береді.
2-қадам: Токендерді ID-ге түрлендіру
Әр токен модельдің сөздігінде нөмірге сәйкес келеді.
Мысал:
| Токен | Токен ID |
|---|---|
| The | 791 |
| model | 4382 |
| works | 2921 |
Модель мәтінді тікелей «көрмейді». Ол тек осы сандық бейнелерді көреді.
Бұл адам тілінің және нейрондық есептеудің арасындағы көпір.
3-қадам: ID-лерді эмбедингтерге түрлендіру
Токен ID-лері құрылып болғаннан кейін, олар векторлы эмбедингтерге түрлендіріледі.
Бұл жерде мағына айқындала бастайды.
Бұл кезеңде:
- ұқсас токендер векторлық кеңістікте жақын позицияларды ала алады
- ұғымдар арасындағы байланыстар өлшенетін болады
- контекст маңызды бола бастайды
Токенизация деректерді жүйеге ендіреді. Эмбедингтер оны түсінікті етеді.
Неге субсөздік токенизация стандартқа айналды
Ескі NLP жүйелері көбінесе мәтінді сөздер бойынша бөлетін.
Бұл жұмыс істеді, олар бұрын көрмеген сөздермен бетпе-бет келгенше.
Заманауи LLM-дер әдетте Byte Pair Encoding (BPE) сияқты әдістерді немесе ұқсас субсөздік стратегияларды қолданады.
BPE жиі кездесетін таңбалық үлгілерді қайта-қайта біріктіріп, қайта пайдаланылатын бірліктерге айналады. Бұл сығу мен сөздік тиімділігін жақсартады.
Неге субсөздік модельдер жақсырақ
| Әдіс | Негізгі проблема |
|---|---|
| Сөздік деңгей | Білмейтін сөздер көп |
| Символдық деңгей | Тым баяу, тым ұзақ |
| Субсөздік деңгей | Икемділік пен тиімділіктің ең жақсы теңгерімі |
Сондықтан заманауи модельдердің көпшілігі субсөздік токенизацияның қандай да бір нұсқасын пайдаланады.
Неге токенизация шығындарға әсер етеді
Токенизация практикалық түрде маңызды болады.
Көптеген ИИ API-лері келесі негізде төлейді:
- енгізу токендері
- шығыс токендері
Бұл токенизация тікелей бағаны әсер етеді.
Мысалы:
| Кіру түрі | Жақын токен тығыздығы |
|---|---|
| Қарапайым ағылшын | Төмен |
| Код | Орташа, жоғары |
| Заң мәтіні | Жоғары |
| Қытай/Жапон | Әдетте жоғары |
| Эмодзи көп мәтін | Тым жоғары |
Сол сөйлемдер бірдей символ санауымен, бірақ әртүрлі токен санауларымен болуы мүмкін.
Бұл өндірістік ИИ жүйелерінде ең көп кездесетін жасырын шығын драйверлерінің бірі.
Неге токенизация модельдің әрекетіне әсер етеді
Токенизация «бұрыс» модель әрекеттерінің көпшілігін де түсіндіреді.
Мысалы:
- неге модельдер әріп санауымен қиындық көреді
- неге сирек сөздер күтпеген түрде әрекет етеді
- неге форматтау өзгерістері шығыстарға әсер ете алады
- неге промпттардың тәртібі маңызды
Модельдер адамдар сияқты әріптер немесе грамматикада ойламайды. Ол токендер тізбегін болжайды.
Бұл айырмашылық пайдаланушылар байқап отырған көптеген ерекшеліктерді жасайды.
Қауымдастық талқылаулары көбінесе токен құрылымын модельдердің символдық деңгейдегі түсіндіруі сәтсіздіктерінің бір себебі ретінде көрсетеді.
Токендер шығысқа айналады
Кіріс токенизацияланғаннан кейін:
- Токендер трансформаторға өтеді
- Модель келесі токенді болжайды
- Бұл токен қосылады
- Процесс қайталанады
Бұл:
- тоқтау токені пайда болғанша
- токен шегіне жеткенше
- жүйе генерацияны тоқтатқанша
бұлай жалғасады.
Бұл ИИ генерациясының негізінен токен-токенді болжау циклында екенін білдіреді, сөйлем деңгейіндегі түсінік емес.
Соңғы қорытынды
Токенизация шағын техникалық деталь секілді көрінуі мүмкін, бірақ ол қазіргі LLM жүйелерінің дерлік бәрін қалыптастырады.
Ол әсер етеді:
- шығын
- жылдамдық
- контекст шектері
- көптілді өнімділік
- модельдің әрекеті
- шығыс сапасы
Егер сіз ИИ-мен жұмыс істеп жатсаңыз, токенизацияны түсіну жүйелердің неге осындай әрекет ететінін кешенді түрде түсінуге көмектеседі.
Эмбедингтер, трансформаторлар немесе шығыстардан бұрын, токендер бар.
Және бәрі сонда басталады.
Дұрыс промпт дизайны, сөздік таңдаулар және токен бюджеті сіздің токен пайдалануыңыз бен токен санауларыңыздың шығындар мен сапа мақсаттарыңызбен сәйкес келуін қамтамасыз етуге көмектеседі. Бұл күтпеген аяқтаулар, API шығындарын төмендету және модельдеріңіздің пайдаланушылардың жазу тәсілдерін жақсы түсінуі үшін төлемді азайтады.




