Tokenizatsiya tushuntirilishi: tokenlardan chiqarishgacha
Muallif: Wendy Frey

Katta til modeli foydali narsalarni yaratishdan avval, avvalroq juda oddiy ishni bajarishi kerak: matnni bo‘lish.
Bu jarayon tokenizatsiya deb ataladi va bu zamonaviy sun’iy intellekt tizimlarining ishlashining eng muhim, va ko‘pincha e’tibordan chetda qoladigan, qismidir.
Ko‘pchilik odamlar modellarning so‘zlarni o‘qishini o‘ylaydi. Ular buni qilmaydi.
Ular tokenlarni o‘qiydi: to‘liq so‘zlarni, so‘z qismlarini, punktuatsiya, bo‘shliq yoki hatto alohida ramzlarni ifodalovchi kichik matn bo‘laklari. Bu tokenlar model tomonidan ichki hisoblash uchun raqamli IDlarga aylantiriladi.
Tokenizatsiyani tushunish ko‘plab narsalarni tushuntirishga yordam beradi:
- nega so‘rovlar pul talab qiladi
- nega kontekst oynalarining chegaralari bor
- nega ba'zi tillar boshqalaridan qimmatroq
- nega modellarning ba'zida g‘alati harakat qilishlari
Tokenizatsiya sun’iy intellekt quvurining eng boshlanishida joylashgan, va u tinchlik bilan keyin quyidagi hamma narsaga shakl beradi.
Token nima?
Token model ishlov beradigan eng kichik matn birligi.
Bu har doim so‘z bilan bir xil emas.
Masalan:
| Matn | Ehtimoliy token bo‘laklari |
|---|---|
| salom | salom |
| tokenizatsiya | token + izatsiya |
| ishonchsiz | ishon + chs + iz |
| 2026! | 202 + 6 +! |
Bu muhim, chunki modellar tokenlarni, so‘zlarni emas, hisoblaydi.
Qisqa ko‘rinadigan jumla kutilgandan ko‘ra ko‘proq token ishlatishi mumkin, ayniqsa, kam uchraydigan so‘zlar, kod, emojilar yoki ingliz tilidagi bo‘lmagan tillar bilan.
Tokenizatsiya qanday ishlaydi
Yuqqa darajada, tokenizatsiya oddiy quvurdan o‘tadi.
Qadam 1: Matnni bo‘lish
Tokenizator xom matnni lug‘at qoidalariga asoslanib bo‘laklarga ajratadi.
Zamonaviy LLMlar odatda sub-so‘z tokenizatsiyasiga tayanadi, to‘liq-so‘z tokenizatsiyasiga emas.
Bu ularga quyidagilarni hal qilishda moslashuvchanlik beradi:
- kam uchraydigan so‘zlar
- xatolar
- ism
- ko‘p tilli kiritish
- kod
Qadam 2: Tokenlarni IDlarga aylantirish
Har bir token modelning lug‘atidagi raqamlarga xaritada joylashadi.
Misol:
| Token | Token ID |
|---|---|
| The | 791 |
| model | 4382 |
| works | 2921 |
Model matnni to‘g‘ridan-to‘g‘ri “ko‘rmaydi”. U faqatgina ushbu raqamli ko‘rinishlarni ko‘radi.
Bu inson tilidan neyron hisoblashga o‘tish ko‘prigidir.
Qadam 3: IDlarni embeddinglarga aylantirish
Token IDlari yaratilgandan so‘ng, ular vektor embeddinglarga aylantiriladi.
Bu yerda ma'no paydo bo‘la boshlar.
Ushbu nuqtada:
- o‘xshash tokenlar vektor maydonida yaqin joylarni egallashi mumkin
- tushunchalar o‘rtasidagi aloqalar o‘lchovga ega bo‘ladi
- kontekst ahamiyat kasb etadi
Tokenizatsiya ma'lumotlarni tizimga kiritadi. Embeddinglar uni tushunarli qiladi.
Nima uchun sub-so‘z tokenizatsiyasi standart bo‘lib qoldi
Eski NLP tizimlari ko‘pincha matnni so‘zlar bilan ajratardi.
Bu ishladi, ular ilgari hech qachon ko‘rmagan so‘zlarga duch kelgunicha.
Zamonaviy LLMlar odatda Byte Pair Encoding (BPE) yoki shunga o‘xshash sub-so‘z strategiyalaridan foydalanadi.
BPE tez-tez takrorlanadigan belgilarning naqshlarini qayta birlashtirib, qayta ishlatiladigan birliklarga aylantiradi. Bu siqishni va lug‘at samaradorligini yaxshilaydi.
Nima uchun sub-so‘z modellari yaxshiroq
| Usul | Asosiy muammo |
|---|---|
| So‘z darajasi | Juda ko‘p noma'lum so‘zlar |
| Belgilar darajasi | Juda sekin, juda uzun |
| Sub-so‘z darajasi | Eng yaxshi moslashuvchanlik va samaradorlik balansi |
Shu sababli ko‘pchilik zamonaviy modellarda sub-so‘z tokenizatsiyasining bir versiyasi ishlatiladi.
Nima uchun tokenizatsiya narxga ta'sir qiladi
Bu yerda tokenizatsiya amaliy ahamiyat kasb etadi.
Ko‘pchilik AI APIlari hisob-kitoblarni quyidagi asosda amalga oshiradi:
- kiritilgan tokenlar
- chiqarilgan tokenlar
Bu shuni anglatadiki, tokenizatsiya to‘g‘ridan-to‘g‘ri narxga ta'sir qiladi.
Masalan:
| Kiritish turi | Taxminiy token zichligi |
|---|---|
| Oddiy ingliz | Past |
| Kod | O‘rta-yuqli |
| Huquqiy matn | Yuqori |
| Xitoy/Yaponiya | Ko‘pincha yuqoriroq |
| Emoji ko‘p matn | Kutilmaganda yuqori |
Bir xil belgi hisobiga ega ikki so‘rov juda turli xil token sonlariga ega bo‘lishi mumkin.
Bu ishlab chiqarish AI tizimlaridagi eng keng tarqalgan yashirin xarajatlarni keltirib chiqaruvchi omillardandir.
Nima uchun tokenizatsiya model xulq-atvoriga ta'sir qiladi
Tokenizatsiya ham ko‘plab “g‘alati” model xulq-atvorlarini tushuntiradi.
Masalan:
- nega modellarda harf hisoblashda qiyinchiliklar bo‘ladi
- nega kam uchraydigan so‘zlar kutilmagan tarzda harakat qiladi
- nega formatting o‘zgarishlari chiqarishni ta'sir qiladi
- nega so‘rov tartibi muhim
Model odamlar kabi harflarda yoki grammatikada o‘ylamaydi. U tokenlar ketma-ketligini bashorat qiladi.
Bu farq ko‘plab foydalanuvchilar kuzatadigan g‘alati xususiyatlarni yaratadi.
Jamoa munozaralari ko‘pincha token strukturasini modellarning harf darajasida fikrlashda muvaffaqiyatsizligiga sabab bo‘lib ko‘rsatadi.
Tokenlar chiqarishga aylanadi
Kiritish tokenizatsiyalanganidan so‘ng:
- Tokenlar transformatorga kiradi
- Model kelajakdagi tokenni bashorat qiladi
- Ushbu token qo‘shiladi
- Jarayon takrorlanadi
Bu davom etadi, to:
- to‘xtatish tokeni paydo bo‘ladi
- token chegarasi yetib bormaydi
- tizim yaratilishini to‘xtatar
Bu sun’iy intellekt yaratilishi asosiy oqimda token-by-token bashorat aylanishidir, jumla darajasidagi fikrlash emas.
Yakuniy xulosa
Tokenizatsiya kichik texnik tafsilot kabi ko‘rinadi, ammo bu zamonaviy LLM tizimlaridagi deyarli barchaga shakl beradi.
Bu ta'sir qiladi:
- narx
- tezlik
- kontekst chegaralari
- ko‘p tilli ishlash
- model xulq-atvori
- chiqarish sifati
Agar siz AI bilan qurayotgan bo‘lsangiz, tokenizatsiyani tushunish tizimlarning qanday xulq-atvorni anglashda sizga ancha yaxshi tushuncha beradi.
Embeddinglar, transformatorlar yoki chiqarishdan oldin, tokenlar mavjud.
Va hamma narsa shu yerda boshlanadi.
E’tibor bilan so‘rovlarni tayyorlash, lug‘at tanlash va token byudjeti sizning token ishlatishingiz va token hisobingiz narx va sifat maqsadlaringizga muvofiq kelishini ta’minlashga yordam beradi. Natija kutilmagan to‘liq ma’lumotlarning kam, API xarajatlarining pasayishi va modellarning foydalanuvchilaringiz qanday yozishini yaxshiroq tushunishidir.




