Tokenlaşdırma Açıqlandı: Tokenlərdən Çıxışlara
Müəllif: Wendy Frey
Böyük dil modeli, istifadəli bir şey yarada bilmədən əvvəl daha sadə bir şey etməlidir: mətninizi parçalara ayırmaq.
Bu prosesə tokenlaşdırma deyilir və bu, müasir süni intellekt sistemlərinin işləməsinin ən vacib - və əksər hallarda göz ardı edilən - hissələrindən biridir.
Çox insan modelərin sözləri oxuduğunu düşünür. Onlar elə bilmir.
Onlar tokenlər oxuyurlar: tam sözləri, sözlərin parçalarını, durğu işarələrini, boşluqları və ya hətta fərdi simvolları təmsil edə bilən kiçik mətn parçaları. Bu tokenlər daha sonra modelin daxilində işləyə biləcəyi sayısal ID-lərə çevrilir.
Tokenlaşdırmanı başa düşmək çox şeyin izahına kömək edir:
- niyə təlqinlər pul tələb edir
- niyə kontekst pəncərələrinin limitləri var
- niyə bəzi dillər digərlərindən daha baha başa gəlir
- niyə modellər bəzən qəribə davranır
Tokenlaşdırma süni intellekt sisteminin çox başlanğıcındadır - və həmişə göz ardı edərək sonrakı hər şeyi formalaşdırır.
Token nədir?
Token, modelin işlədiyi mətnin ən kiçik vahididir.
Bu, həmişə bir sözlə eyni deyil.
Məsələn:
| Mətn | Mümkün token bölməsi |
|---|---|
| hello | hello |
| tokenlaşdırma | token + ization |
| unbelievable | un + believ + able |
| 2026! | 202 + 6 +! |
Bu əhəmiyyətlidir, çünki modellər sözləri deyil, tokenləri sayır.
Qısa görünən bir cümlə, gözlənildiyindən daha çox token istifadə edə bilər, xüsusilə də nadir sözlər, kodlar, emoji-lər və ya qeyri-ingilis dilləri ilə.
Tokenlaşdırma necə işləyir
Yüksək səviyyədə, tokenlaşdırma sadə bir boru xəttini izləyir.
Addım 1: Mətni bölmək
Tokenizer xam mətni lüğət qaydalarına əsaslanaraq parçalara ayırır.
Müasir LLM-lər adətən alt-söz tokenlaşdırmasından istifadə edirlər, tam söz tokenlaşdırması deyil.
Bu onlara aşağıdakıları idarə etmək üçün elastiklik verir:
- nadir sözlər
- yazı xətaları
- adlar
- çoxdilli giriş
- kod
Addım 2: Tokenləri ID-lərə çevirmək
Hər token modelin lüğətində bir rəqəmə uyğun gəlir.
Məsələn:
| Token | Token ID |
|---|---|
| The | 791 |
| model | 4382 |
| works | 2921 |
Model birbaşa mətni “görmür”. O, yalnız bu ədədi təmsilləri görür.
Bu, insan dilinin və neyron hesablamanın arasındakı körpüdür.
Addım 3: ID-ləri embedding-lərə çevirmək
Token ID-ləri yaradıldıqdan sonra, onlar vektor embedding-lərə çevrilir.
Bu, mənanın baş verməyə başladığı yerdir.
Bu nöqtədə:
- oxşar tokenlər vektor məkanında yaxın mövqelərdə ola bilər
- anlayışlar arasındakı münasibətlər ölçülə bilən olur
- kontekst əhəmiyyət kəsb etməyə başlayır
Tokenlaşdırma məlumatı sistemə daxil edir. Embedding-lər onu izaholunur edir.
Niyə alt-söz tokenlaşdırması standart oldu
Köhnə NLP sistemləri çox vaxt mətni sözlərə ayırırdılar.
Bu işləyirdi - ta ki, daha əvvəl görmədikləri sözlərlə qarşılaşana qədər.
Müasir LLM-lər adətən Byte Pair Encoding (BPE) və ya oxşar alt-söz strategiyalarından istifadə edir.
BPE, tez-tez təkrarlanan simvol naxışlarını yenidən istifadə edilə bilən vahidlərə birləşdirməklə işləyir. Bu, sıxılma və lüğət səmərəliliyini artırır.
Niyə alt-söz modelləri daha yaxşıdır
| Metod | Əsas problem |
|---|---|
| Söz səviyyəsi | Çox sayda bilinməyən söz |
| Simvol səviyyəsi | Çox yavaş, çox uzun |
| Alt-söz səviyyəsi | Ən yaxşı elastiklik və səmərəlilik tarazlığı |
Buna görə də müasir modellərin əksəriyyəti alt-söz tokenlaşdırmasının bir versiyasından istifadə edir.
Niyə tokenlaşdırma xərcləri təsir edir
Burada tokenlaşdırma praktik olur.
Əksər AI API-ləri aşağıdakı üzrə hesablanır:
- giriş tokenləri
- çıxış tokenləri
Bu, tokenlaşdırmanın birbaşa qiymətə təsir etdiyi deməkdir.
Məsələn:
| Giriş növü | Təxmini token sıxlığı |
|---|---|
| Sadə İngilis | Aşağı |
| Kod | Orta-yüksək |
| Hüquqi mətn | Yüksək |
| Çin/Yapon | Tez-tez daha yüksək |
| Emoji zəngin mətn | Həddən artıq yüksək |
Eyni simvol sayına malik iki təlqin, çox fərqli token sayına malik ola bilər.
Bu, istehsal AI sistemlərində ən yaygın gizli xərclərdən biridir.
Niyə tokenlaşdırma model davranışına təsir edir
Tokenlaşdırma həmçinin bir çox "qəribə" model davranışlarını izah edir.
Məsələn:
- niyə modellər hərf saymaqda çətinlik çəkir
- niyə nadir sözlər qeyri-müəyyən davranır
- niyə format dəyişiklikləri çıxışlara təsir edə bilər
- niyə təlqin ardıcıllığı əhəmiyyətlidir
Model insanlar kimi hərflər və qrammatika ilə düşünmür. O, token ardıcıllıqlarını proqnozlaşdırır.
Bu fərq, istifadəçilərin gördüyü bir çox qəribəliklər yaradır.
İctimai müzakirələr tez-tez token strukturlarını modellərin simvol səviyyəsində düşünmədə uğursuzluğuna səbəb olan bir səbəb kimi göstərir.
Tokenlər çıxışlara çevrilir
Daxil olan tokenlər tokenlaşdırıldıqdan sonra:
- Tokenlər transformatora daxil olur
- Model növbəti token-i proqnozlaşdırır
- O token əlavə olunur
- Proses təkrarlanır
Bu, aşağıdakı hallara qədər davam edir:
- bir dayanma tokeni meydana çıxır
- token limitinə çatılır
- sistem yaradılışı kəsir
Bu, AI yaradılmasının əsasən token-token proqnoz döngüsü olduğunu, cümlə səviyyəsində düşüncə olmadığını göstərir.
Son nəticə
Tokenlaşdırma, kiçik bir texniki detal kimi görünür, lakin müasir LLM sistemlərində demək olar ki, hər şeyi formalaşdırır.
Bu, aşağıdakıları təsir edir:
- xərc
- sürət
- kontekst limitləri
- çoxdilli performans
- model davranışı
- çıxış keyfiyyəti
AI ilə işləyirsinizsə, tokenlaşdırmanı başa düşmək sistemlərin necə davrandığını anlamaq üçün sizə daha yaxşı bir intuisiya verir.
Embedding-lər, transformatorlar və ya çıxışlar olmadan - tokenlər vardır.
Və hər şey oradan başlayır.
Dikkatli təlqin dizaynı, lüğət seçimləri və token büdcəsi, token istifadə və token sayınızın xərc və keyfiyyət hədəflərinizlə uyğun gəlməsini təmin etməyə kömək edir. Nəticəsi, gözlənilməz tamamlamaların az olması, API xərclərinin aşağı olması və modellərin istifadəçilərin yazı tərzini daha yaxşı başa düşmələri olur.




