Tokenlaşdırma Açıqlandı: Tokenlərdən Çıxışlara

Blog

Müəllif: Wendy Frey

26702eff-dbff-43b4-a5fb-fb97eab89247-1200x600.webp Böyük dil modeli, istifadəli bir şey yarada bilmədən əvvəl daha sadə bir şey etməlidir: mətninizi parçalara ayırmaq.

Bu prosesə tokenlaşdırma deyilir və bu, müasir süni intellekt sistemlərinin işləməsinin ən vacib - və əksər hallarda göz ardı edilən - hissələrindən biridir.

Çox insan modelərin sözləri oxuduğunu düşünür. Onlar elə bilmir.

Onlar tokenlər oxuyurlar: tam sözləri, sözlərin parçalarını, durğu işarələrini, boşluqları və ya hətta fərdi simvolları təmsil edə bilən kiçik mətn parçaları. Bu tokenlər daha sonra modelin daxilində işləyə biləcəyi sayısal ID-lərə çevrilir.

Tokenlaşdırmanı başa düşmək çox şeyin izahına kömək edir:

  • niyə təlqinlər pul tələb edir
  • niyə kontekst pəncərələrinin limitləri var
  • niyə bəzi dillər digərlərindən daha baha başa gəlir
  • niyə modellər bəzən qəribə davranır

Tokenlaşdırma süni intellekt sisteminin çox başlanğıcındadır - və həmişə göz ardı edərək sonrakı hər şeyi formalaşdırır.

Token nədir?

Token, modelin işlədiyi mətnin ən kiçik vahididir.

Bu, həmişə bir sözlə eyni deyil.

Məsələn:

MətnMümkün token bölməsi
hellohello
tokenlaşdırmatoken + ization
unbelievableun + believ + able
2026!202 + 6 +!

Bu əhəmiyyətlidir, çünki modellər sözləri deyil, tokenləri sayır.

Qısa görünən bir cümlə, gözlənildiyindən daha çox token istifadə edə bilər, xüsusilə də nadir sözlər, kodlar, emoji-lər və ya qeyri-ingilis dilləri ilə.

Tokenlaşdırma necə işləyir

Yüksək səviyyədə, tokenlaşdırma sadə bir boru xəttini izləyir.

Addım 1: Mətni bölmək

Tokenizer xam mətni lüğət qaydalarına əsaslanaraq parçalara ayırır.

Müasir LLM-lər adətən alt-söz tokenlaşdırmasından istifadə edirlər, tam söz tokenlaşdırması deyil.

Bu onlara aşağıdakıları idarə etmək üçün elastiklik verir:

  • nadir sözlər
  • yazı xətaları
  • adlar
  • çoxdilli giriş
  • kod

Addım 2: Tokenləri ID-lərə çevirmək

Hər token modelin lüğətində bir rəqəmə uyğun gəlir.

Məsələn:

TokenToken ID
The791
model4382
works2921

Model birbaşa mətni “görmür”. O, yalnız bu ədədi təmsilləri görür.

Bu, insan dilinin və neyron hesablamanın arasındakı körpüdür.

Addım 3: ID-ləri embedding-lərə çevirmək

Token ID-ləri yaradıldıqdan sonra, onlar vektor embedding-lərə çevrilir.

Bu, mənanın baş verməyə başladığı yerdir.

Bu nöqtədə:

  • oxşar tokenlər vektor məkanında yaxın mövqelərdə ola bilər
  • anlayışlar arasındakı münasibətlər ölçülə bilən olur
  • kontekst əhəmiyyət kəsb etməyə başlayır

Tokenlaşdırma məlumatı sistemə daxil edir. Embedding-lər onu izaholunur edir.

Niyə alt-söz tokenlaşdırması standart oldu

Köhnə NLP sistemləri çox vaxt mətni sözlərə ayırırdılar.

Bu işləyirdi - ta ki, daha əvvəl görmədikləri sözlərlə qarşılaşana qədər.

Müasir LLM-lər adətən Byte Pair Encoding (BPE) və ya oxşar alt-söz strategiyalarından istifadə edir.

BPE, tez-tez təkrarlanan simvol naxışlarını yenidən istifadə edilə bilən vahidlərə birləşdirməklə işləyir. Bu, sıxılma və lüğət səmərəliliyini artırır.

Niyə alt-söz modelləri daha yaxşıdır

MetodƏsas problem
Söz səviyyəsiÇox sayda bilinməyən söz
Simvol səviyyəsiÇox yavaş, çox uzun
Alt-söz səviyyəsiƏn yaxşı elastiklik və səmərəlilik tarazlığı

Buna görə də müasir modellərin əksəriyyəti alt-söz tokenlaşdırmasının bir versiyasından istifadə edir.

Niyə tokenlaşdırma xərcləri təsir edir

Burada tokenlaşdırma praktik olur.

Əksər AI API-ləri aşağıdakı üzrə hesablanır:

  • giriş tokenləri
  • çıxış tokenləri

Bu, tokenlaşdırmanın birbaşa qiymətə təsir etdiyi deməkdir.

Məsələn:

Giriş növüTəxmini token sıxlığı
Sadə İngilisAşağı
KodOrta-yüksək
Hüquqi mətnYüksək
Çin/YaponTez-tez daha yüksək
Emoji zəngin mətnHəddən artıq yüksək

Eyni simvol sayına malik iki təlqin, çox fərqli token sayına malik ola bilər.

Bu, istehsal AI sistemlərində ən yaygın gizli xərclərdən biridir.

Niyə tokenlaşdırma model davranışına təsir edir

Tokenlaşdırma həmçinin bir çox "qəribə" model davranışlarını izah edir.

Məsələn:

  • niyə modellər hərf saymaqda çətinlik çəkir
  • niyə nadir sözlər qeyri-müəyyən davranır
  • niyə format dəyişiklikləri çıxışlara təsir edə bilər
  • niyə təlqin ardıcıllığı əhəmiyyətlidir

Model insanlar kimi hərflər və qrammatika ilə düşünmür. O, token ardıcıllıqlarını proqnozlaşdırır.

Bu fərq, istifadəçilərin gördüyü bir çox qəribəliklər yaradır.

İctimai müzakirələr tez-tez token strukturlarını modellərin simvol səviyyəsində düşünmədə uğursuzluğuna səbəb olan bir səbəb kimi göstərir.

Tokenlər çıxışlara çevrilir

Daxil olan tokenlər tokenlaşdırıldıqdan sonra:

  1. Tokenlər transformatora daxil olur
  2. Model növbəti token-i proqnozlaşdırır
  3. O token əlavə olunur
  4. Proses təkrarlanır

Bu, aşağıdakı hallara qədər davam edir:

  • bir dayanma tokeni meydana çıxır
  • token limitinə çatılır
  • sistem yaradılışı kəsir

Bu, AI yaradılmasının əsasən token-token proqnoz döngüsü olduğunu, cümlə səviyyəsində düşüncə olmadığını göstərir.

Son nəticə

Tokenlaşdırma, kiçik bir texniki detal kimi görünür, lakin müasir LLM sistemlərində demək olar ki, hər şeyi formalaşdırır.

Bu, aşağıdakıları təsir edir:

  • xərc
  • sürət
  • kontekst limitləri
  • çoxdilli performans
  • model davranışı
  • çıxış keyfiyyəti

AI ilə işləyirsinizsə, tokenlaşdırmanı başa düşmək sistemlərin necə davrandığını anlamaq üçün sizə daha yaxşı bir intuisiya verir.

Embedding-lər, transformatorlar və ya çıxışlar olmadan - tokenlər vardır.

Və hər şey oradan başlayır.

Dikkatli təlqin dizaynı, lüğət seçimləri və token büdcəsi, token istifadə və token sayınızın xərc və keyfiyyət hədəflərinizlə uyğun gəlməsini təmin etməyə kömək edir. Nəticəsi, gözlənilməz tamamlamaların az olması, API xərclərinin aşağı olması və modellərin istifadəçilərin yazı tərzini daha yaxşı başa düşmələri olur.

Viral şablonlar

Viral AI şablonlarımızı kəşf edin və şəkillərinizə tətbiq edin.

Şablonları kəşf et