Tokenizasyon Açıklaması: Tokenlerden Çıktılara
Wendy Frey tarafından

Büyük bir dil modeli, yararlı bir şey üretmeden önce öncelikle çok daha basit bir şey yapmak zorundadır: metni parçalamak.
Bu süreç tokenizasyon olarak adlandırılır ve modern AI sistemlerinin nasıl çalıştığının en önemli, ve en göz ardı edilen, kısımlarından biridir.
Çoğu insan modellerin kelimeleri okuduğunu düşünür. Ama okumazlar.
Onlar token okurlar: tam kelimeleri, kelime parçalarını, noktalama işaretlerini, boşlukları veya hatta tekil sembolleri temsil edebilen küçük metin parçaları. Bu tokenlar daha sonra modelin içsel olarak işleyebileceği sayısal kimliklere dönüştürülür.
Tokenizasyonu anlamak birçok şeyi açıklamaya yardımcı olur:
- neden istemler para tutuyor
- neden bağlam pencerelerinin sınırları var
- neden bazı dillerin maliyeti diğerlerinden daha fazla
- neden modeller bazen garip davranışlar sergiliyor
Tokenizasyon, AI boru hattının tam başında yer alır, ve sessizce sonrasındaki her şeyi şekillendirir.
Token nedir?
Bir token, bir modelin çalıştığı en küçük metin birimidir.
Bu her zaman bir kelimeyle aynı değildir.
Örneğin:
| Metin | Olası token bölünmesi |
|---|---|
| merhaba | merhaba |
| tokenizasyon | token + izasyon |
| inanılmaz | in + an + ılmaz |
| 2026! | 202 + 6 +! |
Bu önemlidir çünkü modeller kelimeleri değil, tokenları sayar.
Kısa görünen bir cümle, özellikle yaygın olmayan kelimeler, kod, emojiler veya İngilizce dışında diller ile daha fazla token kullanabilir.
Tokenizasyon nasıl çalışır
Yüksek seviyede, tokenizasyon basit bir boru hattını takip eder.
Adım 1: Metni böl
Tokenizer, ham metni kelime dağarcığı kurallarına göre parçalara ayırır.
Modern LLM'ler genellikle alt kelime tokenizasyonuna dayanır, tam kelime tokenizasyonuna değil.
Bu onlara şunları ele alacak esneklik sağlar:
- nadir kelimeler
- yazım hataları
- isimler
- çok dilli giriş
- kod
Adım 2: Tokenları ID'lere dönüştür
Her token, modelin kelime dağarcığı içindeki bir numaraya karşılık gelir.
Örnek:
| Token | Token ID |
|---|---|
| The | 791 |
| model | 4382 |
| çalışır | 2921 |
Model, metni doğrudan “görmez”. Sadece bu sayısal temsilleri görür.
Bu, insan dili ile sinirsel hesaplama arasında bir köprüdür.
Adım 3: ID’leri gömülere dönüştür
Token ID'leri oluşturulduktan sonra, vektör gömülerine dönüştürülür.
Bu, anlamın ortaya çıkmaya başladığı yerdir.
Bu noktada:
- benzer tokenlar, vektör alanında yakın konumlar kaplayabilir
- kavramlar arasındaki ilişkiler ölçülebilir hale gelir
- bağlam, önemli hale gelmeye başlar
Tokenizasyon verileri sisteme alır. Gömüler bunu yorumlanabilir hale getirir.
Neden alt kelime tokenizasyonu standart haline geldi
Eski NLP sistemleri genellikle metni kelimelere ayırıyordu.
Bu işe yaradı, ta ki daha önce hiç görmedikleri kelimelerle karşılaşana kadar.
Modern LLM'ler genellikle Byte Pair Encoding (BPE) veya benzeri alt kelime stratejileri kullanır.
BPE, sık kullanılan karakter desenlerini tekrar tekrar birleştirerek yeniden kullanılabilir birimlere dönüştürür. Bu, sıkıştırmayı ve kelime dağarcığı verimliliğini artırır.
Neden alt kelime modelleri daha iyidir
| Yöntem | Temel sorun |
|---|---|
| Kelime düzeyinde | Çok fazla bilinmeyen kelime |
| Karakter düzeyinde | Çok yavaş, çok uzun |
| Alt kelime düzeyinde | Esneklik ve verimin en iyi dengesi |
Bu yüzden modern modellerin çoğu alt kelime tokenizasyonunun bir versiyonunu kullanır.
Neden tokenizasyon maliyeti etkiler
Burada tokenizasyon pratik hale gelir.
Çoğu AI API'si, şuna göre faturalandırır:
- girdi tokenları
- çıktı tokenları
Bu, tokenizasyonun doğrudan fiyatı etkilediği anlamına gelir.
Örneğin:
| Girdi türü | Yaklaşık token yoğunluğu |
|---|---|
| Basit İngilizce | Düşük |
| Kod | Orta-yüksek |
| Hukuk metni | Yüksek |
| Çince/Japonca | Genellikle daha yüksek |
| Emoji yoğun metin | Şaşırtıcı derecede yüksek |
Aynı karakter sayısına sahip iki istem, çok farklı token sayısına sahip olabilir.
Bu, üretim AI sistemlerindeki en yaygın gizli maliyet sürücülerinden biridir.
Neden tokenizasyon model davranışını etkiler
Tokenizasyon ayrıca birçok “garip” model davranışını açıklar.
Örneğin:
- modellerin harf sayısını zorlaması
- nadir kelimelerin öngörülemeyen şekilde davranması
- biçimlendirme değişikliklerinin çıktıları etkilemesi
- istem sırasının önemli olması
Bir model, insanlar gibi harfler veya dil bilgisi ile düşünmez. Token dizilerini tahmin eder.
Bu fark, kullanıcıların fark ettiği birçok tuhaflık yaratır.
Topluluk tartışmaları genellikle token yapısını, modellerin karakter düzeyinde akıl yürütme başarısızlıklarının bir nedeni olarak gösterir.
Tokenlar çıktılara dönüşür
Girdi tokenize edildikten sonra:
- Tokenlar dönüştürücüye girer
- Model bir sonraki tokenı tahmin eder
- O token eklenir
- Süreç tekrarlar
Bu, şunlardan biri meydana gelene kadar devam eder:
- bir durma tokenı görünür
- token sınırı ulaşılır
- sistem üretimi kesintiye uğratır
Bu, AI üretiminin temelde bir token-başına-tahmin döngüsü olduğu anlamına gelir, cümle düzeyinde akıl yürütme değil.
Sonuç
Tokenizasyon, küçük bir teknik detay gibi görünse de, modern LLM sistemlerinde neredeyse her şeyi şekillendirir.
Bu, şunları etkiler:
- maliyet
- hız
- bağlam sınırlamaları
- çok dilli performans
- model davranışı
- çıktı kalitesi
Yapay zeka ile çalışıyorsanız, tokenizasyonu anlamak sistemlerin neden bu şekilde davrandığına dair çok daha iyi bir sezgi verir.
Gömüler, dönüştürücüler veya çıktılar olmadan, tokenlar vardır.
Ve her şey orada başlar.
Dikkatli istem tasarımı, kelime dağarcığı seçimleri ve token bütçelemesi, token kullanımınızın ve token sayılarınızın maliyet ve kalite hedeflerinizle uyumlu olmasını sağlamaya yardımcı olur. Karşılık, beklenmedik tamamlamaların daha az, API maliyetlerinin daha düşük ve kullanıcılarınızın yazma tarzını daha iyi anlayan modeller sunar.




