Tokenizasyon Açıklaması: Tokenlerden Çıktılara

Blog

Wendy Frey tarafından

26702eff-dbff-43b4-a5fb-fb97eab89247-1200x600.webp

Büyük bir dil modeli, yararlı bir şey üretmeden önce öncelikle çok daha basit bir şey yapmak zorundadır: metni parçalamak.

Bu süreç tokenizasyon olarak adlandırılır ve modern AI sistemlerinin nasıl çalıştığının en önemli, ve en göz ardı edilen, kısımlarından biridir.

Çoğu insan modellerin kelimeleri okuduğunu düşünür. Ama okumazlar.

Onlar token okurlar: tam kelimeleri, kelime parçalarını, noktalama işaretlerini, boşlukları veya hatta tekil sembolleri temsil edebilen küçük metin parçaları. Bu tokenlar daha sonra modelin içsel olarak işleyebileceği sayısal kimliklere dönüştürülür.

Tokenizasyonu anlamak birçok şeyi açıklamaya yardımcı olur:

  • neden istemler para tutuyor
  • neden bağlam pencerelerinin sınırları var
  • neden bazı dillerin maliyeti diğerlerinden daha fazla
  • neden modeller bazen garip davranışlar sergiliyor

Tokenizasyon, AI boru hattının tam başında yer alır, ve sessizce sonrasındaki her şeyi şekillendirir.

Token nedir?

Bir token, bir modelin çalıştığı en küçük metin birimidir.

Bu her zaman bir kelimeyle aynı değildir.

Örneğin:

MetinOlası token bölünmesi
merhabamerhaba
tokenizasyontoken + izasyon
inanılmazin + an + ılmaz
2026!202 + 6 +!

Bu önemlidir çünkü modeller kelimeleri değil, tokenları sayar.

Kısa görünen bir cümle, özellikle yaygın olmayan kelimeler, kod, emojiler veya İngilizce dışında diller ile daha fazla token kullanabilir.

Tokenizasyon nasıl çalışır

Yüksek seviyede, tokenizasyon basit bir boru hattını takip eder.

Adım 1: Metni böl

Tokenizer, ham metni kelime dağarcığı kurallarına göre parçalara ayırır.

Modern LLM'ler genellikle alt kelime tokenizasyonuna dayanır, tam kelime tokenizasyonuna değil.

Bu onlara şunları ele alacak esneklik sağlar:

  • nadir kelimeler
  • yazım hataları
  • isimler
  • çok dilli giriş
  • kod

Adım 2: Tokenları ID'lere dönüştür

Her token, modelin kelime dağarcığı içindeki bir numaraya karşılık gelir.

Örnek:

TokenToken ID
The791
model4382
çalışır2921

Model, metni doğrudan “görmez”. Sadece bu sayısal temsilleri görür.

Bu, insan dili ile sinirsel hesaplama arasında bir köprüdür.

Adım 3: ID’leri gömülere dönüştür

Token ID'leri oluşturulduktan sonra, vektör gömülerine dönüştürülür.

Bu, anlamın ortaya çıkmaya başladığı yerdir.

Bu noktada:

  • benzer tokenlar, vektör alanında yakın konumlar kaplayabilir
  • kavramlar arasındaki ilişkiler ölçülebilir hale gelir
  • bağlam, önemli hale gelmeye başlar

Tokenizasyon verileri sisteme alır. Gömüler bunu yorumlanabilir hale getirir.

Neden alt kelime tokenizasyonu standart haline geldi

Eski NLP sistemleri genellikle metni kelimelere ayırıyordu.

Bu işe yaradı, ta ki daha önce hiç görmedikleri kelimelerle karşılaşana kadar.

Modern LLM'ler genellikle Byte Pair Encoding (BPE) veya benzeri alt kelime stratejileri kullanır.

BPE, sık kullanılan karakter desenlerini tekrar tekrar birleştirerek yeniden kullanılabilir birimlere dönüştürür. Bu, sıkıştırmayı ve kelime dağarcığı verimliliğini artırır.

Neden alt kelime modelleri daha iyidir

YöntemTemel sorun
Kelime düzeyindeÇok fazla bilinmeyen kelime
Karakter düzeyindeÇok yavaş, çok uzun
Alt kelime düzeyindeEsneklik ve verimin en iyi dengesi

Bu yüzden modern modellerin çoğu alt kelime tokenizasyonunun bir versiyonunu kullanır.

Neden tokenizasyon maliyeti etkiler

Burada tokenizasyon pratik hale gelir.

Çoğu AI API'si, şuna göre faturalandırır:

  • girdi tokenları
  • çıktı tokenları

Bu, tokenizasyonun doğrudan fiyatı etkilediği anlamına gelir.

Örneğin:

Girdi türüYaklaşık token yoğunluğu
Basit İngilizceDüşük
KodOrta-yüksek
Hukuk metniYüksek
Çince/JaponcaGenellikle daha yüksek
Emoji yoğun metinŞaşırtıcı derecede yüksek

Aynı karakter sayısına sahip iki istem, çok farklı token sayısına sahip olabilir.

Bu, üretim AI sistemlerindeki en yaygın gizli maliyet sürücülerinden biridir.

Neden tokenizasyon model davranışını etkiler

Tokenizasyon ayrıca birçok “garip” model davranışını açıklar.

Örneğin:

  • modellerin harf sayısını zorlaması
  • nadir kelimelerin öngörülemeyen şekilde davranması
  • biçimlendirme değişikliklerinin çıktıları etkilemesi
  • istem sırasının önemli olması

Bir model, insanlar gibi harfler veya dil bilgisi ile düşünmez. Token dizilerini tahmin eder.

Bu fark, kullanıcıların fark ettiği birçok tuhaflık yaratır.

Topluluk tartışmaları genellikle token yapısını, modellerin karakter düzeyinde akıl yürütme başarısızlıklarının bir nedeni olarak gösterir.

Tokenlar çıktılara dönüşür

Girdi tokenize edildikten sonra:

  1. Tokenlar dönüştürücüye girer
  2. Model bir sonraki tokenı tahmin eder
  3. O token eklenir
  4. Süreç tekrarlar

Bu, şunlardan biri meydana gelene kadar devam eder:

  • bir durma tokenı görünür
  • token sınırı ulaşılır
  • sistem üretimi kesintiye uğratır

Bu, AI üretiminin temelde bir token-başına-tahmin döngüsü olduğu anlamına gelir, cümle düzeyinde akıl yürütme değil.

Sonuç

Tokenizasyon, küçük bir teknik detay gibi görünse de, modern LLM sistemlerinde neredeyse her şeyi şekillendirir.

Bu, şunları etkiler:

  • maliyet
  • hız
  • bağlam sınırlamaları
  • çok dilli performans
  • model davranışı
  • çıktı kalitesi

Yapay zeka ile çalışıyorsanız, tokenizasyonu anlamak sistemlerin neden bu şekilde davrandığına dair çok daha iyi bir sezgi verir.

Gömüler, dönüştürücüler veya çıktılar olmadan, tokenlar vardır.

Ve her şey orada başlar.

Dikkatli istem tasarımı, kelime dağarcığı seçimleri ve token bütçelemesi, token kullanımınızın ve token sayılarınızın maliyet ve kalite hedeflerinizle uyumlu olmasını sağlamaya yardımcı olur. Karşılık, beklenmedik tamamlamaların daha az, API maliyetlerinin daha düşük ve kullanıcılarınızın yazma tarzını daha iyi anlayan modeller sunar.

Viral şablonlar

Viral AI şablonlarımızı keşfedin ve fotoğraflarınıza uygulayın.

Şablonları keşfet