Penjelasan Tokenisasi: Dari Token ke Output

Blog

Oleh Wendy Frey

26702eff-dbff-43b4-a5fb-fb97eab89247-1200x600.webp Sebelum model bahasa besar dapat menjana apa-apa yang berguna, ia perlu melakukan sesuatu yang jauh lebih mudah terlebih dahulu: memecahkan teks anda.

Proses itu dipanggil tokenisasi, dan ia adalah salah satu bahagian yang paling penting, dan paling sering diabaikan, tentang bagaimana sistem AI moden berfungsi.

Kebanyakan orang berfikir model membaca perkataan. Mereka tidak.

Mereka membaca token: kepingan kecil teks yang boleh mewakili perkataan penuh, bahagian perkataan, tanda baca, ruang, atau bahkan simbol individu. Token tersebut kemudian ditukar menjadi ID nombor yang boleh diproses oleh model secara dalaman.

Memahami tokenisasi membantu menerangkan banyak perkara:

  • mengapa permintaan memerlukan wang
  • mengapa tingkap konteks mempunyai had
  • mengapa sesetengah bahasa lebih mahal daripada yang lain
  • mengapa model kadang-kadang berkelakuan dengan cara yang aneh

Tokenisasi berada di permulaan saluran AI, dan ia secara senyap membentuk segala-galanya yang datang selepasnya.

Apakah itu token?

Token adalah unit teks terkecil yang digunakan oleh model.

Ia tidak selalu sama dengan perkataan.

Contohnya:

TeksPembahagian token yang mungkin
hellohello
tokenizationtoken + ization
unbelievableun + believ + able
2026!202 + 6 +!

Ini penting kerana model mengira token, bukan perkataan.

Ayat yang kelihatan pendek mungkin menggunakan lebih banyak token daripada yang dijangka, terutamanya dengan perkataan yang jarang, kod, emoji, atau bahasa bukan Inggeris.

Bagaimana tokenisasi berfungsi

Pada tahap tinggi, tokenisasi mengikuti saluran yang mudah.

Langkah 1: Pisahkan teks

Tokenizer memecahkan teks mentah menjadi kepingan berdasarkan peraturan vocabulary-nya.

LLM moden biasanya bergantung pada tokenisasi subword, bukan tokenisasi perkataan penuh.

Ini memberi mereka fleksibiliti untuk menangani:

  • perkataan jarang
  • kesilapan ejaan
  • nama
  • input pelbagai bahasa
  • kod

Langkah 2: Tukarkan token kepada ID

Setiap token ditetapkan ke nombor dalam vocabulary model.

Contoh:

TokenID Token
The791
model4382
works2921

Model tidak pernah “melihat” teks secara langsung. Ia hanya melihat perwakilan numerik ini.

Itulah jambatan antara bahasa manusia dan pengiraan neural.

Langkah 3: Tukarkan ID kepada embedding

Setelah ID token dicipta, ia ditransformasikan menjadi embedding vektor.

Di sinilah makna mula muncul.

Pada ketika ini:

  • token serupa boleh menduduki kedudukan berdekatan dalam ruang vektor
  • hubungan antara konsep menjadi dapat diukur
  • konteks mula menjadi penting

Tokenisasi memasukkan data ke dalam sistem. Embedding menjadikannya boleh diinterpretasikan.

Mengapa tokenisasi subword menjadi standard

Sistem NLP yang lebih lama sering memecahkan teks mengikut perkataan.

Ia berfungsi, sehingga mereka menemui perkataan yang tidak pernah mereka lihat sebelum ini.

LLM moden biasanya menggunakan kaedah seperti Pengkodan Pasangan Byte (BPE) atau strategi subword yang serupa.

BPE berfungsi dengan menggabungkan corak watak yang kerap menjadi unit yang boleh digunakan semula. Ini meningkatkan pemampatan dan kecekapan vocabulary.

Mengapa model subword lebih baik

KaedahMasalah utama
Tahap perkataanTerlalu banyak perkataan yang tidak diketahui
Tahap watakTerlalu perlahan, terlalu panjang
Tahap subwordKeseimbangan terbaik antara fleksibiliti dan kecekapan

Inilah sebabnya mengapa kebanyakan model moden menggunakan versi tokenisasi subword.

Mengapa tokenisasi mempengaruhi kos

Di sinilah tokenisasi menjadi praktikal.

Kebanyakan API AI membebankan berdasarkan:

  • token input
  • token output

Ini bermakna tokenisasi secara langsung mempengaruhi harga.

Contohnya:

Jenis inputKetumpatan token anggaran
Bahasa Inggeris ringkasRendah
KodSederhana, tinggi
Teks undang-undangTinggi
Cina/JepunSelalunya lebih tinggi
Teks yang banyak emojiMengejutkan tinggi

Dua permintaan dengan pengiraan aksara yang sama boleh mempunyai bilangan token yang sangat berbeza.

Ini adalah salah satu pendorong kos tersembunyi yang paling biasa dalam sistem AI pengeluaran.

Mengapa tokenisasi mempengaruhi perilaku model

Tokenisasi juga menerangkan banyak perilaku model yang "aneh".

Contohnya:

  • mengapa model menghadapi kesulitan dengan pengiraan huruf
  • mengapa perkataan jarang berkelakuan secara tidak dapat diramalkan
  • mengapa perubahan format boleh mempengaruhi output
  • mengapa urutan permintaan adalah penting

Model tidak berfikir dalam huruf atau tatabahasa seperti manusia. Ia meramalkan urutan token.

Perbezaan itu mencipta banyak keanehan yang diperhatikan oleh pengguna.

Perbincangan komuniti sering menunjukkan struktur token sebagai salah satu sebab model gagal dalam penaakulan peringkat huruf.

Token menjadi output

Setelah input ditokenisasi:

  1. Token pergi ke dalam transformer
  2. Model meramalkan token seterusnya
  3. Token tersebut ditambah
  4. Proses berulang

Ini berterusan sehingga:

  • token berhenti muncul
  • had token tercapai
  • sistem menghentikan penjanaan

Ini bermakna penjanaan AI secara asasnya adalah gelung ramalan token demi token, bukan penaakulan peringkat ayat.

Pengambilan akhir

Tokenisasi kelihatan seperti butiran teknikal kecil, tetapi ia membentuk hampir segala-galanya dalam sistem LLM moden.

Ia mempengaruhi:

  • kos
  • kelajuan
  • had konteks
  • prestasi pelbagai bahasa
  • perilaku model
  • kualiti output

Jika anda membina dengan AI, memahami tokenisasi memberi anda intuisi yang jauh lebih baik tentang mengapa sistem berkelakuan seperti yang mereka lakukan.

Sebelum terdapat embedding, transformer, atau output, terdapat token.

Dan semuanya bermula di situ.

Reka bentuk permintaan yang berhati-hati, pilihan vocabulary, dan penganggaran token membantu memastikan penggunaan token dan bilangan token anda selaras dengan kos dan matlamat kualiti anda. Ganjarannya adalah lebih sedikit penyempurnaan yang tidak dijangka, kos API yang lebih rendah, dan model yang lebih memahami cara pengguna anda menulis.

Templat viral

Terokai templat AI viral kami dan gunakannya pada foto anda.

Terokai templat