ការពន្យល់អំពី Tokenization: ចាប់ពី Tokens ទៅ Outputs

Blog

ដោយ Wendy Frey

26702eff-dbff-43b4-a5fb-fb97eab89247-1200x600.webp មុនពេលដែលម៉ូដែលភាសាធំអាចបង្កើតអ្វីដែលមានប្រយោជន៍ណាមួយវាកំណត់ត្រូវធ្វើអ្វីមួយដែលថ្តាត្រលប់ភាគីមុន: រៀបចំអត្ថបទរបស់អ្នក។

ដំណើរការនេះត្រូវបានហៅថា tokenization ហើយវាជារបស់ទីតាំងមួយសំខាន់បំផុត, និងមិនទាន់បានមើលឃើញ, នៅក្នុងរបៀបដែលប្រព័ន្ធ AI សម័យទំនើបធ្វើការ។

មនុស្សភាគច្រើនគិតថាម៉ូដែលអាចអានពាក្យ។ ពួកគេមិនអាចអានបាន។

ពួកគេអាន tokens: បន្ទះអត្ថបទតូចៗដែលអាចហៅបញ្ចូលពាក្យពេញ, ផ្នែកនៃពាក្យ, សញ្ញាវិថី, កន្លែងទទេ ឬ ح甚至 ផ្នែកសំឡេងបន្ត។ Tokens ទាំងនោះត្រូវបានបំលែងទៅជារាប់លេខដែលម៉ូដែលអាចដំណើរការប្រសិនបើនៅខាងក្នុង។

ការយល់ដឹងអំពី tokenization ជាជម្រើសនេះសង្ខេបប្លែកៗម៉ែ៖

  • ហេតុអ្វីបានជាពិន្ទុមានថ្លៃប្រាក់
  • ហេតុអ្វីបានជាកញ្ចក់បរិ konteks មានកំណត់
  • ហេតុអ្វីបានជាភាសាដែលមួយមានថ្លៃអត្រាអានច្រើនជាងភាសាផ្សេងៗ
  • ហេតុអ្វីបានជាម៉ូដែលមួយអាចប្រើប្រាស់បានយ៉ាងច្រាស់

Tokenization ទៅ​ទីតាំងនៃឌីនេគ្រាប់ដោយឆ្លើយឡើងដាក់ចំពោះបណ្តុំរៀងគ្នាទាំងអស់។

តើអ្វីទៅជា token?

Token គឺជាឯកតាបន្តតិចតួចដែលម៉ូដែលធ្វើការជាមួយ។

វាមិន មួយជា​ពាក្យ​តែមួយ​ទេ

ឧទាហរណ៍៖

អត្ថបទការបំបែក token ចម្រង់
ជំរាបសួរជំរាបសួរ
tokenizationtoken + ization
unbelievableun + believ + able
2026!202 + 6 +!

នេះមានសារៈសំខាន់ព្រោះម៉ូដែលគុណពិន្ទុំឱ្យបាន tokens មិនមែនជា​ពាក្យ។

អត្ថបទដែលមើលទៅដូចជាអត្ថបទខ្លីៗអាចប្រើប្រាស់ tokens ច្រើនជាងដែលបានរំពឹង, ជាពិសេសជាមួយផលិតផលដែលគឺមិនធម្មតា, កូដ, emoji ឬភាសាដែលមិនមែនជាភាសាអង់គ្លេស។

របៀបដែល tokenization ធ្វើការ

នៅកម្រិតខ្ពស់, tokenization ធ្វើតាមប៉ាសបំណែកធំមួយ។

ជំហានទី ១: ចែកអត្ថបទ

Tokenizer បំបែកអត្ថបទរាស្ត្រចេញទៅជា​ព្រំកំណត់ ហើយមួយឱកាសលុះ។

LLM សម័យទំនើបភាគច្រើនពឹងផ្អែកលើ subword tokenization, មិនមែន tokenization ពពាត់ពេញ។

នេះផ្តល់ឱ្យពួកគេមានភាពងាយស្រួលក្នុងការដោះសោរ៖

  • ពាក្យដែលមិនធម្មតា
  • តម្រូវការបញ្ជូន
  • អត្ថបទណាមេ
  • ការបញ្ចូលភាសាបហ្នឹង
  • កូដ

ជំហានទី ២: បំលែង token ទៅជារាប់លេខ

Token ទាំងមូលមិនត្រូវបានបញ្ជីជាទម្រង់ក្នុងអត្ថបទដែលស្ត្រីរួមស្របិនំណិត។

ឧទាហរណ៍៖

TokenToken ID
The791
model4382
works2921

ម៉ូដែលមិនមានកាសអានអត្ថបទដោយផ្ទាល់ទេ។ វា​មិនអាចប្រើប្រាស់នៅក្នុងការងារ។

នេះអ្នកយល់បានពីការប្រឹមតតិចតួចដែលមិនមានតេល្ខោលគួរ។

ជំហានទី ៣: បំលែង ID ទៅជាគំនិត

បន្ទាប់ពី token ID បានបង្កើត, វាត្រូវបានផ្លាស់ប្តូរទៅជារូបភាព។

នេះគឺជាលក្ខណៈដែលមានន័យនឹងលេចឡើង។

នៅពេលនេះ៖

  • tokens ដែលស្រដៀងអាចកាន់កាប់ទីតាំងជិតក្នុងជາនាងគ្នា
  • ការពាក់ព័ន្ធរវាងគំនិតអាចមានអនុភាព
  • បរិ contexto ចាប់ដំណើរការ

Tokenization ធ្វើឲ្យទិន្នន័យនៅក្នុងប្រព័ន្ធ។ Embeddings ធ្វើឲ្យវាអាចអានបាន។

ហេតុអ្វីបានជាការបំបែក Token ត្រូវបានកំណត់ជា Standards

ប្រព័ន្ធ NLP ដែលចាស់ប៉ុន្មានទូពនបំបែកអត្ថបទដោយពាក្យ។

វាបានដំណើរការ, រហូតដល់ពួកគេឈឺអត្ថបទដែលពួកគេចុងបញ្ចប់មិនបានឃើញ។

LLM សម័យទំនើបភាគច្រើនប្រើវិធីសាស្រ្តដូចជាការបំបែក Byte Pair Encoding (BPE) ឬយុទ្ធសាស្រ្តសរសេរដូចគ្នា។

BPE ធ្វើការបញ្ចូលប្រវត្តិនិងកន្លែងទីមួយ។

ហេតុអ្វីបានជាម៉ូដែលអាចមានមុនកំណត់ច្រកគេបានល្អគ្នា

វិធីសាស្រ្តបញ្ហាសំខាន់
បន្ទះពាក្យមានពាក្យមិនស៊ាំរ
លេខកូដមានសូរ, មានស្មាំ
បន្ទះគ្រឿនគួរអោយបានល្អ

នេះគឺហេតុផលដែលម៉ូដែលភាគច្រើនឈានទៅប្រើប្រាស់ Tokenization ដូចលក្ខណៈមួយ។

ហេតុអ្វីបានជាការប្រារព្ធ Token មានអត្ថៈឲ្យប្រាក់

នេះគឺជាគន្លងដែល tokenization ធ្វើអោយមានការណែនាំ។

API AI ជាច្រើនគិតថ្លៃដោយផ្អែកលើ៖

  • tokens ជាធភាព
  • tokens ចេញ

ដែលមានន័យថាភាគី tokenization ជួយឡើងមានការ

ឧទាហរណ៍:

ប្រភេទបញ្ចូលការពាំនាំទៅនឹង token density
ភាសាអង់គ្លេសសាមញ្ញខ្ពស់
កូដខ្ពស់-មធ្យម
អត្ថបទច្បាប់ខ្ពស់
ភាសាចិន/ជប៉ុនខ្ពស់
អត្ថបទដែលមាន emojiស្រួលរឺមានខ្ពស់

ពីរ prompts មានចំនួនខ្លាដែលដូចគ្នាអាចកើតឡើងក្រពះច្រើននិងភាពខុសគ្នាត្រូវមានកូដរូប​សំណព្វយ៉ាងខ្លាំង។

នេះគឺជាទិន្នន័យមួយប្រថុយខ្លួនដកថ្លៃក្នុង AI ពាណិជ្ជកម្ម។

ហេតុអ្វីបានជាការបំបែក Token មានសារពារ Behavior កំណត់

Tokenization ក៏បញ្ជាក់ថាអ្នកអានបានកើតមានមករវាងលក្ខណៈវិស័យល្អ។

ឧទាហរណ៍:

  • ហេតុអ្វីបានជា ម៉ូដែលប្រើត្រាច់ចុះ
  • ហេតុអ្វីបានជាពាក្យមិនធម្មតាធ្វើអោយមានអារម្មណ៍
  • ហេតុអ្វីបានជាការកែប្រែរង្វង់អាចផ្លាស់ប្ដូរចេញ
  • ហេតុអ្វីបានជាសេចក្តីលម្អិតអាចសំរេចបាន

ម៉ូដែលមិនគិតនៅក្នុងកឋិតជាការសរសេរកំពូលឬផ្សងផ្សមដែលអ្នកអាចអានបាន។ វា​ទាំងអស់យកឆ្វេងប្រើដោយភាពប៉ុន្តាតែមួយ។

ការវាយតម្លៃនៃ Tokens ជាសារសំខាន់ដែលនាំឲ្យអង្កេត។

Tokens ក្លាយជាអត្ថបទ

ម្តងដែលមានការផ្តល់វត្ថុ៖

  1. Tokens ជួយទៅក្នុង transformer
  2. ម៉ូដែលជាមួយអត្ថបទបន្ថែមថ្មី
  3. Token នេះគឺបានបន្ថែមឡើង
  4. ដំណើរការនេះកើតឡើងឡើងវិញ

វិធីនេះបន្តរហូតដល់៖

  • token ត្រូវបង្ខំក្រៅ
  • កំណត់ត្រូវបានសម្រេច,
  • ប្រព័ន្ធរំពឹងរយៈពេលចាក់អង្កេត

នេះមានន័យថាការបង្កើត AI គឺជាដំណើរការ token-by-token prediction loop, មិនមែនឆ្លងស្រាប់។

ចំណុចសំខាន់ចុងក្រោយ

Tokenization មើលទៅដូចជាអត្ថបទបច្ចេកទេសតិចតួច ប៉ុន្តែវាធ្វើឱ្យប៉ុនប៉ងឡើងនូវអ្វីៗប្រហែលគ្នាទាក់ទូទៅមុខ និងخصوصгийгធ្វើការចូសស៊ែជាច្រើនក្នុង LLM។

វាបំពានការទៅ:

  • តម្លៃ
  • ល្បឿន
  • កំណត់គ្នា
  • ការផលិតភាសាបហ្នឹង
  • ពលកម្មនៃល cuir
  • គុណភាព​ពាក្យ

បើអ្នកកំពុងបញ្ចូលជាមួយ AI, ការយល់ដឹងអំពី tokenization ផ្តល់ឱ្យអ្នកនូវការយល់ស្របខាងយល់ទីពីលើក្វំពោះការបន្ដតេពិការពីរ។

មុនពេលដែលជាជំនលិក, transformers, ឬ outputs, មាន tokens។

ហើយអ្វីដែលចាប់ផ្តើមច在那里។

ការរចនាផ្តល់ការសំរេច, ការជ្រើសរើសនិងការបង្ហាញ token នាំឲ្យលោកអ្នកលទ្ធលេខធាតុនិងអត្ថបទគ្នា។។។`

អានអត្ថបទផ្សេងទៀត

ដឹងមុនអ្នកដទៃដែលចម្លងគ្នា។

មើលទាំងអស់

ពុម្ពវីរុល

ស្វែងយល់ពុម្ព AI វីរុលរបស់យើង ហើយអនុវត្តវាទៅលើរូបថតរបស់អ្នក។

មើលពុម្ព