ការពន្យល់អំពី Tokenization: ចាប់ពី Tokens ទៅ Outputs
ដោយ Wendy Frey
មុនពេលដែលម៉ូដែលភាសាធំអាចបង្កើតអ្វីដែលមានប្រយោជន៍ណាមួយវាកំណត់ត្រូវធ្វើអ្វីមួយដែលថ្តាត្រលប់ភាគីមុន: រៀបចំអត្ថបទរបស់អ្នក។
ដំណើរការនេះត្រូវបានហៅថា tokenization ហើយវាជារបស់ទីតាំងមួយសំខាន់បំផុត, និងមិនទាន់បានមើលឃើញ, នៅក្នុងរបៀបដែលប្រព័ន្ធ AI សម័យទំនើបធ្វើការ។
មនុស្សភាគច្រើនគិតថាម៉ូដែលអាចអានពាក្យ។ ពួកគេមិនអាចអានបាន។
ពួកគេអាន tokens: បន្ទះអត្ថបទតូចៗដែលអាចហៅបញ្ចូលពាក្យពេញ, ផ្នែកនៃពាក្យ, សញ្ញាវិថី, កន្លែងទទេ ឬ ح甚至 ផ្នែកសំឡេងបន្ត។ Tokens ទាំងនោះត្រូវបានបំលែងទៅជារាប់លេខដែលម៉ូដែលអាចដំណើរការប្រសិនបើនៅខាងក្នុង។
ការយល់ដឹងអំពី tokenization ជាជម្រើសនេះសង្ខេបប្លែកៗម៉ែ៖
- ហេតុអ្វីបានជាពិន្ទុមានថ្លៃប្រាក់
- ហេតុអ្វីបានជាកញ្ចក់បរិ konteks មានកំណត់
- ហេតុអ្វីបានជាភាសាដែលមួយមានថ្លៃអត្រាអានច្រើនជាងភាសាផ្សេងៗ
- ហេតុអ្វីបានជាម៉ូដែលមួយអាចប្រើប្រាស់បានយ៉ាងច្រាស់
Tokenization ទៅទីតាំងនៃឌីនេគ្រាប់ដោយឆ្លើយឡើងដាក់ចំពោះបណ្តុំរៀងគ្នាទាំងអស់។
តើអ្វីទៅជា token?
Token គឺជាឯកតាបន្តតិចតួចដែលម៉ូដែលធ្វើការជាមួយ។
វាមិន មួយជាពាក្យតែមួយទេ។
ឧទាហរណ៍៖
| អត្ថបទ | ការបំបែក token ចម្រង់ |
|---|---|
| ជំរាបសួរ | ជំរាបសួរ |
| tokenization | token + ization |
| unbelievable | un + believ + able |
| 2026! | 202 + 6 +! |
នេះមានសារៈសំខាន់ព្រោះម៉ូដែលគុណពិន្ទុំឱ្យបាន tokens មិនមែនជាពាក្យ។
អត្ថបទដែលមើលទៅដូចជាអត្ថបទខ្លីៗអាចប្រើប្រាស់ tokens ច្រើនជាងដែលបានរំពឹង, ជាពិសេសជាមួយផលិតផលដែលគឺមិនធម្មតា, កូដ, emoji ឬភាសាដែលមិនមែនជាភាសាអង់គ្លេស។
របៀបដែល tokenization ធ្វើការ
នៅកម្រិតខ្ពស់, tokenization ធ្វើតាមប៉ាសបំណែកធំមួយ។
ជំហានទី ១: ចែកអត្ថបទ
Tokenizer បំបែកអត្ថបទរាស្ត្រចេញទៅជាព្រំកំណត់ ហើយមួយឱកាសលុះ។
LLM សម័យទំនើបភាគច្រើនពឹងផ្អែកលើ subword tokenization, មិនមែន tokenization ពពាត់ពេញ។
នេះផ្តល់ឱ្យពួកគេមានភាពងាយស្រួលក្នុងការដោះសោរ៖
- ពាក្យដែលមិនធម្មតា
- តម្រូវការបញ្ជូន
- អត្ថបទណាមេ
- ការបញ្ចូលភាសាបហ្នឹង
- កូដ
ជំហានទី ២: បំលែង token ទៅជារាប់លេខ
Token ទាំងមូលមិនត្រូវបានបញ្ជីជាទម្រង់ក្នុងអត្ថបទដែលស្ត្រីរួមស្របិនំណិត។
ឧទាហរណ៍៖
| Token | Token ID |
|---|---|
| The | 791 |
| model | 4382 |
| works | 2921 |
ម៉ូដែលមិនមានកាសអានអត្ថបទដោយផ្ទាល់ទេ។ វាមិនអាចប្រើប្រាស់នៅក្នុងការងារ។
នេះអ្នកយល់បានពីការប្រឹមតតិចតួចដែលមិនមានតេល្ខោលគួរ។
ជំហានទី ៣: បំលែង ID ទៅជាគំនិត
បន្ទាប់ពី token ID បានបង្កើត, វាត្រូវបានផ្លាស់ប្តូរទៅជារូបភាព។
នេះគឺជាលក្ខណៈដែលមានន័យនឹងលេចឡើង។
នៅពេលនេះ៖
- tokens ដែលស្រដៀងអាចកាន់កាប់ទីតាំងជិតក្នុងជາនាងគ្នា
- ការពាក់ព័ន្ធរវាងគំនិតអាចមានអនុភាព
- បរិ contexto ចាប់ដំណើរការ
Tokenization ធ្វើឲ្យទិន្នន័យនៅក្នុងប្រព័ន្ធ។ Embeddings ធ្វើឲ្យវាអាចអានបាន។
ហេតុអ្វីបានជាការបំបែក Token ត្រូវបានកំណត់ជា Standards
ប្រព័ន្ធ NLP ដែលចាស់ប៉ុន្មានទូពនបំបែកអត្ថបទដោយពាក្យ។
វាបានដំណើរការ, រហូតដល់ពួកគេឈឺអត្ថបទដែលពួកគេចុងបញ្ចប់មិនបានឃើញ។
LLM សម័យទំនើបភាគច្រើនប្រើវិធីសាស្រ្តដូចជាការបំបែក Byte Pair Encoding (BPE) ឬយុទ្ធសាស្រ្តសរសេរដូចគ្នា។
BPE ធ្វើការបញ្ចូលប្រវត្តិនិងកន្លែងទីមួយ។
ហេតុអ្វីបានជាម៉ូដែលអាចមានមុនកំណត់ច្រកគេបានល្អគ្នា
| វិធីសាស្រ្ត | បញ្ហាសំខាន់ |
|---|---|
| បន្ទះពាក្យ | មានពាក្យមិនស៊ាំរ |
| លេខកូដ | មានសូរ, មានស្មាំ |
| បន្ទះគ្រឿន | គួរអោយបានល្អ |
នេះគឺហេតុផលដែលម៉ូដែលភាគច្រើនឈានទៅប្រើប្រាស់ Tokenization ដូចលក្ខណៈមួយ។
ហេតុអ្វីបានជាការប្រារព្ធ Token មានអត្ថៈឲ្យប្រាក់
នេះគឺជាគន្លងដែល tokenization ធ្វើអោយមានការណែនាំ។
API AI ជាច្រើនគិតថ្លៃដោយផ្អែកលើ៖
- tokens ជាធភាព
- tokens ចេញ
ដែលមានន័យថាភាគី tokenization ជួយឡើងមានការ
ឧទាហរណ៍:
| ប្រភេទបញ្ចូល | ការពាំនាំទៅនឹង token density |
|---|---|
| ភាសាអង់គ្លេសសាមញ្ញ | ខ្ពស់ |
| កូដ | ខ្ពស់-មធ្យម |
| អត្ថបទច្បាប់ | ខ្ពស់ |
| ភាសាចិន/ជប៉ុន | ខ្ពស់ |
| អត្ថបទដែលមាន emoji | ស្រួលរឺមានខ្ពស់ |
ពីរ prompts មានចំនួនខ្លាដែលដូចគ្នាអាចកើតឡើងក្រពះច្រើននិងភាពខុសគ្នាត្រូវមានកូដរូបសំណព្វយ៉ាងខ្លាំង។
នេះគឺជាទិន្នន័យមួយប្រថុយខ្លួនដកថ្លៃក្នុង AI ពាណិជ្ជកម្ម។
ហេតុអ្វីបានជាការបំបែក Token មានសារពារ Behavior កំណត់
Tokenization ក៏បញ្ជាក់ថាអ្នកអានបានកើតមានមករវាងលក្ខណៈវិស័យល្អ។
ឧទាហរណ៍:
- ហេតុអ្វីបានជា ម៉ូដែលប្រើត្រាច់ចុះ
- ហេតុអ្វីបានជាពាក្យមិនធម្មតាធ្វើអោយមានអារម្មណ៍
- ហេតុអ្វីបានជាការកែប្រែរង្វង់អាចផ្លាស់ប្ដូរចេញ
- ហេតុអ្វីបានជាសេចក្តីលម្អិតអាចសំរេចបាន
ម៉ូដែលមិនគិតនៅក្នុងកឋិតជាការសរសេរកំពូលឬផ្សងផ្សមដែលអ្នកអាចអានបាន។ វាទាំងអស់យកឆ្វេងប្រើដោយភាពប៉ុន្តាតែមួយ។
ការវាយតម្លៃនៃ Tokens ជាសារសំខាន់ដែលនាំឲ្យអង្កេត។
Tokens ក្លាយជាអត្ថបទ
ម្តងដែលមានការផ្តល់វត្ថុ៖
- Tokens ជួយទៅក្នុង transformer
- ម៉ូដែលជាមួយអត្ថបទបន្ថែមថ្មី
- Token នេះគឺបានបន្ថែមឡើង
- ដំណើរការនេះកើតឡើងឡើងវិញ
វិធីនេះបន្តរហូតដល់៖
- token ត្រូវបង្ខំក្រៅ
- កំណត់ត្រូវបានសម្រេច,
- ប្រព័ន្ធរំពឹងរយៈពេលចាក់អង្កេត
នេះមានន័យថាការបង្កើត AI គឺជាដំណើរការ token-by-token prediction loop, មិនមែនឆ្លងស្រាប់។
ចំណុចសំខាន់ចុងក្រោយ
Tokenization មើលទៅដូចជាអត្ថបទបច្ចេកទេសតិចតួច ប៉ុន្តែវាធ្វើឱ្យប៉ុនប៉ងឡើងនូវអ្វីៗប្រហែលគ្នាទាក់ទូទៅមុខ និងخصوصгийгធ្វើការចូសស៊ែជាច្រើនក្នុង LLM។
វាបំពានការទៅ:
- តម្លៃ
- ល្បឿន
- កំណត់គ្នា
- ការផលិតភាសាបហ្នឹង
- ពលកម្មនៃល cuir
- គុណភាពពាក្យ
បើអ្នកកំពុងបញ្ចូលជាមួយ AI, ការយល់ដឹងអំពី tokenization ផ្តល់ឱ្យអ្នកនូវការយល់ស្របខាងយល់ទីពីលើក្វំពោះការបន្ដតេពិការពីរ។
មុនពេលដែលជាជំនលិក, transformers, ឬ outputs, មាន tokens។
ហើយអ្វីដែលចាប់ផ្តើមច在那里។
ការរចនាផ្តល់ការសំរេច, ការជ្រើសរើសនិងការបង្ហាញ token នាំឲ្យលោកអ្នកលទ្ធលេខធាតុនិងអត្ថបទគ្នា។។។`




