টোকেনাইজেশন ব্যাখ্যা: টোকেন থেকে আউটপুটে
লেখক: Wendy Frey

একটি বড় ভাষার মডেল কিছু ব্যবহারিক তৈরি করার আগে প্রথমে অনেক সহজ একটি কাজ করতে হয়: আপনার লেখা ভঙ্গ করা।
এই প্রক্রিয়াকে বলা হয় টোকেনাইজেশন, এবং এটি আধুনিক AI সিস্টেমগুলোর কাজের একটি সবচেয়ে গুরুত্বপূর্ণ, এবং অনেক সময় উপেক্ষিত, অংশ।
বেশিরভাগ লোক মনে করেন মডেলগুলো শব্দ পড়ে। তারা পড়ে না।
তারা পড়ে টোকেন: ক্ষুদ্র টেক্সট শীটগুলো যা সম্পূর্ণ শব্দ, শব্দের অংশ, বিরাম চিহ্ন, ফাঁকা স্থান, অথবা এমনকি একক প্রতীকগুলোর প্রতিনিধিত্ব করতে পারে। তারপর সেই টোকেনগুলো সাংখ্যাঙ্ক আইডিতে রূপান্তরিত হয় যা মডেল অভ্যন্তরীণভাবে প্রসেস করতে পারে।
টোকেনাইজেশন বোঝা অনেক কিছু ব্যাখ্যা করতে সাহায্য করে:
- কেন প্রম্পটগুলোতে খরচ হয়
- কেন প্রসঙ্গের সীমা থাকে
- কেন কিছু ভাষা অন্যগুলোর তুলনায় বেশি খরচ করে
- কেন মডেলগুলো কখনও অদ্ভুত আচরণ করে
টোকেনাইজেশন AI পাইপলাইনের অঙ্গভঙ্গীতে অবস্থান করে, এবং এটি চুপচাপ পরবর্তী প্রতিটি কিছুর আকৃতি নির্ধারণ করে।
টোকেন কি?
একটি টোকেন হল সেই ক্ষুদ্রতম ইউনিট যার সাথে একটি মডেল কাজ করে।
এটি সদা শব্দের সমান নয়।
উদাহরণস্বরূপ:
| পাঠ্য | সম্ভাব্য টোকেন বিভাজন |
|---|---|
| hello | hello |
| tokenization | token + ization |
| unbelievable | un + believ + able |
| 2026! | 202 + 6 +! |
এটি গুরুত্বপূর্ণ কারণ মডেলগুলো টোকেন গোনে, শব্দ গোনে না।
একটি স্বল্প দেখনাসম্পন্ন বাক্য অপেক্ষার চেয়েও বেশি টোকেন ব্যবহার করতে পারে, বিশেষ করে অস্বাভাবিক শব্দ, কোড, ইমোজি, বা ইংরেজির বাইরে ভাষায়।
টোকেনাইজেশন কিভাবে কাজ করে
একটি উচ্চ স্তরে, টোকেনাইজেশন একটি সহজ পাইপলাইন অনুসরণ করে।
পদক্ষেপ ১: পাঠ্য ভঙ্গ করা
টোকেনাইজার কাঁচা টেক্সটকে তার শব্দভাণ্ডার নিয়মের ভিত্তিতে টুকরো টুকরো করে।
আধুনিক LLMs সাধারণত সাবওয়ার্ড টোকেনাইজেশন ব্যবহার করে, সম্পূর্ণ শব্দের টোকেনাইজেশন নয়।
এটি তাদের জন্য নিম্নলিখিতগুলোর পরিচালনা করতে নমনীয়তা প্রদান করে:
- বিরল শব্দ
- টাইপো
- নাম
- একাধিক ভাষার ইনপুট
- কোড
পদক্ষেপ ২: টোকেনগুলোর আইডিতে রূপান্তর করা
প্রতি টোকেন একটি সংখ্যার সাথে মডেলের শব্দভাণ্ডারের মধ্যে ম্যাপ করে।
উদাহরণ:
| টোকেন | টোকেন আইডি |
|---|---|
| The | 791 |
| model | 4382 |
| works | 2921 |
মডেল কখনোই সরাসরি ‘‘টেক্সট’’ দেখে না। এটি কেবলমাত্র এই সংখ্যামূলক প্রতিনিধিত্বগুলো দেখে।
এটি মানব ভাষা এবং স্নায়ু গণনার মধ্যে ব্রিজ।
পদক্ষেপ ৩: আইডি গুলোকে এমবেডিংসে রূপান্তর করা
টোকেন আইডি তৈরি হওয়ার পর, সেগুলো ভেক্টর এমবেডিংসে রূপান্তরিত হয়।
এখানেই অর্থ উন্মোচন শুরু হয়।
এই পয়েন্টে:
- সমান টোকেনগুলো ভেক্টর স্পেসে পার্শ্ববর্তী অবস্থান দখল করতে পারে
- ধারণার মধ্যে সম্পর্কগুলি পরিমাপযোগ্য হয়ে ওঠে
- প্রসঙ্গ গুরুত্বপূর্ণ হতে শুরু করে
টোকেনাইজেশন ডেটাকে সিস্টেমে নিয়ে আসে। এমবেডিংস এটি ব্যাখ্যা সম্পন্ন করে।
কেন সাবওয়ার্ড টোকেনাইজেশন স্টান্ডার্ড হয়ে উঠেছে
পুরানো NLP সিস্টেমগুলি সাধারণত টেক্সট শব্দ দ্বারা ভাঙতো।
এটি কাজ করত, যতক্ষণ না তারা এমন শব্দে এসে পৌঁছাত যা তারা আগে কখনো দেখেনি।
আধুনিক LLMs সাধারণত বাইট পেয়ার এনকোডিং (BPE) বা অনুরূপ সাবওয়ার্ড কৌশল ব্যবহার করে।
BPE কার্যকর হয় একাধিক বার পুনরাবৃত্ত ভিত্তিতে অনেক চিহ্নের নিয়মিত প্যাটার্নগুলোকে পুনরায় মিশ্রিত করে পুনরায় ব্যবহৃত ইউনিটে রূপান্তরিত করে। এটি সংৰক্ষণ এবং শব্দভাণ্ডার দক্ষতা উন্নত করে।
কেন সাবওয়ার্ড মডেলগুলো ভাল
| পদ্ধতি | প্রধান সমস্যা |
|---|---|
| শব্দ-স্তর | খুব বেশি অজানা শব্দ |
| অক্ষর-স্তর | খুব ধীর, খুব দীর্ঘ |
| সাবওয়ার্ড-স্তর | নমনীয়তা এবং দক্ষতার সেরা ভারসাম্য |
এটাই কেন অধিকাংশ আধুনিক মডেলগুলি সাবওয়ার্ড টোকেনাইজেশনের কিছু সংস্করণ ব্যবহার করে।
কেন টোকেনাইজেশন খরচকে প্রভাবিত করে
এখানেই টোকেনাইজেশন বাস্তবিক হয়ে দাঁড়ায়।
বেশিরভাগ AI API ইনপুট টোকেন এবং আউটপুট টোকেনের ভিত্তিতে বিলিং করে।
অর্থাৎ টোকেনাইজেশন সরাসরি মূল্যকে প্রভাবিত করে।
উদাহরণস্বরূপ:
| ইনপুটের ধরন | আনুমানিক টোকেন ঘনত্ব |
|---|---|
| সাধারণ ইংরেজি | নিম্ন |
| কোড | মধ্যম, উচ্চ |
| আইনি পাঠ্য | উচ্চ |
| চীনা/জাপানি | প্রায়ই উচ্চতর |
| ইমোজি-ভারী পাঠ্য | আশ্চর্যজনকভাবে উচ্চ |
একই চরিত্রের সংখ্যা নিয়ে দুইটি প্রম্পটের অত্যন্ত আলাদা টোকেন গণনা হতে পারে।
এটি উৎপাদন AI সিস্টেমগুলোর একটি সাধারণ গোপন খরচ চালিকাশক্তি।
কেন টোকেনাইজেশন মডেলের আচরণকে প্রভাবিত করে
টোকেনাইজেশনও অনেক “অদ্ভুত” মডেল আচরণ ব্যাখ্যা করে।
উদাহরণস্বরূপ:
- কেন মডেলগুলো অক্ষর গোনা কঠিন অনুভব করে
- কেন বিরল শব্দ অপ্রত্যাশিতভাবে আচরণ করে
- কেন ফরম্যাট পরিবর্তন আউটপুটে প্রভাব ফেলতে পারে
- কেন প্রম্পটের অর্ডার গুরুত্বপূর্ণ
একটি মডেল অক্ষর বা ব্যাকরণ সম্পর্কে মানুষের মতো চিন্তা করে না। এটি টোকেন সিকোয়েন্সের পূর্বাভাস দেয়।
এই পার্থক্য অনেক অদ্ভুততাকে সৃষ্টি করে যা ব্যবহারকারীরা লক্ষ্য করে।
কমিউনিটি আলোচনা প্রায়শই টোকেনের কাঠামোকে উল্লেখ করে যে এটি মডেলগুলোকে অক্ষর স্তরের যুক্তিবিজ্ঞান সম্পাদনের ক্ষেত্রে বাধাগ্রস্ত করে।
টোকেন আউটপুটে পরিণত হয়
একবার ইনপুট টোকেনাইজড হলে:
- টোকেন ট্রান্সফরমারে প্রবাহিত হয়
- মডেল পরবর্তী টোকেনের পূর্বাভাস করে
- সেই টোকেন যুক্ত করা হয়
- প্রক্রিয়া পুনরাবৃত্ত হয়
এটি চলতে থাকে যতক্ষণ না:
- একটি স্টপ টোকেন উপস্থিত হয়
- টোকেনের সীমা পৌঁছে যায়
- সিস্টেম উৎপাদন বন্ধ করে
এতে বোঝা যায় AI উৎপাদন মূলত একটি টোকেন-বাই-টোকেন পূর্বাভাস চক্র, বাক্য-স্তরের যুক্তিবিজ্ঞান নয়।
চূড়ান্ত নোট
টোকেনাইজেশন একটি ক্ষুদ্র প্রযুক্তিগত বিস্তারিত মনে হয়, কিন্তু এটি আধুনিক LLM সিস্টেমগুলির প্রায় সবকিছুকে আকৃতি দেয়।
এটি প্রভাব ফেলে:
- খরচ
- গতি
- প্রসঙ্গের সীমা
- একাধিক ভাষার কার্যকরিতা
- মডেলের আচরণ
- আউটপুটের গুণমান
যদি আপনি AI নিয়ে কাজ করছেন, তাহলে টোকেনাইজেশন বোঝা আপনাকে দেয় যে সিস্টেমগুলি কেন কার্যকর হয় তা নিয়ে একটি ভাল স্বজ্ঞা।
এমবেডিংস, ট্রান্সফরমার, বা আউটপুটের আগে, টোকেন রয়েছে।
এবং সবকিছু সেখান থেকেই শুরু হয়।
সাবধান প্রম্পট ডিজাইন, শব্দভাণ্ডার পছন্দ এবং টোকেন বাজেটিং নিশ্চিত করে যে আপনার টোকেন ব্যবহার এবং টোকেনের গণনা আপনার খরচ এবং গুণমানের লক্ষ্যগুলির সাথে সামঞ্জস্যপূর্ণ। ফলস্বরূপ অন্তর্ভুক্ত হয় অপ্রত্যাশিত সম্পূর্ণ হওয়ার সংখ্যা কমানো, নিম্ন API খরচ, এবং মডেল যা আপনার ব্যবহারকারীদের লেখার ধরনকে ভালভাবে বোঝে।




