এজ LLMs এবং ক্ষুদ্র মডেলগুলি কেন প্রকৃত সময়ের অ্যাপগুলির জন্য গুরুত্বপূর্ণ

AI Agents

লেখক: Win.AI Editorial

Engineer testing on-device AI: laptop showing a local LLM console and smartphone running an AI assistant, with a small development team bench in the background.

আমার দাবী: এজ LLMs ল্যাটেন্সি সংবেদনশীল, গোপনতা সচেতন ফিচারের জন্য স্বাভাবিক পছন্দে পরিণত হচ্ছে কারণ ছোট, প্রান্তিক মডেলগুলির সাথে হাইব্রিড পাইপলাইনগুলি স্বচ্ছ tail latency এবং কম ডেটা প্রকাশ নিশ্চিত করে অপরিকল্পিত ক্লাউড বিলের খরচে। এটি এখন টুলিং, মডেল ফরম্যাট এবং বিক্রেতার পণ্যের চলনে দৃশ্যমান।

প্র্যাকটিসে এজ LLMs

যে প্রযুক্তিগত পলম্বং যন্ত্রকে ডিভাইসে ইনফারেন্স বাস্তবসম্মত করে তুলছে তা আর অনুমানমূলক নয়। llama.cpp প্রকল্প এবং এর GGUF কোয়ান্টাইজেশন টুলগুলি ব্যাপকভাবে ব্যবহৃত হচ্ছে ফোন এবং ল্যাপটপে 4-বিট এবং 8-বিট মডেল চালানোর জন্য, যা 1B থেকে 8B প্যারামিটার মডেলগুলি সাধারণ হার্ডওয়ারে ব্যবহারযোগ্য করে। Ollama স্থানীয় রানটাইম এবং একটি মডেল রেজিস্ট্রি বাণিজ্যিকভাবে চালু করেছে যা GGUF এবং MLX রানটাইমগুলি Apple সিলিকন-এর জন্য মানককৃত করে। Apple ICLR 2026 এ MLX ডেমো প্রকাশ করেছে যা দেখায় যে কোয়ান্টাইজড মডেলগুলি M-সিরিজ চিপে নেটিভভাবে চলতে সক্ষম। এই তিনটি পরিবর্তন মিলে গবেষণাকে বাস্তবায়নযোগ্য স্ট্যাকগুলিতে পরিণত করে।

কেন এটি সময় সম্বন্ধীয় অ্যাপগুলির জন্য গুরুত্বপূর্ণ

ল্যাটেন্সি শুধুমাত্র গড় টোকেন প্রতি সেকেন্ড নয়। ব্যবহারকারীরা টেইল লক্ষ্য করেন। প্রিফিল এবং সহজ তৈরি ডিভাইসে স্থানান্তর করলে 50 থেকে 300 মিলিসেকেন্ড নেটওয়ার্ক রাউন্ডট্রিপটি আধুনিক NPU এবং GPU-তে একক অঙ্কের ডিকোড ল্যাটেন্সিতে নেমে আসে, বিশেষ করে Apple সিলিকন এবং Snapdragon ফ্ল্যাগশিপে। গোপনতা উন্নত হয় কারণ কম প্রম্পট এবং কম ডকুমেন্ট এমবেডিং ডিভাইস থেকে বের হয়। আর্থিক বাজারও অনুসরণ করছে: ইনফারেন্স অবকাঠামোর জন্য ভেঞ্চার এবং হার্ডওয়্যার বাজেট 2026 সালের মধ্যভাগে বৃদ্ধি পেয়েছে, যা স্থায়ীভাবে নিম্ন স্তরের ইনফারেন্স অপ্টিমাইজেশনের জন্য বিনিয়োগের সংকেত দেয়।

কাউন্টারপয়েন্ট: কোয়ান্টাইজেশন এবং আক্রমণাত্মক সংকোচন বিনামূল্য নয়। GGUF এবং পোস্ট-ট্রেনিং কোয়ান্টাইজেশনের উপর সাম্প্রতিক মূল্যায়নগুলি কম সম্পদের ভাষা এবং কিছু জেনারেটিভ কাজে পরিমাপযোগ্য গুণগত হ্রাস দেখায়। এর মানে হলো ডিভাইসে মডেলগুলি প্রথমিক চিকিৎসা, নিষ্কাশন, সারসংক্ষেপ এবং মাল্টিমোডাল প্রি-প্রসেসিংয়ের জন্য সেরা, চূড়ান্ত দীর্ঘমেয়াদী সৃষ্টিশীল কাজগুলির জন্য নয়।

এজ বনাম ক্লাউড কিভাবে নির্বাচন করবেন

তিনটি লিভারের ভিত্তিতে সিদ্ধান্ত নিন: ল্যাটেন্সি সহনশীলতা, গোপনতা ঝুঁকি এবং মডেল ফ্রেশনেস। যদি আপনার বৈশিষ্টটি 200 মিলিসেকেন্ডের নিচে প্রতিত্তোরের প্রয়োজন হয় এবং সংবেদনশীল ব্যবহারকারীর ডেটার সাথে যুক্ত হয়, তাহলে প্রথম স্তরের ফিল্টার হিসেবে একটি অন-ডিভাইস ক্ষুদ্র মডেলকে অগ্রাধিকার দিন। যদি আপনাকে সর্বশেষ রিজনিং মডেল বা অত্যন্ত বড় প্রসঙ্গ উইন্ডোগুলি প্রয়োজন হয়, তাহলে ফিল্টারকৃত অনুরোধগুলি একটি ক্লাউড মডেলে পাঠান যাতে রাষ্ট্র এবং দীর্ঘ প্রসঙ্গের স্মৃতি থাকে।

পণ্য দলের জন্য দুটি প্রকৌশল বাস্তবতা দেখতে হবে। প্রথমত, অবকাঠামোর প্রাপ্তি: llama.cpp, Ollama, MLX এবং ব্রাউজারের WebLLM যেমন রানটাইমগুলি মডেল আমদানি, কোয়ান্টাইজেশন এবং সময়সূচী স্থায়ী করছে। দ্বিতীয়ত, আপডেটের খরচ: একটি পinned অন-ডিভাইস মডেল প্রদান করা চলাফেরা খরচের চেয়ে আপডেটের জটিলতা এবং অ্যাপ-স্টোর চক্রের জন্য কম খরচ দিতে পারে। উভয়ই সমাধানযোগ্য কিন্তু এগুলি রোডম্যাপের অংশ হতে হবে।

প্রয়োগে আমরা একটি সাধারণ প্যাটার্ন লক্ষ্য করেছি: ছোট অন-ডিভাইস মডেলগুলি অপ্রয়োজনীয় ক্লাউড কল হ্রাস করে এবং টেইল ল্যাটেন্সি মসৃণ করে। আমরা আরেকটি প্যাটার্ন লক্ষ্য করেছি: যে দলগুলি অন-ডিভাইস মডেলটিকে একটি নির্ধারিত ফিল্টার হিসেবে গন্য করে তাদের ব্যবহারকারীদের অভিজ্ঞতা প্রিডিক্টেবল হয়। একটি সমস্যা দলের সামনে এসে দাঁড়ায় খুব কম বিট কোয়ান্টাইজেশনের অধীনে ভাষা এবং ডোমেইন ক্ষতি; পুনরুদ্ধারের পরিকল্পনা করুন।

নিজেই চেষ্টা করুন

নিচের প্রম্পট দুটি বাস্তবায়নযোগ্য হাইব্রিড প্যাটার্ন প্রদর্শন করে যা আপনি স্থানীয় ক্ষুদ্র মডেল রানটাইমে পরীক্ষার জন্য পেস্ট করতে পারেন।

এই প্রম্পটটি নির্ধারণ করে যে একটি ব্যবহারকারী প্রশ্ন কি ক্লাউড কল প্রয়োজন। আশা করুন একটি JSON প্রতিক্রিয়া সহ call_cloud true বা false এবং একটি সংক্ষিপ্ত কারণ।

You are a triage agent. Given the user message in the field "input", decide whether this needs a cloud LLM for long-form reasoning or whether the device can respond locally. Output valid JSON with three keys: call_cloud (true or false), reason (one short sentence), and local_action (one-line instruction the device can execute if call_cloud is false). Input: "{{user_input}}"

এই প্রম্পটটি একটি ছবির এবং সংক্ষিপ্ত শিরোনাম থেকে কাঠামোবদ্ধ তথ্য বের করে, যা ডিভাইসে মাল্টিমোডাল এজেন্টগুলোর জন্য উপকারী যারা কেবল প্রয়োজনীয় ক্ষেত্রগুলি ক্লাউডে ফরওয়ার্ড করে।

You are an on-device vision extractor. Describe the primary object in one sentence. Then return a JSON object with keys: caption, objects (list of names), and sensitive (true if image contains personal ID, credit card, or other private data). Use concise phrases only. Image: [attach image bytes].

পণ্য টেকঅওয়ে: ক্ষুদ্র অন-ডিভাইস মডেলগুলি একটি ক্লাউড ব্যাকআপের সাথে জুড়ুন, আপনার ভাষা এবং কাজগুলির জন্য গুণগত ক্ষয় মাপুন এবং মডেল পুনরায় তাৎক্ষণিক করার জন্য অ্যাপ আপডেট চক্র বাজেট করুন। এজেন্টিক প্রবাহের জন্য, গভীর কার্যক্ষম প্যাটার্ন এবং ব্যর্থ মোডের জন্য আমাদের AI এজেন্টগুলি এবং চ্যাটবটগুলোর মধ্যে পার্থকের গাইড দেখুন।

সম্পর্কিত

আরও আর্টিকেল পড়ুন

সবাই যা কপি করছে, তার চেয়ে এগিয়ে থাকুন।

সব দেখুন
AI Agents

এজেন্টিক সহকারী: নিরাপদ ক্যালেন্ডার এবং জিমেইল ইন্টিগ্রেশন

সুরক্ষিতভাবে এজেন্টদের Gmail, Calendar এবং অন্যান্য অ্যাপগুলিতে পড়া এবং কাজ করার জন্য একটি সংক্ষিপ্ত প্রকৌশল চেকলিস্ট।

AI Agents

এআই এজেন্ট বনাম চ্যাটবট: পার্থক্য কী এবং কেন তা গুরুত্বপূর্ণ

এআই এজেন্ট এবং চ্যাটবটের মধ্যে পার্থক্য বোঝা আজকের বিশ্বের প্রযুক্তিতে গুরুত্বপূর্ণ। এটি কিভাবে কাজ করছে তা ব্যাখ্যা করে।

AI Agents

AI এজেন্ট কী? 2026-এ স্বায়ত্তশাসিত AI এর জন্য ব্যবহারকারীর গাইড

কয়েক বছর আগে, ChatGPT AI উন্নয়নে একটি বাস্তব বিপ্লব ছিল। এটি দ্রুত, বুদ্ধিমান, এবং বাস্তব জীবনে কার্যকর। কিন্তু এটি একটি বৃহত্তর গল্পের একটি ছোট অংশ।

ভাইরাল টেমপ্লেট

আমাদের ভাইরাল AI টেমপ্লেট এক্সপ্লোর করুন এবং নিজের ফটোতে ব্যবহার করুন।

টেমপ্লেট এক্সপ্লোর করুন
এজ LLMs এবং ক্ষুদ্র মডেল যা আসছে