ব্যবসায়ের জন্য প্রাইভেট LLM ডিপ্লয়মেন্ট: কার্যকর RAG

Blog

লেখক: Win.AI Editorial

একটি প্রাইভেট LLM ডিপ্লয়মেন্ট যেটি রিট্রিভাল-অগমেন্টেড জেনারেশন (RAG) ব্যবহার করে, অডিটযোগ্য এবং ডোমেইন সঠিক উত্তর প্রদান করে যখন ডেটা আপনার সার্কেলের ভিতরে থাকে। এই গাইডটি ইঞ্জিনিয়ারিং এবং প্রোডাক্ট টিমগুলির জন্য মডেল নির্বাচন থেকে শুরু করে একটি নিরাপদ RAG পাইপলাইন, মূল্যায়ন এবং একটি ন্যূনতম প্রোডাকশন ব্লুপ্রিন্টের একটি সংক্ষিপ্ত, কার্যকর রুট দেয়।

মডেল এবং এম্বেডিং নির্বাচন করুন সীমাবদ্ধতার সাথে

একটি মডেল বেছে নিন যা আপনার লেটেন্সি, খরচ এবং লাইসেন্স সীমাবদ্ধতার সাথে মানানসই। Leafy.dev এবং PocketLLM এর মতো সাম্প্রতিক ওপেন ওজনের তালিকা ছোট 7B মডেল থেকে 70B পরিবারের বিস্তৃত একটি চিত্র দেখায়; ছোট মডেলগুলি হোস্টিং খরচ কমায় এবং অন-প্রেম ইনফারেন্সকে বাস্তবসম্মত করে, বৃহত্তর মডেলগুলির একটি আউট-অফ-দ্য-বক্স যুক্তি উন্নত করে। ভেক্টর ড্রিফট এড়াতে ইনডেক্সিং এবং রানটাইমের জন্য একই বিক্রেতা বা একটি L2-কম্প্যাটিবল এম্বেডিং মডেল ব্যবহার করুন। আমরা লক্ষ্য করেছি যে স্ট্যাটিক ডকুমেন্টের জন্য প্রি-ক্যামপিউটেড এম্বেডিংগুলি কিউরি লেটেন্সি প্রায় একটি একক ফরোয়ার্ড পাসের সময় কমিয়ে দেয় এবং রোলব্যাকগুলোকে সহজ করে।

নিরাপদ ভেক্টর স্টোর এবং প্রাইভেসি প্রযুক্তি

৫ মিলিয়নের নীচে ভেক্টরের জন্য অনেক টিমের জন্য, এম্বেডেড পোস্টগ্রেস pgvector সহ একটি কার্যকরভাবে সহজ ডিফল্ট, যখন Pinecone, Weaviate এবং Milvus-এর মতো পরিচালিত সেবা কম অপারেশনাল খরচের বিনিময়ে উচ্চ খরচ এবং বিশেষায়িত বৈশিষ্ট্যগুলি দেয়। Inductivee এবং Tensoria বেঞ্চমার্ক 1M থেকে 100M ভেক্টর ডেটাসেটের জন্য থ্রুপুট এবং খরচের পার্থক্য আলোচনা করে এবং দেখায় যে পছন্দটি ভেক্টরের আকার, QPS এবং আপনার কি মাল্টি-রিজিয়ন রিপ্লিকেশন প্রয়োজন তার উপর নির্ভর করে।

ভেক্টরগুলি বিশ্রামে এনক্রিপ্ট করুন এবং কী-এর জন্য এনভেলপ এনক্রিপশন ব্যবহার করুন। ভেক্টর স্টোরের জন্য কঠোর IAM প্রয়োগ করুন এবং সমস্ত সেবার সংযোগের জন্য mTLS প্রয়োজন করুন। হুমকি মডেলিং এবং রেড-টিমিং গাইডেন্সের জন্য আমাদের LLM সিকিউরিটি প্লেবুক LLM সিকিউরিটি প্লেবুক তে পরামর্শ করুন। যদি আপনি আনুষ্ঠানিক প্রাইভেসি গ্যারান্টি প্রয়োজন হয়, তবে আমাদের টিউটোরিয়ালে ডিফারেনশিয়াল প্রাইভেসি টেকনিক এ ডিফারেনশিয়াল প্রাইভেসির অপশন এবং সুরক্ষিত সংগ্রহ পর্যালোচনা করুন।

আমরা যে একটি সমস্যা আমাদের অভিজ্ঞতায় সৃষ্টি হয়েছে তা হলো ভুল কনফিগার করা সার্ভিস অ্যাকাউন্টগুলি যা ভেক্টর মেটাডেটা প্রকাশ করে। মেটাডেটাকে উচ্চ সংবেদনশীলতা হিসেবে গণ্য করুন এবং ভেক্টরের মতো একই নিয়ন্ত্রণের পিছনে এটি লক করুন।

প্রাসঙ্গিকতা, ভ্রমণ, লেটেন্সি এবং খরচ পরিমাপ করুন

রিট্রিভাল মেট্রিকস যেমন Hit@k, MRR এবং NDCG ব্যবহার করুন রিট্রিভারের জন্য এবং পূর্ণতা, ভ্রমণ এবং অপ্রাসঙ্গিকতা পরিমাপ করার জন্য রেফারেন্স এবং রেফারেন্স-মুক্ত মূল্যায়ন কাঠামো যেমন RAGEval এবং RAGAS ব্যবহার করুন। RAGEval এবং RAGAS ডোমেইন কাজের জন্য দৃশ্য-নির্দিষ্ট পরীক্ষা সরবরাহ করে এবং স্কেলিং মূল্যায়নের জন্য স্বয়ংক্রিয় LLM-এ-জাজ পরীক্ষা করার জন্য সুপারিশ করে। তিনটি প্রোডাকশন সিগন্যালে পর্যবেক্ষণ করুন: রিট্রিভাল সঠিকতা, উত্তর বিশ্বাসযোগ্যতা এবং টেইল লেটেন্সি। প্রকরণতে, রিট্রিভারের রিকল বাড়ানো প্রায়শই মডেল সাইজ বাড়ানোর চেয়ে ভ্রমণ হ্রাস করতে আরও কার্যকর।

প্রাইভেট LLM ডিপ্লয়মেন্টের জন্য ব্লুপ্রিন্ট

ন্যূনতম ব্লুপ্রিন্ট: একটি VPC-এর পিছনে কনটেইনারাইজড মডেল সার্ভিং, একটি পৃথক ভেক্টর স্টোর ক্লাস্টার যার লক করা নেটওয়ার্ক ACLs, একটি অথ প্রোক্সি যা স্বল্পমেয়াদী টোকেন প্রদান করে, এবং একটি পর্যবেক্ষণ স্ট্যাক যা অডিটের জন্য উত্তর সহ রিট্রিভাল আইডিগুলি লগ করে। লেটেন্সি পূর্বাভাসের জন্য একটি একক-region VPC-হোস্টেড মডেল দিয়ে শুরু করুন, তারপর যদি প্রয়োজন হয় তাহলে ক্রস-রিজিয়ন রিপ্লিকেশন যোগ করুন। ছোট ডিপ্লয়মেন্টের জন্য উচ্চতর স্থির খরচের প্রত্যাশা করুন কিন্তু ভাল নিয়ন্ত্রণ এবং গোপনীয়তা।

প্রচলিত আপত্তি হলো বিক্রেতার উদ্ভাবন। ক্লাউড-হোস্টed LLM পরিষেবাগুলি দ্রুত এগিয়ে যাবে এবং তারা প্রকৌশলকে অর্ধেক করলে সস্তা হতে পারে। আমার অনুমান: Sustained heavy query volumes-এর জন্য, মাসিক কয়েক মিলিয়নের উপরে, পরিচালিত ইনফারেন্স প্রায়ই মোট খরচের মালিকানায় জিতবে। কিন্তু নিয়ন্ত্রিত ডেটা বা কঠোর আবাসিক নিয়মগুলির জন্য, প্রাইভেট ডিপ্লয়মেন্টই একমাত্র কার্যকর বিকল্প।

নিজে চেষ্টা করুন: নিচের দুটি প্রম্পট দেখায় কীভাবে গ্রাউন্ডিং প্রকাশ করতে এবং সাপোর্টেড না হওয়া বিবৃতি সনাক্ত করতে হয়।

এই প্রম্পটটি মডেলকে প্রদত্ত প্রসঙ্গ ব্যবহার করে একটি প্রশ্নের উত্তর দিতে এবং যেসব উৎস আইডি সে ব্যবহার করেছে সেগুলি একটি তালিকায় উল্লেখ করতে বলছে। সংক্ষিপ্ত উত্তর এবং উৎসের উদ্ধৃতি আশা করুন।

নিম্নলিখিত প্রসঙ্গ স্নিপগুলি অনুমান করুন এবং ব্যবহারকারী প্রশ্নের উত্তর দিন এবং আপনি যে তিনটি শীর্ষে প্রাসঙ্গিক আইডি ব্যবহার করেছেন তাদের একটি নম্বরযুক্ত তালিকা অন্তর্ভুক্ত করুন এবং প্রতিটির জন্য সঠিক উদ্ধৃতি।
প্রসঙ্গ ১ [id=C1]: "..."
প্রসঙ্গ ২ [id=C2]: "..."
ব্যবহারকারী প্রশ্ন: "X ব্যাখ্যা করুন এবং তিনটি সমর্থনকারী স্নিপেট উল্লেখ করুন।"

এই প্রম্পটটি মডেলকে তার নিজের উত্তরগুলিতে unsupported দাবিগুলি চিহ্নিত করতে বলছে। প্রত্যাশা করুন সমর্থনের জন্য হ্যাঁ বা না মার্ক করা একটি ছোট তালিকা এবং উপলব্ধ হলে সমর্থনকারী স্নিপেট আইডি।

আপনি এই উত্তরটি তৈরি করেছেন। প্রতিটি বাক্যের জন্য, চিহ্নিত করুন এটি প্রদত্ত প্রসঙ্গগুলির দ্বারা পুরোপুরি সমর্থিত কিনা এবং সমর্থনকারী প্রসঙ্গ আইডি দিন অথবা UNSUPPORTED হিসাবে চিহ্নিত করুন।
উত্তর: "..."
প্রসঙ্গ: C1, C2, C3

আমরা লক্ষ্য করেছি যে ছোট, পুনরাবৃত্তিযোগ্য পরীক্ষাগুলি রিট্রিভাল প্যারামিটারগুলির সাথে বিশ্বাসযোগ্যতা বৃদ্ধির ক্ষেত্রে সবচেয়ে বড় উন্নতি সন্ধান করে। মূল্যায়নগুলিকে পুনরাবৃত্তিযোগ্য রাখুন এবং মূল কারণ বিশ্লেষণের জন্য উত্তরগুলির সাথে রিট্রিভাল আইডি লগ করুন।

আরও আর্টিকেল পড়ুন

সবাই যা কপি করছে, তার চেয়ে এগিয়ে থাকুন।

সব দেখুন
Blog

এআই 2040: সুপার ইন্টেলিজেন্স কি 2030 সালে আসতে পারে?

আর্টিফিশিয়াল ইন্টেলিজেন্স (এআই) দ্রুত গতিতে বিকাশ হচ্ছে, কিন্তু সবচেয়ে বড় প্রশ্ন হল, এআই কি দ্রুত নিজের উন্নতি করতে পারে? এই নিবন্ধে বিস্তারিত আলোচনা করা হয়েছে।

Blog

ভেরা রুবিন NVL72: পরবর্তী প্রজন্মের প্রশিক্ষণ অবকাঠামোর অর্থ

ভেরা রুবিন NVL72 এর একটি সংক্ষিপ্ত বিশ্লেষণ: র্যাক-স্তরের ডিজাইন পরিবর্তনগুলি, প্রকৃত অপারেটিং খরচ এবং কোন প্রতিষ্ঠানগুলি কেনা অথবা ভাড়া করা উচিত।

Blog

মানুষ-এআই কাজের প্রবাহ ডিজাইন: হ্যান্ডঅফ, প্রোভেনান্স এবং আত্মবিশ্বাসের জন্য ব্যবহারিক ইউএক্স প্যাটার্ন

মানুষ-এআই সহযোগিতা তখনই সবচেয়ে ভাল যখন পণ্যটি মডেলটিকে একটি দলের সদস্য হিসেবে গণ্য করে, একটি সর্বজ্ঞ ওরাকল হিসেবে নয়।

ভাইরাল টেমপ্লেট

আমাদের ভাইরাল AI টেমপ্লেট এক্সপ্লোর করুন এবং নিজের ফটোতে ব্যবহার করুন।

টেমপ্লেট এক্সপ্লোর করুন
প্রাইভেট LLM ডিপ্লয়মেন্ট: কার্যকর RAG টিমের জন্য গাইড