Хувийн LLM ашиглалт: Аж ахуйн нэгжүүдэд зориулсан практик RAG

Blog

Зохиогч: Win.AI Editorial

Хувийн llm ашиглалт нь мэдээллийг таны хязгаарын дотор байлгаж, хяналт тавих боломжтой, салбарын нарийн хариултуудыг олгодог. Энэ гарын авлага нь инженер, бүтээгдэхүүний багуудад загвар сонголтоос аюулгүй RAG хоолой, үнэлгээ, минимал үйлдвэрлэлийн төлөвлөгөө рүү хурдан, практик замыг өгнө.

Загвар, иEmbedding-ийг хязгаарлалттайгаар сонго

Танай хүлээлт, зардал, лицензийн хязгаарлалтад тохирох загварыг сонгоно уу. Сүүлийн үеийн нээлттэй жинтэй жагсаалууд нь Leafy.dev болон PocketLLM-ийн гэрээнд 7B-аас 70B-ийн загварууд хүртэлх өргөн спектрийг харуулдаг; жижиг загварууд хостингийн зардлыг бууруулж, дотоод мэдрэгчийг практик болгодог, том загварууд багц чанарыг сайжруулдаг. Индексжүүлэлт болон гүйцэтгэлийн аль аль нь ижил үйлдвэрлэгч эсвэл L2-тэй нийцсэн иEmbedding загварыг ашиглах нь векторын гуйвуулгаас зайлсхийх болно. Статик баримтуудад иEmbedding-ийг урьдчилан тооцоолсноор асуусны хүлээлтийн хугацааг нэг удаагийн урьдчилан явах хугацаагаар бууруулдаг бөгөөд буцаалтыг хялбаршуулдаг нь үзүүлсэн.

Аюулгүй векторын дэлгүүрүүд ба нууцлалын техник

5 сая вектороос доош байгаа олон багийн хувьд, pgvector-тай Embedded Postgres нь ажиллагааны хувьд энгийн стандарт байдаг бол Pinecone, Weaviate болон Milvus зэрэг удирдлагын үйлчилгээ нь нэмэлт зардал, мэргэшилттэй онцлогтойг арилжаалж өгдөг. Inductivee болон Tensoria-ийн магадлан шинжилгээ нь 1M-100M векторын дата сетийн throughput болон зардлын ялгааг хэлэлцдэг бөгөөд сонголт нь векторын хэмжээ, QPS болон та олон бүсийн давтамж хэрэгтэй эсэхээс хамаардаг.

Векторуудыг амраахад нь шифрлэж, түлхүүрүүдийн хувьд савны шифрлэлийг хэрэглээрэй. Векторын дэлгүүрт хатуу IAM-ыг хэрэглэж, бүх үйлчилгээний холболтод mTLS-г шаардана. Аюулын загварчлал болон red-teaming-ийн зааварыг бидний LLM аюулгүй байдлын түлхүүр цагийн хугацааг шалгаж LLM security playbook. Хэрэв танд албан ёсны нууцлалын баталгааг шаарддаг бол манай сургалтаас ялгаатай нууцлалыг шалгаарай differential privacy techniques.

Бидний практикт олж авсан нэг асуудал нь векторын метадата хамаарсан үйлчилгээний дансуудын тохиргоо буруу байх явдал. Метадатаг өндөр мэдрэмжтэй зүйл гэж үзэж, векторын адал шиг эдгээрийг хааж, нэгж хяналтын аргаар хийгээрэй.

Холбоотой байдал, хүүдийн, хүлээлт, зардлыг хэмжих

Retrieval метрикүүдийг Hit@k, MRR болон NDCG-ийг алдаа олшруулахад ашиглаж, мөн RAGEval, RAGAS зэрэг лавлагаа болон лавлагаагүй үнэлгээний бүтэцүүдийг ашиглан бүрэн байдал, хүүдийн болон холбоогүй байдал шалгана. RAGEval болон RAGAS нь салбарын даалгаваруудаас арилуулсан гараг дотроо өөрийн сценари байлгах үүргийг санал болгож, автоматжуулсан LLM-as-judge шалгалтыг дууддаг. Гурван үйлдвэрлэлийн дохиог хянаарай: retrieval-ийн нарийн, хариултын үнэнч байдал болон сүүлчийн хүлээлт. Практикаар, retrieval-ийн эргэн тойрдыг нэмэгдүүлэх нь загварын хэмжээгээс илүү үр дүнтэйгээр хүүдийн бууруулдаг.

Хувийн llm ашиглалтыг төлөвлөх загвар

Ийм төлөвлөгөө: VPC-ийн ард савласан загвараа, тусдаа векторын дэлгүүрийн кластерийг, сүлжээний ACL-уудыг хааж, богино наслалттай токен гаргаж өгдөг таны аутентификацийн прокси, аудитаар хариултын хариулттай retrieval-ийн ID-г логлодог ажиглалтын давхарга. Хүлээлтийн тусад нь нэг бүсийн VPC-дугараасан загварыг эхлээд хийж, дараа нь шаардлагатай бол 2 бүсийн давтамжийг нэмнэ. Бага хэмжээний шилжүүлэгт их зардал гарна, гэхдээ илүү хяналт, нууцлалтай.

Илэрхий шүүмжлэлээр бол бүтээгдэхүүний дэвшил юм. Үүлд хостлож буй LLM үйлчилгээ нь хурдтай хөгжих бөгөөд инженерийн зардлын өөрчлөлттэй илүү хямд байж магадгүй. Миний таамаг: Сар бүр 2 саяас илүү асуултаар дунд эрч хүчтэй байхад, удирдлагаар дамжуулан гүйцэтгэх нь нийт зардлын эзэмшилд давамгайлах байх. Гэхдээ зохицуулалттай дата болон хатуу оршин суух дүрэмд хувийн ашиглалт нь ганц боломжит сонголт юм.

Өөрөө туршаад үз: доорх хоёр асуулт нь үндсэн мэдээллийг нээж, дэмжихгүй мэдэгдлүүдийг илрүүлэх аргыг харуулдаг.

Энэхүү асуулт нь загварыг өгөгдсөн контекстийг ашиглан асуусан асуултын хариултыг өгөхийг хүснэ, мөн тухайн контекстой харгалзах идэвхид хэрэглэсэн эх үүсвэрийн ID-г жагсаана. Хариу нь товч бөгөөд эх сурвалжийн ишлэлтэй байхыг хүлээгээрэй.

Эдгээр контекстийн ID-тай хамаарсан баримтуудаас хариултаа өгч, хэрэглэсэн гурван контекстийн ID-гийн жагсаалтыг оруулж, тус бүрийн яг ишлэлийг бичнэ үү.
Контекст 1 [id=C1]: "..."
Контекст 2 [id=C2]: "..."
Хэрэглэгчийн асуулт: "X-г тайлбарлаад 3 дэмжигч баримт бичиг оруулна уу."

Энэхүү асуулт нь загвараас хариултад дэмжигддэггүй мэдэгдлүүдийг тэмдэглэхийг хүснэ. Бид хүлээдэг богино жагсаалт нь дэмжигдсэн эсэхийг мэдэгддэг, дэмжих контекстийн ID-ийг харамсдаг.

Та энэ хариултыг бий болгосон. Аль өгүүлбэр бүрт хариулт өгсөн контекстын хамаарлыг оруулаад ч юмуу дэмжигдээгүйгээр тэмдэглэж өгнө үү.
Хариулт: "..."
Контекстууд: C1, C2, C3

Бидний анзаарахад жижиг, давтагдсан туршилт нь retrieval-ийн параметрүүдтэй гэсэн өмнөх итгэл дарханыг хамгийн их сайжруулдаг. Үнэлгээг давтагдах байдлыг хадгалж, хариултуудын хамт retrieval-ийн ID-г логлож, үндсэн шалтгааныг шинжилнэ.

Бусад нийтлэл унших

Бусад хуулж байгаагаас нэг алхам түрүүлээрэй.

Бүгдийг харах
Blog

АИ 2040: Суперинтеллект 2030 он гэхэд ирж чадах уу?

Хиймэл оюун ухаан өмнөх технологиудаас илүү хурдан хөгжиж байна, гэхдээ хамгийн том асуулт одоо АИ одоо яаж ажилладаг вэ гэдэгт биш, харин АИ яаж өөрсдийгөө сайжруулах чадвартай болох вэ гэдэгт төвлөрч байна.

Blog

Vera Rubin NVL72: Дараачийн үеийн сургалтын инфра бүтэц юу гэсэн үг вэ

Vera Rubin NVL72-ийн хураангуй тайлбар: юун тухай rack-ийн түвшний загварын өөрчлөлтүүд, та төсөвт хүргэх ёстой бодит үйлдлийн зардлууд, болон ямар байгууллагууд худалдаж авах ёстой, ямар байгууллагууд түрээслэх ёстой.

Blog

Хүний ба хиймэл оюун ухааны ажлын урсгалыг дизайнаар боловсруулах: шилжүүлэг, үүсэл, итгэлийн төлөө хэрэглээний UX загварууд

Хүмүүн ба хиймэл оюун ухааны хамтын ажиллагаа бүтээгдэхүүн нь загварыг багийн гишүүн мэт ханддаг үед хамгийн сайн ажилладаг, бүхнийг мэдэгч оюун ухаан биш.

Вирал загварууд

Манай вирал AI загваруудыг судалж, зургаадаа хэрэглээрэй.

Загваруудыг судлах