Penerapan LLM Peribadi: RAG Praktikal untuk Perusahaan

Blog

Oleh Win.AI Editorial

Penerapan llm peribadi dengan generation yang diperkuat pemulihan memberikan jawapan yang boleh diaudit dan tepat bidang sambil mengekalkan data dalam perimeter anda. Panduan ini memberikan pasukan kejuruteraan dan produk laluan praktikal yang padat dari pemilihan model melalui pemindahan RAG yang selamat, penilaian, dan pelan pengeluaran minimum.

Pilih model dan embedding dengan kekangan

Pilih model yang sepadan dengan kelewatan, kos, dan kekangan lesen anda. Senarai berat terbuka terbaru seperti Leafy.dev dan PocketLLM menunjukkan spektrum yang luas dari model 7B kecil hingga keluarga 70B; model yang lebih kecil mengurangkan kos hosting dan menjadikan inferens on-prem menjadi praktikal, sementara model yang lebih besar meningkatkan penalaran di luar kotak. Gunakan vendor yang sama atau model embedding yang serasi L2 untuk pengindeksan dan runtime untuk mengelakkan drift vektor. Kami mendapati bahawa mengira embedding untuk dokumen statik mengurangkan kelewatan pertanyaan dengan anggaran masa satu laluan hadapan, dan menyederhanakan rollback.

Kedai vektor selamat dan teknik privasi

Untuk banyak pasukan di bawah 5 juta vektor, Postgres terbenam dengan pgvector adalah pilihan default yang sederhana secara operasional, sementara perkhidmatan yang dikendalikan seperti Pinecone, Weaviate dan Milvus menukar operasi yang lebih rendah untuk kos yang lebih tinggi dan ciri khusus. Penanda aras Inductivee dan Tensoria membincangkan perbezaan throughput dan kos untuk dataset vektor 1M hingga 100M dan menunjukkan bahawa pilihan bergantung pada saiz vektor, QPS dan sama ada anda memerlukan replikasi pelbagai daerah.

Enkripsi vektor yang tidak aktif dan gunakan enkripsi jemputan untuk kunci. Terapkan IAM ketat pada kedai vektor dan perlukan mTLS untuk semua sambungan perkhidmatan. Untuk pemodelan ancaman dan panduan red-teaming, rujuk buku panduan keselamatan LLM kami buku panduan keselamatan LLM. Jika anda memerlukan jaminan privasi formal, semak pilihan privasi pembezaan dan pengagregatan selamat dalam tutorial kami teknik privasi pembezaan.

Satu isu yang kami temui dalam praktik ialah akaun perkhidmatan yang disusun dengan tidak betul yang mendedahkan metadata vektor. Anggap metadata sebagai sensitiviti tinggi dan kunci ia di belakang kawalan yang sama seperti vektor.

Ukur kaitan, halusinasi, kelewatan dan kos

Gunakan metrik pengambilan seperti Hit@k, MRR dan NDCG untuk pengambil dan gunakan rangka kerja evaluasi rujukan dan tanpa rujukan seperti RAGEval dan RAGAS untuk menilai kesempurnaan, halusinasi dan ketidaksamaan. RAGEval dan RAGAS membekalkan ujian khusus senario untuk tugas domain dan mencadangkan pemeriksaan LLM-sebagai-hakim automatik untuk penilaian skala. Pantau tiga isyarat pengeluaran: ketepatan pengambilan, kesetiaan jawapan dan kelewatan ekor. Dalam praktiknya, meningkatkan ingatan pengambil sering mengurangkan halusinasi lebih berkesan daripada peningkatan saiz model.

Pelan pengeluaran untuk penerapan llm peribadi

Pelan minimum: model yang disediakan dalam bekas di belakang VPC, kluster kedai vektor yang berasingan dengan ACL rangkaian yang terkunci, proksi pengesahan yang mengeluarkan token jangka pendek, dan timbunan penglihatan yang mencatat id pengambilan dengan jawapan untuk audit. Mulakan dengan model yang dihoskan di VPC satu daerah untuk kebolehan ramalan kelewatan, kemudian tambah replikasi merentas daerah hanya jika perlu. Jangkakan kos tetap yang lebih tinggi pada penerapan kecil tetapi lebih baik kawalan dan privasi.

Sanggahan yang jelas ialah inovasi vendor. Perkhidmatan LLM yang dihoskan di awan akan berkembang lebih cepat, dan mungkin lebih murah apabila anda memindahkan kejuruteraan. Anggaran saya: untuk volum pertanyaan berat yang berterusan di atas beberapa juta pertanyaan bulanan, inferens yang dikendalikan sering menang dari segi kos pemilikan keseluruhan. Namun untuk data yang diatur atau peraturan kediaman yang ketat, penerapan peribadi adalah satu-satunya pilihan yang boleh diterima.

Cuba sendiri: dua arahan di bawah menunjukkan cara untuk mendedahkan grounding dan mengesan kenyataan yang tidak disokong.

Arahan ini meminta model untuk menjawab satu pertanyaan menggunakan konteks yang diberikan dan untuk menyenaraikan id sumber yang digunakannya. Jangkaan adalah jawapan yang padat dan petikan sumber.

Memandangkan petikan konteks berikut dengan id, jawab soalan pengguna dan sertakan senarai bernombor tiga id konteks teratas yang anda gunakan dan bukti yang dipetik dengan tepat untuk setiap satu.
Konteks 1 [id=C1]: "..."
Konteks 2 [id=C2]: "..."
Soalan pengguna: "Terangkan X dan petik tiga petikan sokongan teratas."

Arahan ini meminta model untuk menandakan tuntutan yang tidak disokong dalam jawapannya sendiri. Jangkaan adalah senarai ringkas kenyataan ditandakan ya atau tidak untuk sokongan dan id konteks sokongan apabila boleh didapati.

Anda menghasilkan jawapan ini. Untuk setiap ayat, tandakan sama ada ia disokong sepenuhnya oleh konteks yang diberikan dan berikan id konteks sokongan atau tandakan TIDAK DISOKONG.
Jawapan: "..."
Konteks: C1, C2, C3

Kami mendapati bahawa eksperimen kecil yang boleh diulang dengan parameter pengambilan menemukan peningkatan terbesar dalam kesetiaan. Pastikan penilaian boleh diulang dan catat id pengambilan bersama jawapan untuk analisis punca akar.

Templat viral

Terokai templat AI viral kami dan gunakannya pada foto anda.

Terokai templat