Triển Khai LLM Riêng Tư: RAG Thực Tiễn Cho Doanh Nghiệp
Bởi Win.AI Editorial
Triển khai llm riêng tư với thế hệ tăng cường truy xuất cung cấp câu trả lời có thể kiểm toán, chính xác theo miền trong khi giữ dữ liệu bên trong ranh giới của bạn. Hướng dẫn này cung cấp cho các nhóm kỹ thuật và sản phẩm một lộ trình ngắn gọn, thực tiễn từ việc chọn mô hình đến ống dẫn RAG an toàn, đánh giá và một kế hoạch sản xuất tối thiểu.
Chọn mô hình và nhúng với các giới hạn
Chọn một mô hình phù hợp với các giới hạn về độ trễ, chi phí và giấy phép của bạn. Các danh sách trọng số mở gần đây như Leafy.dev và PocketLLM cho thấy một phổ rộng từ các mô hình nhỏ 7B đến 70B; các mô hình nhỏ hơn giảm chi phí lưu trữ và làm cho suy luận tại chỗ trở nên khả thi, các mô hình lớn hơn cải thiện khả năng suy luận ngay lập tức. Sử dụng cùng một nhà cung cấp hoặc một mô hình nhúng tương thích L2 cho cả chỉ mục và thời gian chạy để tránh trôi vector. Chúng tôi quan sát thấy rằng việc tính trước nhúng cho các tài liệu tĩnh làm giảm độ trễ truy vấn khoảng thời gian của một lần tiến lên đơn, và đơn giản hóa việc hoàn nguyên.
Lưu trữ vector an toàn và kỹ thuật bảo mật
Đối với nhiều nhóm dưới 5 triệu vector, Postgres nhúng với pgvector là một mặc định đơn giản về hoạt động, trong khi các dịch vụ được quản lý như Pinecone, Weaviate và Milvus đánh đổi chi phí hoạt động thấp hơn với chi phí cao hơn và các tính năng chuyên biệt. Các bài kiểm tra Inductivee và Tensoria thảo luận về sự khác biệt về thông lượng và chi phí cho các tập dữ liệu vector từ 1 triệu đến 100 triệu và cho thấy rằng sự lựa chọn tùy thuộc vào kích thước vector, QPS và liệu bạn có cần sao chép đa vùng hay không.
Mã hóa vector khi nghỉ và sử dụng mã hóa phong bì cho các khóa. Áp dụng IAM nghiêm ngặt cho kho lưu trữ vector và yêu cầu mTLS cho tất cả các kết nối dịch vụ. Để mô hình hóa mối đe dọa và hướng dẫn kiểm tra đỏ, hãy tham khảo sách hướng dẫn bảo mật LLM của chúng tôi sách hướng dẫn bảo mật LLM. Nếu bạn cần đảm bảo bảo mật chính thức, hãy xem xét các tùy chọn bảo mật khác nhau và tổng hợp an toàn trong hướng dẫn của chúng tôi kỹ thuật bảo mật khác nhau.
Một vấn đề mà chúng tôi gặp phải trong thực tế là các tài khoản dịch vụ được cấu hình sai có thể làm lộ siêu dữ liệu vector. Đối xử với siêu dữ liệu như có độ nhạy cao và khóa nó lại phía sau cùng các điều khiển như các vector.
Đo lường tính liên quan, ảo giác, độ trễ và chi phí
Sử dụng các chỉ số truy xuất như Hit@k, MRR và NDCG cho trình truy xuất và sử dụng các khung đánh giá tham chiếu và không tham chiếu như RAGEval và RAGAS để đánh giá tính toàn vẹn, ảo giác và không liên quan. RAGEval và RAGAS cung cấp các bài kiểm tra cụ thể cho các tác vụ miền và đề xuất các kiểm tra tự động LLM như người đánh giá để mở rộng đánh giá. Giám sát ba tín hiệu sản xuất: độ chính xác của truy xuất, độ trung thực của câu trả lời và độ trễ đuôi. Thực tế, việc nâng cao tỷ lệ hồi đáp của trình truy xuất thường làm giảm ảo giác một cách hiệu quả hơn là tăng kích thước mô hình.
Kế hoạch triển khai cho việc triển khai llm riêng tư
Kế hoạch tối thiểu: phục vụ mô hình được container hóa sau một VPC, một cụm kho lưu trữ vector riêng với ACL mạng khóa, một proxy xác thực phát hành token ngắn hạn, và một ngăn xếp quan sát ghi lại các id truy xuất với câu trả lời cho việc kiểm toán. Bắt đầu với một mô hình được lưu trữ trên VPC ở một vùng để dự đoán độ trễ, sau đó thêm sao chép giữa các vùng chỉ khi cần thiết. Mong đợi chi phí cố định cao hơn cho các triển khai nhỏ nhưng kiểm soát và bảo mật tốt hơn.
Phản đối rõ ràng là đổi mới nhà cung cấp. Các dịch vụ LLM được lưu trữ trên đám mây sẽ phát triển nhanh hơn, và chúng có thể rẻ hơn khi bạn phân bổ chi phí kỹ thuật. Dự đoán của tôi: đối với khối lượng truy vấn lớn duy trì trên vài triệu truy vấn hàng tháng, việc suy luận được quản lý thường thắng lợi về tổng chi phí sở hữu. Tuy nhiên, đối với dữ liệu được quy định hoặc các quy tắc cư trú nghiêm ngặt, triển khai riêng tư là lựa chọn khả thi duy nhất.
Hãy thử nó: hai lời nhắc dưới đây cho thấy cách phơi bày căn cứ và phát hiện các tuyên bố không được hỗ trợ.
Lời nhắc này yêu cầu mô hình trả lời một truy vấn sử dụng ngữ cảnh đã cung cấp và liệt kê các id nguồn mà nó đã sử dụng. Mong đợi câu trả lời ngắn gọn và các trích dẫn từ nguồn.
Cho ngữ cảnh sau với các id, trả lời câu hỏi của người dùng và bao gồm danh sách có số thứ tự của ba id ngữ cảnh hàng đầu mà bạn đã sử dụng và chứng cứ được trích dẫn chính xác cho mỗi id.
Ngữ cảnh 1 [id=C1]: "..."
Ngữ cảnh 2 [id=C2]: "..."
Câu hỏi người dùng: "Giải thích X và trích dẫn 3 đoạn hỗ trợ hàng đầu."
Lời nhắc này yêu cầu mô hình đánh dấu các tuyên bố không được hỗ trợ trong câu trả lời của chính nó. Mong đợi một danh sách ngắn các tuyên bố được đánh dấu có hay không cho sự hỗ trợ và id ngữ cảnh hỗ trợ khi có sẵn.
Bạn đã tạo ra câu trả lời này. Đối với mỗi câu, đánh dấu xem nó có được hỗ trợ hoàn toàn bởi các ngữ cảnh đã cung cấp và đưa id ngữ cảnh hỗ trợ hoặc đánh dấu LÀ KHÔNG ĐƯỢC HỖ TRỢ.
Câu trả lời: "..."
Các ngữ cảnh: C1, C2, C3
Chúng tôi quan sát thấy rằng các thí nghiệm nhỏ, có thể lặp lại với các tham số truy xuất tìm thấy sự cải thiện lớn nhất trong tính trung thực. Giữ cho các đánh giá có thể lặp lại và ghi lại các id truy xuất bên cạnh các câu trả lời để phân tích nguyên nhân gốc.




