Private LLM-Implementierung: Praktisches RAG für Unternehmen
Von Win.AI Editorial
Eine private LLM-Implementierung mit retrieval-augmented generation liefert prüfbare, domänenspezifische Antworten und hält dabei die Daten innerhalb Ihres Perimeters. Dieser Leitfaden bietet Ingenieurs- und Produktteams eine kompakte, praktische Route von der Modellauswahl über eine sichere RAG-Pipeline, Bewertung und einem minimalen Produktionsplan.
Wählen Sie Modell und Embeddings mit Einschränkungen
Wählen Sie ein Modell, das zu Ihren Latenz-, Kosten- und Lizenzanforderungen passt. Neueste Open-Weight-Listen wie Leafy.dev und PocketLLM zeigen ein breites Spektrum von kleinen 7B-Modellen bis hin zu 70B-Familien; kleinere Modelle reduzieren die Hosting-Kosten und machen lokale Inferenz praktikabel, größere Modelle verbessern die unmittelbare Problemlösungsfähigkeit. Verwenden Sie dasselbe Anbieter- oder ein L2-kompatibles Embedding-Modell sowohl für die Indizierung als auch für die Laufzeit, um Vektordrift zu vermeiden. Wir haben beobachtet, dass das Vorausberechnen von Embeddings für statische Dokumente die Abfrage-Latenz um ungefähr die Zeit eines einzelnen Vorwärtsdurchlaufs verkürzt und Rückholungen erleichtert.
Sichere Vektor-Speicher und Datenschutztechniken
Für viele Teams mit weniger als 5 Millionen Vektoren ist embedded Postgres mit pgvector eine betrieblich einfache Standardlösung, während verwaltete Dienste wie Pinecone, Weaviate und Milvus niedrigere Betriebskosten gegen höhere Kosten und spezialisierte Funktionen eintauschen. Inductivee und Tensoria-Benchmarks diskutieren Durchsatz- und Kostendifferenzen für Datensätze von 1M bis 100M Vektoren und zeigen, dass die Wahl von der Vektorgröße, dem QPS und der Notwendigkeit von Multi-Region-Replikation abhängt.
Verschlüsseln Sie Vektoren im Ruhezustand und verwenden Sie Envelope-Verschlüsselung für Schlüssel. Wenden Sie strikte IAM auf den Vektor-Speicher an und verlangen Sie mTLS für alle Dienstverbindungen. Für die Bedrohungsmodellierung und Anleitungen zur Red-Teaming-Konsultation konsultieren Sie unser LLM-Sicherheits-Handbuch LLM-Sicherheits-Handbuch. Wenn Sie formale Datenschutzgarantien benötigen, überprüfen Sie die Differential-Publikationsoptionen und sichere Aggregation in unserem Tutorial Techniken der Differentialprivacy.
Ein Problem, das wir in der Praxis festgestellt haben, sind falsch konfigurierte Dienstkonten, die Vektormetadaten preisgeben. Behandeln Sie Metadaten als hochsensibel und schützen Sie sie mit denselben Kontrollen wie die Vektoren.
Messen Sie Relevanz, Halluzination, Latenz und Kosten
Verwenden Sie Retrieval-Metriken wie Hit@k, MRR und NDCG für den Retrievier und nutzen Sie referenzbasierte und referenzfreie Bewertungsrahmen wie RAGEval und RAGAS, um Vollständigkeit, Halluzination und Irrelevanz zu bewerten. RAGEval und RAGAS bieten szenariospezifische Tests für Domänenaufgaben und schlagen automatisierte LLM-as-Judge-Überprüfungen für die Skalierung der Bewertung vor. Überwachen Sie drei Produktionssignale: Retrieval-Präzision, Antworttreue und Tail-Latenz. In der Praxis führt eine Erhöhung des Retrievier-Recalls oft effektiver zu einer Reduzierung der Halluzinationen als eine Erhöhung der Modellgröße.
Implementierungsplan für die private LLM-Implementierung
Minimaler Plan: containerisierte Modeldienste hinter einem VPC, ein separater Vektor-Speichercluster mit gesperrten Netzwerk-ACLs, ein Auth-Proxydienst, der kurzlebige Tokens ausgibt, und ein Überwachungs-Stack, der Retrieval-IDs zusammen mit Antworten für die Prüfung protokolliert. Beginnen Sie mit einem in einer Region gehosteten VPC-Modell für Vorhersehbarkeit der Latenz und fügen Sie eine cross-region-Replikation nur hinzu, wenn erforderlich. Erwarten Sie höhere Fixkosten bei kleinen Implementierungen, aber bessere Kontrolle und Datenschutz.
Der offensichtliche Einwand ist die Innovation der Anbieter. In der Cloud gehostete LLM-Dienste werden schneller voranschreiten und sie können günstiger sein, wenn Sie Ingenieurkosten amortisieren. Meine Schätzung: Für nachhaltige, hohe Abfragevolumina über einige Millionen monatlichen Abfragen liegt die verwaltete Inferenz oft bei den Gesamtkosten im Vorteil. Doch für regulierte Daten oder strikte Aufenthaltsregeln ist die private Implementierung die einzige praktikable Option.
Versuchen Sie es selbst: die beiden untenstehenden Prompts zeigen, wie man das Fundament freilegt und nicht unterstützte Aussagen erkennt.
Dieser Prompt fordert das Modell auf, eine Anfrage unter Verwendung des bereitgestellten Kontexts zu beantworten und die verwendeten Quellen-IDs aufzulisten. Erwarten Sie prägnante Antworten und Quellenangaben.
Geben Sie die folgenden Kontext-Snippets mit IDs an, antworten Sie auf die Benutzeranfrage und geben Sie eine nummerierte Liste der drei besten Kontext-IDs an, die Sie verwendet haben, sowie genaue zitierte Beweise für jede.
Kontext 1 [id=C1]: "..."
Kontext 2 [id=C2]: "..."
Benutzerfrage: "Erklären Sie X und zitieren Sie die top 3 unterstützenden Snippets."
Dieser Prompt fordert das Modell auf, nicht unterstützte Behauptungen in seiner eigenen Antwort zu kennzeichnen. Erwarten Sie eine kurze Liste von Aussagen, die mit Ja oder Nein für Unterstützung markiert sind, sowie die unterstützende Snippet-ID, wenn verfügbar.
Sie haben diese Antwort erstellt. Markieren Sie für jeden Satz, ob er vollständig durch die bereitgestellten Kontexte unterstützt wird, und geben Sie die unterstützende Kontext-ID oder markieren Sie UNTERSTÜTZT.
Antwort: "..."
Kontexte: C1, C2, C3
Wir haben beobachtet, dass kleine, wiederholbare Experimente mit Retrieval-Parametern die größte Verbesserung in der Treue finden. Halten Sie die Bewertungen wiederholbar und protokollieren Sie die Retrieval-IDs zusammen mit den Antworten für die Ursachenanalyse.




