Ein individueller KI-Chatbot mit RAG für Schweizer KMU
Ein individueller Chatbot ist kein fein abgestimmtes Modell. Es ist ein kleines, privates Retrieval-System mit einem Sprachmodell obendrauf, so gebaut, dass Ihre Daten Schweizer oder EU-Infrastruktur nie verlassen.
Warum RAG statt Fine-Tuning
Die meisten KMU, die nach einem 'individuellen KI-Chatbot' fragen, nehmen an, die Antwort sei ein auf ihre Dokumente trainiertes Modell. Sie ist es fast nie. Fine-Tuning verändert, wie ein Modell schreibt; es verändert nicht zuverlässig, was es weiss, und brennt Ihre Daten stillschweigend in ein Modell ein, das teuer zu aktualisieren und Zeile für Zeile unmöglich zu prüfen ist.
Retrieval-Augmented Generation löst das eigentliche Problem. Ihre Dokumente bleiben in einer Datenbank unter Ihrer Kontrolle. Zur Anfragezeit werden die relevanten Passagen abgerufen und einem allgemeinen Sprachmodell als Kontext übergeben, zusammen mit der strikten Anweisung, nur aus diesem Kontext zu antworten. Der Chatbot antwortet mit Quellenangaben; jede Antwort lässt sich zum Ursprungstext zurückverfolgen, ein gelöschtes Dokument verschwindet sofort aus den Antworten, und das zugrundeliegende Modell lässt sich austauschen, ohne irgendetwas nachzutrainieren.
Die fünf Teile eines echten RAG-Systems
Ein produktiver Chatbot besteht aus fünf Komponenten, nicht einer. Lassen Sie eine weg, und Sie erhalten eine Demo, die halluziniert.
Erstens, eine Ingest-Pipeline, die Ihre Quellen liest, PDFs, Wiki-Seiten, Ticket-Exporte, Verträge, und sie in sauberen Text mit stabilen Identifikatoren normalisiert. Zweitens, ein Chunker, der diesen Text in Passagen zerlegt, die klein genug sind, damit ein Modell darüber schliessen kann, und gross genug, um Bedeutung zu tragen, mit angehängter Quell-URL und Seitenzahl. Drittens, ein Embedding-Modell, das jedes Chunk in einen Vektor überführt, gespeichert in einer Vektordatenbank (pgvector, Qdrant, Weaviate). Viertens, ein Retriever, der zu jeder Nutzerfrage die top-k relevantesten Chunks findet und idealerweise mit einem stärkeren Modell nachrangiert. Fünftens, ein Antwortschritt, in dem ein Sprachmodell die Frage, die abgerufenen Chunks und einen System-Prompt erhält, der Antworten ausserhalb dieser Chunks verbietet.
Alles Übrige, Chat-Gedächtnis, mehrsprachiges Routing, Sicherheitsfilter, Analytics, legt sich um diese fünf.
Einen KI-Chatbot auf der eigenen Wissensbasis trainieren
Die Formulierung 'einen Chatbot mit einer eigenen Wissensbasis trainieren' ist irreführend. Sie trainieren kein Modell. Sie kuratieren ein Korpus, embedden es und richten einen Retriever darauf.
Fangen Sie klein und ehrlich an. Wählen Sie eine begrenzte Domäne, interne HR-Richtlinien, Produktdokumentation, eine bestimmte Servicelinie, in der die Grundwahrheit tatsächlich schriftlich vorliegt. Ingestieren Sie diese zuerst. Messen Sie die Retrieval-Qualität, bevor Sie am Generierungs-Prompt drehen: enthalten für eine Menge echter Fragen die Top-3-Chunks tatsächlich die Antwort? Wenn nicht, wird kein Prompt-Engineering den Chatbot retten; reparieren Sie zuerst Chunking und Embeddings.
Steht das Retrieval, justieren Sie den Antwort-Prompt so, dass er höflich ablehnt, wenn der Kontext die Antwort nicht enthält. Ein Chatbot, der 'Diese Information habe ich nicht' sagt, ist unendlich nützlicher als einer, der sie erfindet.
Die Schweizer Rahmenbedingung: Daten durchgängig privat halten
Für ein Schweizer KMU ist nicht die Modellwahl das spannende Engineering. Es ist der Datenpfad. nDSG und DSGVO interessieren sich beide dafür, wohin Personendaten wandern, wie lange sie aufbewahrt werden und wer sie sieht, und Standard-Vendor-Stacks leiten alles über US-Inference-APIs mit undurchsichtigen Bedingungen.
Ein konformer RAG-Betrieb hält Dokumente und Embeddings in einer Schweizer oder EU-Datenbank unter Ihrer Kontrolle. Er nutzt Inference-Anbieter mit EU- oder Schweizer Datenresidenz, Zero-Retention-Vereinbarungen und keinem Training auf eingereichten Daten. Er protokolliert jeden Prompt und jede Antwort für die Prüfung, verschlüsselt Embeddings im Ruhezustand und erzwingt nutzerbasierten Zugriff, damit eine Vertriebsperson keine HR-Dokumente abrufen kann.
Nichts davon ist exotisch. Es ist die Frage, auf jeder Ebene die langweilige Option zu wählen und sie vor dem ersten Ingest in einem Datenflussdiagramm festzuhalten.
Häufige Fehlerbilder und wie man sie vermeidet
Vier Fehlerbilder decken die meisten RAG-Projekte ab, die wir retten müssen.
Das Retrieval wird auf synthetischen Fragen abgestimmt statt auf echten. Das System sieht in der Demo grossartig aus und versagt am ersten Produktionstag. Bewerten Sie immer gegen ein Set von Fragen, die echte Nutzer gestellt haben.
Chunks sind zu gross oder zu klein. Passagen, die drei Themen umfassen, verwässern das Retrieval; Ein-Satz-Chunks verlieren Kontext. Beginnen Sie mit rund 400-800 Tokens mit Überlappung und justieren Sie messgestützt.
Der Prompt lässt das Modell aus Vorwissen antworten. Eine ernst gemeinte Systemanweisung verbietet explizit jede Nutzung ausserhalb des bereitgestellten Kontexts und verlangt Zitate per Quellen-ID.
Niemand besitzt das Korpus. Dokumente veralten, doppeln sich oder widersprechen einander, und der Chatbot präsentiert unbekümmert die falsche Version. Ein produktives RAG braucht eine benannte verantwortliche Person und eine monatliche Prüfung, wie jedes andere Referenzsystem.
Fazit
Ein individueller KI-Chatbot auf Basis von RAG ist ein kleines, sauber gebautes Retrieval-System mit einem Sprachmodell am Ende. Die interessante Arbeit steckt im Korpus, im Chunking, im Retriever und im Datenpfad, nicht im Modell.
Wenn Sie einen privaten Assistenten auf Ihren eigenen Dokumenten in Erwägung ziehen, ist der schnellste nützliche nächste Schritt ein Gespräch von dreissig Minuten. Wir sagen Ihnen ehrlich, ob Ihr Korpus bereit ist, wie ein konformer Schweizer Betrieb aussähe und was zuerst zu reparieren ist, falls die Antwort 'noch nicht' lautet.