Ein KI-Assistent, der mit den eigenen Dokumenten arbeitet, sucht bei jeder Frage passende Ausschnitte heraus und formuliert daraus eine Antwort. Die Qualität hängt deshalb weniger am Modell als an der Suche und an der Aufbereitung der Inhalte. Wer widersprüchliche oder veraltete Unterlagen einspeist, bekommt widersprüchliche und veraltete Antworten – nur flüssig formuliert.
Eigene Wissensdatenbank für KI: Was nötig ist, damit die Antworten stimmen
Das Wichtigste in Kürze
- Das Verfahren stützt Antworten auf eigene Inhalte; die Qualität hängt laut Dokumentation davon ab, wie die Inhalte für den Abruf vorbereitet werden.
- Lange Dokumente werden in Abschnitte zerlegt, damit einzelne Teile gefunden werden können.
- Berechtigungen müssen mitgeführt werden: Es darf nur abgerufen werden, wofür der Nutzer berechtigt ist.
- Veraltete Dokumente sind die häufigste Fehlerquelle – nicht das Modell.
Die Anfrage kommt inzwischen regelmäßig: Ein Assistent soll Fragen zu den eigenen Unterlagen beantworten – zu Angeboten, Handbüchern, internen Richtlinien. Die Erwartung ist meist, dass dafür ein Modell „auf den eigenen Daten trainiert“ werden muss.
Das ist fast nie der Weg. Der übliche Aufbau ist ein anderer, und er verschiebt die Arbeit an eine Stelle, die die wenigsten erwarten.
Wie es tatsächlich funktioniert
Das verbreitete Verfahren heißt Retrieval-Augmented Generation. Der Ablauf bei jeder Frage:
- Die Frage wird gegen einen durchsuchbaren Bestand der eigenen Dokumente gestellt.
- Die passendsten Ausschnitte werden herausgesucht.
- Diese Ausschnitte werden dem Modell zusammen mit der Frage übergeben.
- Das Modell formuliert daraus die Antwort.
Das Modell „weiß“ also nichts über das Unternehmen. Es bekommt bei jeder Frage das Material mitgeliefert und formuliert daraus.
Die Konsequenz ist der entscheidende Punkt: Wenn Schritt 2 das Falsche findet, hilft kein besseres Modell. Die Dokumentation formuliert es direkt – die Qualität hängt davon ab, wie die Inhalte für den Abruf vorbereitet werden.
Was das für die Vorbereitung heißt
Abschnitte statt ganzer Dokumente
Große Dokumente werden beim Aufbau des Index in Abschnitte zerlegt, damit einzelne Teile unabhängig voneinander gefunden werden können. Der Grund ist praktischer Natur: Ein Modell kann nur eine begrenzte Menge Text auf einmal verarbeiten – ein Handbuch mit tausend Seiten passt nicht in eine Anfrage.
Daraus folgt eine Anforderung an die Dokumente selbst: Ein Abschnitt muss für sich verständlich sein. Ein Absatz, der mit „Dieser Wert gilt auch hier“ beginnt, ist herausgelöst wertlos. Das ist dieselbe Anforderung, die auch für Webinhalte gilt, die in generativen Suchsystemen zitierbar sein sollen – und ein gutes Argument für saubere Überschriften und Textstruktur auch in internen Unterlagen.
Berechtigungen müssen mitwandern
Die Dokumentation ist an dieser Stelle unmissverständlich: Wer private Inhalte für Sprachmodelle öffnet, braucht eine feingliedrige Zugriffssteuerung – Nutzer und Agenten dürfen nur abrufen, wofür sie berechtigt sind.
Das ist der Punkt, an dem solche Projekte am häufigsten schiefgehen. Ein Bestand, der Personalakten, Gehaltsunterlagen und Vertragsentwürfe enthält, wird durch einen Assistenten für jeden im Haus durchsuchbar – auch für die, die vorher keinen Zugriff auf den Ordner hatten. Die Berechtigungen des Quellsystems müssen in die Suche übernommen und bei jeder Anfrage angewendet werden, sonst entsteht genau dieser Effekt. Die datenschutzrechtliche Seite steht in KI und Datenschutz.
Aktualität
Der Bestand muss fortlaufend nachgeführt werden. Ein Assistent, der die Preisliste von vorletztem Jahr zitiert, ist schlimmer als keiner – weil die Antwort richtig klingt.
Was vorher zu klären ist
| Frage | Warum sie vor der Technik kommt |
|---|---|
| Welche Fragen soll der Assistent beantworten? | Bestimmt, welche Dokumente überhaupt gebraucht werden |
| Welches Dokument ist im Zweifel maßgeblich? | Bei widersprüchlichen Fassungen muss eine gewinnen |
| Wer darf was sehen? | Muss in die Suche übernommen werden, nicht nachträglich |
| Wer pflegt den Bestand? | Ohne Zuständigkeit veraltet er innerhalb weniger Monate |
| Was passiert bei einer falschen Antwort? | Bestimmt, ob Quellenangaben Pflicht sind |
Die letzte Zeile hat eine praktische Folge: Jede Antwort sollte die verwendeten Dokumente nennen. Das kostet nichts, macht Fehler überprüfbar und verschiebt die Nutzung von „der Assistent sagt“ zu „im Dokument X steht“ – der Unterschied zwischen einer Auskunft und einem Fundstellenhinweis. Warum das nötig bleibt, zeigt falsche KI-Antworten.
Der realistische Einstieg
- Einen Anwendungsfall wählen, bei dem heute regelmäßig dieselben Fragen gestellt werden – interner Support, Produktauskünfte, Prozessfragen.
- Zwanzig bis fünfzig geprüfte Dokumente einspeisen, nicht das gesamte Laufwerk.
- Dreißig echte Fragen sammeln und die Antworten gegen die Dokumente prüfen. Diese Liste ist die Messlatte und bleibt es.
- Nachbessern, wo die Suche danebenliegt – meist durch bessere Abschnittsbildung oder durch Ergänzen fehlender Dokumente.
- Erst dann erweitern.
Schritt drei ist der, der über Erfolg oder Misserfolg entscheidet, und der am häufigsten übersprungen wird. Ohne einen festen Fragenkatalog lässt sich nicht beurteilen, ob eine Änderung etwas verbessert hat – man hat nur den Eindruck, dass es besser geworden ist.
Was daneben zu regeln ist – Nutzungsregeln, Zuständigkeit und die Pflicht aus Artikel 4 des EU AI Act, für ausreichende KI-Kompetenz zu sorgen – steht in ChatGPT im Unternehmen einführen. Systeme, die auf dieser Grundlage eigenständig Arbeitsschritte ausführen, behandelt KI-Agenten.
Häufige Fragen
In aller Regel nicht. Der übliche Weg ist, die Dokumente durchsuchbar zu machen und dem Modell bei jeder Frage die passenden Ausschnitte mitzugeben. Das ist schneller umzusetzen, günstiger im Betrieb und hat den Vorteil, dass geänderte Dokumente sofort wirken.
Meist, weil die Suche nichts Passendes gefunden hat und das Modell die Lücke füllt. Die Gegenmittel liegen vor dem Modell: bessere Abschnittsbildung, bessere Suche – und die Anweisung, bei fehlender Grundlage zu sagen, dass keine Information vorliegt.
Alles auf einmal einzuspeisen. Ein Bestand aus zwanzig Jahren enthält widersprüchliche Fassungen, veraltete Preise und Entwürfe. Besser ist ein kleiner, geprüfter Anfangsbestand, der wächst.
Quellen
- Microsoft Learn: Retrieval-Augmented Generation (RAG) in Azure AI Search (abgerufen am 29.09.2026)
- EU AI Act, Artikel 4 – KI-Kompetenz (abgerufen am 29.09.2026)
Lass uns dreißig Minuten über deine Sichtbarkeit sprechen
Kostenlos, unverbindlich, und mit einer ehrlichen Einschätzung - auch wenn die lautet, dass du mich gerade nicht brauchst.
Erstgespräch vereinbaren