DEEN
KI & Governance

RAG-Chatbots für Banken: Quellen und Antwortqualität

Wie RAG-Chatbots auf Dokumente zugreifen und Antworten belegen. Prüfungen für Berechtigungen, Datenpflege und fachliche Antwortqualität.

Erstfassung: Aktualisiert: Lesezeit: ca. 8 Minuten

Symbolbild RAG-Chatbot in der Bank: stilisiertes Chatfenster mit Antwortblase und Zitatmarke, leuchtende Linien verbinden die Zitatmarke mit einer hervorgehobenen Passage in einem Stapel regulatorischer Dokumente, darüber eine Lupe, dunkelblauer Hintergrund mit smaragdgrünen Akzenten

Ein RAG-Chatbot verbindet die Suche in Dokumenten mit der Formulierung einer Antwort durch ein Sprachmodell. Das eröffnet einen Zugang zum Wissen des Instituts, erzeugt aber neue Prüfaufgaben. Die richtige Passage muss gefunden werden; die Antwort muss sie zutreffend wiedergeben und die Zugriffsrechte der fragenden Person beachten.

Aufbau eines RAG-Chatbots

Retrieval Augmented Generation (RAG) verbindet eine Dokumentensuche mit einem Sprachmodell. Das System ruft zur Nutzerfrage passende Passagen ab und gibt sie dem Modell als Kontext für seine Antwort. Anders als eine reine Suche erzeugt das Modell dabei neuen Text; dieser Text muss fachlich geprüft werden können. Lewis et al.: Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks

  1. 01Ingestion und Indexierung

    Dokumente werden aufbereitet, in Abschnitte zerlegt und in einem durchsuchbaren Index abgelegt, typischerweise mit Vektor-Repräsentationen. Metadaten wie Quelle, Version und Vertraulichkeitsstufe gehören von Anfang an dazu.

  2. 02Retrieval

    Zu jeder Nutzerfrage werden die passendsten Passagen aus dem Index abgerufen. Die Qualität dieses Schritts entscheidet, ob die Antwort auf den richtigen Textstellen aufsetzt.

  3. 03Augmentierung und Generierung

    Die abgerufenen Passagen werden dem Sprachmodell zusammen mit der Frage übergeben; das Modell formuliert die Antwort aus diesem Kontext und weist die verwendeten Stellen als Quellen aus.

Für Banken ist das Muster aus drei Gründen attraktiv: Aktualität, weil neue Dokumente nach der Indexierung sofort verfügbar sind, ohne das Modell neu zu trainieren; Grounding, weil Antworten auf konkrete Textstellen gestützt werden; und Quellenattribution, weil jede Antwort ausweisen kann, aus welchem Dokument und welchem Abschnitt sie stammt.

Typische Fehler erkennen und gezielt testen

RAG stellt dem Sprachmodell ausgewählte Fundstellen für die Antwort bereit. Das kann unbelegte Antworten verringern, verhindert Fehler aber nicht. Für die eigene Anwendung sind passende Treffer, belegte Aussagen und korrekt verweigerte Antworten getrennt zu prüfen. DSK: Orientierungshilfe zu RAG, Version 1.0 Correctness is not Faithfulness in RAG Attributions

Auch mit perfektem Retrieval bleibt ein Restrisiko: Modelle können abgerufene Passagen überinterpretieren oder Lücken zwischen zwei Textstellen mit plausibel klingenden Erfindungen füllen. Umgekehrt gilt: Wird das entscheidende Dokument gar nicht erst abgerufen, entsteht eine systematisch falsche Antwort, die trotzdem eine Quellenangabe trägt. Und die oft beworbene Aktualität ist eine Prozessfrage, keine Technikeigenschaft: Sie entsteht nur, wenn Re-Ingestion und Versionierung der Wissensbasis organisatorisch geregelt sind, mit klaren Zuständigkeiten dafür, welche Dokumentstände wann in den Index gelangen.

Quellenangaben auf ihre Aussage prüfen

Eine Quellenangabe zeigt zunächst, auf welches Dokument die Antwort verweist. Ob diese Stelle die Aussage trägt und ob sie aktuell und für die fragende Person zugänglich ist, muss die Anwendung gesondert prüfen. Eine korrekt aussehende Referenz ist dafür kein Nachweis. Correctness is not Faithfulness in RAG Attributions DSK: Orientierungshilfe zu RAG, Version 1.0

  1. 01Belegte Antworten als Ziel

    Das System auf Antworten aus dem bereitgestellten Kontext auslegen und unbelegte Aussagen gezielt testen. Eine Anweisung allein garantiert dieses Verhalten nicht.

  2. 02Fundstellen prüfen

    Aussagen den tatsächlich tragenden Dokumentstellen zuordnen und widersprüchliche Quellen im Testbestand berücksichtigen.

  3. 03Abweichungen erkennen

    Automatische Prüfungen mit fachlich bewerteten Beispielen vergleichen; Fehlalarme und übersehene Fehler erfassen.

  4. 04Folgen berücksichtigen

    Für Auskünfte mit erheblichen Folgen einen geeigneten Freigabe- oder Eskalationsweg festlegen.

KI-Interaktion kenntlich machen

Art. 50 Abs. 1 AI Act verlangt grundsätzlich, dass Menschen über eine direkte Interaktion mit einem KI-System informiert werden, sofern dies nicht offensichtlich ist. Die Information muss zum jeweiligen Nutzungskontext passen. Für einen Kunden-Chatbot sollte die Offenlegung bereits beim Einstieg erkennbar sein. AI Act: konsolidierte Fassung vom 27.07.2026

Die Pflicht zur Offenlegung der KI-Interaktion gilt seit dem 02.08.2026. Für erzeugte Inhalte enthält Art. 50 weitere Regeln mit eigenem Anwendungsbereich und Ausnahmen. Ob ein Chatbot Hochrisiko-KI ist, folgt aus seinem Zweck und der gesetzlichen Einordnung; RAG allein entscheidet diese Frage nicht. AI Act: konsolidierte Fassung vom 27.07.2026

Datenschutz im konkreten Verfahren

Der Betriebsort allein entscheidet nicht über Datenschutzkonformität. Zu prüfen sind insbesondere Rechtsgrundlage, Zugriffsrechte, Löschung und die tatsächlichen Rollen der Beteiligten. Ein Vertrag zur Auftragsverarbeitung ist erforderlich, wenn die konkrete Beziehung eine Auftragsverarbeitung ist. DSK: Orientierungshilfe zu RAG, Version 1.0

Die Datenschutzkonferenz beschreibt in ihrer RAG-Orientierungshilfe, Version 1.0 vom Oktober 2025, Prüfungen für den Umgang mit personenbezogenen Daten. Der Datenfluss muss bis zu externen Komponenten nachvollziehbar sein. Dazu gehört, ob Prompts oder Antworten gespeichert oder für weitere Zwecke verwendet werden. DSK: Orientierungshilfe zu RAG, Version 1.0

Zugriffsrechte vor der Generierung

Ein Chatbot darf nur Wissen verwenden, auf das die fragende Person zugreifen darf. Die Berechtigungslogik muss im Retrieval-Schritt greifen: Abgerufen werden nur Passagen, für die die fragende Person nach Rolle, Vertraulichkeitsstufe und Mandantentrennung berechtigt ist; erst danach formuliert das Modell die Antwort. Wer stattdessen erst die fertige Ausgabe filtert, hat das Problem bereits erzeugt: Die vertraulichen Passagen standen dann im Antwortkontext des Modells, und über Umformulierungen, Zusammenfassungen oder geschickte Anschlussfragen droht Datenabfluss über die Antwort.

Dazu kommt ein Integritätsrisiko, das klassische Anwendungen so nicht kennen: Manipulierte Dokumente im Index können das Modellverhalten steuern. Prompt-Injection über die Wissensbasis und Data Poisoning heißen die Muster: Ein präpariertes Dokument enthält Anweisungen oder gezielte Falschinformationen, die das Modell beim Generieren übernimmt. Die Datenintegrität des Index ist deshalb eine Sicherheitsfrage des ISMS, des Informationssicherheits-Managementsystems des Instituts: Wer darf Dokumente in die Wissensbasis einstellen, wie werden Änderungen geprüft, und wie fällt Manipulation auf.

Einordnung in DORA und MaRisk

Ein RAG-Chatbot gehört als IKT-Asset in den bestehenden Risikomanagementrahmen. Die BaFin hat am 18.12.2025 eine Orientierungshilfe zu IKT-Risiken beim Einsatz von KI veröffentlicht: KI-Systeme sind unter der DORA-Verordnung als IKT-Assets zu inventarisieren, durchlaufen einen kontrollierten Lebenszyklus und gehören in das Drittparteienmanagement, sobald externe Dienste beteiligt sind. Bindet der Chatbot externe Modell-APIs oder externes Hosting an, fällt das unter das IKT-Drittparteienrisiko nach DORA Kapitel V.

Die menschliche Letztverantwortung bleibt dabei beim Institut: Ein Compliance-Copilot ist ein Recherchebeschleuniger, kein Entscheider. Auskünfte, aus denen Entscheidungen folgen, brauchen einen verantwortlichen Menschen im Prozess. Wie Institute Modell-Governance und Risikomanagement grundsätzlich organisieren, vertiefen unsere Beiträge zu den MaRisk und zur DORA-Verordnung.

Antwortqualität nachvollziehbar messen

Ein Evaluationswerkzeug kann Vergleichsläufe unterstützen. Für die Freigabe bleiben ein dokumentierter Fragenbestand und fachlich bewertete Antworten nötig. Werkzeug, Modellversion und Wissensstand werden pro Testlauf festgehalten. DSK: Orientierungshilfe zu RAG, Version 1.0

Für die Prüfung sollen sich Antwort, verwendete Fundstellen sowie Modell- und Dokumentversionen nachvollziehen lassen. Das Protokollierungskonzept legt fest, welche Inhalte dafür erforderlich sind, wer sie sehen darf und wann sie gelöscht werden. Es muss Nachvollziehbarkeit und Datenminimierung gemeinsam abbilden; ein unbegrenztes Speichern aller Fragen und Antworten ist kein Qualitätsmerkmal.

RAG und kuratiertes Wissen verbinden

Eine RAG-Wissensbasis kann aus freigegebenen Wiki-Inhalten, Originaldokumenten oder einer kontrollierten Kombination bestehen. Redaktionelle Pflege und Retrieval sind unterschiedliche Aufgaben. Die Architektur ersetzt weder Zugriffsregeln noch die Prüfung der Quellen. DSK: Orientierungshilfe zu RAG, Version 1.0 Lewis et al.: Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks

RAG-Wissensbasis und kuratiertes Wissens-Wiki im Vergleich
DimensionRAG-WissensbasisKuratiertes Wissens-Wiki
AufgabeFundstellen für die Generierung abrufenWissen redaktionell aufbereiten und verknüpfen
QuelleFreigegebene Dokumente oder kuratierte InhalteGeprüfte Dokumente und fachliche Beiträge
AktualisierungGeregelte Übernahme in den SuchindexRedaktionelle Pflege mit Stand und Verantwortung
FehlerprüfungRetrieval und erzeugte Aussagen getrennt prüfenAussagen und Quellenzuordnung redaktionell prüfen

Ein kuratiertes Wiki kann als Quelle eines RAG-Systems dienen. Entscheidend bleibt, welche Inhalte freigegeben sind und wie deren Stand in den Suchindex gelangt. Ein zusätzlicher Generierungsschritt braucht eigene Prüfungen, auch wenn seine Quellen redaktionell gepflegt werden.

Prüfpunkte vor dem Einsatz

Der folgende Katalog unterstützt die technische und fachliche Vorbereitung. Die Freigabe braucht nachgewiesenes Verhalten im vorgesehenen Einsatz; ein Architekturbegriff genügt nicht.

  1. 01Grounding mit Abstinenz als Grundeinstellung

    Das Ziel sind Antworten aus dem zugelassenen Kontext. Unbeantwortbare Fragen und unerlaubte Anweisungen gehören in den Testbestand.

  2. 02Zitatpflicht je Aussage

    Fundstellen den tragenden Aussagen zuordnen und ihre fachliche Unterstützung prüfen.

  3. 03Berechtigungsfilterung im Retrieval, nicht in der Ausgabe

    Rolle, Vertraulichkeitsstufe und Mandantentrennung filtern die abrufbaren Passagen vor der Generierung.

  4. 04Audit-Trail je Interaktion

    Die für die Nachvollziehbarkeit nötigen Angaben werden mit festgelegten Zugriffsrechten und Löschfristen protokolliert.

  5. 05Eskalationspfad an Menschen

    Konsequenzenreiche Auskünfte gehen an einen verantwortlichen Menschen, statt automatisch beantwortet zu werden.

  6. 06Re-Ingest- und Versionierungsprozess für die Wissensbasis

    Ein geregelter Prozess bestimmt, welche Dokumentstände wann in den Index gelangen; erst das macht die versprochene Aktualität real.

  7. 07Laufende Messung

    Geeignete Qualitätsmaße an fachlich bewerteten Fragen prüfen und bei relevanten Änderungen erneut auswerten.

Das US-Normungsinstitut NIST führt selbstbewusst vorgetragene Falschauskünfte generativer KI als eigene Risikokategorie Confabulation und stuft sie gerade in Finanz- und Rechtskontexten als besonders gefährlich ein (NIST AI 600-1, 2024).

Verwandte Themen

  • EU AI Act für Banken: Risikoklassen, Pflichten und Fristen, einschließlich der Transparenzpflichten nach Art. 50.
  • KI-Agenten in Banken: Wenn der Chatbot nicht nur antwortet, sondern handelt, von Freigabe-Schwellen bis Audit-Trail.
  • DORA-Verordnung im Überblick: IKT-Risikomanagement, Vorfallmeldewesen und das Drittparteienregime nach Kapitel V.
  • MaRisk (BaFin): Modulsystematik und Modell-Governance im deutschen Aufsichtsrahmen.
FAQ

Häufige Fragen zu RAG-Chatbots in Banken

Ist ein RAG-Chatbot in der Bank DSGVO-konform möglich?

Der Betriebsort allein entscheidet nicht über Datenschutzkonformität. Zu prüfen sind insbesondere Rechtsgrundlage, Zugriffsrechte, Löschung und die tatsächlichen Rollen der Beteiligten. Ein Vertrag zur Auftragsverarbeitung ist erforderlich, wenn die konkrete Beziehung eine Auftragsverarbeitung ist.

Muss unser Chatbot offenlegen, dass er eine KI ist?

Bei direkter KI-Interaktion ist seit dem 02.08.2026 grundsätzlich ein Hinweis erforderlich, sofern die KI-Eigenschaft nicht offensichtlich ist. Art. 50 Abs. 1 AI Act nennt den verbindlichen Anwendungsbereich.

Ist ein interner GRC-Copilot Hochrisiko-KI?

Eine interne Suche in GRC-Unterlagen ist nicht allein wegen des Einsatzes in einer Bank Hochrisiko-KI. Maßgeblich sind der vorgesehene Zweck und Art. 6 mit den Anhängen I und III. Eine Nutzung für Kreditwürdigkeits- oder bestimmte Personalentscheidungen erfordert deshalb eine eigene Einordnung.

Verhindert RAG Halluzinationen?

RAG stellt dem Sprachmodell ausgewählte Fundstellen für die Antwort bereit. Das kann unbelegte Antworten verringern, verhindert Fehler aber nicht. Für die eigene Anwendung sind passende Treffer, belegte Aussagen und korrekt verweigerte Antworten getrennt zu prüfen.

Dürfen Kundendaten in die Wissensbasis?

Nur soweit Zweck, Rechtsgrundlage und Berechtigungen die Verarbeitung tragen. Prüfen Sie zuerst, ob für die Aufgabe anonymisierte oder weniger Daten genügen. Kundendaten benötigen eine passende Zugriffstrennung und Löschregeln; bei externen Diensten sind die tatsächlichen Empfänger und Datenflüsse einzubeziehen.

Ein Angebot der T-NEX GmbH

Das Vorhaben mit T-NEX besprechen

Vom gepflegten Antwortbestand bis zu generativem RAG sind unterschiedliche Ausbaustufen möglich. Die Angebotsseite erklärt Quellenpflege und Antwortgrenzen; eine Evaluation prüft Ihren eigenen Fragenbestand vor dem breiteren Einsatz.

Geschäftsführung: Andreas Unruh und Christoph Gembruch.

Herausgegeben von der T-NEX GmbH.