aistack KI-Wissen

RAG vs. Long Context

Welcher Ansatz passt zu Ihrem Unternehmenswissen?

Soll Ihre KI zwei Dokumente vergleichen oder Antworten in Tausenden Dateien finden? Für die erste Aufgabe kann ein großes Kontextfenster genügen. Für die zweite ist eine gezielte Suche oft sinnvoll. Hier erfahren Sie, wie sich RAG und Long Context unterscheiden und wann eine Kombination hilft.

Begriffe: Was ist Long Context, was ist RAG?

Long Context

Das Kontextfenster bestimmt, wie viel Inhalt ein Sprachmodell in einer Anfrage verarbeiten kann. Modelle mit einem großen Fenster können längere Dokumente gemeinsam mit Ihrer Frage erhalten. Die Größe wird in Tokens gemessen, also kleinen Textbausteinen.

Das ist etwa beim Vergleich von Vertragsfassungen oder bei Fragen zu einem Handbuch nützlich. Wie gut das Modell die enthaltenen Informationen nutzt, müssen Sie für die jeweilige Aufgabe prüfen.

RAG: Suche mit anschließender Antwort

RAG steht für Retrieval-Augmented Generation. Zuerst sucht die Anwendung passende Informationen in Ihren Datenquellen. Dann erhält das Sprachmodell diese Fundstellen als Grundlage für seine Antwort.

Neue Informationen können so über die Suche verfügbar werden, ohne das Modell neu zu trainieren. Die RAG-Dokumentation von Microsoft beschreibt auch die nötige Datenaufbereitung und Zugriffskontrolle. Beides gehört zur Umsetzung.

RAG und Long Context kombinieren

Die Ansätze lassen sich verbinden: Eine Suche findet die passenden Dokumente. Für eine Frage, die mehr Zusammenhang braucht, lädt die Anwendung anschließend längere Abschnitte in das Kontextfenster.

Ein Beispiel ist eine Frage zu Änderungen in einer internen Richtlinie. Die Suche findet die betreffenden Fassungen; das Modell vergleicht deren Inhalt. Ob dieser Ablauf einen Vorteil bringt, zeigt ein Test mit typischen Fragen aus Ihrem Unternehmen.

Welcher Ansatz passt zu welcher Aufgabe?

Interner Wissensassistent im Unternehmen

Mitarbeitende suchen Antworten in Handbüchern, Richtlinien und Projektunterlagen.

RAG ist ein sinnvoller Ausgangspunkt, wenn die Suche aktuelle Quellen und unterschiedliche Zugriffsrechte berücksichtigen muss.

Dokumentenvergleich mit wenigen Quellen

Sie möchten etwa zwei Vertragsfassungen oder technische Spezifikationen vergleichen.

Testen Sie zunächst Long Context. Wenn die Unterlagen ins Kontextfenster passen, kann das Modell sie gemeinsam auswerten.

Antworten mit nachvollziehbaren Quellen

Die gesuchten Informationen liegen in mehreren Systemen und müssen überprüfbar sein.

Planen Sie eine Suche mit Quellenverweisen ein. Prüfen Sie zusätzlich, ob die angegebenen Textstellen die Antwort tatsächlich stützen.

KI mit Zugriff auf andere Anwendungen

Ein Assistent soll Informationen suchen und anschließend eine Aktion vorbereiten.

Legen Sie fest, welche Daten der Assistent lesen und welche Aktionen er ausführen darf. Je nach Aufgabe kann er Suche und größere Dokumentkontexte kombinieren.

So kann eine Anfrage ablaufen

1) Aufgabe klären

Geht es um eine einzelne Auskunft oder um einen Vergleich mehrerer Unterlagen?

2) Quellen suchen

Die Anwendung sucht in den Quellen, auf die die anfragende Person zugreifen darf.

3) Treffer auswählen

Filter und gegebenenfalls Reranking wählen die Stellen aus, die zur Frage passen.

4) Antwort vorbereiten

Bei Bedarf lädt die Anwendung mehr Kontext nach. Fehlen Belege, soll der Assistent das kenntlich machen.

Qualität, Aufwand und Grenzen im Vergleich

Qualität

Viel Kontext allein garantiert keine gute Antwort. Entscheidend ist, ob das Modell die benötigten Stellen findet und richtig verbindet. Auch die Formulierung der Frage spielt eine Rolle.

Typische Fehler

Bei RAG kann die Suche eine wichtige Stelle übersehen. Bei Long Context kann sie zwar in der Eingabe stehen, aber in der Antwort unberücksichtigt bleiben. Google beschreibt diese Grenzen für Aufgaben mit mehreren gesuchten Informationen.

Kosten

Zur Modellnutzung kommen gegebenenfalls Suche, Datenaufbereitung und laufende Pflege hinzu. Vergleichen Sie die Kosten des gesamten Ablaufs bei Ihrem erwarteten Anfragevolumen.

Antwortzeit

Lange Eingaben können die Antwort verzögern. Eine vorgeschaltete Suche braucht ebenfalls Zeit, kann aber den Modellkontext verkürzen. Messen Sie den vollständigen Weg von der Frage bis zur Antwort.

Die Vergleichstabelle lässt sich seitlich scrollen.

Long Context, RAG und Hybrid im Vergleich nach Datenumfang, Aktualität, Rechten und Kosten
Kriterium Long Context RAG Hybrid
Datenumfang Passt zu ausgewählten Unterlagen, die gemeinsam ins Kontextfenster des Modells passen. Wählt relevante Stellen aus einem größeren Bestand aus. Sucht zuerst passende Quellen und übergibt bei Bedarf längere Abschnitte oder ganze Dokumente.
Aktualität Die Anwendung muss die aktuelle Fassung bei jeder Anfrage bereitstellen oder einen Zwischenspeicher erneuern. Benötigt aktuelle Suchquellen. Änderungen und Löschungen müssen auch im Index ankommen. Muss Suchindex und übergebenen Dokumentkontext auf demselben Stand halten.
Zugriff und Quellen Nur freigegebene Dokumente dürfen in die Anfrage gelangen. Quellenverweise müssen mitgegeben werden. Kann Treffer nach Zugriffsrechten filtern und Fundstellen mitliefern. Beides muss die Anwendung umsetzen. Prüft Berechtigungen auch dann erneut, wenn weitere Abschnitte nachgeladen werden.
Skalierung und Kosten Lange Eingaben beanspruchen Rechenleistung. Caching kann bei wiederholten Anfragen helfen. Spart möglicherweise Eingabe-Tokens, benötigt aber Suchinfrastruktur und Datenaufbereitung. Kann den Aufwand pro Anfrage steuern, braucht dafür zusätzliche Ablaufregeln und Tests.

Drei mögliche Architekturen

Beginnen Sie mit dem einfachsten Ablauf, der Ihre fachlichen Anforderungen erfüllt. Weitere Such- oder Entscheidungsschritte brauchen einen nachweisbaren Nutzen.

Direkter Dokumentkontext

  • Die Anwendung übergibt ausgewählte Dokumente zusammen mit der Frage.
  • Eine separate Suche ist für diesen Ablauf nicht nötig.
  • Der Betrieb bleibt überschaubar, solange Umfang und Aktualisierung der Dokumente es erlauben.

Suche vor der Antwort

  • Die Suche liefert passende Textstellen aus freigegebenen Quellen.
  • Bei Bedarf bewertet ein zweiter Schritt die Treffer neu. Das nennt sich Reranking.
  • Das Modell erhält die ausgewählten Stellen; die Antwort verlinkt auf ihre Herkunft.

Kombinierter Ablauf

  • Die Anwendung entscheidet nach festgelegten Regeln, welcher Ablauf zur Frage passt.
  • Für einen Quervergleich kann sie nach der Suche längere Dokumentabschnitte laden.
  • Dieser zusätzliche Aufwand lohnt sich, wenn er im Test bessere Ergebnisse für Ihre Aufgaben liefert.

Zugriffsrechte, Quellen und Betrieb

Rechte und Rollen

Die Anwendung muss prüfen, welche Inhalte eine Person sehen darf, bevor sie diese an das Modell übergibt. Das gilt für Suchtreffer ebenso wie für hochgeladene Dokumente.

Quellennachweise

Ergänzen Sie Antworten um Links zu den verwendeten Dokumenten und Fundstellen. So können Mitarbeitende Aussagen nachlesen und erkennen, auf welcher Fassung sie beruhen.

Qualität im Betrieb

Prüfen Sie regelmäßig Antworten auf bekannte Fragen. Beobachten Sie auch Fehler nach Daten- oder Modelländerungen sowie Antwortzeiten und Kosten.

Betrieb mit vertraulichen Unternehmensdaten

RAG und Long Context lassen sich mit geeigneten Modellen auf eigener Infrastruktur oder in einer privaten Cloud betreiben. Legen Sie fest, wo Daten verarbeitet werden, wer darauf zugreifen darf und wann sie gelöscht werden. Der Betriebsort allein stellt die Einhaltung der DSGVO nicht sicher.

Häufige Fragen zu RAG und Long Context

Ersetzt ein großes Kontextfenster RAG?

Es kann eine separate Suche überflüssig machen, wenn alle benötigten Unterlagen in die Anfrage passen. Bei umfangreichen Beständen bleibt die Auswahl passender Quellen eine eigene Aufgabe. Zugriffsrechte und Aktualität muss die Anwendung in beiden Fällen berücksichtigen.

Wann reicht Long Context allein aus?

Wenn Sie mit einem überschaubaren Satz freigegebener Dokumente arbeiten, etwa beim Vergleich zweier Spezifikationen. Voraussetzung ist, dass diese in das Kontextfenster passen und das gewählte Modell die Aufgabe im Test zuverlässig genug löst.

Wann ist RAG sinnvoll?

Wenn ein Assistent passende Informationen aus vielen Quellen suchen soll. RAG lässt sich mit Berechtigungsfiltern und Quellenverweisen verbinden. Wie gut das funktioniert, hängt von der Datenaufbereitung und der Qualität der Suche ab.

Ist RAG immer günstiger als Long Context?

Nein. Rechnen Sie bei RAG auch Datenaufbereitung, Suchindex und dessen Betrieb mit ein. Bei Long Context zählen unter anderem Eingabeumfang, Modell und die Möglichkeit, wiederkehrende Inhalte zwischenzuspeichern.

Wie lässt sich der Aufwand vergleichen?

Vergleichen Sie beide Ansätze mit denselben typischen Fragen und Unterlagen. Bewerten Sie die Antworten fachlich und messen Sie Antwortzeit sowie Betriebskosten. Ein kurzer Test mit Ihren Daten ist aussagekräftiger als die maximale Kontextgröße allein.

Wie stabil bleibt die Qualität bei sehr langen Eingaben?

Das hängt vom Modell und der Aufgabe ab. Ein Modell kann eine einzelne Fundstelle gut erkennen und trotzdem Zusammenhänge zwischen vielen verstreuten Stellen übersehen. Testen Sie deshalb auch schwierige Fragen und fehlende Informationen.

Lassen sich RAG und Long Context automatisch kombinieren?

Ja. Die Anwendung kann zunächst suchen und anschließend längere Abschnitte aus den Treffern laden. Regeln für diesen Ablauf sollten auch festlegen, wann die Suche endet und wie der Assistent mit fehlenden Belegen umgeht.

Wie unterstützt aistack bei der Entscheidung?

Wir besprechen Ihre Aufgaben, Datenquellen und Anforderungen an den Betrieb. In einem begrenzten Prototyp prüfen wir die passenden Ansätze mit Ihren Beispielfragen. Daraus leiten wir die Architektur und die nächsten Umsetzungsschritte ab.

Nächster Schritt

Welche Architektur passt zu Ihrer Aufgabe?

Bringen Sie Ihre Beispielfragen und einen Überblick über die vorhandenen Daten mit. aistack prüft mit Ihnen, ob direkter Dokumentkontext, RAG oder eine Kombination zu Ihrem Vorhaben passt und wie sich die Lösung in Ihrer Umgebung betreiben lässt.