# RAG ist angekommen. Jetzt wird es eingebaut.

**Autor:** Oliver Welling, DoWell UG (haftungsbeschränkt)  
**Kanonische URL:** https://brunosan.de/ki-praxis/check/rag/  

> Belegarten: ✓ verifiziert · › berichtet · ○ Einordnung · — Leerstelle

Reality-Check RAG: Das Verfahren ist belegt und erprobt, sein Forschungswachstum aber seit Mitte 2025 flach. GraphRAG, Wissensgraphen und Context Engineering wachsen schneller. Belegt aus 602.340 arXiv-Papieren.

Das Verfahren, das Sprachmodelle mit Firmendokumenten verbindet, ist breit untersucht und vielfach im Einsatz. Sein Forschungswachstum ist seit Mitte 2025 flach — während drei weiterführende Ansätze schneller wachsen, die klassisches RAG nicht ablösen, sondern in größere Systeme einbetten.

## Was ist RAG?

Ein Sprachmodell weiß nichts über Ihr Unternehmen. RAG — Retrieval Augmented Generation, auf Deutsch etwa „Antworten mit vorgeschaltetem Nachschlagen“ — löst das so: Bevor das Modell antwortet, sucht ein Suchschritt passende Stellen in Ihren Dokumenten heraus und legt sie dem Modell vor. Die Antwort entsteht dann aus diesen Fundstellen statt aus dem Gedächtnis des Modells.

Das ist heute der übliche Weg, wenn ein Unternehmen einen KI-Assistenten auf eigene Verträge, Handbücher oder Protokolle setzen will. Ein großer Teil der Angebote in diesem Bereich basiert darauf.

Dieser Artikel prüft: Ist RAG ausgereift — und wo stößt es an Grenzen? Wir messen das nicht an Meinungen, sondern daran, wie sich die Forschungsliteratur bewegt.

## Die Kurve ist flach geworden.

RAG-Arbeiten wuchsen 2024 noch um 75 Prozent pro Halbjahr. Seit Mitte 2025 sind es 3 bis 12 Prozent. Gleichzeitig wachsen drei angrenzende Ansätze deutlich schneller.

Das Ursprungspapier ist von 2020 und kommt in unserem Bestand auf 890 interne Referenzkanten ✓ — also Zitate aus Arbeiten, die selbst in diesem Bestand liegen; die tatsächliche Zitationszahl ist höher. Der große Übersichtsartikel von Ende 2023 kommt auf 2.042 ✓ — der meistzitierte Treffer dieser Auswertung. Das Verfahren ist damit wissenschaftlich etabliert und breit untersucht. Dass es auch praktisch trägt, zeigen unzählige laufende Installationen — die sind allerdings nicht Gegenstand dieser Datenauswertung ○.

Interessant ist die zweite Ableitung. So entwickelte sich die Zahl der Arbeiten pro Halbjahr:

So sieht Reife aus, nicht Niedergang ○ — 1.228 Arbeiten im Halbjahr sind weiterhin ein starkes Feld. Aber die Neugier der Forschung wandert sichtbar weiter.

## Drei angrenzende Ansätze wachsen schneller.

Balkenbreite = 1 px je 2 Arbeiten. 2026-H2 unvollständig (Datenstand 23.07.2026) und deshalb nicht abgebildet. Nicht auf das arXiv-Gesamtaufkommen normalisiert — das wächst ebenfalls, und nicht zwingend gleichmäßig über alle Teilgebiete. Der Vergleich bleibt informativ, ist aber kein normalisierter Anteilsvergleich. Daten als JSON · als CSV — nachrechnen erwünscht.

Der vierte Ansatz passt nicht in dieselbe Grafik, weil er zu jung ist: Context Engineering — erster Treffer im Januar 2025, dann 2 · 29 · 52 Arbeiten pro Halbjahr ✓. Es geht dabei nicht um besseres Suchen, sondern um die Frage, was ein System überhaupt vor sich hat, wenn es antwortet.

Und ein fünfter Faden, der in unserem Trend-Radar auftauchte: „agent memory“ ging von 2 auf 85 Titel-Treffer ✓ — also Wissen, das ein System über Sitzungen hinweg behält, statt es jedes Mal neu zusammenzusuchen.

## Warum RAG der richtige Standard war.

Bevor wir zu den Grenzen kommen, gehört die faire Bilanz an den Anfang. RAG hat drei Dinge gelöst, an denen vorher jeder Ansatz gescheitert ist.

### 1 · Aktualität ohne Neutraining

Ein Sprachmodell jedes Mal neu zu trainieren, wenn sich ein Vertrag ändert, wäre wirtschaftlich unsinnig. RAG umgeht das: Das Wissen liegt außerhalb des Modells und kann jederzeit ausgetauscht werden.

### 2 · Belegbarkeit

Weil die Antwort aus abgerufenen Textstellen entsteht, lässt sich mitliefern, woher sie stammt. Self-RAG erweitert das 2023 um eine Selbstprüfung des Abrufs ✓.

### 3 · Wissen bleibt außerhalb der Modellgewichte

Firmendokumente müssen für RAG nicht in ein Sprachmodell eintrainiert werden. Das ist ein realer Vorteil — aber es ist nicht dasselbe wie Datenschutz. Die abgerufenen Textstellen werden beim Antworten an das Modell übermittelt; ob sie damit Ihren Systembereich verlassen, hängt an Hosting, Anbieter, Protokollierung und Vertrag. Wer ein extern betriebenes Modell nutzt, hat die zweite Frage damit nicht gelöst ○.

Wenn Sie heute einen Dokumenten-Assistenten brauchen, ist RAG eine solide, gut untersuchte Wahl. Die folgenden Abschnitte sind kein Argument dagegen — sie beschreiben, wo Sie beim Einkauf genauer hinsehen sollten.

## Was die weiterführenden Ansätze über RAG verraten.

Man muss keine Meinung über RAG haben, um seine Schwachstellen zu erkennen. Es genügt, zu lesen, woran die Forschung stattdessen arbeitet — denn jeder Nachfolgeansatz ist die Antwort auf ein bestimmtes Problem.

### Zusammenhänge über mehrere Dokumente hinweg

Einfaches, abschnittsbasiertes RAG holt Textstellen. Wenn eine Antwort Informationen aus fünf Dokumenten verbinden muss, liefert es fünf Fundstellen — die Beziehung zwischen ihnen wird dabei nicht als eigenes Wissensobjekt abgebildet. Fortgeschrittene Aufbauten können das teilweise auffangen, etwa durch mehrstufigen Abruf oder Zerlegung der Frage. Genau dafür wurde GraphRAG 2024 vorgestellt ✓: Statt Textschnipsel wird ein Graph aus Entitäten und Beziehungen aufgebaut. Von einer Arbeit im ersten Halbjahr 2024 auf 109 im ersten Halbjahr 2026 ✓.

### Widersprüche und Zeitbezug

Wenn zwei Dokumente sich widersprechen, weiß ein Abrufsystem nicht, welches gilt — außer man modelliert, wann was galt. Zep beschreibt 2025 eine Architektur, die Wissen als zeitlichen Graphen führt ✓ — also mit Gültigkeitszeiträumen statt als flachen Textbestand.

### Was das System überhaupt sieht

Der jüngste Faden dreht die Frage um: Nicht „wie finde ich die richtige Stelle“, sondern „wie sieht der Arbeitsbereich aus, in dem entschieden wird“. Ein Übersichtsartikel vom Juli 2025 fasst das unter Context Engineering zusammen ✓.

Für ein Auswahlgespräch heißt das: Fragen Sie nicht „macht ihr RAG?“, sondern stellen Sie drei konkrete Fälle. Was passiert, wenn die Antwort in vier Dokumenten verteilt liegt? Was, wenn zwei Dokumente sich widersprechen? Was, wenn eine Regel seit März gilt und vorher eine andere galt? An diesen drei Fragen trennt sich ein Dokumentensuchsystem von einem, das Zusammenhänge kennt.

## Wir haben hier ein Eigeninteresse.

Die Ansätze, die in diesem Artikel als Erweiterungen von RAG erscheinen — Graphen, Zeitbezug, Objekte mit Beziehungen — sind genau die, auf denen unsere eigenen Produkte aufbauen. Das sollten Sie beim Lesen wissen.

BrunoSan ist auf einem Objekt- und Beziehungsmodell gebaut, nicht auf einem Textindex. Wenn die Forschung sich in diese Richtung bewegt, bestätigt das eine Entscheidung, die wir vor der Messung getroffen haben. Das ist ein Grund, unsere Auswahl kritisch zu prüfen — deshalb liegen die Rohdaten zu diesem Artikel als JSON und CSV offen, und deshalb steht jede Zahl mit Suchbegriff und Datenstand dabei.

Was wir nicht behaupten können: dass unsere Begriffsauswahl neutral war ○. Wir haben nach GraphRAG, Wissensgraphen und Context Engineering gesucht, weil wir diese Ansätze kennen — und weil sie zu unserer Architektur passen. Eine unabhängige Auswahl hätte womöglich andere Kandidaten gefunden. Welche: —

### Der Ansatz, den wir nicht gemessen haben

Es gibt eine Alternative, die RAG nicht erweitert, sondern überflüssig machen könnte: Sprachmodelle mit sehr großen Kontextfenstern. Wenn ein Modell hunderttausende oder Millionen Textbausteine auf einmal verarbeitet, lässt sich ein Dokumentenbestand direkt hineingeben — kein Abruf, kein Index, keine Graphen.

Diesen Strang haben wir nicht ausgewertet. Er passt nicht in unsere Produktarchitektur, und genau deshalb gehört der Hinweis hierher und nicht in eine Fußnote. Wie sich die Literatur zu großen Kontextfenstern gegenüber RAG entwickelt: — Das kommt in eine eigene Auswertung.

Unsere Vermutung — als solche gekennzeichnet — lautet: Beides wird kombiniert ○, weil große Kontextfenster weder die Kosten pro Anfrage noch die Nachvollziehbarkeit lösen. Aber das ist eine Einschätzung, keine Messung.

## Viele messen. Wenige liefern den Code mit.

Dieser Abschnitt gehört nicht zur RAG-These. Er ist ein Nebenbefund aus derselben Abfrage — relevant für jeden, der eine Studienzahl in einem Angebot findet.

Wie in unseren anderen Auswertungen lässt sich aus diesen beiden Randwerten die Schnittmenge nicht berechnen — nur ihre Grenzen. Zwischen 79 und 84 Prozent der RAG-Arbeiten sind als empirisch klassifiziert und führen keinen Code-Verweis ✓. Bei GraphRAG liegt die Spanne bei 81 bis 83 Prozent, bei Wissensgraph + LLM bei 76 bis 85. Der genaue Wert: —

Das heißt nicht, dass diese Ergebnisse falsch sind oder nie überprüft wurden. Es heißt: Sie können es aus der Veröffentlichung allein meist nicht erkennen.

Wie zuverlässig die automatische Code-Erkennung selbst ist, haben wir nicht an einer Stichprobe geprüft: — Diese Prüfung steht aus und kommt in die nächste Auswertung.

## Wie diese Zahlen entstanden sind.

## Fünf Fragen an jeden Anbieter eines Dokumenten-Assistenten.

Die ersten drei folgen direkt aus den Grenzen in Abschnitt 04. Sie lassen sich in zehn Minuten am eigenen Material prüfen.

- 01 Verteilte Antwort. Stellen Sie eine Frage, deren Antwort in vier Dokumenten steckt. Kommt eine zusammengesetzte Antwort — oder vier Fundstellen?
- 02 Widerspruch. Laden Sie zwei Dokumente hoch, die sich widersprechen. Merkt das System den Konflikt — oder wählt es stillschweigend eines aus?
- 03 Zeitbezug. Fragen Sie nach einer Regel, die seit März gilt und vorher anders lautete. Kennt das System die Gültigkeitszeiträume?
- 04 Nichtwissen. Fragen Sie etwas, das in keinem Dokument steht. Kommt „weiß ich nicht“ — oder eine plausibel klingende Erfindung?
- 05 Beleg. Führt jede Aussage zur konkreten Stelle im Originaldokument — Seite und Absatz — oder nur zum Dateinamen?
## Sieben Antworten, die wir nicht geben.

Die zweite und dritte Frage entscheiden in der Praxis über das Budget ○ — und sie lassen sich nur an Ihrem eigenen Dokumentenbestand beantworten, nicht aus einem Datensatz.

Ihren Dokumentenbestand bewerten lassen DoWell UG · Hamburg

## Alle Quellen dieses Artikels.

„Rolle“ ist unsere Einordnung, keine Angabe der Autoren. Zitationszahlen sind Referenzkanten innerhalb des BrunoSan-Bestands.

## Was Leser dazu meistens fragen.

Um zu sehen, dass eine Kurve flach wird und eine andere steigt, braucht es einen versionierten Zeitreihenbestand: 602.340 wissenschaftliche Arbeiten von 2007 bis vorgestern, jede als eigenes Objekt mit ID, Datum und Referenzkanten. Genau das Objektmodell, um das es in diesem Artikel inhaltlich geht — angewandt auf uns selbst.

Dasselbe Prinzip für Ihre Dokumente: Atomizer zerlegt Verträge, Rechnungen und Protokolle in Objekte mit ID und Beziehungen. BrunoSan Assistant beantwortet Fragen darauf — mit Quelle zur Originalstelle, und mit „weiß ich nicht aus deinen Daten“ als vollwertiger Antwort. Den arXiv-Bestand gibt es als MCP-Server.

Nach Agentic AI: Drei frühe Forschungssignale → Wo Gedächtnis und Zeitbezug in der Forschungssprache gerade auftauchen — und warum das Urteil dort „zu früh“ lautet.

KI-Agenten: Neu ist nur das Wort → Warum die Verfahren hinter „Agentic AI“ aus 2022 und 2023 stammen.
