Referenzarchitektur
Agentic Enterprise RAG
Agentisches RAG-Referenzsystem mit LangGraph-Orchestrierung, hybrider Suche in Weaviate, lokalen und cloudbasierten LLM-Modi sowie einem FastAPI-Backend.
GitHub ↗Überblick
Untersucht Dokumentensuche und begrenzte, werkzeuggestützte Antwort-Workflows über ein gemeinsames FastAPI-Backend.
Architektur
- Dokumentenverarbeitung und Embeddings bilden die Grundlage der hybriden Vektor-/BM25-Suche in Weaviate (backend/app/core/vector_store.py).
- Eine LangGraph-Schleife für Entscheidungen und Tools erhält den Quellenkontext für die abschließende Antwort (backend/app/agent/graph.py und nodes.py).
- Die Provider-Konfiguration wählt Ollama- oder OpenAI-Modelle (backend/app/core/llm_provider.py).
Engineering-Entscheidungen
- Semantische Suche mit Stichwortsuche kombinieren.
- Die LLM-Provider-Konfiguration von Retrieval und Orchestrierung trennen.
- Graph-Entscheidungen auf fünf Schritte begrenzen und Quellenmetadaten über Tool-Aufrufe hinweg erhalten.
Implementierte Komponenten
- Endpunkte für Dokumenten-Upload und Anfragen in backend/app/api/.
- Hybride Weaviate-Suche und Tool-Orchestrierung mit LangGraph.
- Spracherkennung und englische/deutsche Prompts in backend/app/core/language_detect.py.
- Optionale Regex-Maskierung von Anfragen und geschätzte Tokenkosten.
Aktuelle Grenzen
- Der lokale Modus enthält einen Cloud-Fallback bei konfigurierten OpenAI-Zugangsdaten; ausschließlich lokale Verarbeitung ist nicht garantiert.
- Regex-Maskierung belegt weder DSGVO-Konformität noch eine unternehmensweite Zugriffskontrolle.
- Kosten sind Schätzwerte. Deployment-Konfiguration und Evaluationswerkzeuge belegen weder einen verifizierten Live-Dienst noch einen Benchmark zur Antwortqualität.