On-Premises-RAG & KI-Agenten auf Ihren GPUs | AgentixLake
PRIVATE KI · ON-PREMISES

RAG und KI-Agenten auf Ihren eigenen GPU-Servern.

Für Daten, die nicht an ein Cloud-Modell gehen dürfen. Wir betreiben Open-Source-LLMs auf NVIDIA-GPU-Servern in Ihrer Umgebung und bauen Retrieval, Agenten und Evaluierung darauf auf. Dokumente, Prompts und Antworten bleiben auf Ihrer Hardware.

WENN DATEN IM HAUS BLEIBEN MÜSSEN

Manche Daten dürfen nicht an ein Cloud-Modell gehen.

Kundenverträge, Vorgaben zur Datenresidenz und vertrauliche Engineering-Daten schließen öffentliche KI-Services oft aus. Mit dem Modell auf Ihren eigenen GPUs gehen dieselben Use Cases trotzdem in Produktion.

HÄUFIGE GRÜNDE
  • Vorgaben zur Datenresidenz in Ihrem Land oder Ihrer Branche
  • Kundenverträge, nach denen Daten vor Ort bleiben
  • Zeichnungen, Handbücher und Spezifikationen als zentrales geistiges Eigentum
  • Feste Hardwarekosten statt Abrechnung pro Token
WAS WIR LIEFERN

Der gesamte Stack auf Ihrer Hardware.

01 · MODELLE

Wir wählen Open-Source-LLMs aus und betreiben sie auf Ihren NVIDIA-GPUs.

  • Modellauswahl, getestet mit Ihren Dokumenten
  • GPU-Dimensionierung für Ihre Nutzer und Workloads
  • Lokale Embedding-Modelle und Vektorindex
02 · RAG UND AGENTEN

Retrieval über Ihre Dokumente und Agenten, die mit Ihren internen Systemen arbeiten.

  • Ingestion, OCR und Chunking
  • Antworten mit Angabe von Dokument und Seite
  • Agenten mit freigegebenem Zugriff auf ERP und weitere Systeme
03 · BETRIEB

Qualität, Monitoring und Updates, alles innerhalb Ihres Netzwerks.

  • Evaluierungssets, zu Beginn vereinbart
  • Monitoring von Latenz, Nutzung und Qualität
  • Modell-Updates, getestet vor dem Rollout
SO SETZEN WIR UM

In der Cloud starten, auf Ihren Servern live gehen.

01
Cloud-MVP mit nicht sensiblen Daten

Wir bauen den Use Case auf AWS oder Ihrer Cloud-Plattform mit dafür freigegebenen Dokumenten, damit Ihr Team ihn an echter Arbeit testen kann.

CLOUD
02
Produktion auf Ihrem GPU-Server

Wir übertragen dieselbe Pipeline auf einen NVIDIA-GPU-Server in Ihrer Umgebung und ersetzen das Cloud-Modell durch ein Open-Source-LLM. Vor dem Go-live läuft das Evaluierungsset erneut, um die Qualität zu bestätigen.

ON-PREMISES

Wenn vom ersten Tag an keine Daten nach außen dürfen, starten wir direkt auf Ihrer Hardware.

AUS DER PRAXIS

Cloud-MVP, Produktion On-Premises

So haben wir die Document-Intelligence-Pipeline von Tracium gebaut.

Tracium-Logo
TRACIUM · SCHWESTERUNTERNEHMEN · SCHIFFBAU

Lieferanten­handbücher werden zu ERP-fähigen Wartungs­plänen. Das MVP läuft auf AWS. Die Produktion läuft auf einem GPU-Server mit NVIDIA RTX PRO 6000 Blackwell in der Umgebung des Kunden, mit einem selbst gehosteten Open-Source-LLM.

70 % weniger manuelle DokumentationOn-Prem-LLM in Produktion
Zur Tracium-Fallstudie →
FAQ

Häufige Fragen

Welche Modelle betreiben Sie?+

Open-Source-LLMs, zum Beispiel aus den Familien Llama, Mistral oder Qwen. Wir testen Kandidaten mit Ihren Dokumenten und wählen das Modell, das das Qualitätsziel auf Ihrer Hardware erreicht.

Welche Hardware brauchen wir?+

Das hängt von Modellgröße, Nutzerzahl und Antwortzeiten ab. Das Produktiv­system von Tracium läuft auf einer NVIDIA RTX PRO 6000 Blackwell GPU. Die Dimensionierung des Servers legen wir mit Ihnen in der Cloud-Phase fest.

Verlässt irgendetwas unser Netzwerk?+

Keine Dokumente, Prompts oder Antworten gehen an einen externen KI-Service. Modell, Embeddings und Vektorindex laufen vollständig auf Ihren Servern.

Können wir in der Cloud starten?+

Ja. Wir können die erste Version in der Cloud mit nicht sensiblen Daten bauen und dieselbe Pipeline dann auf Ihre Server übertragen. So lief das Tracium-Projekt.

Wem gehört das System?+

Alles, was wir für Sie bauen, gehört Ihnen: Pipelines, Konfiguration, Infrastruktur-Code und Dokumentation, auf Ihren Servern und in Ihren Repositories. Unsere Agenten und Accelerators erhalten Sie mit einer Lizenz, die auch dann weiterläuft, wenn Sie nicht mehr mit uns zusammenarbeiten. Wenn Sie vollen Zugriff auf den Quellcode benötigen, bieten wir auch das an.

Sie brauchen KI für Daten, die Ihr Haus nicht verlassen dürfen?

Nennen Sie uns den Use Case und wo die Daten bleiben müssen.

Production Sprint starten→