On-Premises- & Air-Gapped-RAG und KI-Agenten | AgentixLake
PRIVATE KI · ON-PREMISES

RAG und KI-Agenten auf Ihren eigenen GPU-Servern.

Für Daten, die nicht an ein Cloud-Modell gehen dürfen. Wir betreiben Open-Source-LLMs auf NVIDIA-GPU-Servern in Ihrer Umgebung, auch in Air-Gapped-Netzwerken, und bauen Retrieval, Agenten und Evaluierung darauf auf. Dokumente, Prompts und Antworten bleiben auf Ihrer Hardware.

WENN DATEN IM HAUS BLEIBEN MÜSSEN

Manche Daten dürfen nicht an ein Cloud-Modell gehen.

Kundenverträge, Vorgaben zur Datenresidenz und vertrauliche Engineering-Daten schließen öffentliche KI-Services oft aus. Mit dem Modell auf Ihren eigenen GPUs gehen dieselben Use Cases trotzdem in Produktion.

HÄUFIGE GRÜNDE
  • Vorgaben zur Datenresidenz in Ihrem Land oder Ihrer Branche
  • Kundenverträge, nach denen Daten vor Ort bleiben
  • Zeichnungen, Handbücher und Spezifikationen als zentrales geistiges Eigentum
  • Feste Hardwarekosten statt Abrechnung pro Token
WAS WIR LIEFERN

Der gesamte Stack auf Ihrer Hardware.

01 · MODELLE

Wir wählen Open-Source-LLMs aus und betreiben sie auf Ihren NVIDIA-GPUs.

  • Modellauswahl, getestet mit Ihren Dokumenten
  • GPU-Dimensionierung für Ihre Nutzer und Workloads
  • Lokale Embedding-Modelle und Vektorindex
02 · RAG UND AGENTEN

Retrieval über Ihre Dokumente und Agenten, die mit Ihren internen Systemen arbeiten.

  • Ingestion, OCR und Chunking
  • Antworten mit Angabe von Dokument und Seite
  • Agenten mit freigegebenem Zugriff auf ERP und weitere Systeme
03 · BETRIEB

Qualität, Monitoring und Updates, alles innerhalb Ihres Netzwerks.

  • Evaluierungssets, zu Beginn vereinbart
  • Monitoring von Latenz, Nutzung und Qualität
  • Modell-Updates, getestet vor dem Rollout
SO SETZEN WIR UM

Auf Ihren eigenen Servern gebaut und betrieben.

01
Aufbau auf Ihrem GPU-Server

Wir installieren ein Open-Source-LLM auf einem NVIDIA-GPU-Server in Ihrer Umgebung und bauen die Pipeline dort mit Ihren eigenen Dokumenten auf.

ON-PREMISES
02
Testen, dann live gehen

Ein Evaluierungsset aus Ihren echten Dokumenten und Fragen bestätigt die Qualität vor dem Go-live. Dokumente, Prompts und Antworten verlassen nie Ihr Netzwerk.

IM PRODUKTIVBETRIEB
AUS DER PRAXIS

Vollständig On-Premises

Die Pipeline von Tracium läuft vor Ort. Kein Dokument und kein Prompt geht an einen externen KI-Service.

Tracium-Logo
TRACIUM · SCHWESTERUNTERNEHMEN · SCHIFFBAU

Lieferanten­handbücher werden zu ERP-fähigen Wartungs­plänen. Im Produktiv­betrieb läuft es auf einem NVIDIA RTX PRO 6000 Blackwell GPU-Server in der Umgebung des Kunden, mit einem selbst gehosteten Open-Source-LLM.

300+ komplexe PDFs vor OrtOn-Prem-LLM in Produktion
Zur Tracium-Fallstudie →
FAQ

Häufige Fragen

Welche Modelle betreiben Sie?+

Open-Source-LLMs, zum Beispiel aus den Familien Llama, Mistral oder Qwen. Wir testen Kandidaten mit Ihren Dokumenten und wählen das Modell, das das Qualitätsziel auf Ihrer Hardware erreicht.

Welche Hardware brauchen wir?+

Das hängt von Modellgröße, Nutzerzahl und Antwortzeiten ab. Das Produktiv­system von Tracium läuft auf einer NVIDIA RTX PRO 6000 Blackwell GPU. Die Dimensionierung des Servers legen wir mit Ihnen im Scoping fest.

Verlässt irgendetwas unser Netzwerk?+

Keine Dokumente, Prompts oder Antworten gehen an einen externen KI-Service. Modell, Embeddings und Vektorindex laufen vollständig auf Ihren Servern.

Läuft es auch air-gapped?+

Ja. Modell, Embeddings und Vektorindex laufen ohne Internetverbindung. Zugriff, Modell-Updates und Support stimmen wir beim Scoping mit Ihrem Security-Team ab.

Können wir in der Cloud starten?+

Ja. Wenn Sie den Use Case zuerst testen möchten, können wir ihn in der Cloud mit nicht sensiblen Daten aufbauen und dieselbe Pipeline dann auf Ihre Server übertragen.

Wem gehört das System?+

Alles, was wir für Sie bauen, gehört Ihnen: Pipelines, Konfiguration, Infrastruktur-Code und Dokumentation, auf Ihren Servern und in Ihren Repositories. Unsere Agenten und Accelerators erhalten Sie mit einer Lizenz, die auch dann weiterläuft, wenn Sie nicht mehr mit uns zusammenarbeiten. Wenn Sie vollen Zugriff auf den Quellcode benötigen, bieten wir auch das an.

Sie brauchen KI für Daten, die Ihr Haus nicht verlassen dürfen?

Nennen Sie uns den Use Case und wo die Daten bleiben müssen.

Production Sprint starten→