Manche Daten dürfen nicht an ein Cloud-Modell gehen.
Kundenverträge, Vorgaben zur Datenresidenz und vertrauliche Engineering-Daten schließen öffentliche KI-Services oft aus. Mit dem Modell auf Ihren eigenen GPUs gehen dieselben Use Cases trotzdem in Produktion.
- Vorgaben zur Datenresidenz in Ihrem Land oder Ihrer Branche
- Kundenverträge, nach denen Daten vor Ort bleiben
- Zeichnungen, Handbücher und Spezifikationen als zentrales geistiges Eigentum
- Feste Hardwarekosten statt Abrechnung pro Token
Der gesamte Stack auf Ihrer Hardware.
Wir wählen Open-Source-LLMs aus und betreiben sie auf Ihren NVIDIA-GPUs.
- Modellauswahl, getestet mit Ihren Dokumenten
- GPU-Dimensionierung für Ihre Nutzer und Workloads
- Lokale Embedding-Modelle und Vektorindex
Retrieval über Ihre Dokumente und Agenten, die mit Ihren internen Systemen arbeiten.
- Ingestion, OCR und Chunking
- Antworten mit Angabe von Dokument und Seite
- Agenten mit freigegebenem Zugriff auf ERP und weitere Systeme
Qualität, Monitoring und Updates, alles innerhalb Ihres Netzwerks.
- Evaluierungssets, zu Beginn vereinbart
- Monitoring von Latenz, Nutzung und Qualität
- Modell-Updates, getestet vor dem Rollout
Auf Ihren eigenen Servern gebaut und betrieben.
Wir installieren ein Open-Source-LLM auf einem NVIDIA-GPU-Server in Ihrer Umgebung und bauen die Pipeline dort mit Ihren eigenen Dokumenten auf.
Ein Evaluierungsset aus Ihren echten Dokumenten und Fragen bestätigt die Qualität vor dem Go-live. Dokumente, Prompts und Antworten verlassen nie Ihr Netzwerk.
Vollständig On-Premises
Die Pipeline von Tracium läuft vor Ort. Kein Dokument und kein Prompt geht an einen externen KI-Service.
Häufige Fragen
Welche Modelle betreiben Sie?+
Open-Source-LLMs, zum Beispiel aus den Familien Llama, Mistral oder Qwen. Wir testen Kandidaten mit Ihren Dokumenten und wählen das Modell, das das Qualitätsziel auf Ihrer Hardware erreicht.
Welche Hardware brauchen wir?+
Das hängt von Modellgröße, Nutzerzahl und Antwortzeiten ab. Das Produktivsystem von Tracium läuft auf einer NVIDIA RTX PRO 6000 Blackwell GPU. Die Dimensionierung des Servers legen wir mit Ihnen im Scoping fest.
Verlässt irgendetwas unser Netzwerk?+
Keine Dokumente, Prompts oder Antworten gehen an einen externen KI-Service. Modell, Embeddings und Vektorindex laufen vollständig auf Ihren Servern.
Läuft es auch air-gapped?+
Ja. Modell, Embeddings und Vektorindex laufen ohne Internetverbindung. Zugriff, Modell-Updates und Support stimmen wir beim Scoping mit Ihrem Security-Team ab.
Können wir in der Cloud starten?+
Ja. Wenn Sie den Use Case zuerst testen möchten, können wir ihn in der Cloud mit nicht sensiblen Daten aufbauen und dieselbe Pipeline dann auf Ihre Server übertragen.
Wem gehört das System?+
Alles, was wir für Sie bauen, gehört Ihnen: Pipelines, Konfiguration, Infrastruktur-Code und Dokumentation, auf Ihren Servern und in Ihren Repositories. Unsere Agenten und Accelerators erhalten Sie mit einer Lizenz, die auch dann weiterläuft, wenn Sie nicht mehr mit uns zusammenarbeiten. Wenn Sie vollen Zugriff auf den Quellcode benötigen, bieten wir auch das an.
Sie brauchen KI für Daten, die Ihr Haus nicht verlassen dürfen?
Nennen Sie uns den Use Case und wo die Daten bleiben müssen.
