Manche Daten dürfen nicht an ein Cloud-Modell gehen.
Kundenverträge, Vorgaben zur Datenresidenz und vertrauliche Engineering-Daten schließen öffentliche KI-Services oft aus. Mit dem Modell auf Ihren eigenen GPUs gehen dieselben Use Cases trotzdem in Produktion.
- Vorgaben zur Datenresidenz in Ihrem Land oder Ihrer Branche
- Kundenverträge, nach denen Daten vor Ort bleiben
- Zeichnungen, Handbücher und Spezifikationen als zentrales geistiges Eigentum
- Feste Hardwarekosten statt Abrechnung pro Token
Der gesamte Stack auf Ihrer Hardware.
Wir wählen Open-Source-LLMs aus und betreiben sie auf Ihren NVIDIA-GPUs.
- Modellauswahl, getestet mit Ihren Dokumenten
- GPU-Dimensionierung für Ihre Nutzer und Workloads
- Lokale Embedding-Modelle und Vektorindex
Retrieval über Ihre Dokumente und Agenten, die mit Ihren internen Systemen arbeiten.
- Ingestion, OCR und Chunking
- Antworten mit Angabe von Dokument und Seite
- Agenten mit freigegebenem Zugriff auf ERP und weitere Systeme
Qualität, Monitoring und Updates, alles innerhalb Ihres Netzwerks.
- Evaluierungssets, zu Beginn vereinbart
- Monitoring von Latenz, Nutzung und Qualität
- Modell-Updates, getestet vor dem Rollout
In der Cloud starten, auf Ihren Servern live gehen.
Wir bauen den Use Case auf AWS oder Ihrer Cloud-Plattform mit dafür freigegebenen Dokumenten, damit Ihr Team ihn an echter Arbeit testen kann.
Wir übertragen dieselbe Pipeline auf einen NVIDIA-GPU-Server in Ihrer Umgebung und ersetzen das Cloud-Modell durch ein Open-Source-LLM. Vor dem Go-live läuft das Evaluierungsset erneut, um die Qualität zu bestätigen.
Wenn vom ersten Tag an keine Daten nach außen dürfen, starten wir direkt auf Ihrer Hardware.
Cloud-MVP, Produktion On-Premises
So haben wir die Document-Intelligence-Pipeline von Tracium gebaut.
Häufige Fragen
Welche Modelle betreiben Sie?+
Open-Source-LLMs, zum Beispiel aus den Familien Llama, Mistral oder Qwen. Wir testen Kandidaten mit Ihren Dokumenten und wählen das Modell, das das Qualitätsziel auf Ihrer Hardware erreicht.
Welche Hardware brauchen wir?+
Das hängt von Modellgröße, Nutzerzahl und Antwortzeiten ab. Das Produktivsystem von Tracium läuft auf einer NVIDIA RTX PRO 6000 Blackwell GPU. Die Dimensionierung des Servers legen wir mit Ihnen in der Cloud-Phase fest.
Verlässt irgendetwas unser Netzwerk?+
Keine Dokumente, Prompts oder Antworten gehen an einen externen KI-Service. Modell, Embeddings und Vektorindex laufen vollständig auf Ihren Servern.
Können wir in der Cloud starten?+
Ja. Wir können die erste Version in der Cloud mit nicht sensiblen Daten bauen und dieselbe Pipeline dann auf Ihre Server übertragen. So lief das Tracium-Projekt.
Wem gehört das System?+
Alles, was wir für Sie bauen, gehört Ihnen: Pipelines, Konfiguration, Infrastruktur-Code und Dokumentation, auf Ihren Servern und in Ihren Repositories. Unsere Agenten und Accelerators erhalten Sie mit einer Lizenz, die auch dann weiterläuft, wenn Sie nicht mehr mit uns zusammenarbeiten. Wenn Sie vollen Zugriff auf den Quellcode benötigen, bieten wir auch das an.
Sie brauchen KI für Daten, die Ihr Haus nicht verlassen dürfen?
Nennen Sie uns den Use Case und wo die Daten bleiben müssen.
