Sovereign AI: Datenhoheit entscheidet sich in der Architektur, nicht im Marketing
Jede KI, die über eine API läuft, hat ein Datenproblem, das man nicht wegreden kann: der Prompt verlässt das Haus. Bei internen Dokumenten, Buchungsdaten oder Personalthemen ist das kein theoretisches Risiko — es ist die Definition fehlender Datenhoheit.
Was „Sovereign AI“ tatsächlich verlangt
- Verarbeitungsort: Eingabe, Modell und Ausgabe laufen auf Hardware, die man kontrolliert — nicht auf der eines API-Anbieters.
- Kein Trainings-Teilen: Das Modell wird nicht mit den Prompts anderer Kunden verbessert, weil es schlicht nicht in der Cloud trainiert wird.
- Nachvollziehbarkeit: Wer, wann, welche Anfrage gestellt hat, ist protokollierbar — intern, nicht bei einem externen Provider.
- Auditierbarkeit: Im Zweifel kann man den Server zeigen, nicht nur ein Datenschutz-Datenblatt.
Wie on-prem LLM das löst
- vLLM oder Ollama dienen ein offenes Gewichtsmodell (z. B. Qwen, Llama oder Mistral) auf eigener GPU aus. Die Eingabetexte erreichen nie ein fremdes Rechenzentrum.
- RAG mit Qdrant bindet das Modell an die echten internen Dokumente — die Vektoren liegen im eigenen Netz, nicht in einer US-Vektordatenbank.
- Kontrollierte Updates: Neue Modellversionen werden bewusst eingespielt, nicht über Nacht ausgerollt — was unter Stability-Gesichtspunkten ein Vorteil ist.
Wo die Grenzen liegen
- Trainingsdaten des Modells kann man auch on-prem nicht vollständig auditieren — das offene Gewicht zeigt, was im Modell ist, aber nicht mit letzter Sicherheit, was im Training war. Das ist aber ein deutlich kleineres Risiko als die laufende Datenweitergabe an eine API.
- Frontier-Modelle sind auf-API teils schärfer als das, was man lokal hosten kann. Wer absolute Reasoning-Spitze braucht, muss abwägen. Für die meisten betrieblichen Anwendungen reicht eine gut geführte lokale 70B.
- Betriebsaufwand fällt an: Monitoring, Backups, Patchen der GPU-Treiber. Das gehört ehrlich dazugesagt, ist aber kein Mangel.
Warum der API-Weg teuer endet
Der interessante Teil von API-Preisen ist nicht der Listenpreis, sondern die Skalierung: jeder Token kostet, jeder Retry kostet, jeder interne Test-Call kostet. On-prem ist der Token kostenlos — die Kosten sind die Hardware, und die ist amortisiert da. Ab einem gewissen Nutzungsgrad kehrt sich das Verhältnis um.
Unsere Sicht
Datenhoheit lässt sich nicht kaufen. Sie ergibt sich daraus, dass die Architektur von Anfang an auf den Verarbeitungsort achtet. Wer LLMs ernsthaft im Unternehmen einsetzt, kommt an on-prem nicht vorbei — nicht aus Ideologie, sondern weil die Alternativen entweder teuer oder datenschutzrechtlich unhaltbar sind.