Was self-hosted KI-Infrastruktur für ein Unternehmen bedeutet
Eine self-hosted KI-Infrastruktur bedeutet, dass das Sprachmodell auf vom Unternehmen kontrollierten Servern oder auf dedizierter GPU bei einem Anbieter in der EU läuft — nicht in einer öffentlichen amerikanischen API, an die Sie Anfrage für Anfrage Verträge, Zugangscodes oder Kundendaten senden. Der Unterschied ist nicht kosmetisch: Die Daten verlassen den festgelegten Perimeter nie mehr.
Wir sprechen nicht nur davon, „ein Modell laufen zu lassen“. Eine private KI-Plattform bedeutet eine Oberfläche für Mitarbeitende, rollenbasierte Berechtigungen, Anbindung an interne Dokumente und Systeme, Audit-Protokolle und Monitoring — all das, was einem generischen KI-Chat-Abonnement fehlt.
Von Dutzenden isolierter Chats auf US-Servern zu Agenten, die in den Systemen des Unternehmens arbeiten, auf einem Open-Source-Modell, das auf GPUs in der Europäischen Union läuft. Video auf Englisch.
Die Plattform ist mehr als ein Modell: Oberfläche, RAG, Agenten, Audit
Ein privates LLM allein löst für ein Unternehmen noch nichts. Der Wert entsteht, wenn das Modell mit einer Oberfläche verbunden ist, die Mitarbeitende tatsächlich nutzen, mit den Unternehmensdokumenten und, wo es sinnvoll ist, mit den bestehenden operativen Systemen.
Wir bauen jede Komponente als Teil derselben Plattform, nicht als separate Werkzeuge, die manuell miteinander verbunden werden. Der Teil, der die Plattform im Alltag nützlich macht, die Anbindung der Agenten an das ERP über MCP-Server, hat eine eigene Seite.
Oberfläche mit Rollen, Berechtigungen und SSO
Jeder Mitarbeitende meldet sich mit dem Unternehmenskonto an; was er sehen und anfragen kann, hängt von seiner Rolle ab, nicht vom gesunden Menschenverstand.
Suche in den Unternehmensdokumenten
Die Antworten stammen aus den internen Verfahren, Verträgen und Berichten, nicht aus dem allgemeinen Gedächtnis des Modells.
Konnektoren über API oder maßgeschneidertes MCP
Agenten, die bestehende Systeme lesen und mit ausdrücklicher Freigabe auch beschreiben — ERP, CRM, SAGA, SAP.
Nutzungs- und Zugriffsprotokolle
Wer was gefragt hat, was das Modell geantwortet hat — intern sichtbar, nicht hinter einer externen API verborgen.
Evaluationssets für jeden Anwendungsfall
Wir messen die Genauigkeit anhand realer Unternehmensdaten, nicht anhand eines generischen öffentlichen Benchmarks.
Wie groß muss ein KI-Server eigentlich sein
Die Dimensionierung erfolgt nicht nach dem „größten verfügbaren Modell“, sondern nach dem Anwendungsfall: wie viele Mitarbeitende das System gleichzeitig nutzen, wie lang der verarbeitete Kontext ist (ganze Dokumente oder kurze Fragen) und welche Größe und Quantisierung das gewählte Modell hat — diese Variablen bestimmen den benötigten Grafikspeicher.
Ein sehr großes Modell vom Typ MoE (mixture-of-experts) kann selbst quantisiert Hunderte GB Grafikspeicher benötigen; ein Modell mit 20-30 Milliarden Parametern läuft dagegen problemlos auf einer einzigen GPU mit viel Speicher. Für die meisten internen Prozesse ist die zweite Variante die richtige — nicht das größte Modell, sondern das für die Aufgabe passende. Für einen ersten Test auf einem einzelnen Rechner haben wir separat beschrieben, wie Sie ein lokales LLM betreiben und wie viel Speicher es braucht.
Privates LLM: on-premise bei Ihnen oder auf dedizierter GPU in der EU
Es gibt zwei Arten, ein privates LLM zu betreiben, nicht nur eine. Auf eigenen Servern (on-premise) kontrolliert das Unternehmen die Infrastruktur physisch — eine geeignete Variante dort, wo interne oder vertragliche Richtlinien dies ausdrücklich verlangen. Auf dedizierter GPU bei einem Anbieter in der Europäischen Union kauft das Unternehmen keine Hardware, aber die Daten verlassen trotzdem nicht die EU und gelangen nicht zu einem amerikanischen Anbieter.
Die Entscheidung hängt auch von der durch die DSGVO geforderten Datenresidenz, von den Transparenzpflichten des AI Act und, für regulierte Branchen, von den Anforderungen der NIS2 ab — sachliche Themen, die mit der Rechtsabteilung des Unternehmens zu klären sind, kein Bereich, in dem wir Rechtsberatung anbieten. Falls sich die Begriffe in internen Diskussionen vermischen, haben wir separat den Unterschied zwischen self-hosted KI und souveräner KI erklärt. Auf derselben Infrastruktur kann ein KI-Assistent für die Unternehmensdokumente laufen, dessen Antworten die Quelle nennen.
Self-hosted oder API: wo liegt die Rentabilitätsschwelle
Es gibt keine universelle Antwort. Bei wenigen Nutzern und schwankendem Traffic ist die Abrechnung pro Token bei einer gehosteten API fast sicher günstiger, als einen eigenen Server zu betreiben — die Infrastruktur würde außerhalb der Nutzungsspitzen ungenutzt bleiben.
Bei mehreren Dutzend täglichen Nutzern, konstantem Traffic und sensiblen Daten beginnt sich self-hosted zu lohnen — sowohl bei den Kosten bei hohem Volumen als auch bei der Kontrolle über die Daten. Die genaue Schwelle hängt von der Nutzerzahl und dem tatsächlichen Anfragevolumen ab; wir berechnen sie im Discovery, anhand der Unternehmenszahlen, nicht aus einer generischen Tabelle.
Self-hosted oder API? 5 Fragen, bevor Sie entscheiden
Haken Sie ab, was auf Sie zutrifft.
Haken Sie die Punkte oben ab.
Von Discovery bis zur an das Unternehmen übergebenen Infrastruktur
Wir starten mit dem Discovery: Anwendungsfälle, welche Daten vorhanden sind und wie sauber sie sind, Sicherheitsanforderungen, eine Dimensionierungsschätzung. Es folgt ein Pilotprojekt in einer einzelnen Abteilung, mit vorab schriftlich festgelegten Abnahmekriterien — genau wie bei jeder ernsthaften KI-Implementierung.
Nach dem Pilotprojekt erweitern wir in die Produktion mit aktivem Monitoring und übergeben am Ende Code und Infrastruktur an das Unternehmen. Sie bleiben Ihr Eigentum — wir betreiben keine geschlossene Plattform, von der Sie auf unbestimmte Zeit abhängig sind.
Festpreis, nach einem kurzen Discovery-Gespräch.
- Audit von Anwendungsfällen und Daten
- Sicherheits- und Compliance-Anforderungen
- Dimensionierungsempfehlung
- Modellauswahl + Runtime (vLLM/SGLang)
- RAG auf den Dokumenten der Abteilung
- schriftliche Abnahmekriterien
- Erweiterung über mehrere Abteilungen
- Monitoring und Audit-Protokolle
- Übergabe Code + Infrastruktur
Jedes Projekt hat einen anderen Kontext, andere Abläufe und eine andere Infrastruktur. Der Preis wird nach einem kurzen, bezahlten Discovery festgelegt und ändert sich danach nicht mehr.
Häufige Fragen
Wie groß muss der Server sein?
Das hängt von drei Dingen ab: wie viele Mitarbeitende es gleichzeitig nutzen, wie lang der verarbeitete Kontext ist und welches Modell Sie wählen. Ein sehr großes Modell vom Typ MoE kann selbst quantisiert Hunderte GB Grafikspeicher benötigen; ein Modell mit 20-30 Milliarden Parametern läuft dagegen auf einer einzigen GPU mit viel Speicher — die passende Variante für die meisten internen Prozesse. Die genaue Dimensionierung erfolgt im Discovery, anhand Ihres Anwendungsfalls.
Kann ich lokale KI mit den Daten aus dem ERP nutzen?
Ja — die Agenten verbinden sich über API oder über maßgeschneiderte MCP-Konnektoren mit ERP/CRM, lesen die benötigten Daten und können mit ausdrücklicher Freigabe auch in das System zurückschreiben. Der gesamte Ablauf bleibt auf der gewählten self-hosted oder EU-Infrastruktur, ohne dass die Daten aus dem ERP über eine externe API laufen.
Ist das günstiger als ChatGPT Team/Enterprise?
Es gibt keine universelle Antwort. Bei wenigen Nutzern und schwankendem Traffic bleibt ein Abonnement oder die Abrechnung pro Token in der Regel günstiger. Bei mehreren Dutzend täglichen Nutzern, konstantem Traffic und sensiblen Daten beginnt sich self-hosted zu lohnen — die genaue Schwelle hängt von der Nutzerzahl und dem Anfragevolumen ab und wird im Discovery berechnet, nicht aus einer generischen Preistabelle.
Welches Open-Source-Modell wählen wir?
Das hängt von der Aufgabe, der Sprache und der akzeptierten Latenz ab — es gibt kein universell besseres Modell. Wir arbeiten mit Open-Weight-Modellfamilien wie Qwen, DeepSeek, GLM, Gemma oder Mistral, bereitgestellt über Produktions-Engines wie vLLM oder SGLang, und wählen die passende Variante im Discovery, auf Basis von Tests für Ihren konkreten Fall.
Bleiben die Daten in Rumänien/der EU?
Ja — die Plattform läuft entweder auf den Servern des Unternehmens (on-premise, physisch dort, wo sich das Unternehmen befindet), oder auf dedizierter GPU bei einem Anbieter in der Europäischen Union. Die Daten verlassen den festgelegten Perimeter weder in Richtung einer externen API noch außerhalb der EU — relevant für die von der DSGVO geforderte Datenresidenz und für NIS2 in regulierten Branchen.
Wo kann ein KI-Server für ein Unternehmen in Rumänien laufen?
Entweder auf den eigenen Servern des Unternehmens, on-premise, oder auf dedizierten GPUs, die bei einem Anbieter in der Europäischen Union gemietet werden. Welche Variante passt, hängt davon ab, wie viele Mitarbeitende ihn gleichzeitig nutzen, wie sensibel die Daten sind und wer die Infrastruktur betreibt; die Dimensionierung erfolgt im Discovery, anhand der Zahlen des Unternehmens.

Lassen Sie uns schauen, was sich bei Ihnen automatisieren lässt.
Eine kostenlose 30-Minuten-Sitzung: Wir sagen Ihnen, was sich automatisieren lässt, wie lange es dauert und was es kostet – mit Festpreis nach dem Discovery-Gespräch.
