KI-INFRASTRUKTUR

Private KI-Infrastruktur: on‑premise oder in der EU-Cloud

Eine externe API ist einfach zu starten, aber Verträge, Zugangscodes und Kundendaten landen auf Servern außerhalb des Unternehmens. Wir bauen KI-Plattformen, die on-premise oder auf dedizierter GPU in der EU laufen, mit den Daten im vom Unternehmen festgelegten Perimeter.

EUdie Infrastruktur läuft im Perimeter des Unternehmens oder auf dedizierter GPU in der Europäischen Union, nicht auf einer API aus den USA
Open-WeightModellfamilien mit offenen Gewichten (Qwen, DeepSeek, GLM, Gemma, Mistral), kein in einer API geschlossenes Modell
des UnternehmensCode und Infrastruktur bleiben bei der Übergabe Eigentum des Kunden, nicht des Anbieters
KI-INFRASTRUKTUR
KI-INFRASTRUKTUR
01

Was self-hosted KI-Infrastruktur für ein Unternehmen bedeutet

Eine self-hosted KI-Infrastruktur bedeutet, dass das Sprachmodell auf vom Unternehmen kontrollierten Servern oder auf dedizierter GPU bei einem Anbieter in der EU läuft — nicht in einer öffentlichen amerikanischen API, an die Sie Anfrage für Anfrage Verträge, Zugangscodes oder Kundendaten senden. Der Unterschied ist nicht kosmetisch: Die Daten verlassen den festgelegten Perimeter nie mehr.

Wir sprechen nicht nur davon, „ein Modell laufen zu lassen“. Eine private KI-Plattform bedeutet eine Oberfläche für Mitarbeitende, rollenbasierte Berechtigungen, Anbindung an interne Dokumente und Systeme, Audit-Protokolle und Monitoring — all das, was einem generischen KI-Chat-Abonnement fehlt.

Private KI-Infrastruktur, erklärt in zweieinhalb Minuten
Von Dutzenden isolierter Chats auf US-Servern zu Agenten, die in den Systemen des Unternehmens arbeiten, auf einem Open-Source-Modell, das auf GPUs in der Europäischen Union läuft. Video auf Englisch.
02

Die Plattform ist mehr als ein Modell: Oberfläche, RAG, Agenten, Audit

Ein privates LLM allein löst für ein Unternehmen noch nichts. Der Wert entsteht, wenn das Modell mit einer Oberfläche verbunden ist, die Mitarbeitende tatsächlich nutzen, mit den Unternehmensdokumenten und, wo es sinnvoll ist, mit den bestehenden operativen Systemen.

Wir bauen jede Komponente als Teil derselben Plattform, nicht als separate Werkzeuge, die manuell miteinander verbunden werden. Der Teil, der die Plattform im Alltag nützlich macht, die Anbindung der Agenten an das ERP über MCP-Server, hat eine eigene Seite.

INTERNER CHAT

Oberfläche mit Rollen, Berechtigungen und SSO

Jeder Mitarbeitende meldet sich mit dem Unternehmenskonto an; was er sehen und anfragen kann, hängt von seiner Rolle ab, nicht vom gesunden Menschenverstand.

RAG

Suche in den Unternehmensdokumenten

Die Antworten stammen aus den internen Verfahren, Verträgen und Berichten, nicht aus dem allgemeinen Gedächtnis des Modells.

AGENTEN + ERP/CRM

Konnektoren über API oder maßgeschneidertes MCP

Agenten, die bestehende Systeme lesen und mit ausdrücklicher Freigabe auch beschreiben — ERP, CRM, SAGA, SAP.

AUDIT & MONITORING

Nutzungs- und Zugriffsprotokolle

Wer was gefragt hat, was das Modell geantwortet hat — intern sichtbar, nicht hinter einer externen API verborgen.

EVALUIERUNG

Evaluationssets für jeden Anwendungsfall

Wir messen die Genauigkeit anhand realer Unternehmensdaten, nicht anhand eines generischen öffentlichen Benchmarks.

03

Wie groß muss ein KI-Server eigentlich sein

Die Dimensionierung erfolgt nicht nach dem „größten verfügbaren Modell“, sondern nach dem Anwendungsfall: wie viele Mitarbeitende das System gleichzeitig nutzen, wie lang der verarbeitete Kontext ist (ganze Dokumente oder kurze Fragen) und welche Größe und Quantisierung das gewählte Modell hat — diese Variablen bestimmen den benötigten Grafikspeicher.

Ein sehr großes Modell vom Typ MoE (mixture-of-experts) kann selbst quantisiert Hunderte GB Grafikspeicher benötigen; ein Modell mit 20-30 Milliarden Parametern läuft dagegen problemlos auf einer einzigen GPU mit viel Speicher. Für die meisten internen Prozesse ist die zweite Variante die richtige — nicht das größte Modell, sondern das für die Aufgabe passende. Für einen ersten Test auf einem einzelnen Rechner haben wir separat beschrieben, wie Sie ein lokales LLM betreiben und wie viel Speicher es braucht.

04

Privates LLM: on-premise bei Ihnen oder auf dedizierter GPU in der EU

Es gibt zwei Arten, ein privates LLM zu betreiben, nicht nur eine. Auf eigenen Servern (on-premise) kontrolliert das Unternehmen die Infrastruktur physisch — eine geeignete Variante dort, wo interne oder vertragliche Richtlinien dies ausdrücklich verlangen. Auf dedizierter GPU bei einem Anbieter in der Europäischen Union kauft das Unternehmen keine Hardware, aber die Daten verlassen trotzdem nicht die EU und gelangen nicht zu einem amerikanischen Anbieter.

Die Entscheidung hängt auch von der durch die DSGVO geforderten Datenresidenz, von den Transparenzpflichten des AI Act und, für regulierte Branchen, von den Anforderungen der NIS2 ab — sachliche Themen, die mit der Rechtsabteilung des Unternehmens zu klären sind, kein Bereich, in dem wir Rechtsberatung anbieten. Falls sich die Begriffe in internen Diskussionen vermischen, haben wir separat den Unterschied zwischen self-hosted KI und souveräner KI erklärt. Auf derselben Infrastruktur kann ein KI-Assistent für die Unternehmensdokumente laufen, dessen Antworten die Quelle nennen.

05

Self-hosted oder API: wo liegt die Rentabilitätsschwelle

Es gibt keine universelle Antwort. Bei wenigen Nutzern und schwankendem Traffic ist die Abrechnung pro Token bei einer gehosteten API fast sicher günstiger, als einen eigenen Server zu betreiben — die Infrastruktur würde außerhalb der Nutzungsspitzen ungenutzt bleiben.

Bei mehreren Dutzend täglichen Nutzern, konstantem Traffic und sensiblen Daten beginnt sich self-hosted zu lohnen — sowohl bei den Kosten bei hohem Volumen als auch bei der Kontrolle über die Daten. Die genaue Schwelle hängt von der Nutzerzahl und dem tatsächlichen Anfragevolumen ab; wir berechnen sie im Discovery, anhand der Unternehmenszahlen, nicht aus einer generischen Tabelle.

Self-hosted oder API? 5 Fragen, bevor Sie entscheiden

Haken Sie ab, was auf Sie zutrifft.

0 von 5

Haken Sie die Punkte oben ab.

06

Von Discovery bis zur an das Unternehmen übergebenen Infrastruktur

Wir starten mit dem Discovery: Anwendungsfälle, welche Daten vorhanden sind und wie sauber sie sind, Sicherheitsanforderungen, eine Dimensionierungsschätzung. Es folgt ein Pilotprojekt in einer einzelnen Abteilung, mit vorab schriftlich festgelegten Abnahmekriterien — genau wie bei jeder ernsthaften KI-Implementierung.

Nach dem Pilotprojekt erweitern wir in die Produktion mit aktivem Monitoring und übergeben am Ende Code und Infrastruktur an das Unternehmen. Sie bleiben Ihr Eigentum — wir betreiben keine geschlossene Plattform, von der Sie auf unbestimmte Zeit abhängig sind.

07

Festpreis, nach einem kurzen Discovery-Gespräch.

Discovery KI-Infrastruktur
auf Anfrage · nach DiscoveryEin Analysetag: Anwendungsfälle, verfügbare Daten, Sicherheitsanforderungen und eine Dimensionierungsschätzung
  • Audit von Anwendungsfällen und Daten
  • Sicherheits- und Compliance-Anforderungen
  • Dimensionierungsempfehlung
Pilotprojekt in einer Abteilung
auf Anfrage · nach DiscoveryDas gewählte Modell läuft für eine einzelne Abteilung, auf On-Premise- oder EU-Infrastruktur, mit vorab schriftlich festgelegten Abnahmekriterien
  • Modellauswahl + Runtime (vLLM/SGLang)
  • RAG auf den Dokumenten der Abteilung
  • schriftliche Abnahmekriterien
Rollout + Übergabe
auf Anfrage · nach DiscoveryWir erweitern auf mehrere Abteilungen mit Nutzungsmonitoring und übergeben anschließend Code und Infrastruktur an das Unternehmen
  • Erweiterung über mehrere Abteilungen
  • Monitoring und Audit-Protokolle
  • Übergabe Code + Infrastruktur

Jedes Projekt hat einen anderen Kontext, andere Abläufe und eine andere Infrastruktur. Der Preis wird nach einem kurzen, bezahlten Discovery festgelegt und ändert sich danach nicht mehr.

FAQ

Häufige Fragen

Wie groß muss der Server sein?

Das hängt von drei Dingen ab: wie viele Mitarbeitende es gleichzeitig nutzen, wie lang der verarbeitete Kontext ist und welches Modell Sie wählen. Ein sehr großes Modell vom Typ MoE kann selbst quantisiert Hunderte GB Grafikspeicher benötigen; ein Modell mit 20-30 Milliarden Parametern läuft dagegen auf einer einzigen GPU mit viel Speicher — die passende Variante für die meisten internen Prozesse. Die genaue Dimensionierung erfolgt im Discovery, anhand Ihres Anwendungsfalls.

Kann ich lokale KI mit den Daten aus dem ERP nutzen?

Ja — die Agenten verbinden sich über API oder über maßgeschneiderte MCP-Konnektoren mit ERP/CRM, lesen die benötigten Daten und können mit ausdrücklicher Freigabe auch in das System zurückschreiben. Der gesamte Ablauf bleibt auf der gewählten self-hosted oder EU-Infrastruktur, ohne dass die Daten aus dem ERP über eine externe API laufen.

Ist das günstiger als ChatGPT Team/Enterprise?

Es gibt keine universelle Antwort. Bei wenigen Nutzern und schwankendem Traffic bleibt ein Abonnement oder die Abrechnung pro Token in der Regel günstiger. Bei mehreren Dutzend täglichen Nutzern, konstantem Traffic und sensiblen Daten beginnt sich self-hosted zu lohnen — die genaue Schwelle hängt von der Nutzerzahl und dem Anfragevolumen ab und wird im Discovery berechnet, nicht aus einer generischen Preistabelle.

Welches Open-Source-Modell wählen wir?

Das hängt von der Aufgabe, der Sprache und der akzeptierten Latenz ab — es gibt kein universell besseres Modell. Wir arbeiten mit Open-Weight-Modellfamilien wie Qwen, DeepSeek, GLM, Gemma oder Mistral, bereitgestellt über Produktions-Engines wie vLLM oder SGLang, und wählen die passende Variante im Discovery, auf Basis von Tests für Ihren konkreten Fall.

Bleiben die Daten in Rumänien/der EU?

Ja — die Plattform läuft entweder auf den Servern des Unternehmens (on-premise, physisch dort, wo sich das Unternehmen befindet), oder auf dedizierter GPU bei einem Anbieter in der Europäischen Union. Die Daten verlassen den festgelegten Perimeter weder in Richtung einer externen API noch außerhalb der EU — relevant für die von der DSGVO geforderte Datenresidenz und für NIS2 in regulierten Branchen.

Wo kann ein KI-Server für ein Unternehmen in Rumänien laufen?

Entweder auf den eigenen Servern des Unternehmens, on-premise, oder auf dedizierten GPUs, die bei einem Anbieter in der Europäischen Union gemietet werden. Welche Variante passt, hängt davon ab, wie viele Mitarbeitende ihn gleichzeitig nutzen, wie sensibel die Daten sind und wer die Infrastruktur betreibt; die Dimensionierung erfolgt im Discovery, anhand der Zahlen des Unternehmens.

The Niche Society
Das Team von The Niche SocietyKI- und Software-Ingenieure aus Bukarest · LinkedIn
aktualisiert am 17. Sept. 2026

Lassen Sie uns schauen, was sich bei Ihnen automatisieren lässt.

Eine kostenlose 30-Minuten-Sitzung: Wir sagen Ihnen, was sich automatisieren lässt, wie lange es dauert und was es kostet – mit Festpreis nach dem Discovery-Gespräch.

Kostenloses Erstgespräch buchenoffice@thenichesociety.ro

Wir antworten am selben Werktag.

+40 733 045 833