Blog · KI

Lokales LLM für Unternehmen: was läuft, worauf und wann es sich lohnt

Ein lokales LLM ist ein Sprachmodell, das auf Ihrem eigenen Rechner oder Server läuft, ohne dass der Text zu einem externen Anbieter gelangt. Die Dimensionierung beginnt beim Speicher: etwa 0,5 GB pro Milliarde Parameter bei 4-Bit-Quantisierung, plus Platz für den Kontext. Es lohnt sich, wenn die Daten sensibel sind und das Volumen konstant ist, nicht als kostenloser Ersatz für ChatGPT.

8Minuten Lesezeit
2026-09-17Veröffentlicht
KIKategorie
Tower-Server nebeneinander, mit leuchtenden Statusanzeigen
KI
01

Was ein lokales LLM ist und worin es sich von ChatGPT unterscheidet

Ein lokales LLM ist ein Sprachmodell, das auf Ihrer eigenen Hardware läuft, einem Laptop, einem PC oder einem Server im Unternehmen, statt über das Internet bei einem Anbieter genutzt zu werden. Der eingegebene Text und die Antworten bleiben auf diesem Gerät. Möglich ist das, weil immer mehr Hersteller Modelle mit offenen Gewichten veröffentlichen, die jeder herunterladen und ausführen kann: OpenAI mit gpt-oss, Google mit Gemma oder Alibaba mit Qwen, alle unter der freizügigen Lizenz Apache 2.0.

Der praktische Unterschied zu ChatGPT oder Claude im Browser liegt in der Aufteilung der Verantwortung. In der Cloud kümmert sich der Anbieter um Server, Updates und Kapazität, und Sie zahlen das Abonnement oder die Nutzung. Lokal haben Sie die volle Kontrolle über die Daten und das gewählte Modell, aber auch die Sorge um Hardware, Geschwindigkeit und Wartung. Offene Modelle haben zu einigen kommerziellen Modellen aufgeschlossen: Laut OpenAI kommt gpt-oss-120b bei den zentralen Reasoning-Benchmarks nah an o4-mini heran, doch bei den schwierigsten Aufgaben haben die Spitzenmodelle aus der Cloud in der Regel einen Vorsprung.

02

Wie viel Speicher Sie für ein lokales LLM brauchen

Die Grundregel für die Dimensionierung ist der Speicher, nicht der Prozessor. Jeder Parameter des Modells belegt Platz: Bei FP16-Genauigkeit sind es zwei Bytes, also etwa 2 GB Speicher pro Milliarde Parameter, und bei 4-Bit-Quantisierung, der Variante, die lokal meist genutzt wird, etwa 0,5 GB. Ein Modell mit 20 Milliarden Parametern braucht also rund 10 GB allein für die Gewichte. Der Speicher kann der der Grafikkarte sein oder, bei Rechnern mit Unified Memory, der gemeinsame Arbeitsspeicher des Systems.

Zu den Gewichten kommt der Speicher für den Kontext hinzu, der KV-Cache, der mit jedem Token im Gespräch und mit jedem gleichzeitig arbeitenden Nutzer wächst. Deshalb kann ein Modell, das bequem Platz hat, solange eine einzelne Person es testet, der Speicher ausgehen, sobald ein ganzes Team damit arbeitet. Leitfäden zur Dimensionierung empfehlen eine Reserve von 15-20% für den Betrieb. Als konkrete Anhaltspunkte: gpt-oss-20b ist ein Download von 14 GB und läuft mit 16 GB Speicher, gpt-oss-120b hat 65 GB und passt auf eine einzelne GPU mit 80 GB.

ModellgrößeSpeicher für die Gewichte, bei 4 BitWo es läuft, als Richtwert
3-4 Milliarden Parameteretwa 2 GBgewöhnlicher Laptop, für Tests
12-14 Milliardenetwa 6-7 GBPC mit Grafikkarte mit 12-16 GB
20-32 Milliardenetwa 10-16 GBGrafikkarte mit 24 GB oder Mac mit mindestens 32 GB Unified Memory
über 100 Milliardenüber 50 GBServer mit GPU mit 80 GB oder mehreren Karten
03

Welche Open-Source-Modelle Sie 2026 lokal betreiben können

Das Angebot hat sich im letzten Jahr stark verändert, und die Lizenz ist so wichtig geworden wie die Leistung. Apache 2.0, die Lizenz von gpt-oss, Gemma 4 und Qwen3, erlaubt kommerzielle Nutzung, Änderungen und die Integration in Produkte ohne separate Vereinbarung mit dem Hersteller. Andere Modellfamilien haben eigene Lizenzen mit Bedingungen, die Sie lesen sollten, bevor Sie sie in einem Produkt oder einem Dienst für Kunden einsetzen. Das Etikett „Open Source“ in einer Präsentation bedeutet nicht automatisch, dass Sie mit dem Modell alles tun dürfen.

Für ein Unternehmen in Rumänien zählt auch die Sprache. Gemma 4 gibt Unterstützung für mehr als 140 Sprachen an, und Qwen3 listet 119 Sprachen und Dialekte, darunter Rumänisch. Das garantiert nicht dieselbe Qualität wie im Englischen, vor allem bei juristischer, steuerlicher oder technischer Fachsprache. Der einzige Test, der zählt, ist der mit Ihren eigenen Dokumenten: dieselben Fragen an mehrere Modelle, mit Antworten, die jemand vergleicht, der weiß, wie eine korrekte Antwort im jeweiligen Fachgebiet aussieht.

  • 01gpt-oss OpenAI, seit August 2025, in den Varianten 20b und 120b, Lizenz Apache 2.0.
  • 02Gemma 4 Google, seit April 2026, von kleinen Varianten für Endgeräte bis zu einem Modell mit 31 Milliarden Parametern, Lizenz Apache 2.0.
  • 03Qwen3 Alibaba, seit April 2025, in mehreren Größen, mit angegebener Unterstützung für Rumänisch, Lizenz Apache 2.0.
04

Ollama, LM Studio, llama.cpp oder vLLM: womit Sie das Modell betreiben

Für die ersten Tests brauchen Sie nichts Kompliziertes. Ollama, ein Open-Source-Projekt unter MIT-Lizenz, lädt ein Modell mit einem einzigen Befehl herunter, führt es aus und bietet eine mit OpenAI kompatible API, sodass sich viele bestehende Anwendungen ohne größere Änderungen mit dem lokalen Modell verbinden lassen. LM Studio tut dasselbe über eine grafische Oberfläche und ist seit Juli 2025 auch für die Nutzung im Beruf kostenlos, ohne separate Lizenz. Für alle, die keine Kommandozeile möchten, ist es meist der einfachste Einstieg.

Unter vielen dieser Anwendungen arbeitet llama.cpp, die Open-Source-Engine, die den Betrieb quantisierter Modelle auf gewöhnlicher Hardware erst möglich gemacht hat. Wenn Sie von einer Person zu einem Team übergehen, wird die Kapazität zum Thema: mehrere gleichzeitige Nutzer, schnelle Antworten für alle und Monitoring. Dort kommt in der Regel vLLM zum Einsatz, ein Inferenzserver unter Apache-2.0-Lizenz, ausgelegt für viele parallele Anfragen. Der Unterschied zwischen einem Test auf dem Laptop und einem System, das ein Team täglich nutzt, liegt mehr in der Infrastruktur als im Modell.

WerkzeugWofür es gut istLizenz
OllamaEinfacher Betrieb über die Kommandozeile und lokale, mit OpenAI kompatible APIMIT
LM StudioGrafische Oberfläche, Einzeltests, ohne KommandozeileKostenlose App, auch im Beruf
llama.cppDie Basis-Engine für quantisierte Modelle auf gewöhnlicher HardwareMIT
vLLMServer für viele gleichzeitige NutzerApache 2.0
05

Lokales LLM vs. Cloud: was Sie gewinnen und was Sie verlieren

Der faire Vergleich ist nicht der zwischen einem kostenlosen Modell und einem Abonnement, sondern zwischen zwei Arten zu bezahlen. In der Cloud zahlen Sie pro Nutzer oder nach verarbeitetem Textvolumen, und die Kosten steigen mit der Nutzung. Lokal zahlen Sie die Hardware im Voraus und danach die Zeit der Menschen, die sie installieren, aktualisieren und absichern. Bei geringem oder unregelmäßigem Volumen ist die Cloud fast immer günstiger. Bei hohem, konstantem Volumen mit sensiblen Daten kann sich die Waage zugunsten der lokalen Variante neigen.

Es gibt auch Unterschiede, die in keiner Rechnung auftauchen. Lokal ändert sich das Modell nicht über Nacht, ohne dass Sie es wissen, und es funktioniert auch ohne Internet, bekommt aber auch keine Verbesserungen von selbst. In der Cloud haben Sie sofort Zugang zu den neuesten Modellen, doch die Daten laufen über die Infrastruktur eines anderen, auch wenn das vertraglich geregelt ist. Für viele Unternehmen ist die realistische Antwort eine Kombination: Aufgaben mit sensiblen Daten laufen lokal, die ohne Risiko bei einem sorgfältig ausgewählten Cloud-Dienst.

KriteriumLokales LLMCloud
Wohin die Daten gehenBleiben auf der Hardware des UnternehmensLaufen über die Server des Anbieters
Maximale QualitätGut, unter den SpitzenmodellenDie neuesten und größten Modelle
KostenHardware im Voraus bezahlt, plus WartungAbonnement oder Abrechnung nach Verbrauch
WartungIhre Aufgabe oder die eines PartnersAufgabe des Anbieters
Ohne InternetFunktioniertFunktioniert nicht
06

Wann sich ein lokales LLM für ein Unternehmen lohnt und wann nicht

Ein lokales LLM ist sinnvoll, wenn mindestens eine der folgenden Bedingungen klar erfüllt ist und nicht nur im Prinzip. Meist geht es um Daten, die per Vertrag oder ihrer Natur nach nicht zu einem externen Anbieter gelangen dürfen: Kundenakten, medizinische Daten, technische oder finanzielle Dokumentation. Bei einem Unternehmen mit vielen Nutzern und konstantem Volumen wird aus der Team-Variante eine private KI-Infrastruktur, mit einem Server, der auf die Zahl der gleichzeitig arbeitenden Menschen ausgelegt ist.

Es lohnt sich nicht für ein Experiment von einem Monat, für ein Team aus wenigen Personen, das KI gelegentlich nutzt, oder wenn sich weder jemand im Unternehmen noch ein Partner um die Wartung kümmert. Ein unbeaufsichtigter Server mit veraltetem Modell und hastig eingerichtetem Zugriff schafft mehr Risiken, als er löst. Für eine breitere Analyse der Self-Hosted-Variante, mit den Auswirkungen der DSGVO und den aktuellen Grenzen, haben wir separat über selbst gehostete KI für Unternehmen geschrieben.

  • 01Sensible Daten Dokumente, die nicht zu einem externen Anbieter gelangen dürfen.
  • 02Konstantes Volumen tägliche Nutzung, groß genug, dass die Cloud-Kosten ins Gewicht fallen.
  • 03Offline-Betrieb Standorte oder Abläufe, in denen Internet nicht garantiert ist.
  • 04Jemand ist verantwortlich eine Person oder ein Partner, der das System aktualisiert und absichert.
07

Wie Sie ein lokales LLM im Unternehmen testen, Schritt für Schritt

Ein erster Test lässt sich in wenigen Tagen durchführen und beginnt mit einer echten Aufgabe, nicht mit einer Demo. Wählen Sie etwas, das das Team häufig erledigt, zum Beispiel die Zusammenfassung interner Dokumente oder Antworten auf Fragen zu Abläufen, und bereiten Sie für die erste Runde einen Satz Dokumente ohne sensible Daten vor. Stellen Sie dieselben Fragen einem kleinen Modell, einem mittleren und einem Cloud-Dienst und vergleichen Sie dann die Antworten, die Geschwindigkeit und den genutzten Speicher.

Wenn die Ergebnisse gut sind, ist der nächste Schritt kein stärkerer Laptop, sondern ein Server für das Team, mit Zugriffskontrolle, Protokollierung und einer sicheren Möglichkeit, in den Dokumenten des Unternehmens zu suchen. Das bedeutet meist einen KI-Assistenten für die Unternehmensdokumente, der mit Quellenangabe antwortet und auf dem im Test gewählten Modell aufbaut. Sind die Ergebnisse auf Rumänisch für Ihre Aufgabe nicht gut genug, haben Sie das günstig erfahren, vor jeder Investition in Hardware.

  • 01Wählen Sie eine echte Aufgabe und einen Satz Dokumente ohne sensible Daten.
  • 02Installieren Sie Ollama oder LM Studio auf einem Testrechner.
  • 03Stellen Sie dieselben Fragen einem kleinen und einem mittleren Modell.
  • 04Vergleichen Sie mit einem Cloud-Dienst: Qualität auf Rumänisch, Geschwindigkeit, Speicher.
  • 05Entscheiden Sie anhand der Ergebnisse, ob sich ein Server für das Team lohnt.
08

Quellen und weiterführende Lektüre.

FAQ

Häufige Fragen

Was ist ein lokales LLM?

Ein lokales LLM ist ein Sprachmodell, das auf der eigenen Hardware heruntergeladen und betrieben wird, einem Laptop, einem PC oder einem Server im Unternehmen. Der eingegebene Text und die Antworten gelangen nicht zu einem externen Anbieter, aber Wartung, Updates und Sicherheit liegen bei Ihnen.

Welchen Rechner brauche ich für ein lokales LLM?

Das hängt von der Größe des Modells ab. Bei 4-Bit-Quantisierung belegt ein Modell etwa 0,5 GB Speicher pro Milliarde Parameter, plus Platz für den Kontext. Ein Modell mit 20 Milliarden Parametern läuft als Richtwert auf einer Grafikkarte mit 16-24 GB oder auf einem Mac mit ausreichend Unified Memory.

Ollama oder LM Studio: Was soll ich wählen?

LM Studio ist einfacher, wenn Sie eine grafische Oberfläche möchten und allein auf Ihrem Rechner testen. Ollama passt besser, wenn Sie das Modell über eine API mit anderen Anwendungen verbinden oder auf einem Server betreiben möchten. Beide können im Beruf kostenlos genutzt werden.

Ist ein lokales LLM so gut wie ChatGPT?

Für viele alltägliche Aufgaben, etwa Zusammenfassungen, Klassifizierungen oder Antworten auf Basis von Dokumenten, liefern die heutigen offenen Modelle gute Ergebnisse. Bei komplexem Reasoning und sehr schwierigen Aufgaben haben die Spitzenmodelle aus der Cloud in der Regel einen Vorsprung. Den Unterschied sieht man am besten beim Test mit den eigenen Aufgaben.

Darf ich ein Open-Source-Modell kommerziell nutzen?

Das hängt von der Lizenz ab. Modelle unter Apache 2.0, wie gpt-oss, Gemma 4 und Qwen3, erlauben kommerzielle Nutzung und Änderungen. Andere Modelle haben eigene Lizenzen mit Bedingungen, deshalb sollten Sie die Lizenz lesen, bevor Sie das Modell in einem Produkt oder Dienst einsetzen.

Versteht ein lokales LLM Rumänisch?

Mehrere offene Modelle geben Unterstützung für Rumänisch an: Qwen3 führt es unter seinen 119 Sprachen und Dialekten, und Gemma 4 nennt mehr als 140 Sprachen. Die Qualität unterscheidet sich jedoch vom Englischen, vor allem bei Fachbegriffen, daher lohnt sich ein Test mit den Dokumenten des Unternehmens vor jeder Entscheidung.

The Niche Society
Das Team von The Niche SocietyKI- und Software-Ingenieure aus Bukarest · LinkedIn
veröffentlicht 2026-09-17

Lassen Sie uns schauen, was sich bei Ihnen automatisieren lässt.

Eine kostenlose 30-Minuten-Sitzung: Wir sagen Ihnen, was sich automatisieren lässt, wie lange es dauert und was es kostet – mit Festpreis nach dem Discovery-Gespräch.

Kostenloses Erstgespräch buchenoffice@thenichesociety.ro

Wir antworten am selben Werktag.

+40 733 045 833