Ein Konstrukteur kopiert die Stückliste eines neuen Bauteils in ChatGPT, damit die KI schnell eine Zusammenfassung schreibt. Praktisch — nur hat in diesem Moment eine vertrauliche Konstruktionsdatei das Unternehmen verlassen und liegt auf einem Server in den USA. Solche Alltagsszenarien bringen viele Geschäftsführer und IT-Verantwortliche ins Grübeln: Muss das eigentlich sein? Immer öfter lautet die Antwort nein — und genau hier setzt lokale KI an.
Lokale KI — auch On-Premise-KI genannt — bedeutet, dass das KI-Modell auf der eigenen Hardware oder in einer selbst kontrollierten Cloud läuft, statt bei OpenAI, Anthropic oder Google. Für den Mittelstand ist das kein Nerd-Thema, sondern eine handfeste Frage von Datenschutz, Unabhängigkeit und Kosten. Dieser Beitrag zeigt die konkreten Vorteile — und benennt klar, wann sich der Aufwand nicht lohnt.
Was lokale KI bedeutet — und was nicht
Wenn du ChatGPT und Co. nutzt, schickst du deine Eingabe (den sogenannten Prompt) über das Internet an einen fremden Rechner, wo ein riesiges Sprachmodell sie verarbeitet und die Antwort zurückschickt. Du mietest also Rechenleistung und Modell — wie Strom aus der Steckdose.
Lokale KI dreht das um: Das Modell selbst läuft auf einem Rechner in deinem Haus oder in einer von dir kontrollierten Cloud. Möglich machen das Open-Weight-Modelle — KI-Modelle, deren „Gewichte" (die trainierten Parameter, quasi das fertige Gehirn des Modells) frei heruntergeladen werden dürfen. Dazu zählen Llama von Meta, Qwen von Alibaba, Gemma von Google, Mistral aus Frankreich oder die im August 2025 unter freier Apache-2.0-Lizenz veröffentlichten gpt-oss-Modelle von OpenAI. Du lädst das Modell einmal herunter und betreibst es selbst — auch offline, ohne dass eine einzige Zeile an einen Anbieter geht.
Vorteil 1: Betriebsgeheimnisse bleiben im Haus
Der offensichtlichste Vorteil zuerst: Was das Haus nicht verlässt, kann auch nicht abfließen. Beim rein lokalen Betrieb bleiben Prompts und Unternehmensdaten im eigenen Netzwerk. Für einen Maschinenbauer heißt das konkret: Konstruktionszeichnungen, Stücklisten, die Angebotskalkulation oder eine Personalakte lassen sich von der KI auswerten, ohne je auf einem fremden Server zu landen. Das eigene Know-how — oft der eigentliche Wettbewerbsvorteil eines Mittelständlers — bleibt unter Verschluss.
Das ist mehr als ein gutes Gefühl: Viele Cloud-Anbieter behalten sich in ihren Nutzungsbedingungen vor, Eingaben für das Training ihrer Modelle zu verwenden. Bei lokaler KI stellt sich diese Frage gar nicht — es gibt niemanden, an den Daten abfließen könnten. Warum unkontrollierte KI-Nutzung, die sogenannte Schatten-KI, ein echtes Risiko ist, haben wir in Teil 1 unserer Serie zum KI-Wissensmanagement beschrieben.
DSGVO und Datenhoheit: Die Kontrolle bleibt bei dir
Die Datenschutzkonferenz (DSK) — der Zusammenschluss der deutschen Datenschutzaufsichtsbehörden — hat im Mai 2024 ihre erste abgestimmte Orientierungshilfe „Künstliche Intelligenz und Datenschutz" veröffentlicht. Sie dient Unternehmen und Behörden als Prüf-Checkliste mit Schwerpunkt auf großen Sprachmodellen. Ein zentraler Punkt: Wer KI-Systeme externer Anbieter einsetzt, muss prüfen, ob ein Auftragsverarbeitungsvertrag nach Art. 28 DSGVO nötig ist. Fließen Daten in Drittländer wie die USA, kommen weitere Anforderungen hinzu.
Genau hier spielt lokale KI ihren größten Trumpf aus: Verlassen die Daten das eigene Netzwerk nicht, entfallen der Auftragsverarbeitungsvertrag mit einem US-Anbieter und die gesamte Drittlandtransfer-Problematik. Berater sprechen deshalb von „DSGVO-konform by design".
Ein wichtiger Vorbehalt bleibt trotzdem: Lokal ist nicht automatisch DSGVO-konform. Rechtsgrundlage, Löschkonzepte und Betroffenenrechte musst du weiterhin erfüllen — On-Premise nimmt dir nur den internationalen Datentransfer ab, nicht deine übrigen Pflichten.
Vorteil 2: Unabhängig statt ausgeliefert
Wer seine Abläufe auf einen einzigen Cloud-Dienst stützt, macht sich abhängig. Der Anbieter kann Preise erhöhen, ein bewährtes Modell abschalten oder einen Dienst ganz einstellen — und dein Prozess steht. Fachleute nennen das Vendor-Lock-in: Du sitzt fest, weil der Umstieg teuer und aufwändig wäre.
Ein Beispiel aus dem Vertrieb: Ein Großhändler lässt eine KI aus Produktdaten und Kundenhistorie automatisch Angebotstexte formulieren. Läuft das Modell lokal, kann kein Anbieter über Nacht den Preis pro Anfrage verdoppeln oder es durch eine schlechtere Version ersetzen. Du entscheidest, wann du aktualisierst — unabhängig von Änderungen an Bedingungen, Preisen oder Modellen.
Vorteil 3: Planbare Kosten — bei stetigem Volumen
Cloud-KI wird meist pro Token abgerechnet — grob gesagt pro Textbaustein, den das Modell liest und schreibt. Bei gelegentlicher Nutzung ist das günstig. Wächst das Volumen aber — täglich Tausende Serviceanfragen, Prüfprotokolle oder Dokumente — summieren sich die Cent-Beträge zu einem laufenden Kostenblock, der immer weiter steigt.
Lokale KI kehrt das um: Du investierst einmal in Hardware und trägst danach vor allem Strom und Wartung — die variablen Token-Gebühren entfallen, die Kosten werden planbar. Der Haken: Das greift nur bei ausreichendem, gleichmäßigem Volumen. Wer KI nur sporadisch einsetzt, fährt mit der Cloud meist günstiger, weil dort kein Kapital in ungenutzter Hardware steckt.
Vorteil 4: Offline-fähig, schnell und immer verfügbar
Ein Cloud-Dienst braucht eine stabile Internetverbindung — und funktioniert nur, solange der Anbieter läuft. Lokale KI ist davon unabhängig. In einer Produktionshalle ohne WLAN oder beim Servicetechniker im Außendienst mit schlechtem Empfang arbeitet ein lokales Modell einfach weiter.
Beispiel Qualitätssicherung: Ein Prüfassistent, der Messwerte einordnet und Prüfanweisungen erklärt, läuft direkt auf einem Rechner an der Linie — mit zwei weiteren Vorteilen. Die Latenz (die Verzögerung zwischen Anfrage und Antwort) bleibt kontrollierbar, weil kein Weg über fremde Server nötig ist. Und die Verfügbarkeit liegt in deiner Hand: Hat ein externer KI-Dienst eine Störung, steht dein Betrieb trotzdem nicht still.
Vorteil 5: Anpassbar — und das KI-Know-how bleibt bei dir
Ein Modell von der Stange kennt die Welt, aber nicht deinen Betrieb. Lokale KI lässt sich auf die eigenen Daten anpassen — Fachbegriffe, Produktnamen, interne Abläufe. Diese Anpassung heißt Feintuning: Man trainiert ein fertiges Modell mit firmeneigenen Beispielen nach, damit es die eigene Sprache spricht. Mit QLoRA, einem ressourcensparenden Nachtrainings-Verfahren, gelingt das inzwischen auch auf Grafikkarten mit 24 bis 48 GB Speicher — mit vertretbarem Aufwand statt eigenem Rechenzentrum.
Der entscheidende Punkt: Beim lokalen Feintuning bleiben Trainingsdaten und das verbesserte Modell im Haus. Das aufgebaute KI-Know-how gehört deinem Unternehmen — nicht einem Anbieter. Für einen Service-Dienstleister, der sein Modell auf zehntausende gelöste Support-Fälle anpasst, ist genau dieses angelernte Wissen bares Geld wert.
Ein Selbstläufer ist das trotzdem nicht: Feintuning erfordert Erfahrung im Umgang mit Modellen, sauber aufbereitete Daten und eine ehrliche Erfolgskontrolle. Für viele Einstiegsfälle reicht ohnehin der schlankere Weg, firmeneigenes Wissen mit einem RAG-System an ein Standardmodell anzudocken — dabei schlägt die KI Antworten in deinen eigenen Dokumenten nach, statt sie auswendig zu lernen. Das ist die Basis einer Wissens-KI und deutlich einfacher, als das Modell nachzutrainieren.
Wann Cloud oder Hybrid die bessere Wahl ist
Damit dieser Beitrag keine Werbung wird: Lokale KI ist nicht immer die richtige Wahl. Die größten Frontier-Modelle — die modernsten Spitzenmodelle der großen Anbieter — sind weiterhin einen Schritt besser als alles lokal Betreibbare. Cloud-Dienste bieten zudem verwaltete Infrastruktur mit vertraglich zugesicherter Verfügbarkeit (oft 99,9 %), skalieren automatisch mit Lastspitzen und verursachen kaum Betriebsaufwand.
Lokaler Betrieb bedeutet umgekehrt: höhere Anfangsinvestition, mehr Aufwand für Hardware, Modell-Updates und Wartung sowie ein Qualitäts-Limit gegenüber den neuesten Modellen. Als grobe Größenordnung — ausdrücklich nicht als exakte Messung — erreichen Frontier-Modelle auf gängigen Vergleichstests etwa 85 bis 92 %, die besten lokal lauffähigen 70B-Modelle rund 75 bis 85 % und kleine Einsteigermodelle etwa 55 bis 70 %; Open-Weight-Modelle liegen typischerweise einige Monate hinter der Spitze. Dazu kommt: Ein lokales Modell hat einen Wissens-Stichtag und braucht Zusatzwerkzeuge wie RAG oder eine Websuche für aktuelle Fakten. Und die Betriebsverantwortung — Verfügbarkeit, Sicherheit, Updates — liegt komplett bei dir; ein vertraglich zugesichertes Service-Level (SLA) gibt es nicht.
Ein verbreiteter Irrtum noch dazu: Lokale KI befreit nicht vom EU AI Act — seine Pflichten treffen Anbieter und Betreiber, egal wo das Modell läuft. Die Regeln für universell einsetzbare KI-Modelle gelten seit dem 2. August 2025; durchsetzen kann die EU sie ab dem 2. August 2026, mit Sanktionen bis zu 15 Millionen Euro oder 3 % des weltweiten Jahresumsatzes. Für Hochrisiko-Systeme verschiebt der geplante „Digital Omnibus" den Start von August 2026 auf Dezember 2027 — Transparenzpflichten und die Pflicht zur KI-Kompetenz bleiben unberührt. On-Premise hilft also bei der DSGVO-Drittlandfrage, nicht bei den Pflichten aus dem AI Act.
Was du realistisch brauchst
Es braucht drei Zutaten: ein passendes Modell, genug Hardware und die richtigen Werkzeuge.
Modell: Die Größe eines Modells misst man in Parametern (Milliarden = B). Kleine Modelle mit rund 1 bis 8 Milliarden Parametern — etwa Gemma 3 in 1B oder 4B, Qwen3 oder Microsofts Phi-4-mini — laufen schon auf einem gut ausgestatteten Laptop. Mittlere Modelle sind Mistral Small (rund 24B) oder Gemma 3 27B, große die 70B-Klasse. Ein Sonderfall sind die gpt-oss-Modelle: Das kleinere läuft schon in rund 16 GB Speicher, das große auf einer einzelnen 80-GB-GPU.
Hardware: Der Speicher der Grafikkarte (VRAM) ist der Flaschenhals. Eine Technik namens Quantisierung „dampft" die Modelle auf 4 Bit ein und viertelt den Speicherbedarf grob — bei meist geringem Qualitätsverlust. Als Faustregel für quantisierte Modelle:
- 7B-Modell: rund 4 bis 5 GB VRAM — läuft auf einer 8-GB-Karte
- 14B-Modell: rund 12 GB VRAM
- 24B- bis 32B-Modell: rund 16 bis 24 GB VRAM
- 70B-Modell: rund 40 bis 48 GB VRAM — passt nicht mehr auf eine einzelne Consumer-Karte wie eine RTX 4090
Für die kleinen Modelle auf der CPU gelten mindestens 16 GB Arbeitsspeicher (32 GB empfohlen), ein moderner Achtkern-Prozessor und eine schnelle NVMe-SSD mit 100 bis 500 GB Platz. Für ernsthafte Nutzung landest du je nach Modellgröße bei einer professionellen Workstation oder einem kleinen Server — konkrete Preise hängen zu stark von Markt und Ausstattung ab, um sie hier seriös zu nennen.
Werkzeuge: Zum Ausprobieren genügt Ollama — ein Befehl lädt und startet ein Modell — oder die grafische Oberfläche LM Studio und die Offline-App Jan. Technische Grundlage vieler dieser Tools ist llama.cpp mit dem universellen GGUF-Dateiformat. Für den Mehrbenutzer-Betrieb kommen Serving-Engines wie vLLM oder SGLang ins Spiel: Sie bündeln gleichzeitige Anfragen in einen Rechendurchlauf (Continuous Batching) und bedienen so viele Nutzer parallel — wofür die Einzelnutzer-Tools nicht ausgelegt sind.
Der pragmatische Mittelweg: Hybrid
Für die meisten Mittelständler ist die beste Antwort weder rein lokal noch rein Cloud, sondern hybrid: Sensible Daten — Konstruktion, Kalkulation, Personal — bleiben auf einem lokalen Modell, unkritische Aufgaben oder solche mit höchstem Qualitätsanspruch dürfen in die Cloud. So bekommst du Datenschutz dort, wo er zählt, ohne bei harmlosen Aufgaben auf die Spitzenqualität zu verzichten.
Einstiegsempfehlung: Fang klein an. Lade ein Open-Weight-Modell mit Ollama auf einen vorhandenen Rechner mit anständiger Grafikkarte, wähle einen klar abgegrenzten Anwendungsfall mit sensiblen Daten und miss über ein, zwei Monate, ob Qualität und Aufwand passen. Daraus entscheidest du seriös, was lokal bleibt und was in die Cloud darf — ohne gleich in einen Server zu investieren. Wer eine unabhängige Einschätzung möchte, findet in einer KI-Beratung Orientierung.
Häufige Fragen zu lokaler KI
Was ist lokale KI?
Lokale KI (auch On-Premise-KI) bezeichnet ein KI-Modell, das auf der eigenen Hardware oder in einer selbst kontrollierten Cloud läuft — statt bei einem Anbieter wie OpenAI, Anthropic oder Google. Möglich machen das frei herunterladbare Open-Weight-Modelle. Deine Daten verlassen dabei das eigene Netzwerk nicht.
Ist lokale KI automatisch DSGVO-konform?
Nein. Der On-Premise-Betrieb löst die Drittlandtransfer-Frage, weil keine Daten an einen US-Anbieter fließen. Rechtsgrundlage, technisch-organisatorische Maßnahmen, Löschkonzepte und Betroffenenrechte musst du aber weiterhin selbst erfüllen. Lokal heißt „deutlich einfacher", nicht „automatisch erledigt".
Welche Hardware brauche ich für einen ersten Test?
Für kleine Modelle bis rund 8 Milliarden Parameter reicht ein aktueller Laptop oder PC mit mindestens 16 GB Arbeitsspeicher; eine Grafikkarte mit 8 GB Speicher genügt für ein quantisiertes 7B-Modell. So gewinnst du einen realistischen Eindruck, bevor du in einen Server investierst.
Ist lokale KI günstiger als ChatGPT und Co.?
Das hängt am Volumen. Bei hoher, gleichmäßiger Nutzung amortisiert sich die Hardware, und ohne Token-Gebühren wird lokal auf Dauer oft günstiger. Bei sporadischem Einsatz ist die Cloud meist billiger — du bindest dort kein Kapital in Hardware, die im Leerlauf steht.
Fazit
Lokale KI ist für den Mittelstand kein Selbstzweck, sondern eine Antwort auf konkrete Sorgen: Betriebsgeheimnisse, die im Haus bleiben; volle Kontrolle über die Daten; Unabhängigkeit von einem einzelnen Anbieter; planbare Kosten bei hohem Volumen; und KI, die auch offline funktioniert. Die Technik ist reif — mit frei verfügbaren Modellen und ausgereiften Werkzeugen startest du heute mit überschaubarer Hardware.
Zur fairen Einordnung: Die absolute Spitzenqualität, die elastische Skalierung und der minimale Betriebsaufwand sprechen weiter für die Cloud, und lokal ist nicht automatisch DSGVO-konform oder vom AI Act befreit. Für die meisten Betriebe ist der hybride Weg deshalb der klügste — das Sensible lokal, den Rest nach Bedarf. Willst du herausfinden, welcher Mix zu deinen Prozessen passt? Dennis Drzosga unterstützt dich mit KI-Automatisierung und Prozessoptimierung im Raum Aalen und dem Ostalbkreis — vereinbare über die Kontaktseite ein unverbindliches Erstgespräch.