Zum Inhalt springen
Startseite›Blog›Souveräne KI: Wann sich lokale Modelle wirklich lohnen
Strategie · Lesezeit ~4 Min

Souveräne KI: Wann sich lokale Modelle wirklich lohnen

22. September 2026

Ein Mac Mini M4 Pro mit 24 GB kostet 1.539 Euro. Die Abos, die er ersetzen soll, kosten 318 Euro im Monat. Die Rechnung geht auf – und sie ist trotzdem das schwächste Argument für lokale KI-Modelle, das wir kennen.

Wir haben genau so eine Maschine als KI-Workstation aufgesetzt: Sprachmodelle direkt auf dem Gerät, RAG über interne Dokumente, Tests mit quelloffenen Modellen. Was dabei herauskam, widerspricht dem, was wir anfangs selbst angenommen hatten.

Was lokale KI wirklich kostet

Die Anschaffung ist der kleinere Posten. Vollständig sieht es so aus:

Mac Mini M4 Pro, 24 GB: 1.539 Euro

  • Einrichtung: 16 Stunden
  • Laufende Kosten heute: sechs Plätze Anthropic Claude à 20 Euro und zwei Plätze Anthropic Claude à 99 Euro, zusammen 318 Euro im Monat

Vollständige Kostenübersicht

Fallen alle acht Plätze weg, hat sich die Hardware nach fünf Monaten bezahlt. Das klingt nach einer einfachen Entscheidung.

Nur fallen nicht alle acht weg.

Warum die Kostenrechnung nicht trägt

Die sechs günstigen Plätze sind Alltagswerkzeuge: Texte entwerfen, zusammenfassen, übersetzen, Fragen an interne Unterlagen stellen. Das kann ein lokales Modell übernehmen.

Die beiden teuren Plätze kaufen etwas anderes ein. Agentisches Arbeiten über mehrere Schritte, Recherche, jeweils die stärksten Modelle am Markt. Das leistet ein Rechner mit 24 GB nicht. Wer dir etwas anderes verspricht, hat es nicht ausprobiert.

6 × 20 € = 120 € entfallen realistisch / Break-even: 1.539 € ÷ 120 € = ~13 Monate
Break-even verschiebt sich von 5 auf gut 13 Monate

Die 16 Stunden Einrichtung sind darin noch nicht enthalten. Setz deinen eigenen Stundensatz ein, dann rechne noch einmal.

Wenn du lokale KI allein wegen der Kosten einführst: lass es.

Der Grund, der trägt, ist ein anderer.

Welche Daten die Cloud nie sehen dürfen

In jedem Unternehmen liegen Unterlagen, die das Haus nicht verlassen dürfen. Personalakten, Vertragsentwürfe, Kalkulationen, Gutachten, in der Verwaltung Bürgerdaten. Für diese Dokumente ist der Cloud-Preis überhaupt keine Größe in der Rechnung, weil die Cloud nie zur Auswahl stand.

Und trotzdem landet genau dieser Teil der Arbeit heute vielerorts in der Cloud. Nicht aus Absicht, sondern weil die Alternative fehlte. Ein lokales Modell schafft diese Alternative.

Das ist die Begründung. Die gesparten 120 Euro sind eine Fußnote.

Was auf 24 GB tatsächlich läuft

Der Arbeitsspeicher ist die eigentliche Grenze. macOS gibt der Grafikeinheit standardmäßig 16 bis 18 GB frei, anheben lässt sich das auf rund 21 GB. Abzüglich Kontext bleibt komfortabel Platz für etwa 14 GB Modellgewichte.

Was das bedeutet, bei üblicher 4-Bit-Quantisierung:

8B-Modelle, rund 4,8 GB: laufen mühelos, 30 bis 40 Token pro Sekunde

läuft mühelos

14B-Modelle, rund 8,4 GB: der Arbeitsbereich, 18 bis 25 Token pro Sekunde

der Arbeitsbereich

24B-Modelle, rund 14,4 GB: passen, aber mit wenig Kontextreserve

wenig Kontextreserve

32B-Modelle: passen nicht

passen nicht

Für deutschsprachige Aufgaben sind Qwen3 und Mistral Small deutlich stärker als Llama. Als Laufzeit genügt Ollama für den Einstieg; wer Tempo braucht, nimmt Apples MLX, das auf dieser Hardware spürbar mehr herausholt.

Wichtig für die Erwartung: 24 GB ist die Einstiegsgröße. Mit 48 GB wäre es eine andere Maschine.

Der größte Hebel sind nicht die Chats

Die meisten Unternehmen betrachten zuerst den Chat. Das ist selten die interessanteste Stelle.

Wer ein RAG-System betreibt, also eine Suche über eigene Dokumente, schickt bei jeder Indexierung und bei jeder Frage Textausschnitte an einen Anbieter, damit dieser sie in Vektoren übersetzt. Das ist ein dauerhafter, stiller Abfluss von Inhalten, der in keinem Kostenbericht auffällt, weil Embeddings so günstig sind.

Genau dieser Schritt lässt sich lokal erledigen. Ein Modell wie bge-m3 braucht rund 2 GB, ist mehrsprachig und qualitativ unkritisch. Danach verlässt das Firmenwissen die Maschine nicht mehr, während die Chat-Antworten weiter von dort kommen können, wo sie am besten sind.

Embeddings lokal, Chat nach Bedarf: Diese Aufteilung bringt mehr Souveränität pro investierter Stunde als jede andere.

Wann lokale KI die falsche Entscheidung ist

Genauso wichtig wie die Frage, wann es sich lohnt:

  • Nutzung zu gering? Bei ein paar Anfragen am Tag amortisiert sich nichts.
  • Niemand übernimmt den Betrieb? Modelle aktualisieren, Speicher überwachen, Ausfälle abfangen: Das ist Arbeit, kein einmaliges Projekt.
  • Stärkste Modelle gefragt? Für agentische Aufgaben ist lokal derzeit nicht konkurrenzfähig.
  • Daten ohnehin unkritisch? Öffentliche Produktinformationen brauchen keinen eigenen Rechner.

Bleibt dagegen etwas übrig, das wirklich im Haus bleiben muss, ist die Frage nach dem Break-even beantwortet, bevor du sie stellst.

Häufige Fragen
Was kostet eine lokale KI-Workstation?
1.539 Euro Hardware plus rund 16 Stunden Einrichtung. Die laufenden Kosten liegen bei nahezu null, dafür trägst du den Betrieb selbst.
Wann rechnet sich lokale KI gegenüber Cloud-Abos?
Bei 318 Euro Abokosten nach fünf Monaten, realistisch eher nach dreizehn, weil sich nicht jeder Platz ersetzen lässt.
Welche Modelle laufen auf 24 GB?
Modelle bis etwa 14 Milliarden Parameter komfortabel, bis 24 Milliarden mit wenig Kontextreserve. 32B passt nicht.
Ersetzt ein lokales Modell ChatGPT oder Claude?
Für Alltagsaufgaben ja. Für agentisches Arbeiten über mehrere Schritte nicht
Was bringt lokale KI für die öffentliche Verwaltung?
Bürgerdaten und Vorgangsakten bleiben im Haus. Für diese Dokumente war die Cloud nie eine Option.
Nächster Schritt
KI- & Automatisierungscheck — 30 Minuten