Ein Mac Mini M4 Pro mit 24 GB kostet 1.539 Euro. Die Abos, die er ersetzen soll, kosten 318 Euro im Monat. Die Rechnung geht auf – und sie ist trotzdem das schwächste Argument für lokale KI-Modelle, das wir kennen.
Wir haben genau so eine Maschine als KI-Workstation aufgesetzt: Sprachmodelle direkt auf dem Gerät, RAG über interne Dokumente, Tests mit quelloffenen Modellen. Was dabei herauskam, widerspricht dem, was wir anfangs selbst angenommen hatten.
Die Anschaffung ist der kleinere Posten. Vollständig sieht es so aus:
Mac Mini M4 Pro, 24 GB: 1.539 Euro
Vollständige Kostenübersicht
Fallen alle acht Plätze weg, hat sich die Hardware nach fünf Monaten bezahlt. Das klingt nach einer einfachen Entscheidung.
Nur fallen nicht alle acht weg.
Die sechs günstigen Plätze sind Alltagswerkzeuge: Texte entwerfen, zusammenfassen, übersetzen, Fragen an interne Unterlagen stellen. Das kann ein lokales Modell übernehmen.
Die beiden teuren Plätze kaufen etwas anderes ein. Agentisches Arbeiten über mehrere Schritte, Recherche, jeweils die stärksten Modelle am Markt. Das leistet ein Rechner mit 24 GB nicht. Wer dir etwas anderes verspricht, hat es nicht ausprobiert.
Die 16 Stunden Einrichtung sind darin noch nicht enthalten. Setz deinen eigenen Stundensatz ein, dann rechne noch einmal.
Wenn du lokale KI allein wegen der Kosten einführst: lass es.
Der Grund, der trägt, ist ein anderer.
In jedem Unternehmen liegen Unterlagen, die das Haus nicht verlassen dürfen. Personalakten, Vertragsentwürfe, Kalkulationen, Gutachten, in der Verwaltung Bürgerdaten. Für diese Dokumente ist der Cloud-Preis überhaupt keine Größe in der Rechnung, weil die Cloud nie zur Auswahl stand.
Und trotzdem landet genau dieser Teil der Arbeit heute vielerorts in der Cloud. Nicht aus Absicht, sondern weil die Alternative fehlte. Ein lokales Modell schafft diese Alternative.
Das ist die Begründung. Die gesparten 120 Euro sind eine Fußnote.
Der Arbeitsspeicher ist die eigentliche Grenze. macOS gibt der Grafikeinheit standardmäßig 16 bis 18 GB frei, anheben lässt sich das auf rund 21 GB. Abzüglich Kontext bleibt komfortabel Platz für etwa 14 GB Modellgewichte.
Was das bedeutet, bei üblicher 4-Bit-Quantisierung:
8B-Modelle, rund 4,8 GB: laufen mühelos, 30 bis 40 Token pro Sekunde
läuft mühelos
14B-Modelle, rund 8,4 GB: der Arbeitsbereich, 18 bis 25 Token pro Sekunde
der Arbeitsbereich
24B-Modelle, rund 14,4 GB: passen, aber mit wenig Kontextreserve
wenig Kontextreserve
32B-Modelle: passen nicht
passen nicht
Für deutschsprachige Aufgaben sind Qwen3 und Mistral Small deutlich stärker als Llama. Als Laufzeit genügt Ollama für den Einstieg; wer Tempo braucht, nimmt Apples MLX, das auf dieser Hardware spürbar mehr herausholt.
Wichtig für die Erwartung: 24 GB ist die Einstiegsgröße. Mit 48 GB wäre es eine andere Maschine.
Die meisten Unternehmen betrachten zuerst den Chat. Das ist selten die interessanteste Stelle.
Wer ein RAG-System betreibt, also eine Suche über eigene Dokumente, schickt bei jeder Indexierung und bei jeder Frage Textausschnitte an einen Anbieter, damit dieser sie in Vektoren übersetzt. Das ist ein dauerhafter, stiller Abfluss von Inhalten, der in keinem Kostenbericht auffällt, weil Embeddings so günstig sind.
Genau dieser Schritt lässt sich lokal erledigen. Ein Modell wie bge-m3 braucht rund 2 GB, ist mehrsprachig und qualitativ unkritisch. Danach verlässt das Firmenwissen die Maschine nicht mehr, während die Chat-Antworten weiter von dort kommen können, wo sie am besten sind.
Embeddings lokal, Chat nach Bedarf: Diese Aufteilung bringt mehr Souveränität pro investierter Stunde als jede andere.
Genauso wichtig wie die Frage, wann es sich lohnt:
Bleibt dagegen etwas übrig, das wirklich im Haus bleiben muss, ist die Frage nach dem Break-even beantwortet, bevor du sie stellst.