Fragen & AntwortenWelche Hardware benötigt ein lokales LLM?
Die Antwort steckt in einem Wort: Grafikspeicher. Alles andere folgt daraus.

Entscheidend ist der Grafikspeicher, nicht der Prozessor. Kleine bis mittlere Modelle laufen auf einem kompakten Gerät mit KI-Beschleuniger oder einem aktuellen Mac mit viel gemeinsamem Speicher. Mittlere Modelle für mehrere Nutzer brauchen eine Grafikkarte mit 24 GB oder mehr, große Modelle einen Server mit mehreren Karten. Vieles davon lässt sich vorher mit einer Appliance testen.
Wann ist das sinnvoll?
Die Hardwarefrage wird konkret, sobald ein Unternehmen lokale KI dauerhaft betreiben will. Wer sie zu früh stellt, kauft nach Prospekt. Wer sie zu spät stellt, hat einen Pilot, der nicht in den Regelbetrieb skaliert. Der richtige Zeitpunkt ist nach einem ersten Test mit echten Aufgaben, wenn klar ist, welche Modellgröße die Aufgaben tatsächlich brauchen.
Wann ist es nicht sinnvoll?
Wer noch keinen Anwendungsfall hat, sollte keine Hardware kaufen. Ebenso wenig, wer nur gelegentlich unkritische Texte bearbeitet. In beiden Fällen ist ein Leihgerät oder eine europäische Cloud der bessere Anfang.
Voraussetzungen
Drei Größen bestimmen die Hardware: die Modellgröße in Milliarden Parametern, die Zahl gleichzeitiger Nutzer und die Länge der Eingaben, etwa bei Dokumentenfragen. Dazu kommt der Ort: ein leises Gerät im Büro, ein Server im Rack oder eine virtuelle Maschine mit durchgereichter Grafikkarte.
Möglichkeiten: die Geräteklassen
- Kompaktes Gerät mit KI-Beschleuniger. Ein Single-Board-Computer mit dediziertem Beschleuniger, NVMe-Speicher und aktiver Kühlung. Für kleine bis mittlere Modelle und ein Team. Das ist die Klasse der AI Appliance.
- Mac mit gemeinsamem Speicher. Aktuelle Macs teilen den Arbeitsspeicher zwischen Prozessor und Grafik. Mit 64 GB oder mehr laufen auch mittlere Modelle flüssig. Leise, sparsam, gut für ein Team.
- Server mit einer Grafikkarte. 24 GB Grafikspeicher oder mehr. Mittlere Modelle für eine Abteilung mit vielen gleichzeitigen Nutzern. Die übliche Wahl für den Regelbetrieb.
- Server mit mehreren Grafikkarten. Für große Modelle oder das ganze Unternehmen. Braucht Rack, Strom und Kühlung wie andere Rechenzentrumstechnik.
Vorteile
Hardware ist eine einmalige Ausgabe, die Nutzung danach frei. Die Geräteklassen bauen aufeinander auf: Was auf der Appliance läuft, läuft auf dem Server schneller. Und die Auswahl lässt sich mit einem Test absichern statt mit Annahmen.
Grenzen und Risiken
Grafikspeicher ist die knappe Ressource, und seine Preise schwanken. Wer zu klein kauft, bekommt langsame Antworten oder muss ein kleineres Modell nehmen. Wer zu groß kauft, zahlt für Reserven, die niemand nutzt. Sehr lange Eingaben, etwa ganze Verträge, brauchen zusätzlichen Speicher für den Kontext, den viele Rechnungen vergessen.
Beispiel
Ein Fertigungsbetrieb wollte Servicetechnikern Fragen an Wartungshandbücher ermöglichen. Im vierwöchigen Test auf einer Appliance zeigte sich: Ein Modell mittlerer Größe beantwortete die Fragen zuverlässig, ein kleineres nicht. Für die zwölf Techniker reichte danach ein Server mit einer Grafikkarte mit 24 GB. Ohne den Test wäre ein deutlich größerer Server bestellt worden, weil das Angebot des Anbieters vom größten Modell ausging.
Häufige Fragen
Reicht ein normaler Büro-PC für ein lokales LLM?
Für sehr kleine Modelle zum Ausprobieren ja, langsam. Für den Einsatz im Team nicht: Ohne dedizierten Grafikspeicher oder KI-Beschleuniger dauern Antworten zu lange.
Mac oder PC mit Grafikkarte?
Ein Mac mit viel gemeinsamem Speicher ist ein guter Einstieg für ein Team, leise und sparsam. Ein PC oder Server mit Grafikkarte ist schneller bei vielen gleichzeitigen Nutzern und lässt sich erweitern. Für den Regelbetrieb einer Abteilung ist der Server die übliche Wahl.
Wie viel Grafikspeicher für welches Modell?
Als Faustregel braucht ein quantisiertes Modell etwa so viele Gigabyte, wie es Milliarden Parameter hat, geteilt durch zwei, plus Reserve für den Kontext. Ein Modell mit 8 Milliarden Parametern läuft in 8 GB, eines mit 70 Milliarden braucht 40 GB oder mehr.
Brauchen wir mehrere Grafikkarten?
Nur für sehr große Modelle oder sehr viele gleichzeitige Nutzer. Die meisten Anwendungen im Mittelstand laufen mit einer Karte. Wichtiger als eine zweite Karte ist oft ein passendes, kleineres Modell.
Kann ich die Hardware vorher testen?
Ja. Eine Appliance zeigt in vier Wochen, welche Modellgröße Ihre Aufgaben brauchen und wie sich die Antwortzeit anfühlt. Danach lässt sich der Server sauber dimensionieren.
Fazit
Grafikspeicher ist der Maßstab. Kleine Teams starten mit einem kompakten Gerät oder einem Mac, Abteilungen mit einem Server und einer Grafikkarte, große Modelle brauchen mehrere. Die richtige Größe kennt man nach einem Test mit echten Aufgaben, nicht nach dem Prospekt.
Verwandte Fragen: Was kostet eine lokale Unternehmens-KI?, Kann man ChatGPT lokal im Unternehmen betreiben?, Welche Open-Source-KI eignet sich für Unternehmen?
AI Appliance
Vorkonfigurierte lokale KI-Umgebung, am selben Tag einsatzbereit. In vier Wochen mit echten Daten testen, dann entscheiden.
Zur AI Appliance