CHECKPOINT-E
Ratgeber · KI

Lokale KI im Unternehmen: Welche Hardware wird gebraucht?

Checkpoint-E · Stand Oktober 2026 · Lesezeit etwa 6 Minuten

Ein lokales Sprachmodell braucht vor allem eines: genug schnellen Speicher auf der Grafikkarte. Wie viel, hängt von der Modellgröße, der gewünschten Qualität und der Zahl gleichzeitiger Nutzer ab.

Warum der Grafikspeicher entscheidet

Beim Betrieb eines Sprachmodells müssen dessen Parameter, die gelernten Gewichte, im Speicher liegen. Grafikprozessoren (GPUs) berechnen die Antworten um ein Vielfaches schneller als normale Prozessoren, allerdings nur, wenn das Modell in ihren Speicher (VRAM) passt. Reicht der Speicher nicht, wird das System stark ausgebremst.

Faustregeln für die Modellgröße

Die Größe eines Modells wird in Milliarden Parametern angegeben. Durch Quantisierung, also die Speicherung der Gewichte mit weniger Bits, sinkt der Speicherbedarf deutlich, bei meist geringem Qualitätsverlust. Als grobe Orientierung bei 4-Bit-Quantisierung:

ModellgrößeGrafikspeicher (ca.)Typischer Einsatz
7 bis 9 Mrd. Parameter8 bis 12 GBKlassifizieren, Zusammenfassen, einfache Assistenten
12 bis 14 Mrd. Parameter12 bis 16 GBGute deutsche Texte, Dokumentensuche
27 bis 32 Mrd. Parameter24 bis 32 GBAnspruchsvolle Texte, komplexere Auswertungen
70 Mrd. Parameter und mehr48 GB und mehr, oft mehrere GPUsHöchste Qualität, viele Nutzer

Hinzu kommt Speicher für den Kontext, also die Textmenge, die das Modell gleichzeitig verarbeitet. Lange Dokumente und viele parallele Anfragen erhöhen den Bedarf.

Typische Konfigurationen

  • Kleines Büro, wenige Nutzer: Arbeitsplatzrechner oder kleiner Server mit einer Grafikkarte mit 16 bis 24 GB Speicher.
  • Mittelständler, Abteilungsbetrieb: Server mit ein oder zwei professionellen GPUs mit zusammen 48 GB oder mehr, 128 GB Arbeitsspeicher, schnelle NVMe-SSDs.
  • Viele Nutzer, große Modelle: Mehrere GPUs, Betrieb über vLLM mit paralleler Verarbeitung.

Was außer der GPU wichtig ist

  • Arbeitsspeicher: mindestens so viel wie Grafikspeicher, besser das Doppelte.
  • SSD: Modelle umfassen viele Gigabyte; NVMe-SSDs verkürzen die Ladezeiten.
  • Netzteil und Kühlung: Leistungsstarke GPUs brauchen mehrere hundert Watt und gute Belüftung.
  • Dokumentensuche: Für RAG-Anwendungen kommen eine Vektordatenbank und ein kleineres Modell für die Suche hinzu.

Gebrauchte Server als Basis

Ausgemusterte Server aus Rechenzentren sind eine günstige Grundlage für lokale KI: stabile Netzteile, viel Arbeitsspeicher, Platz für mehrere Laufwerke. Mit einer passenden Grafikkarte nachgerüstet, laufen darauf viele Modelle zuverlässig. Wir stellen solche Systeme aus geprüften Beständen zusammen.

Software

Für den Betrieb haben sich Ollama und llama.cpp (einfach, sparsam) sowie vLLM (viele gleichzeitige Nutzer) bewährt. Als Oberfläche dient zum Beispiel Open WebUI. Für Spracherkennung kommt Whisper zum Einsatz, lokal und ohne Cloud.

Lokale KI für Ihr Unternehmen

Wir planen die passende Hardware, installieren das Modell und binden es an Ihre Abläufe an.

Kontakt

Beschreiben Sie kurz, was Sie vorhaben. Wir melden uns mit einer konkreten Einschätzung.

Zum Anfrageformular

Telefon030 417 17370
Mo–Fr 10–18 Uhr
E-MailE-Mail-Adresse von Checkpoint-E (als Bild)
AdresseCheckpoint-E
Danziger Straße 78a
10405 Berlin
Berlin-Prenzlauer Berg