Lokale KI-Systeme ohne Cloud-Abhängigkeit. Datenschutzkonform, unter deiner Kontrolle und auf Hardware, die wir für deine Modelle auslegen.
Prompt rein, Antwort raus – aber die Verarbeitung bleibt im On-Prem-Modell in Deutschland. Es gibt keine externen Aufrufe, deine Daten verlassen das Haus nicht.
DSGVO-konforme KI im eigenen Haus, mit klaren Einstiegspreisen. Den vollständigen TCO-Vergleich gegen Cloud-Inferenz samt interaktivem Rechner gibt es auf der Preise-Seite.
Den lokalen KI-Server gibt es auch im Leasing, mit planbarer Monatsrate statt einmaligem Invest. Zwei Ausbaustufen, sechs Laufzeiten, alle Werte netto zur Orientierung.
| Laufzeit | 96 GB VRAM · Rate/Monat | 96 GB VRAM · Gesamt | 192 GB VRAM (+10.000 €) · Rate/Monat | 192 GB VRAM (+10.000 €) · Gesamt |
|---|---|---|---|---|
| 24 Monate | 902 € | 21.654 € | 1.378 € | 33.063 € |
| 36 Monate | 607 € | 21.869 € | 935 € | 33.653 € |
| 48 Monate | 468 € | 22.466 € | 716 € | 34.391 € |
| 54 Monate | 422 € | 22.801 € | 646 € | 34.871 € |
| 60 Monate | 382 € | 22.944 € | 587 € | 35.240 € |
| 72 Monate | 329 € | 23.661 € | 501 € | 36.089 € |
Ein lokaler Server ist die technisch einfachste Variante, weil keine Daten an Dritte fließen und damit weder Auftragsverarbeitung noch Drittlandübermittlung entstehen. Konform wird er trotzdem erst durch Zugriffskontrolle, Protokollierung, Löschkonzept und dokumentierte technische und organisatorische Maßnahmen. Die Hardware allein ist Voraussetzung, aber kein Nachweis.
Rund 70 GB allein für die Gewichte, denn FP8 belegt ein Byte je Parameter. Dazu kommt der KV-Cache, der mit Kontextlänge und Batch-Größe wächst. Plane deshalb 90 bis 100 GB ein. In 4 Bit belegt dasselbe Modell rund 43 GB und passt auf eine 48-GB-Karte, solange der Kontext klein bleibt.
Bei Batch Size 1 die Bandbreite. Für jedes einzelne Token müssen die kompletten Modellgewichte einmal durch den Speicher. Die Obergrenze ist Bandbreite geteilt durch Modellgröße, mal etwa 70 Prozent erreichbarer Effizienz. 20 GB Gewichte an 120 GB/s ergeben so höchstens gut vier Tokens pro Sekunde.
Ein schlüsselfertiger Einstieg mit 96 GB VRAM und 8 TB Speicher liegt bei 18.000 Euro netto. Die Erweiterung auf 192 GB VRAM kostet rund 10.000 Euro zusätzlich. Managed Betrieb beginnt bei 750 Euro im Monat. Auf vorhandener Hardware startet ein Proof of Concept ab etwa 10.000 Euro.
Ja. Wir bewerten bestehende Systeme in der Analyse und beziehen sie ein, wo es sinnvoll ist. Nicht jedes Vorhaben braucht neue Hardware. Ein Proof of Concept auf vorhandenen Servern kostet ab etwa 10.000 Euro für Einbau, Netzwerk und Software und zeigt belastbar, ob der Ansatz trägt.
Ob GPU Cluster, verteilter Storage, Proxmox Migration oder Cyber Resilience. Wir sprechen über dein System und zeigen konkrete Schritte.