Leistung · Compute

GPU und HPC Cluster, die unter Volllast liefern

Wir planen und bauen Multi-GPU-Compute, High-Speed-Networking und Storage für AI, ML und Forschung. Von der einzelnen Node bis zum Cluster mit Dutzenden Karten.

Live-Schema · Slurm Job-Scheduling

So wandert ein Job von der Queue über den Scheduler auf freie GPU-Slots der Nodes und kommt am Ende als finished heraus. Genau dieses Prinzip planen wir mit Slurm für deine Workloads.

Auf einen Blick. Du bekommst Rechenleistung für KI und Simulation, die im eigenen Haus läuft und sich schnell rechnet, statt laufender Cloud-Mietkosten. Wir planen, bauen und betreiben das Ganze, du arbeitest direkt mit dem Engineer. Kosten und Stromverbrauch siehst du vorab im Konfigurator und auf der Preise-Seite.
Kurz erklärt. GPU-Cluster = viele Grafikkarten, die gemeinsam KI-Modelle trainieren. HPC = High-Performance-Computing, also Rechnen für Wissenschaft und Simulation. Slurm = verteilt Rechenjobs fair auf den Cluster. NVMe = besonders schnelle Flash-Speicher. InfiniBand / RDMA = latenzarmes Hochgeschwindigkeits-Netzwerk zwischen den Servern.
Was wir liefern

Compute, das für deine Workloads ausgelegt ist

  • Multi-GPU-ComputeRTX und Tesla Nodes, ausgelegt auf Training, Inferenz und Simulation. Dimensioniert nach echtem Bedarf, nicht nach Datenblatt.
  • High-Speed-NetworkingInfiniBand und RDMA für niedrige Latenz zwischen den Nodes, damit verteilte Jobs nicht am Netzwerk hängen.
  • Workload-SchedulingSlurm und Container-Orchestrierung, sauber konfiguriert, damit Ressourcen fair und planbar verteilt werden.
  • Thermik und StromDurchdachtes thermisches Management und redundante Stromversorgung, damit der Cluster auch bei Dauerlast stabil bleibt.
gpu-cluster · node-status
nodes.online13 / 13
gpu.utilization94%
interconnectInfiniBand
schedulerslurm ready
$ srun --gpus=39 train.py
Typische Einsatzfelder

Wofür Kunden den Cluster nutzen

🧠

AI Modell-Training

Verteiltes Training großer Modelle über mehrere GPUs, mit Datendurchsatz, der die Karten auch wirklich auslastet.

🔬

Forschung und Simulation

HPC-Workloads für Wissenschaft und Entwicklung, von numerischer Simulation bis zur Auswertung physikalischer Daten.

Inferenz im Betrieb

Produktive Inferenz-Plattformen mit planbarer Latenz und Auslastung, sauber überwacht und dokumentiert.

Verfügbarkeit & Lieferzeit. GPU- und HPC-Hardware ist lieferbar, Auslieferung in der Regel 3 bis 5 Werktage nach Bestellung, Express innerhalb 1 Werktag möglich. Konkrete Modelle und Konfiguration stimmen wir im Infrastructure Check ab.
Preise & TCO

Was ein GPU-Cluster kostet

Transparente Größenordnungen statt "auf Anfrage". Den vollständigen Vergleich On-Premise gegen Cloud über 36 Monate samt interaktivem Rechner gibt es auf der Preise-Seite.

ab 470.000 €
Schlüsselfertiger HPC/HCI-Cluster
8× NVIDIA B200 (1.440 GB VRAM), 96 TB NVMe, 400G-Networking, aufgebaut und integriert.
ab 2.500 € /Monat
Managed Betrieb
Verwaltung, Wartung und Monitoring der Cluster-Infrastruktur.
ab ~10.000 €
Setup ohne Hardware
Standard-4-Node-Aufbau samt Netzwerk- und Software-Konfiguration, wenn Hardware vorhanden ist.
Häufige Fragen

Was Kunden vor dem Clusterkauf fragen

Was kostet ein GPU-Cluster mit acht GPUs?+

Ein schlüsselfertiger Cluster mit acht NVIDIA B200 liegt bei rund 470.000 Euro netto: 452.600 Euro Hardware, 3.000 Euro Netzwerk und 14.400 Euro Aufbau zu 180 Euro je Stunde. Der laufende Betrieb beginnt bei 2.500 Euro im Monat. Stand August 2026, Hardwarepreise sind volatil.

Ab welcher Auslastung lohnt sich ein eigener Cluster gegenüber der Cloud?+

Bei einem 8-GPU-Cluster liegt die Schwelle gegenüber stark rabattierten GPU-Cloud-Anbietern bei rund 47 Prozent Auslastung über 36 Monate. Wer seine GPUs dauerhaft braucht, amortisiert die eigene Hardware nach etwa 15 Monaten. Wer nur stundenweise rechnet, fährt mit der Cloud günstiger und sollte nicht kaufen.

Welche GPUs verbaut ihr?+

Je nach Workload NVIDIA B200 mit 180 GB, RTX PRO 6000 mit 96 GB, RTX PRO 5000 mit 48 GB, L40S mit 48 GB oder H200 NVL mit 141 GB. Für verteiltes Training zählen VRAM und Interconnect, für Inferenz vor allem die Speicherbandbreite. Wir wählen nach dem tatsächlichen Bedarf, nicht nach Datenblatt-Prestige.

Braucht ein GPU-Cluster zwingend InfiniBand?+

Nur wenn Jobs über mehrere Nodes hinweg synchron rechnen. Bei verteiltem Training mit häufigem Gradient-Austausch entscheidet ein Low-Latency-Fabric über die Skalierung. Wer einzelne Jobs pro Node fährt, etwa bei Inferenz, kommt mit 100G oder 200G Ethernet aus und spart einen erheblichen Teil der Netzwerkkosten.

Wie viel Strom zieht so ein Cluster?+

Ein Cluster mit acht NVIDIA B200 liegt bei rund 10,2 kW Anschlussleistung allein auf dem GPU-Baseboard. Bei Dauerbetrieb und 0,25 Euro je Kilowattstunde sind das etwa 1.860 Euro Stromkosten im Monat. Dichte Zuschnitte mit acht GPUs je Node erreichen so leicht 10 kW und mehr, dann wird die Kühlung zum planerischen Hauptthema.

Wie lange dauert es, bis der Cluster produktiv läuft?+

Hardware ist in der Regel drei bis fünf Werktage nach Bestellung lieferbar, bei dringendem Bedarf per Express innerhalb eines Werktags. Für Aufbau sowie Netzwerk- und Software-Konfiguration eines 8-GPU-Clusters rechnen wir rund 80 Stunden. Von der Bestellung bis zum produktiven Betrieb sind das typischerweise zwei bis drei Wochen.

Bereit für Infrastruktur, die hält?

Ob GPU Cluster, verteilter Storage, Proxmox Migration oder Cyber Resilience. Wir sprechen über dein System und zeigen konkrete Schritte.