Reservierte GPUs.
Für den Stack, den du betreibst.
NVIDIA RTX PRO 6000 Blackwell mit 96 GB pro GPU, für dich in Deutschland reserviert und pro GPU und Monat abgerechnet. Modelle, Trainingsjobs und Container bringst du mit. Hardware und Netz betreiben wir.
Auf Anfrage verfügbar. Kapazität und Starttermin bestätigen wir dir pro Anfrage.
Nur für dich.
Deine GPUs sind für die gesamte Vertragslaufzeit für dich reserviert und exklusiv: Kein anderer Kunde betreibt darauf Workloads, und ein Trainingslauf wartet nie auf freie Kapazität.
Fester Betrag pro Monat.
Abgerechnet pro GPU und Monat. Die Rechnung hängt nicht davon ab, wie viele Stunden oder Tokens du verbrauchst.
Als VM oder Kubernetes-Node.
Du bekommst die GPUs als VMs mit Root-Zugang oder als GPU-Nodes in deinem enum Kubernetes-Cluster, direkt neben deinem Object Storage. Beides auf Anfrage.
Ein GPU-Typ.
Passend für offene Modelle.
Wir bieten eine GPU an: die NVIDIA RTX PRO 6000 Blackwell. Mit 96 GB pro Karte laufen gpt-oss-120b, Mistral Small und Qwen3 32B jeweils auf einer einzigen GPU.
| Größe | GPU-Speicher | Preis |
|---|---|---|
| 1 GPU | 96 GB | Auf Anfrage |
| 2 GPUs | 192 GB | Auf Anfrage |
| 4 GPUs | 384 GB | Auf Anfrage |
| 8 GPUs | 768 GB | Auf Anfrage |
| Mehr als 8 | Auf Anfrage | Auf Anfrage |
Richtwerte, jeweils als VM oder als GPU-Nodes in deinem enum Kubernetes-Cluster, alle mit NVIDIA RTX PRO 6000 Blackwell (96 GB GDDR7 mit ECC). Laufzeit, Kapazität und Starttermin bestätigen wir pro Anfrage. Preise auf Anfrage.
Dein Stack.
Auf einer VM oder auf Kubernetes.
Du nimmst die GPUs als VMs mit Root-Zugang und installierst, was du brauchst, oder als GPU-Node-Pool in deinem enum Kubernetes-Cluster. Dort fordern Workloads sie über die Standard-Ressource nvidia.com/gpu an, vLLM, Ollama, PyTorch-Jobs und deine Helm-Charts laufen ohne Anpassung. Beides gibt es auf Anfrage, und wir richten es gemeinsam mit deinem Team ein.
# vllm.yaml (excerpt)
containers:
- name: vllm
image: vllm/vllm-openai
args: ["--model", "openai/gpt-oss-120b"]
resources:
limits:
nvidia.com/gpu: 1Was Teams darauf betreiben.
Eigene Modelle, nach eigenen Regeln.
Inferenz in eigener Regie.
Offene oder hauseigene Modelle mit vLLM, TGI oder Triton ausliefern, mit deinem eigenen Scaling und Monitoring.
Fine-Tuning.
Offene Modelle per LoRA an deine Daten anpassen, kleinere Modelle auch vollständig. Die Trainingsdaten bleiben in deinem Object Storage in Deutschland.
Batch-Jobs.
Embeddings für große Dokumentbestände, Transkription, Klassifizierung: Arbeit, die stundenlang läuft, auf einer GPU, die nur dir zur Verfügung steht.
Die Hardware.
In Zahlen.
Vertrag und Compliance.
Wo wir stehen.
Anfrage senden
GPU-Anzahl, Kapazität und Starttermin bestätigen wir nach einem kurzen Abstimmungsgespräch. Preise auf Anfrage.
Fragen.
Zu reservierten GPUs.
Welche GPUs bietet enum an?
Die NVIDIA RTX PRO 6000 Blackwell mit 96 GB GDDR7-Speicher pro GPU. Reservieren kannst du ab einer GPU.
Wie schnell können wir starten?
Reservierte GPUs gibt es auf Anfrage. Sag uns, wie viele GPUs du ab wann brauchst, dann bestätigen wir Kapazität und Starttermin für deine Anfrage.
Was kostet das?
Du zahlst pro GPU und Monat, in Euro. Den Preis nennen wir dir zusammen mit Kapazität und Starttermin, er ist also auf Anfrage.
Ist das dedizierte Hardware?
Deine GPUs sind für die Vertragslaufzeit für dich reserviert und exklusiv: Kein anderer Kunde betreibt darauf Workloads. Netz, Speicher und Kubernetes Control Planes drumherum laufen auf der gemeinsam genutzten Public-Cloud-Plattform von enum.
Wie nutzen wir die GPUs?
Als GPU-VMs oder als GPU-Nodes in deinem enum Kubernetes-Cluster, beides auf Anfrage. Auf einer VM hast du Root-Zugang und installierst deinen eigenen Stack. Auf Kubernetes fordern Pods die GPUs über nvidia.com/gpu an, deinen Inferenz-Server oder Trainingsjob deployst du wie jeden anderen Workload.
Welche Modelle passen auf eine GPU?
Mit 96 GB passen gpt-oss-120b (MXFP4), gpt-oss-20b, Mistral Small 24B und Qwen3 32B jeweils auf eine GPU. Llama 3.3 70B läuft in FP8 mit begrenztem Kontext auf einer GPU, für längeren Kontext oder mehr Nutzer planst du zwei. Das sind Richtwerte: Kontextlänge und Zahl paralleler Anfragen verändern den Bedarf.
Wo stehen die GPUs?
In Frankfurt. Das Rechenzentrum ist nach ISO 27001 und EN 50600 zertifiziert. Diese Zertifikate hält der Betreiber des Rechenzentrums. Die enum GmbH ist ein deutsches Unternehmen ohne US-Mutterkonzern, der US CLOUD Act erstreckt sich deshalb nicht auf die Daten darauf.
Gibt es eine Mindestlaufzeit?
Die Laufzeit stimmen wir pro Anfrage ab. Sag uns, wie lange du die GPUs brauchst, und das Angebot deckt genau diese Laufzeit ab.
Kann enum die Modelle auch für uns betreiben?
Ja. Bei Models as a Service betreibt enum den Inferenz-Stack auf denselben reservierten GPUs, mit privater, OpenAI-kompatibler API und derselben Abrechnung pro GPU.
GPUs in Deutschland gesucht?
Erzähl uns, was du betreibst.
Schick uns GPU-Anzahl, Zeitplan und was du darauf betreiben willst. Wir bestätigen Kapazität, Starttermin und Preis.