Private Modell-Endpunkte.
Auf GPUs, die für dich reserviert sind.
Models as a Service rechnen wir pro GPU und Monat ab, nicht pro Token. Wir betreiben gpt-oss, Llama, Mistral oder deine eigenen Gewichte auf GPUs, die in Deutschland für dich reserviert sind. Du nutzt sie über eine private, OpenAI-kompatible API.
Auf Anfrage verfügbar. Kapazität und Starttermin bestätigen wir dir pro Anfrage.
Keine Token-Rechnung.
Du zahlst pro GPU und Monat. Schick so viele Tokens, wie deine GPUs verarbeiten, auf der Rechnung taucht keiner davon auf.
Nur dein Traffic.
Die reservierten GPUs gehören exklusiv dir und beantworten deine Anfragen und keine anderen. Prompts und Antworten werden nie für Training verwendet.
Base URL tauschen.
Die API ist OpenAI-kompatibel. Bestehende Clients, SDKs und Frameworks funktionieren, sobald du Base URL und Key änderst.
So funktioniert es.
In drei Schritten zum Endpunkt.
Modelle und GPUs wählen.
Wähl offene Modelle aus dem Katalog oder bring deine eigenen Gewichte mit. Die GPU-Anzahl legen wir gemeinsam fest.
Wir richten sie ein und betreiben sie.
enum installiert den Inferenz-Stack auf deinen reservierten GPUs in Deutschland, betreibt ihn und hält ihn aktuell.
Endpunkt aufrufen.
Nutz einen beliebigen OpenAI-kompatiblen Client mit deiner privaten Base URL und deinem API-Key.
$ curl https://YOUR-ENDPOINT/v1/chat/completions \
-H "Authorization: Bearer $ENUM_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model": "gpt-oss-120b",
"messages": [{"role": "user", "content": "Fass diesen Vertrag zusammen."}]}'Was enum übernimmt.
Damit dein Team die Anwendung bauen kann.
- Inferenz-Server, NVIDIA-Treiber und CUDA auf den reservierten GPUs
- Deployment der Modelle und Versionswechsel, wenn du sie anforderst
- API-Keys für deine Anwendungen
- Monitoring des Inferenz-Stacks
Die Modelle.
Offene Gewichte, die du kennst.
Wir starten mit den Modellen, nach denen Unternehmen in Deutschland am häufigsten fragen. Jedes läuft nur auf den GPUs von enum in Deutschland, keine Anfrage geht an den Hersteller des Modells.
| Modell | Hersteller | Lizenz | GPUs (RTX PRO 6000, 96 GB) |
|---|---|---|---|
| gpt-oss-120b | OpenAI | Apache 2.0 | 1 (MXFP4) |
| gpt-oss-20b | OpenAI | Apache 2.0 | 1 |
| Llama 3.3 70B | Meta | Llama 3.3 Community License | 1 in FP8 mit begrenztem Kontext, 2 für längeren Kontext |
| Mistral Small 24B | Mistral AI | Apache 2.0 | 1 |
| Qwen3 32BOffene Gewichte. Läuft nur auf enum Servern in Deutschland, ohne Verbindung zum Hersteller. | Qwen (Alibaba) | Apache 2.0 | 1 |
| DeepSeekGrößere DeepSeek-Modelle brauchen mehrere GPUs. Den Bedarf klären wir pro Anfrage. | DeepSeek | Je nach Modell | Auf Anfrage |
| Deine eigenen Gewichte | Du | Deine | Gemeinsam festgelegt |
Die GPU-Angaben sind Richtwerte. Kontextlänge, Quantisierung und die Zahl paralleler Nutzer verändern den Bedarf, deshalb bestätigen wir ihn pro Anfrage.
Pro Token oder pro GPU?
Wann was passt.
Reservierte GPUs lohnen sich bei gleichmäßiger Last. Bei gelegentlicher oder stark schwankender Nutzung ist eine geteilte Token-API meist günstiger, und das sagen wir dir schon im ersten Gespräch.
| Geteilte Token-API | Reservierte GPUs bei enum | |
|---|---|---|
| Abrechnung | Pro Million Tokens | Pro GPU und Monat |
| Monatliche Kosten | Steigen mit der Nutzung | Fest |
| Wer die GPUs nutzt | Viele Kunden | Nur deine Anfragen |
| Rate Limits | Vom Anbieter festgelegt | Durch deine GPU-Kapazität begrenzt |
| Eigene oder feinjustierte Gewichte | Selten möglich | Ja |
| Passt am besten zu | Prototypen, wenig oder schwankendes Volumen | Interne Assistenten mit stetiger Last, Dokument-Pipelines, Agenten |
Deine Daten.
Nach deutschem Recht.
- GPUs und Endpunkte in Frankfurt, bereitgestellt von der enum GmbH, einem deutschen Unternehmen ohne US-Mutterkonzern
- Prompts und Antworten speichern wir standardmäßig nicht über die Antwort hinaus und verwenden sie nie für Training
- Betriebslogs enthalten Metadaten wie Zeitstempel und Token-Anzahl, keine Inhalte
- Ein Auftragsverarbeitungsvertrag nach DSGVO in jedem Vertrag
- Model Cards und Lizenzen geben wir an dich weiter, für deine Dokumentation nach dem AI Act
Wo Teams anfangen.
Richtwerte.
Pilot · 1 GPU
Ein Team, ein Modell, zum Beispiel gpt-oss-120b oder Mistral Small.
Abteilung · 2 bis 4 GPUs
Mehrere Teams, ein Modell der 70B-Klasse mit längerem Kontext oder ein Chat-Modell neben einem Embedding-Modell.
Unternehmensweit · 8 GPUs
Mehrere Modelle, viele parallele Nutzer und Reserve für Failover. Größere Setups auf Anfrage.
Nur Richtwerte. Jedes Setup dimensionieren wir pro Anfrage.
Anfrage senden
GPU-Anzahl, Kapazität und Starttermin bestätigen wir nach einem kurzen Abstimmungsgespräch. Preise auf Anfrage.
Fragen.
Zu privaten Modell-Endpunkten.
Wird pro Token abgerechnet?
Nein. Du zahlst pro GPU und Monat. Tokens stellen wir nicht in Rechnung, du kannst also so viele schicken, wie deine reservierten GPUs verarbeiten. Brauchst du mehr Durchsatz, kommen GPUs dazu.
Was bedeutet "Models as a Service" bei enum?
enum betreibt offene Modelle für dich auf GPUs, die für dich reserviert sind, und du zahlst pro GPU und Monat. Manche Anbieter meinen mit dem Begriff eine geteilte API mit Abrechnung pro Token, bei uns ist es die reservierte Variante mit Abrechnung pro GPU. Willst du die Modelle selbst betreiben, reservierst du GPUs und bringst deinen eigenen Stack mit.
Ist das dasselbe wie Dedicated Inference Endpoints?
Fast. Andere Anbieter nennen das Dedicated Endpoints oder Dedicated Inference: ein Modell auf GPUs, die nur deine Anfragen bedienen. Bei enum sind die GPUs für dein Projekt reserviert und werden pro Monat abgerechnet statt pro GPU-Stunde.
Wer kann unsere Prompts sehen?
Deine Anfragen werden auf deinen reservierten GPUs in Deutschland verarbeitet. Prompts und Antworten speichern wir standardmäßig nicht über die Antwort hinaus, und wir verwenden sie nie für Training. Betriebslogs enthalten Metadaten wie Zeitstempel und Token-Anzahl, keine Inhalte.
Können wir unser eigenes feinjustiertes Modell nutzen?
Ja. Schick uns die Gewichte oder nenn uns einen Bucket in deinem enum Object Storage, dann betreiben wir sie wie jedes Modell aus dem Katalog. Die Gewichte bleiben deine, und du nimmst sie mit, wenn du gehst.
Schicken Qwen oder DeepSeek Daten nach China?
Nein. Offene Gewichte sind Dateien: Wir laden sie auf die GPUs von enum in Deutschland und betreiben sie dort. Das Modell hat keine Verbindung zu seinem Hersteller, und deine Daten verlassen enum nicht. Qwen ist im Katalog, DeepSeek gibt es auf Anfrage.
Wo laufen die Modelle?
In Frankfurt. Das Rechenzentrum ist nach ISO 27001 und EN 50600 zertifiziert. Diese Zertifikate hält der Betreiber des Rechenzentrums.
Wie schnell können wir starten, und was kostet es?
Models as a Service gibt es auf Anfrage. Für jede Anfrage bestätigen wir Kapazität, Starttermin und den Preis pro GPU und Monat. Preise auf Anfrage.
Ist das DSGVO-konform?
Die Verarbeitung findet in Deutschland statt, mit einem Auftragsverarbeitungsvertrag nach DSGVO mit der enum GmbH, einem deutschen Unternehmen ohne US-Mutterkonzern. Ob ein konkreter Einsatz zulässig ist, entscheidest du als Verantwortlicher. Die Unterlagen für deinen Datenschutzbeauftragten bekommst du von uns.
Deine eigene Modell-API.
Mit uns geplant.
Sag uns, welche Modelle du brauchst, wie viele Leute sie nutzen und ab wann. Wir bestätigen GPUs, Starttermin und Preis.