Private Modell-Endpunkte.
Auf GPUs, die für dich reserviert sind.

Models as a Service rechnen wir pro GPU und Monat ab, nicht pro Token. Wir betreiben gpt-oss, Llama, Mistral oder deine eigenen Gewichte auf GPUs, die in Deutschland für dich reserviert sind. Du nutzt sie über eine private, OpenAI-kompatible API.

Auf Anfrage verfügbar. Kapazität und Starttermin bestätigen wir dir pro Anfrage.

Keine Token-Rechnung.

Du zahlst pro GPU und Monat. Schick so viele Tokens, wie deine GPUs verarbeiten, auf der Rechnung taucht keiner davon auf.

Nur dein Traffic.

Die reservierten GPUs gehören exklusiv dir und beantworten deine Anfragen und keine anderen. Prompts und Antworten werden nie für Training verwendet.

Base URL tauschen.

Die API ist OpenAI-kompatibel. Bestehende Clients, SDKs und Frameworks funktionieren, sobald du Base URL und Key änderst.

So funktioniert es.
In drei Schritten zum Endpunkt.

01

Modelle und GPUs wählen.

Wähl offene Modelle aus dem Katalog oder bring deine eigenen Gewichte mit. Die GPU-Anzahl legen wir gemeinsam fest.

02

Wir richten sie ein und betreiben sie.

enum installiert den Inferenz-Stack auf deinen reservierten GPUs in Deutschland, betreibt ihn und hält ihn aktuell.

03

Endpunkt aufrufen.

Nutz einen beliebigen OpenAI-kompatiblen Client mit deiner privaten Base URL und deinem API-Key.

$ curl https://YOUR-ENDPOINT/v1/chat/completions \
    -H "Authorization: Bearer $ENUM_API_KEY" \
    -H "Content-Type: application/json" \
    -d '{"model": "gpt-oss-120b",
         "messages": [{"role": "user", "content": "Fass diesen Vertrag zusammen."}]}'

Was enum übernimmt.
Damit dein Team die Anwendung bauen kann.

  • Inferenz-Server, NVIDIA-Treiber und CUDA auf den reservierten GPUs
  • Deployment der Modelle und Versionswechsel, wenn du sie anforderst
  • API-Keys für deine Anwendungen
  • Monitoring des Inferenz-Stacks

Die Modelle.
Offene Gewichte, die du kennst.

Wir starten mit den Modellen, nach denen Unternehmen in Deutschland am häufigsten fragen. Jedes läuft nur auf den GPUs von enum in Deutschland, keine Anfrage geht an den Hersteller des Modells.

ModellHerstellerLizenzGPUs (RTX PRO 6000, 96 GB)
gpt-oss-120bOpenAIApache 2.01 (MXFP4)
gpt-oss-20bOpenAIApache 2.01
Llama 3.3 70BMetaLlama 3.3 Community License1 in FP8 mit begrenztem Kontext, 2 für längeren Kontext
Mistral Small 24BMistral AIApache 2.01
Qwen3 32BOffene Gewichte. Läuft nur auf enum Servern in Deutschland, ohne Verbindung zum Hersteller.Qwen (Alibaba)Apache 2.01
DeepSeekGrößere DeepSeek-Modelle brauchen mehrere GPUs. Den Bedarf klären wir pro Anfrage.DeepSeekJe nach ModellAuf Anfrage
Deine eigenen GewichteDuDeineGemeinsam festgelegt

Die GPU-Angaben sind Richtwerte. Kontextlänge, Quantisierung und die Zahl paralleler Nutzer verändern den Bedarf, deshalb bestätigen wir ihn pro Anfrage.

Pro Token oder pro GPU?
Wann was passt.

Reservierte GPUs lohnen sich bei gleichmäßiger Last. Bei gelegentlicher oder stark schwankender Nutzung ist eine geteilte Token-API meist günstiger, und das sagen wir dir schon im ersten Gespräch.

Geteilte Token-APIReservierte GPUs bei enum
AbrechnungPro Million TokensPro GPU und Monat
Monatliche KostenSteigen mit der NutzungFest
Wer die GPUs nutztViele KundenNur deine Anfragen
Rate LimitsVom Anbieter festgelegtDurch deine GPU-Kapazität begrenzt
Eigene oder feinjustierte GewichteSelten möglichJa
Passt am besten zuPrototypen, wenig oder schwankendes VolumenInterne Assistenten mit stetiger Last, Dokument-Pipelines, Agenten

Deine Daten.
Nach deutschem Recht.

  • GPUs und Endpunkte in Frankfurt, bereitgestellt von der enum GmbH, einem deutschen Unternehmen ohne US-Mutterkonzern
  • Prompts und Antworten speichern wir standardmäßig nicht über die Antwort hinaus und verwenden sie nie für Training
  • Betriebslogs enthalten Metadaten wie Zeitstempel und Token-Anzahl, keine Inhalte
  • Ein Auftragsverarbeitungsvertrag nach DSGVO in jedem Vertrag
  • Model Cards und Lizenzen geben wir an dich weiter, für deine Dokumentation nach dem AI Act
VorhandenISO 27001 und EN 50600 (Rechenzentrum)Zertifikate des Rechenzentrumsbetreibers in Frankfurt.
In jedem VertragAuftragsverarbeitungsvertrag nach DSGVONach deutschem Recht, mit einem deutschen Unternehmen ohne US-Mutterkonzern.
Q4 2026ISO 27001 für enumIn Arbeit, Ziel ist Q4 2026.
2027BSI C5Für 2027 auf der Roadmap.

Wo Teams anfangen.
Richtwerte.

Pilot · 1 GPU

Ein Team, ein Modell, zum Beispiel gpt-oss-120b oder Mistral Small.

Abteilung · 2 bis 4 GPUs

Mehrere Teams, ein Modell der 70B-Klasse mit längerem Kontext oder ein Chat-Modell neben einem Embedding-Modell.

Unternehmensweit · 8 GPUs

Mehrere Modelle, viele parallele Nutzer und Reserve für Failover. Größere Setups auf Anfrage.

Nur Richtwerte. Jedes Setup dimensionieren wir pro Anfrage.

Anfrage senden

GPU-Anzahl, Kapazität und Starttermin bestätigen wir nach einem kurzen Abstimmungsgespräch. Preise auf Anfrage.

Wir verwenden deine Angaben nur, um deine Anfrage zu beantworten und ein Angebot vorzubereiten (Art. 6 Abs. 1 lit. b DSGVO). Mehr dazu in unserer Datenschutzerklärung.

Fragen.
Zu privaten Modell-Endpunkten.

Wird pro Token abgerechnet?

Nein. Du zahlst pro GPU und Monat. Tokens stellen wir nicht in Rechnung, du kannst also so viele schicken, wie deine reservierten GPUs verarbeiten. Brauchst du mehr Durchsatz, kommen GPUs dazu.

Was bedeutet "Models as a Service" bei enum?

enum betreibt offene Modelle für dich auf GPUs, die für dich reserviert sind, und du zahlst pro GPU und Monat. Manche Anbieter meinen mit dem Begriff eine geteilte API mit Abrechnung pro Token, bei uns ist es die reservierte Variante mit Abrechnung pro GPU. Willst du die Modelle selbst betreiben, reservierst du GPUs und bringst deinen eigenen Stack mit.

Ist das dasselbe wie Dedicated Inference Endpoints?

Fast. Andere Anbieter nennen das Dedicated Endpoints oder Dedicated Inference: ein Modell auf GPUs, die nur deine Anfragen bedienen. Bei enum sind die GPUs für dein Projekt reserviert und werden pro Monat abgerechnet statt pro GPU-Stunde.

Wer kann unsere Prompts sehen?

Deine Anfragen werden auf deinen reservierten GPUs in Deutschland verarbeitet. Prompts und Antworten speichern wir standardmäßig nicht über die Antwort hinaus, und wir verwenden sie nie für Training. Betriebslogs enthalten Metadaten wie Zeitstempel und Token-Anzahl, keine Inhalte.

Können wir unser eigenes feinjustiertes Modell nutzen?

Ja. Schick uns die Gewichte oder nenn uns einen Bucket in deinem enum Object Storage, dann betreiben wir sie wie jedes Modell aus dem Katalog. Die Gewichte bleiben deine, und du nimmst sie mit, wenn du gehst.

Schicken Qwen oder DeepSeek Daten nach China?

Nein. Offene Gewichte sind Dateien: Wir laden sie auf die GPUs von enum in Deutschland und betreiben sie dort. Das Modell hat keine Verbindung zu seinem Hersteller, und deine Daten verlassen enum nicht. Qwen ist im Katalog, DeepSeek gibt es auf Anfrage.

Wo laufen die Modelle?

In Frankfurt. Das Rechenzentrum ist nach ISO 27001 und EN 50600 zertifiziert. Diese Zertifikate hält der Betreiber des Rechenzentrums.

Wie schnell können wir starten, und was kostet es?

Models as a Service gibt es auf Anfrage. Für jede Anfrage bestätigen wir Kapazität, Starttermin und den Preis pro GPU und Monat. Preise auf Anfrage.

Ist das DSGVO-konform?

Die Verarbeitung findet in Deutschland statt, mit einem Auftragsverarbeitungsvertrag nach DSGVO mit der enum GmbH, einem deutschen Unternehmen ohne US-Mutterkonzern. Ob ein konkreter Einsatz zulässig ist, entscheidest du als Verantwortlicher. Die Unterlagen für deinen Datenschutzbeauftragten bekommst du von uns.

Deine eigene Modell-API.
Mit uns geplant.

Sag uns, welche Modelle du brauchst, wie viele Leute sie nutzen und ab wann. Wir bestätigen GPUs, Starttermin und Preis.