Modelle
Sprach-LLMs, Embeddings, Re-Ranker und Sprache (STT/TTS) — alle EU-gehostet.
SovrGPT verarbeitet jede Anfrage im europäischen Rechtsraum. Es gibt keinen US-Proxy und kein US-Gateway im kritischen Pfad.
Dafür gibt es zwei Betriebsarten, und der Unterschied ist für Sie vor allem eine Frage der Wartezeit:
- Selbstbetrieb — eigene GPUs in EU-Regionen. Die Endpunkte skalieren auf null herunter, wenn sie nicht gebraucht werden. Das drückt den Preis, erzeugt aber einen Kaltstart von einigen Minuten für die erste Anfrage nach einer Pause.
- Partner-Betrieb — Modelle, die auf unseren eigenen Karten nicht laufen (oder nicht wirtschaftlich laufen), betreiben europäische Partner: STACKIT (Schwarz Digital) in Deutschland und ein europäisches Partner-Rechenzentrum in Irland/Finnland mit vertraglich zugesicherter Nullspeicherung der Ein- und Ausgaben. Hier gibt es nichts hochzufahren — die Antwort beginnt sofort.
Beides ist über dieselbe OpenAI-kompatible API erreichbar; die Betriebsart steht bei jedem Modell in der Tabelle.
Der Katalog umfasst vier Modell-Klassen:
- Sprach-Modelle (LLMs) — sechs Tiers im Selbstbetrieb (Chat, Reasoning, Vision, Code) und vierzehn Modelle im europäischen Partner-Betrieb. 🔧 Korrigiert am 11.09.2026: hier stand „zehn Tiers … inkl. der dreistufigen Coding-Staffelung coder-mini / coder / coder-max". Von den drei Coding-Stufen ist nur
coder-minigeblieben; dazu sindpremiumunddefault-legacyzurückgezogen. Siehe die Tabelle „Zurückgezogen" weiter unten. - Embeddings & Re-Ranker — für Retrieval-Augmented-Generation (RAG).
- Text-to-Speech (TTS) —
supertonic-3, self-hosted in der EU. - Speech-to-Text (STT) — Voxtral (Mistral, Paris/EU).
Alle vier sind über die OpenAI-kompatible API adressierbar und im Chat direkt nutzbar.
Die wichtigsten Modelle
Diese sieben stehen in der Modellübersicht (Modelle in der Seitenleiste) in der ersten Reihe. Sie decken den Alltag ab; alles Weitere ist Spezialisierung.
Die Spalte Besonders gut für sagt, wofür Sie das Modell nehmen sollten — wenn Sie nur eine Spalte lesen, dann diese.
| Modell | Modell-ID | Betrieb | Besonders gut für | Kann | Warten |
|---|---|---|---|---|---|
| Gemma 4 12B | gemma-4-12b | 🇪🇺 Selbstbetrieb | Bilder und lange Dokumente auf eigener Hardware | Text + Bild, 262k Kontext, Werkzeuge, Denk-Schalter | Kaltstart ~5,5–9,5 min ᵐ |
| Qwen 3.8 27B | qwen3.8-27b | 🇪🇺 Selbstbetrieb | den Alltag, wenn es auf eigener Hardware laufen soll | Text, 131k Kontext, Werkzeuge, Denk-Schalter | Kaltstart ~11 min ᵐ |
| Qwen 3.8 27B · ohne Kaltstart | tensorx-qwen3.8-27b | 🇪🇺 Partner-RZ (IE/FI) | den Alltag ohne Wartezeit | dasselbe Modell wie die Zeile darüber | kein Kaltstart |
| GPT-OSS 120B | stackit-gpt-oss-120b | 🇩🇪 STACKIT | schwierige Fragen, bei denen Sie den Denk-Aufwand selbst steuern wollen | Text, Werkzeuge, Denk-Aufwand regelbar ⁸ | kein Kaltstart (129 ms ᵐ) |
| Qwen 3.8 Max | tensorx-qwen3.8-max | 🇪🇺 Partner-RZ (IE/FI) | das bestmögliche Ergebnis, wenn der Preis zweitrangig ist | Text, sehr großer Kontext, Werkzeuge, denkt immer mit | kein Kaltstart |
| Kimi K3 | tensorx-kimi-k3 | 🇪🇺 Partner-RZ (IE/FI) | lange Recherchen mit vielen Werkzeugschritten | Text, sehr großer Kontext, starkes Werkzeug-/Agentenverhalten, denkt immer mit | kein Kaltstart |
| GLM 5.3 | tensorx-glm-5.3 | 🇪🇺 Partner-RZ (IE/FI) | Programmieren — der stärkste offen veröffentlichte Stand ¹⁰ | Text, 131k Kontext, Werkzeuge, denkt immer mit | kein Kaltstart |
⁸ Denk-Aufwand regelbar heißt: Sie können pro Chat zwischen sparsam,
normal und gründlich wählen. Bei GPT-OSS 120B ist der Unterschied gemessen
Faktor 20 an der Länge des Gedankengangs — das stärkste Ergebnis im ganzen
Katalog. Über die API ist es das Feld reasoning_effort; welche Modelle es
unterstützen, listet GET /api/v1/models im Feld effort_levels.
Siehe Chat Completions.
🔑 Warum genau diese sieben? Zwei laufen auf unseren eigenen Karten (Souveränität, dafür Kaltstart), fünf im Partner-Betrieb (sofort, dafür nicht auf eigener Hardware). Jede Zeile deckt einen anderen Zweck ab — Alltag, Bilder, steuerbarer Denk-Aufwand, bestes Ergebnis, lange Werkzeugketten und seit 2026-08 Programmieren. Wer nicht wählen möchte, nimmt Auto — dann entscheidet SovrGPT anhand der ersten Frage.
🔑 Qwen 3.8 27B steht zweimal drin, und das ist Absicht. Es ist dasselbe Modell mit denselben Fähigkeiten; der einzige Unterschied ist, wo es läuft. Auf unserer eigenen Karte warten Sie nach einer Pause rund elf Minuten auf die erste Antwort, im Partner-Rechenzentrum gar nicht. Nehmen Sie den eigenen, wenn die Verarbeitung auf unserer Hardware laufen soll — und den anderen, wenn es schnell gehen muss.
Weitere Modelle
Alles darunter steht in der Übersicht im aufklappbaren Block „Weitere Modelle" und ist über die API unverändert adressierbar.
Im Partner-Betrieb (kein Kaltstart)
| Modell | Modell-ID | Betrieb | Herkunft der Gewichte | Lizenz | Besonderheit |
|---|---|---|---|---|---|
| Gemma 4 31B | stackit-gemma-4-31b | 🇩🇪 STACKIT | 🇺🇸 Google DeepMind | Apache 2.0 | Bild + Text, Betrieb in Deutschland — die einzige Kombination im Katalog ⁹ |
| Qwen 3.6 27B | stackit-qwen3.6-27b | 🇩🇪 STACKIT | 🇨🇳 Alibaba | Apache 2.0 | Allrounder, Verarbeitung in Deutschland |
| DeepSeek V4 Flash | tensorx-deepseek-v4-flash | 🇪🇺 Partner-RZ (IE/FI) | 🇨🇳 DeepSeek | MIT | günstigster Eintrag im Katalog |
| DeepSeek V4 Pro | tensorx-deepseek-v4-pro | 🇪🇺 Partner-RZ (IE/FI) | 🇨🇳 DeepSeek | MIT | starkes Schlussfolgern, sehr großer Kontext |
| Kimi K2.7 Code | tensorx-kimi-k2.7-code | 🇪🇺 Partner-RZ (IE/FI) | 🇨🇳 Moonshot AI | Modified MIT | auf Programmierung und Werkzeugketten ausgelegt |
| MiniMax M3 | tensorx-minimax-m3 | 🇪🇺 Partner-RZ (IE/FI) | 🇨🇳 MiniMax | ⚠️ ungeprüft | agentisch, sehr großer Kontext, niedriger Preis |
| GLM 5.2 | tensorx-glm-5.2 | 🇪🇺 Partner-RZ (IE/FI) | 🇨🇳 Z.ai | MIT | stark bei agentischen Aufgaben |
| GLM 5.3 | tensorx-glm-5.3 | 🇪🇺 Partner-RZ (IE/FI) | 🇨🇳 Z.ai | GLM-5.3 (MIT-artig) | stärkstes offen veröffentlichtes Modell für Programmierung ¹⁰ |
| GLM 5.3 Flash | tensorx-glm-5.3-flash | 🇪🇺 Partner-RZ (IE/FI) | 🇨🇳 Z.ai | MIT | schlanke GLM-5.3-Variante, sehr günstig ¹⁰ |
| Qwen 3.8 Flash | tensorx-qwen3.8-flash-next | 🇪🇺 Partner-RZ (IE/FI) | 🇨🇳 Alibaba | Qwen Community 1.0 ¹¹ | günstigster Eingabepreis im Katalog, 262k Kontext, Denk-Schalter |
⁹ Gemma 4 31B ist seit 2026-08 im Katalog. Gemessen: alle sieben Prüfstufen
bestanden, erste Token nach 208 ms, 65,8 Token/s, Denk-Schalter umschaltbar,
über 140 Sprachen. Es ist der einzige Eintrag, der Bildverständnis und
Betrieb in Deutschland zugleich bietet — im Selbstbetrieb kann Bilder nur der
vision-Tier (mit Kaltstart).
¹⁰ GLM 5.3 und GLM 5.3 Flash sind seit 2026-08 im Katalog. Beide bestehen den Werkzeug-Test auf allen drei Pfaden (frei gewählt, erzwungen, streamend) und antworten ohne Kaltstart in unter einer Sekunde. Beide denken immer mit — das lässt sich bei dieser Reihe nicht abschalten, deshalb erscheint im Modell-Wähler kein Denk-Schalter. Dass GLM 5.3 beim Programmieren führt, stützt sich auf Vergleichszahlen des Herstellers (Z.ai), nicht auf eine unabhängige Nachmessung; wir haben die Funktion geprüft, nicht die Platzierung. Zu den Lizenzen: GLM 5.3 Flash steht unter glattem MIT. GLM 5.3 unter einer eigenen, MIT-artigen Lizenz — volle Rechte zum Nutzen, Ändern und Weitergeben, mit einer einzigen Auflage, die erst ab 10 Mrd. USD Jahresumsatz greift und für das bloße Weiterleiten an fremd gehostete Modelle ohnehin nicht gilt.
¹¹ Qwen 3.8 Flash ist seit 2026-09 im Katalog. Gemessen: erste Antwort nach einer Sekunde (kein Kaltstart), Werkzeugaufrufe erzeugt es erzwungen und streamend zuverlässig, die System-Rolle wird befolgt, und der Denk-Schalter wirkt wirklich — mit ausgeschaltetem Denken ist der Denkteil leer, statt bloß in den sichtbaren Text zu wandern. Es ist ein großes, sparsam rechnendes Modell: 125 Mrd. Parameter, von denen je Token nur 6 Mrd. rechnen. Daher der Preis. Zur Lizenz: dieser Eintrag steht als einziger der Qwen-3.8-Reihe nicht unter Apache 2.0, sondern unter der Qwen Community License 1.0. Sie verlangt eine eigene Lizenz von Alibaba, wenn man selbst ein Modell-als-Dienst-Geschäft betreibt — nimmt das bloße Weiterleiten an fremd gehostete Modelle aber ausdrücklich aus, und genau das tun wir hier. Für den eigenen Betrieb dieser Gewichte gälte die Auflage; für die Nutzung über diesen Eintrag nicht.
⚠️ „Lizenz ungeprüft" heißt genau das: wir haben die Lizenzdatei dieser Gewichte nicht selbst gelesen. Für einen kommerziellen Einsatz mit Weitergabe-Absicht bitte vorher mit uns sprechen. Korrigiert 2026-08: Bei GLM 5.2 stand hier ebenfalls „ungeprüft" — die Lizenzdatei ist inzwischen nachgelesen und lautet MIT. Offen bleibt der Hinweis damit nur noch für MiniMax M3.
Im Selbstbetrieb (eigene GPUs, mit Kaltstart)
| Tier | Modell-ID | HF-Quelle | Herkunft | Index ² | Lizenz | Cold-Start | Status |
|---|---|---|---|---|---|---|---|
default | gemma-4-12b | google/gemma-4-12B-it | 🇺🇸 Google DeepMind | 22 | Apache 2.0 | ~5,5–9,5 min ᵐ ⁶ | aktiv ⁶ |
balanced | qwen3.8-27b | Qwen/Qwen3.8-27B-FP8 | 🇨🇳 Alibaba | n. gelistet | Apache 2.0 | ~11 min ᵐ ⁴ | aktiv ⁴ |
reasoning | qwen3.5-9b-deepseek-v4-flash | Jackrong/Qwen3.5-9B-DeepSeek-V4-Flash | 🇨🇳 Community-Distill | n. gelistet | Apache 2.0 | ~3,5 min ᵐ | aktiv |
vision | gemma-4-26b-a4b | google/gemma-4-26B-A4B-it | 🇺🇸 Google DeepMind | 26 | Apache 2.0 | ~2–4 min ᵐ ⁷ | aktiv ⁷ |
coder-mini | qwen3.6-35b-a3b | Qwen/Qwen3.6-35B-A3B-FP8 (MoE) | 🇨🇳 Alibaba | n. gelistet | Apache 2.0 | ~8 min ᵐ | aktiv |
llama | llama-3.1-8b | NousResearch/Meta-Llama-3.1-8B-Instruct | 🇺🇸 Meta | 8 | Llama Community | ~8 min ᵐ | Legacy ³ |
🅿️ Zurückgezogen — und was Ihre Integration jetzt bekommt
| Modell-ID | seit | Grund | Ihre Anfrage landet bei |
|---|---|---|---|
qwen3.5-35b-a3b (premium) | 2026-09-11 | Index 24 bei 8 192 Token Kontext — das kleinste Fenster im Katalog. Von der Quelle als veraltet geführt. | dem Standard-Tier |
qwen3-coder-next-fp8 (coder) | 2026-09-11 | Von qwen3.6-35b-a3b überholt: bessere Coding-Werte bei vierfachem Kontext und kürzerem Kaltstart. | dem Standard-Tier |
qwen3.5-9b (default-legacy) | 2026-09-11 | Qualitätsindex 22 — identisch mit dem Standard — bei 32 768 statt 262 144 Token Kontext. Sein einziger Vorteil war der kürzeste Kaltstart (205–215 s); seit ein neuer Chat auf einem Modell ohne Kaltstart startet, zählt der nicht mehr. | dem Standard-Tier |
deepseek-v4-flash (coder-max) | 2026-09-07 | Betriebskosten ohne Gegenwert; dasselbe Modell läuft als tensorx-deepseek-v4-flash ohne Kaltstart. | dem Standard-Tier |
🔑 Die ROLLENNAMEN zeigen dagegen auf die Nachfolger, nicht auf den Standard. Wer
coder, coding, qwen-coder oder qwen3-coder schickt, bekommt qwen3.6-35b-a3b — also
weiterhin ein Modell fürs Programmieren. qwen-premium und die alten 30B-Namen zeigen auf
qwen3.8-27b.
⚠️ Nur die exakte alte Modell-ID fällt auf den Standard — dann aber nicht stillschweigend:
die Antwort trägt x-sovrgpt-model-requested und x-sovrgpt-model-substituted
(siehe Chat Completions). Prüfen Sie diese Kopfzeile, wenn Sie
eine der drei IDs fest verdrahtet haben.
ᵐ Gemessen am Live-Endpunkt (2026-08-12, ein Lauf je Tier; default seit dem
Modellwechsel neu gemessen, drei Läufe am 2026-08-08/15/16).
Angegeben ist die Zeit, die der Nutzer wartet — sie enthält also auch das Warten
auf eine freie EU-GPU, nicht nur die reine Hochfahrzeit. Warm antwortet jedes
Modell in unter 5 Sekunden (default in unter 10).
⚠️ Vorher standen hier Schätzungen, und sie waren nicht durchweg zu
vorsichtig: default („30–90 s") war um Faktor 2,3–7 zu niedrig, llama
(„60–180 s") um Faktor 2,7, premium um gut ein Drittel — coder („8–15 min")
dagegen war zu hoch. Deshalb stehen hier jetzt Messwerte und keine Spannen.
¹ 🅿️ coder-max ist am 2026-09-07 zurückgezogen worden — die Fußnote hing
vorher an einer Katalogzeile, die es nicht mehr gibt. Sie bleibt stehen, weil der
Weg dorthin lehrreich ist: erst hiess es „aktiv (Beta)" mit einer
Kaltstart-Schätzung, dann „derzeit nicht nutzbar, wartet auf freie
H200-Kapazität". Beides war zu freundlich. Der Tier bekam durchaus Karten, lud
das Modell und stürzte danach im Engine-Init ab — und die volle Laufzeit
wurde abgerechnet. Vier Tage Ende August: 948 USD gegen sieben
beantwortete Anfragen über die gesamte Lebenszeit. Dasselbe Modell läuft als
tensorx-deepseek-v4-flash ohne Kaltstart und zu einem Bruchteil der Kosten.
⁶ Der default-Tier ist am 2026-08-16 gewechselt: von qwen3.5-9b
(Alibaba) auf gemma-4-12b (Google DeepMind). Ausschlaggebend war der
Kontext: 32 768 → 262 144 Token, also Faktor 8, bei gleichem Qualitätsindex
(22) und gleicher Hardwareklasse. Dazu steht damit erstmals ein zweiter
Gewichte-Anbieter im meistgenutzten Tier.
⚠️ Eine Sache wird schlechter, und wir sagen sie dazu: der Kaltstart. Gemessen
332–574 s gegen vorher 205–215 s. Warm antwortet der Tier unverändert in unter
10 Sekunden — die längere Wartezeit trifft nur die erste Anfrage nach einer Pause.
🔧 Korrigiert am 11.09.2026. Hier stand: „Genau deshalb bleibt das bisherige
Modell wählbar — als eigener Tier default-legacy (qwen3.5-9b), mit dem
kürzesten gemessenen Kaltstart im ganzen Katalog." Dieser Tier ist
zurückgezogen. Sein Argument ist nicht überstimmt, sondern weggefallen:
seit ein neuer Chat auf tensorx-qwen3.8-27b startet — gar kein Kaltstart —
ist „der kürzeste Kaltstart" kein Vorteil mehr.
⚠️ model: "qwen" löst weiterhin auf, jetzt aber auf qwen3.8-27b. Die
exakte Id qwen3.5-9b landet beim Standard-Tier (über die API:
404 model_withdrawn).
⁷ Der vision-Tier kann seit 2026-08-17 zusätzlich Werkzeuge und hat einen
Denk-Schalter. Beides lag nicht am Modell, sondern an zwei fehlenden
Startparametern des Endpunkts. Nachgemessen wurde auf allen Pfaden, die der Chat
tatsächlich benutzt — einschließlich des streamenden, für den vLLM eine
andere Parser-Methode aufruft als für den nicht-streamenden.
Konkret heißt das für Sie: Web-Suche, Bild-/Video-Erzeugung, Datei-Export und
MCP-Connectoren funktionieren jetzt auch dann, wenn Sie ein Bild im Chat haben.
Vorher wurden die Werkzeuge in diesem Tier stillschweigend fallen gelassen — die
Antwort kam, die Suche fand aber nicht statt. Im „Auto"-Modus wich das System
deshalb auf ein anderes Modell aus; das ist nun nicht mehr nötig, Sie behalten
das Bildverständnis. Der Kaltstart-Wert steht jetzt als Spanne aus drei
Messungen (131 s / 161 s / 232 s) statt als Einzelwert.
⁴ balanced läuft wieder — auf einem neu angelegten Rechenknoten (2026-08-15).
Der bisherige Knoten nahm Anfragen entgegen und teilte sie keinem Worker mehr
zu: 137 fehlgeschlagene gegen 30 erfolgreiche Aufträge, zuletzt über 900 s ohne
jeden Worker. Die Ursache lag beim GPU-Anbieter, nicht am Modell — belegt dadurch,
dass ein Knoten mit identischer Konfiguration sofort antwortet.
Der Kaltstart ist damit zum ersten Mal überhaupt gemessen: 487,8 s. Vorher
stand hier die Schätzung „60–180 s" — sie war um Faktor 2,7 bis 8 zu niedrig.
² Index = Artificial Analysis Intelligence Index, Stand 2026-08-08. Es ist die einzige Quelle, die diese Modelle in einem Testaufbau misst — nur deshalb sind die Werte untereinander vergleichbar. „n. gelistet" heißt: die Quelle führt das Modell nicht; wir schätzen dann keinen Wert. ⚠️ Der Index ist ein Aggregat über englischsprachige Tests und sagt nichts über deutsche Sprachqualität.
³ Legacy heißt: das Modell bleibt vollständig nutzbar und über die API adressierbar, ist aber nicht mehr die empfohlene Wahl für seine Rolle und läuft mittelfristig aus. Es gibt keinen harten Abschalttermin; bestehende Chats und Integrationen laufen unverändert weiter.
⁵ Korrektur 2026-08-15: In dieser Tabelle stand premium als Legacy. Das
war ein Widerspruch zum Produkt: im Katalog und in GET /api/v1/models ist der
Tier als aktiv geführt, und genau das ist die getroffene Entscheidung — es ist
der einzige Tier mit einer belegten deutschen Sprachwertung (Soofi-Paper,
Deutsch-Aggregat 87,6, der beste Wert im Vergleichsfeld). Er darf später Legacy
werden, ist es heute aber nicht.
Live-Stand jederzeit über GET /api/v1/models abrufbar — dort liefern die Felder
quality_index, origin_vendor, origin_country und lifecycle dieselben
Angaben maschinenlesbar. Siehe API-Referenz.
Embedding- & Rerank-Modelle (RAG)
Für Retrieval-Augmented-Generation-Pipelines stehen zusätzlich Embedding- und
Rerank-Modelle bereit — ebenfalls vollständig EU-souverän auf RunPod, ohne
US-Proxy. Adressierbar über die OpenAI-kompatible POST /api/v1/embeddings-
und die Cohere-kompatible POST /api/v1/rerank-Route.
| Typ | Modell-ID | HF-Quelle | Lizenz | Dimensionen |
|---|---|---|---|---|
| Embedding | bge-m3 | BAAI/bge-m3 | MIT | 1024 |
| Embedding | nomic-embed-code | nomic-ai/nomic-embed-code | Apache 2.0 | 3584 |
| Rerank | bge-reranker-base | BAAI/bge-reranker-base | Apache 2.0 | — |
bge-m3— Mehrsprachiges Dense-Embedding mit starker deutscher Retrieval-Qualität. Standard-Embedder; OpenAI-Aliase wietext-embedding-3-smallwerden automatisch hierauf gemappt.nomic-embed-code— Code-spezialisiertes Embedding für Repository-Suche und Code-RAG.bge-reranker-base— Cross-Encoder, der eine Kandidatenliste nach Relevanz zu einer Query neu ordnet. Ideal als zweite Stufe nach einer Embedding-Suche.
Diese Modelle sind ebenfalls Scale-to-Zero (Cold-Start 1–4 min, Modell-Pull) und
erscheinen mit kind: "embedding" bzw. kind: "rerank" in GET /api/v1/models.
Sprache: Speech-to-Text & Text-to-Speech (Voice)
SovrGPT spricht und hört — beides EU-souverän. Im Chat über das Mikrofon-Symbol (Diktat statt Tippen) und den Lautsprecher-Button („Vorlesen") an jeder Antwort; programmatisch über die OpenAI-kompatible Audio-API.
| Funktion | Modell-ID | Anbieter / Hosting | Sprachen | Kann |
|---|---|---|---|---|
| TTS — schnell | supertonic-3 | self-hosted, Railway europe-west4 | 31 inkl. Deutsch | 10 feste Stimmen, kein Cold-Start |
| TTS — expressiv + Cloning | cosyvoice-3 | self-hosted, RunPod-EU (GPU) | Deutsch nativ (+ en/fr/es/it/ru/…) | Emotion, Inline-Tags, eigene Stimme klonen |
| TTS — Alternative | voxtral-mini-tts | Mistral, Paris (DSGVO) | mehrsprachig | Fallback |
| Speech-to-Text (STT) | voxtral-mini-transcribe | Mistral, Paris (DSGVO) | mehrsprachig inkl. Deutsch | Diktat/Transkription |
- TTS — Supertonic 3 (Standard): ein ~99M-Parameter-ONNX-Modell, das
vollständig auf SovrGPT-Infrastruktur in der EU läuft (kein Dritt-SaaS).
Zehn Stimmen (
M1–M5männlich,F1–F5weiblich), mit Expression-Tags (<breath>,<sigh>) inline. Ausgabewav/flac/ogg. Kein Cold-Start — erste Wahl für schnelle, feste Ansagen. - TTS — CosyVoice 3 (expressiv, Apache 2.0): GPU-Modell auf RunPod-EU,
nativ Deutsch (inkl. korrektem „ü"). Kann, was Supertonic nicht kann:
- Inline-Tags mitten im Text:
[laughter],[breath],<laughter>…</laughter>,<strong>…</strong>(Betonung). - Emotion / Sprechstil per natürlichsprachiger Anweisung
(
emotion: "Sprich sehr traurig und langsam."). - Zero-Shot-Voice-Cloning: eine eigene Stimme aus einem Referenzclip
(≤ 30 s) klonen — kein Training. Eingebaute Stimme:
de-thorsten. - Opt-in via
provider: "cosyvoice". Scale-to-zero: warm ~6 s, Cold-Start möglich. Kein eingebautes Wasserzeichen → KI-Kennzeichnung auf Anwendungsebene. Voll dokumentiert in der Audio-API.
- Inline-Tags mitten im Text:
- STT — Voxtral (Mistral, Paris): mehrsprachige Transkription mit starker
deutscher Qualität, DSGVO-konform in der EU gehostet.
- Eigennamen erkennen:
context_biaszieht die Erkennung auf Produkt-, Kunden- oder Fachbegriffe (ohne Leerzeichen, max. 100 Einträge) — ohne zusätzliche Antwortzeit. - Formatiertes Transkript:
format_text=1liefert Absätze, eine nummerierte Liste aus gesprochenem „erstens/zweitens/drittens", eine Leerzeile nach der Anrede und eine abgesetzte Grußformel. Dafür läuft parallel ein zweites Modell mit Audio-Verständnis; das Rohtranskript kommt alstext_rawimmer mit, und eine Formatierung, die den Wortlaut verändern würde, wird verworfen statt ausgeliefert. - Ein voll self-hosted STT-Pfad auf RunPod-EU ist bewertet, aber zurückgestellt: das produktiv genutzte Transkriptionsmodell hat keine offenen Gewichte, Self-Hosting wäre also zwingend ein Modellwechsel und bei unserem Volumen 6- bis 13-mal teurer als der EU-Anbieter.
- Eigennamen erkennen:
- Provider-Wahl:
supertonic(Default),cosyvoice(expressiv/Cloning) undmistral(Fallback) — pro Request über dasprovider-Feld wählbar; ohne Angabe entscheidet der Server-Default (Supertonic). Alle erscheinen mitkind: "tts"bzw.kind: "stt"inGET /api/v1/models.
Vollständige API-Beispiele (curl + SDK): Audio-API.
Wenn ein Modell fehlt: die Org-Auswahl
Owner und Admins einer Organisation können unter Einstellungen → Modelle festlegen, welche Modelle ihr Team sieht — sinnvoll, damit der Picker bei einem wachsenden Katalog übersichtlich bleibt. Steht ein Modell hier in der Doku, taucht aber bei dir nicht auf, ist das der wahrscheinlichste Grund.
Die Auswahl wirkt serverseitig und damit auch für die API und für MCP-Clients. Laufende Chats bleiben davon unberührt: ein Chat, der bereits auf ein Modell festgelegt ist, läuft darauf weiter. Details: Orgs & Teams.
Eigene Modelle einbinden (BYO)
Reicht der Katalog nicht, kann eine Organisation eigene OpenAI-kompatible Endpunkte eintragen — unter Einstellungen → Provider, mit eigener Adresse, eigenem Modellnamen und eigenem Anzeigenamen. Typische Fälle: ein selbst betriebenes vLLM im eigenen Rechenzentrum, ein Fachmodell eines Dienstleisters, ein Azure-OpenAI-Deployment.
Der Eintrag erscheint danach nur im Picker dieser Organisation, markiert mit „⚠ extern".
Was Sie dabei wissen müssen — und was wir deshalb bewusst nicht tun:
- Anfragen an einen eigenen Endpunkt verlassen die EU-Souveränität von SovrGPT. Sie gehen direkt an die eingetragene Adresse; es gilt deren Datenschutzerklärung, nicht unsere Zusage. Genau dafür steht die „extern"-Kennzeichnung.
- Werkzeuge und der Denk-Regler bleiben aus. Über einen fremden Endpunkt haben wir nichts gemessen — und ein Werkzeugaufruf an ein Modell ohne passenden Parser scheitert hart, statt auf Text auszuweichen. Wir bieten deshalb nichts an, was wir nicht geprüft haben.
- Warmhalten gibt es nicht. Es gibt keinen Worker von uns, den wir für Sie wach halten könnten — die Verfügbarkeit bestimmt Ihr Endpunkt.
- Nur
https, keine internen Adressen. Adressen im lokalen oder privaten Netz sowie rohe IP-Adressen werden abgelehnt; ein Endpunkt braucht einen DNS-Namen mit gültigem Zertifikat. - Ein hinterlegter API-Schlüssel wird verschlüsselt gespeichert (AES-256-GCM) und verlässt den Server nie. Endpunkte hinter einer IP-Freigabe kommen auch ganz ohne Schlüssel aus.
Pausieren und Löschen ist jederzeit möglich — auch nach einem Tarif-Wechsel, bei dem das Anlegen neuer Einträge nicht mehr enthalten ist. Ein Datenabfluss, den Sie nicht mehr abstellen können, wäre kein akzeptabler Zustand. Gebundene Chats antworten danach wieder mit dem Standard-Modell.
Für die API: GET /v1/models listet die Einträge mit
owned_by: "org" und der ID org-model:….
Welches Modell wofür?
- Default (
gemma-4-12b) — Schnellantworten, Boilerplate, einfache Code-Aufgaben, deutsche Texte. Erste Wahl für interaktive Chats. Mit 262k Kontext der Tier, der lange Dokumente am Stück aufnimmt, und mit nativem Bildverständnis. - Balanced (
qwen3.8-27b) — dichtes 27B-Modell der neuesten Qwen-Generation, ausgelegt auf repository-weite Code-Aufgaben und Tool-Calling, mit fließendem Deutsch und umschaltbarem Denkmodus. 131k Kontext. 🔧 Geändert am 2026-08-18: Dieser Tier führt jetzt Qwen 3.8 27B statt Qwen 3.6 27B. Die alte Modell-Idqwen3.6-27bfunktioniert weiter (sie zeigt auf den Nachfolger), liefert aber ab dem Wechsel das neue Modell. Werkzeugaufrufe, Streaming, System-Rolle und Denk-Schalter sind am neuen Endpunkt gemessen; der Kaltstart ist mit 662 s länger als die ~8 min des Vorgängers — im Messlauf war der EU-Pool allerdings knapp (80×THROTTLED), ein Teil davon ist Warten auf eine freie Karte. Der Kontextwert von 131k bestimmt auch, wie viel eines hochgeladenen PDFs ins Gespräch passt. - Reasoning (
qwen3.5-9b-deepseek-v4-flash) — DeepSeek-V4-Distill auf Qwen-Backbone. Denkt immer sichtbar, geeignet für Mathematik, Logik, Schritt-für-Schritt-Auswertungen. 🔧 Geändert am 2026-08-17: Der Gedankengang kommt jetzt im eigenen Feldreasoning_contentstatt als<think>…</think>im Antworttext — im Chat als aufklappbarer „Gedankengang", über die API als eigenes Feld. (Hier stand „Gibt sichtbare<think>…</think>-Schritte aus". Tatsächlich kam über die API der Gedanke ungetrennt imcontentan, gefolgt von einem nackten</think>ohne öffnendes Gegenstück — das öffnende Tag setzt die Chat-Vorlage selbst in den Prompt, und ohneREASONING_PARSERam Endpunkt trennte niemand die beiden Teile. Wer dencontentbisher am<think>-Tag zerlegt hat, muss aufreasoning_contentumstellen.) - Vision (
gemma-4-26b-a4b) — Liest Bilder im Chat (PNG und JPG). Multimodal in Englisch sehr stark, in Deutsch sehr gut. 262k Kontext, Werkzeuge nutzbar (auch zusammen mit einem Bild) und Denk-Modus umschaltbar — alle drei seit 2026-08-17 nachgemessen, siehe Fußnote ⁷. (Hier standen 16k Kontext und kein Werkzeug-Hinweis; der Katalog hatte die Anhebung des Endpunkts nie mitbekommen.) 🔧 Korrigiert am 13.09.2026: hier stand zusätzlich WebP — dieses Format nimmt der Upload gar nicht an, ein WebP-Bild wurde also immer schon abgewiesen. Erlaubt sind PNG und JPEG. 🔴 Und bis zum 13.09.2026 erreichte überhaupt kein Bild das Modell — der Upload nahm es an, der Chat schickte es aber nie mit. Seitdem geht es wirklich; siehe Bilder im Chat weiter unten. - Coder mini (
qwen3.6-35b-a3b) — schnelle, günstige Coding-Stufe (MoE, 35 B total / 3 B aktiv, FP8, 1× 48-GB-GPU) mit nativem Tool-Calling und 131k Kontext. Erste Wahl für agentisches Coding über IDE-Plugins, wenn Tempo und Kosten zählen. Denk-Modus umschaltbar (Qwen-Stil). - Llama (
llama-3.1-8b) — Llama-spezifische Workloads, Re-Train-Vergleiche oder bei Lizenz-Vorgaben „Built with Llama".
Und im Partner-Betrieb — dieselbe API, aber ohne Kaltstart:
- GPT-OSS 120B (
stackit-gpt-oss-120b) — wenn Sie den Denk-Aufwand selbst regeln wollen. Betrieb in Deutschland. Denkt grundsätzlich mit; bei gründlich braucht die Antwort ein großzügiges Token-Budget, sonst geht es ganz in den Gedankengang. - Gemma 4 31B (
stackit-gemma-4-31b) — Bilder verstehen mit Verarbeitung in Deutschland. Dervision-Tier kann das auch, hat aber Kaltstart. Über 140 Sprachen, Denk-Schalter umschaltbar. - Qwen 3.6 27B (
stackit-qwen3.6-27b) — Allrounder mit Verarbeitung in Deutschland, sofort antwortbereit. - Qwen 3.8 27B (
tensorx-qwen3.8-27b) — exakt dasselbe Modell wie der eigenebalanced-Tier. Nehmen Sie diesen Eintrag, wenn die ~11 Minuten Kaltstart stören; nehmen Sie den eigenen, wenn die Verarbeitung auf unserer eigenen Hardware laufen soll. - Qwen 3.8 Max (
tensorx-qwen3.8-max) — das größte offene Modell im Katalog. Auf eigenen Karten unerreichbar (die Gewichte allein belegen rund 2,4 TB). Denkt immer mit —enable_thinking: falsewird hier abgelehnt. - Kimi K3 (
tensorx-kimi-k3) — sehr großer Kontext, starkes Werkzeug- und Agentenverhalten. Denkt immer mit. ⚠️ Der teuerste Eintrag im Katalog. - Kimi K2.7 Code (
tensorx-kimi-k2.7-code) — Coding und agentische Werkzeugketten ohne Kaltstart. Die Alternative zu den eigenen Coding-Stufen, wenn Wartezeit stört. - DeepSeek V4 Flash (
tensorx-deepseek-v4-flash) — günstigster Eintrag im Katalog. Dasselbe Modell wie der am 07.09.2026 zurückgezogene eigenecoder-max-Tier — hier ohne Kaltstart und zu einem Bruchteil der Betriebskosten. - DeepSeek V4 Pro (
tensorx-deepseek-v4-pro) — das große Modell der V4-Reihe, starkes Schlussfolgern. - GLM 5.3 (
tensorx-glm-5.3) — der stärkste offen veröffentlichte Stand für Programmierung und agentische Werkzeugketten, ohne Kaltstart. Die erste Adresse, wenn Code-Qualität zählt und Wartezeit stört. Denkt immer mit. - GLM 5.3 Flash (
tensorx-glm-5.3-flash) — dieselbe Reihe, schlank und sehr günstig: nach DeepSeek V4 Flash der zweitgünstigste Eintrag im Katalog, und der günstigste mit Werkzeugketten und sauber getrenntem Denkteil. Gut für Massendurchsatz. - Qwen 3.8 Flash (
tensorx-qwen3.8-flash-next) — der günstigste Eingabepreis im ganzen Katalog und zugleich der größte Kontext der Qwen-3.8-Reihe (262k). Ein großes Modell, das je Token nur einen kleinen Teil von sich rechnet: 125 Mrd. Parameter, davon 6 Mrd. aktiv. Anders als GLM 5.3 Flash lässt sich hier das Denken abschalten — nehmen Sie es, wenn Sie viele Anfragen mit langen Vorlagen stellen und die Antwort schnell und knapp sein soll. Es ist nicht dasselbe Modell wie „Qwen 3.8 27B"; wer die gemessene Werkzeug- und Codequalität des 27B braucht, bleibt dort. - MiniMax M3 (
tensorx-minimax-m3) / GLM 5.2 (tensorx-glm-5.2) — agentisch ausgelegt, sehr großer Kontext, niedriger Preis. ⚠️ Bei MiniMax M3 ist die Lizenz von uns nicht geprüft.
Coding in der IDE (API-first)
Die Coding-Stufen sind primär für agentisches Coding über IDE-Plugins gedacht (Cline, Continue, OpenCode, Roo-Code, …). Alle sprechen die OpenAI-kompatible API:
- Base-URL:
https://sovrgpt.com/api/v1 - API-Key: unter
/settings/api-keyserzeugen (Scopechat), als Bearer nutzen. - Modell-ID:
qwen3.6-35b-a3b— die souveräne Coding-Stufe, 131k Kontext. Ohne Kaltstart:stackit-qwen3.6-27bodertensorx-kimi-k2.7-code.
🔧 Korrigiert am 11.09.2026. Hier standen
qwen3-coder-next-fp8unddeepseek-v4-flash— beide sind zurückgezogen, und die Beispiele unten trugen sie bis zu dieser Korrektur in jeder Konfigurationsdatei. Wer sie kopiert hatte, bekommt seit der Rücknahme ein404 model_withdrawnmit dem Nachfolger im Text. Die vollständige Einrichtungsanleitung mit allen Werkzeugen steht in Coding in der IDE.
Cline (VS Code): API Provider → OpenAI Compatible · Base URL
https://sovrgpt.com/api/v1 · API Key sov_… · Model ID qwen3.6-35b-a3b
· Context Window 131072 (muss von Hand gesetzt werden).
Continue (config.yaml):
models:
- name: SovrGPT Coder mini
provider: openai
model: qwen3.6-35b-a3b
apiBase: https://sovrgpt.com/api/v1
apiKey: sov_...
requestOptions:
timeout: 900000 # Kaltstart, siehe obenOpenCode (opencode.json):
{
"provider": {
"sovrgpt": {
"npm": "@ai-sdk/openai-compatible",
"options": { "baseURL": "https://sovrgpt.com/api/v1", "apiKey": "sov_..." },
"models": { "qwen3.6-35b-a3b": { "name": "SovrGPT Coder mini" } }
}
}
}Denk-Level pro Request (reasoning_effort)
🔧 Korrigiert am 11.09.2026. Hier stand „Nur
coder-maxdenkt auf Abruf tiefer" mit einem Beispiel aufdeepseek-v4-flash— einem Modell, das seit dem 07.09.2026 zurückgezogen ist. Der Satz war schon vorher zu eng: der Regler wird seit dem 24.08.2026 katalog-getrieben übersetzt und gilt für jedes Modell, das gemessene Stufen führt.
🔑 Welche Modelle den Regler auswerten, sagt effort_levels in
GET /v1/models — ein leeres Array heißt „kein wirksamer
Regler". Fragen Sie das ab, statt es aus der Modellfamilie zu schließen: die
Stufen sind je Eintrag gemessen, und Geschwistermodelle verhalten sich
unterschiedlich.
Steuerung OpenAI-idiomatisch über das Top-Level-Feld reasoning_effort (im
Python-SDK via extra_body). Produktweit gibt es drei Stufen — low, medium,
high; was daraus beim jeweiligen Anbieter wird (eine Token-Zahl, eine andere
Skala), übernimmt die Route.
curl https://sovrgpt.com/api/v1/chat/completions \
-H "Authorization: Bearer $SOVR_KEY" -H "Content-Type: application/json" \
-d '{
"model": "qwen3.6-35b-a3b",
"messages": [{ "role": "user", "content": "Refactore dieses Modul und erkläre die Schritte." }],
"reasoning_effort": "high",
"max_tokens": 8192
}'⚠️ Bei high das max_tokens mitziehen — der Gedankengang zählt gegen das
Antwortbudget. An qwen3.6-35b-a3b gemessen: bei unbegrenztem Denkbudget und
2 000 max_tokens blieb der Antworttext leer.
Wer volle Kontrolle will, gibt stattdessen chat_template_kwargs direkt mit
(z. B. {"thinking": true, "reasoning_effort": "max"}) — das wird verbatim
durchgereicht und gewinnt gegen reasoning_effort. Details:
POST /v1/chat/completions.
Cold-Start verstehen
- Warm: Modell ist auf einem GPU-Worker geladen, Antwort < 5 s.
- Cold: Worker muss neu hochfahren, Image laden, Modell-Weights pullen. Gemessen 2–9,5 Minuten je nach Tier — die Einzelwerte stehen in der Katalogtabelle oben. (Hier stand „30 s bis 5 Minuten". Das war eine Schätzung und für kein einziges Modell die Untergrenze; der schnellste gemessene Kaltstart liegt bei gut 2 Minuten.)
- Pay-per-use: Während Idle-Zeit kostet das Modell nichts. Aber: Erste Anfrage nach längerer Pause ist langsam. Für Production-Cron-Jobs empfehlen wir, einen Warm-Up-Call vorzuschalten.
Tools im Chat
- Web-Suche — Brave-Search-API, 2 000 Anfragen/Monat im Free-Tier. 🔴 Anbieter sitzt in
den USA (Brave Software, Inc.), Zero Data Retention per Auftragsverarbeitungsvertrag
zugesichert. Je Chat opt-in, standardmässig aus — Einzelheiten unter
Datenschutz. (Hier stand „EU-konform". Das war falsch.)
Derselbe Schalter erlaubt dem Modell zusätzlich, eine Seite zu öffnen und zu lesen
(
fetch_url) — dieser Abruf geht direkt von unseren EU-Servern an die Seite, ohne Brave. 🆕 Seit dem 13.09.2026 entscheidest du, wie sich SovrGPT dabei meldet (Organisation → Seitenabruf): unauffällig (Voreinstellung — SovrGPT gibt sich als gewöhnlicher Browser aus, Seiten mit pauschalen Bot-Sperren liefern dann eher aus) oder mit Namen (SovrGPT nennt sich und die rooom AG). ⚠️ „Unauffällig" ändert nur die Kopfzeilen — es verbirgt weder unsere IP noch technische Merkmale der Verbindung. Nur Owner und Admins können es umstellen, und jede Änderung steht im Prüfprotokoll. - Bild-Generierung — Z-Image-Turbo (schnell) oder FLUX.2-klein (höhere Qualität), beides Apache 2.0, EU-gehostet.
- Video-Generierung — LTX-Video 2B (OpenRAIL-M), 5–8 s Clips bei 768×512.
- Marketplace-Connectoren — Über 20 vorkonfigurierte MCP-Server (siehe Marketplace).
⚠️ Korrektur (2026-08-17): Hier stand „Diese Werkzeuge sind unabhängig vom
Modell verfügbar". Das stimmt nicht. Werkzeuge setzen voraus, dass der
Endpunkt des jeweiligen Modells mit einem passenden Tool-Parser gestartet wurde
— sonst lehnt er jede Anfrage mit tools ab. SovrGPT sperrt die Schalter
deshalb im Composer, statt eine Antwort scheitern zu lassen.
Stand heute können alle Tiers Werkzeuge — mit einer Ausnahme: llama
(llama-3.1-8b). Dort ist der Parser zwar gesetzt und ein erzwungener
Werkzeugaufruf funktioniert, im automatischen Modus ruft das Modell aber in
4 von 4 Messungen nichts auf und antwortet stattdessen in Prosa — einmal sogar
mit einer behaupteten Websuche samt erfundenem Ergebnis. Den Schalter dort
freizugeben würde also eine Halluzination als Suchergebnis ausliefern.
Bilder im Chat
Hängen Sie ein Bild an die Nachricht an (Büroklammer oder per Ablegen im Fenster). Erlaubt sind PNG und JPG.
🔴 Neu seit dem 13.09.2026 — und davor war es kaputt. Bis dahin nahm SovrGPT ein Bild zwar an und zeigte es im Verlauf, schickte es aber nie an das Modell. Die Antwort las sich, als wäre das Bild dabei gewesen; tatsächlich kannte das Modell nur den Dateinamen. Seitdem geht der Bildpfad wirklich.
Was gilt:
| Formate | PNG, JPG — kein WebP, kein GIF, kein PDF-Bild |
| Höchstens je Bild | 8 MiB |
| Höchstens je Nachricht | 4 Bilder und zusammen 12 MiB |
| Bildfähige Modelle | Default (gemma-4-12b), Vision (gemma-4-26b-a4b) und Gemma 4 31B im Partner-Betrieb |
⚠️ Nicht jedes Modell kann Bilder ansehen. Wählen Sie eines, das es nicht kann, sagt SovrGPT das vor dem Absenden über dem Eingabefeld — und der Assistent weist in seiner Antwort zusätzlich darauf hin. Er rät nicht, was auf dem Bild zu sehen ist. Das Bild bleibt im Verlauf erhalten; ein Modellwechsel genügt.
📌 Ein Bild auf eine Folie zu legen funktioniert unabhängig davon. Dafür muss das Modell das
Bild nicht ansehen können — es gibt nur den Dateinamen an export_pptx weiter, eingesetzt wird
die Datei auf dem Server.
📌 Ein zu großes Bild wird abgelehnt, nicht verkleinert. Laden Sie in dem Fall eine kleinere Fassung hoch; ein automatisches Herunterrechnen gibt es bewusst nicht.
⚠️ Über die OpenAI-kompatible API (/v1/chat/completions) gelten diese Schutzmechanismen
NICHT. Die Route reicht den Anfragerumpf unverändert an das Modell weiter, ein
image_url-Teil kommt also durch — aber ohne Fähigkeitsprüfung, ohne Größengrenze und ohne
Hinweis. Schicken Sie dort ein Bild an ein Modell, das keine Bilder liest, scheitert die
Anfrage am Endpunkt, statt eine erklärende Antwort zu liefern. 📌 Wir haben diesen Weg nicht
gemessen — die Aussage beschreibt, was der Code tut, nicht einen bestandenen Test. Wählen Sie
für Bilder über die API eines der drei bildfähigen Modelle oben.
Umgang mit Tokens, Quoten, Limits
- Standard-Plan: faire Nutzung, kein hartes Token-Limit.
- Enterprise-Plan: dedizierte GPU-Worker (kein Cold-Start), garantierte Latenz, separate Vertragsanlage.
- API-Calls werden pro Org abgerechnet — nicht pro User.
Die genauen Pricing-Stufen liegen unter /settings/usage (eingeloggt) und im Vertrag mit eNetworkers.
Erste Schritte
In fünf Minuten vom ersten Login zum ersten API-Call.
Coding in der IDE
SovrGPT als Modell-Backend für Kilo Code, Cline, Roo Code, Continue, OpenCode, Qwen Code, goose, Zed, Theia, OpenHands, Cursor und Aider — souveräne EU-Modelle direkt im Editor, mit ehrlichen Angaben zu Latenz, Telemetrie, Freigaben und Grenzen.