Modelle
Sprach-LLMs, Embeddings, Re-Ranker und Sprache (STT/TTS) — alle EU-gehostet.
SovrGPT routet jede Anfrage auf einen selbst gehosteten Serverless-Inferenz-Endpunkt in einer EU-Region. Es gibt keinen US-Proxy oder US-Gateway im kritischen Pfad. Die Endpunkte skalieren auf null herunter, wenn sie nicht gebraucht werden — was den Preis drückt, aber Cold-Starts erzeugt.
Der Katalog umfasst vier Modell-Klassen, alle EU-souverän:
- Sprach-Modelle (LLMs) — neun Tiers für Chat, Reasoning, Vision und Code, inkl. einer dreistufigen Coding-Staffelung (
coder-mini/coder/coder-max;coder-miniist seit 2026-08 produktiv,coder-maxnoch in Beta). - Embeddings & Re-Ranker — für Retrieval-Augmented-Generation (RAG).
- Text-to-Speech (TTS) —
supertonic-3, self-hosted in der EU. - Speech-to-Text (STT) — Voxtral (Mistral, Paris/EU).
Alle vier sind über die OpenAI-kompatible API adressierbar und im Chat direkt nutzbar.
Aktueller Katalog (Stand 2026-08)
| Tier | Modell-ID | HF-Quelle | Herkunft | Index ² | Lizenz | Cold-Start | Status |
|---|---|---|---|---|---|---|---|
default | qwen3.5-9b | Qwen/Qwen3.5-9B | 🇨🇳 Alibaba | 22 | Apache 2.0 | ~30–90 s | aktiv |
balanced | qwen3.6-27b | Qwen/Qwen3.6-27B | 🇨🇳 Alibaba | n. gelistet | Apache 2.0 | ~60–180 s | aktiv |
premium | qwen3.5-35b-a3b | Qwen/Qwen3.5-35B-A3B (MoE) | 🇨🇳 Alibaba | 24 | Apache 2.0 | ~90–240 s | Legacy ³ |
reasoning | qwen3.5-9b-deepseek-v4-flash | Jackrong/Qwen3.5-9B-DeepSeek-V4-Flash | 🇨🇳 Community-Distill | n. gelistet | Apache 2.0 | ~60–180 s | aktiv |
vision | gemma-4-26b-a4b | google/gemma-4-26B-A4B-it | 🇺🇸 Google DeepMind | 26 | Apache 2.0 | ~60–180 s | aktiv |
coder-mini | qwen3.6-35b-a3b | Qwen/Qwen3.6-35B-A3B-FP8 (MoE) | 🇨🇳 Alibaba | n. gelistet | Apache 2.0 | ~9 min ¹ | aktiv |
coder | qwen3-coder-next-fp8 | Qwen/Qwen3-Coder-Next-FP8 (MoE) | 🇨🇳 Alibaba | n. gelistet | Apache 2.0 | ~8–15 min | Legacy ³ |
coder-max (Beta) | deepseek-v4-flash | deepseek-ai/DeepSeek-V4-Flash | 🇨🇳 DeepSeek | 52 | MIT | ~2–4 min ¹ | aktiv (Beta) |
llama | llama-3.1-8b | NousResearch/Meta-Llama-3.1-8B-Instruct | 🇺🇸 Meta | 8 | Llama Community | ~60–180 s | Legacy ³ |
¹ coder-mini gemessen 2026-08-06 am Live-Endpunkt: warm ~7–10 s, Cold-Start
523 s. coder-max bleibt eine vorläufige Angabe bis zur eigenen Messung.
² Index = Artificial Analysis Intelligence Index, Stand 2026-08-08. Es ist die einzige Quelle, die diese Modelle in einem Testaufbau misst — nur deshalb sind die Werte untereinander vergleichbar. „n. gelistet" heißt: die Quelle führt das Modell nicht; wir schätzen dann keinen Wert. ⚠️ Der Index ist ein Aggregat über englischsprachige Tests und sagt nichts über deutsche Sprachqualität.
³ Legacy heißt: das Modell bleibt vollständig nutzbar und über die API adressierbar, ist aber nicht mehr die empfohlene Wahl für seine Rolle und läuft mittelfristig aus. Es gibt keinen harten Abschalttermin; bestehende Chats und Integrationen laufen unverändert weiter.
Live-Stand jederzeit über GET /api/v1/models abrufbar — dort liefern die Felder
quality_index, origin_vendor, origin_country und lifecycle dieselben
Angaben maschinenlesbar. Siehe API-Referenz.
Embedding- & Rerank-Modelle (RAG)
Für Retrieval-Augmented-Generation-Pipelines stehen zusätzlich Embedding- und
Rerank-Modelle bereit — ebenfalls vollständig EU-souverän auf RunPod, ohne
US-Proxy. Adressierbar über die OpenAI-kompatible POST /api/v1/embeddings-
und die Cohere-kompatible POST /api/v1/rerank-Route.
| Typ | Modell-ID | HF-Quelle | Lizenz | Dimensionen |
|---|---|---|---|---|
| Embedding | bge-m3 | BAAI/bge-m3 | MIT | 1024 |
| Embedding | nomic-embed-code | nomic-ai/nomic-embed-code | Apache 2.0 | 3584 |
| Rerank | bge-reranker-base | BAAI/bge-reranker-base | Apache 2.0 | — |
bge-m3— Mehrsprachiges Dense-Embedding mit starker deutscher Retrieval-Qualität. Standard-Embedder; OpenAI-Aliase wietext-embedding-3-smallwerden automatisch hierauf gemappt.nomic-embed-code— Code-spezialisiertes Embedding für Repository-Suche und Code-RAG.bge-reranker-base— Cross-Encoder, der eine Kandidatenliste nach Relevanz zu einer Query neu ordnet. Ideal als zweite Stufe nach einer Embedding-Suche.
Diese Modelle sind ebenfalls Scale-to-Zero (Cold-Start 1–4 min, Modell-Pull) und
erscheinen mit kind: "embedding" bzw. kind: "rerank" in GET /api/v1/models.
Sprache: Speech-to-Text & Text-to-Speech (Voice)
SovrGPT spricht und hört — beides EU-souverän. Im Chat über das Mikrofon-Symbol (Diktat statt Tippen) und den Lautsprecher-Button („Vorlesen") an jeder Antwort; programmatisch über die OpenAI-kompatible Audio-API.
| Funktion | Modell-ID | Anbieter / Hosting | Sprachen | Kann |
|---|---|---|---|---|
| TTS — schnell | supertonic-3 | self-hosted, Railway europe-west4 | 31 inkl. Deutsch | 10 feste Stimmen, kein Cold-Start |
| TTS — expressiv + Cloning | cosyvoice-3 | self-hosted, RunPod-EU (GPU) | Deutsch nativ (+ en/fr/es/it/ru/…) | Emotion, Inline-Tags, eigene Stimme klonen |
| TTS — Alternative | voxtral-mini-tts | Mistral, Paris (DSGVO) | mehrsprachig | Fallback |
| Speech-to-Text (STT) | voxtral-mini-transcribe | Mistral, Paris (DSGVO) | mehrsprachig inkl. Deutsch | Diktat/Transkription |
- TTS — Supertonic 3 (Standard): ein ~99M-Parameter-ONNX-Modell, das
vollständig auf SovrGPT-Infrastruktur in der EU läuft (kein Dritt-SaaS).
Zehn Stimmen (
M1–M5männlich,F1–F5weiblich), mit Expression-Tags (<breath>,<sigh>) inline. Ausgabewav/flac/ogg. Kein Cold-Start — erste Wahl für schnelle, feste Ansagen. - TTS — CosyVoice 3 (expressiv, Apache 2.0): GPU-Modell auf RunPod-EU,
nativ Deutsch (inkl. korrektem „ü"). Kann, was Supertonic nicht kann:
- Inline-Tags mitten im Text:
[laughter],[breath],<laughter>…</laughter>,<strong>…</strong>(Betonung). - Emotion / Sprechstil per natürlichsprachiger Anweisung
(
emotion: "Sprich sehr traurig und langsam."). - Zero-Shot-Voice-Cloning: eine eigene Stimme aus einem Referenzclip
(≤ 30 s) klonen — kein Training. Eingebaute Stimme:
de-thorsten. - Opt-in via
provider: "cosyvoice". Scale-to-zero: warm ~6 s, Cold-Start möglich. Kein eingebautes Wasserzeichen → KI-Kennzeichnung auf Anwendungsebene. Voll dokumentiert in der Audio-API.
- Inline-Tags mitten im Text:
- STT — Voxtral (Mistral, Paris): mehrsprachige Transkription mit starker deutscher Qualität, DSGVO-konform in der EU gehostet. (Ein voll self-hosted STT-Pfad — faster-whisper auf RunPod-EU — ist in Vorbereitung.)
- Provider-Wahl:
supertonic(Default),cosyvoice(expressiv/Cloning) undmistral(Fallback) — pro Request über dasprovider-Feld wählbar; ohne Angabe entscheidet der Server-Default (Supertonic). Alle erscheinen mitkind: "tts"bzw.kind: "stt"inGET /api/v1/models.
Vollständige API-Beispiele (curl + SDK): Audio-API.
Wenn ein Modell fehlt: die Org-Auswahl
Owner und Admins einer Organisation können unter Einstellungen → Modelle festlegen, welche Modelle ihr Team sieht — sinnvoll, damit der Picker bei einem wachsenden Katalog übersichtlich bleibt. Steht ein Modell hier in der Doku, taucht aber bei dir nicht auf, ist das der wahrscheinlichste Grund.
Die Auswahl wirkt serverseitig und damit auch für die API und für MCP-Clients. Laufende Chats bleiben davon unberührt: ein Chat, der bereits auf ein Modell festgelegt ist, läuft darauf weiter. Details: Orgs & Teams.
Welches Modell wofür?
- Default (
qwen3.5-9b) — Schnellantworten, Boilerplate, einfache Code-Aufgaben, deutsche Texte. Erste Wahl für interaktive Chats. - Balanced (
qwen3.6-27b) — Mehr Argumentationstiefe, längere Texte, anspruchsvolleres Coding. Für Anwendungen, bei denen Qualität vor Latenz geht. - Premium (
qwen3.5-35b-a3b) — Mixture-of-Experts: 35 B Parameter, aber nur 3 B aktiv pro Token. Liefert Qualität nahe 70B-Modellen zu deutlich geringeren GPU-Kosten. - Reasoning (
qwen3.5-9b-deepseek-v4-flash) — DeepSeek-V4-Distill auf Qwen-Backbone. Gibt sichtbare<think>…</think>-Schritte aus, geeignet für Mathematik, Logik, Schritt-für-Schritt-Auswertungen. - Vision (
gemma-4-26b-a4b) — Liest Bilder im Chat (PNG/JPG/WebP). Multimodal in Englisch sehr stark, in Deutsch sehr gut. - Coder mini (
qwen3.6-35b-a3b, Beta) — schnelle, günstige Coding-Stufe (MoE, 35 B total / 3 B aktiv, FP8, 1× 48-GB-GPU) mit nativem Tool-Calling und 131k Kontext. Erste Wahl für agentisches Coding über IDE-Plugins, wenn Tempo und Kosten zählen. Denk-Modus umschaltbar (Qwen-Stil). - Coder (
qwen3-coder-next-fp8) — 80B-Hybrid-MoE mit 3B aktiven Parametern (FP8, 2× H100 Tensor-Parallel). Spezialisiert auf agentic Code-Aufgaben mit nativemqwen3_coder-Tool-Parser. Ideal als Backend für Cursor/Copilot-artige Workflows oder Repository-weite Refactors. 32k Kontext. Cold-Start lang (8–15 min) — für Production-Workloads den Warmup-Pin oder Scheduled-Pin nutzen. - Coder max (
deepseek-v4-flash, Beta) — stärkste souveräne Coding-Stufe (DeepSeek V4-Flash, MIT, FP8 auf 2× H200) für komplexe agentische Aufgaben, Multi-File-Refactors und lange Tool-Call-Sequenzen. Denk-Level pro Request steuerbar (reasoning_effort, siehe unten). Bis 393k Kontext. - Llama (
llama-3.1-8b) — Llama-spezifische Workloads, Re-Train-Vergleiche oder bei Lizenz-Vorgaben „Built with Llama".
Coding in der IDE (API-first)
Die Coding-Stufen sind primär für agentisches Coding über IDE-Plugins gedacht (Cline, Continue, OpenCode, Roo-Code, …). Alle sprechen die OpenAI-kompatible API:
- Base-URL:
https://sovrgpt.com/api/v1 - API-Key: unter
/settings/api-keyserzeugen (Scopechat), als Bearer nutzen. - Modell-ID:
qwen3.6-35b-a3b(mini),qwen3-coder-next-fp8(coder) oderdeepseek-v4-flash(max).
Cline (VS Code): API Provider → OpenAI Compatible · Base URL
https://sovrgpt.com/api/v1 · API Key sovr_… · Model ID deepseek-v4-flash.
Continue (config.yaml):
models:
- name: SovrGPT Coder max
provider: openai
model: deepseek-v4-flash
apiBase: https://sovrgpt.com/api/v1
apiKey: sovr_...OpenCode (opencode.json):
{
"provider": {
"sovrgpt": {
"npm": "@ai-sdk/openai-compatible",
"options": { "baseURL": "https://sovrgpt.com/api/v1", "apiKey": "sovr_..." },
"models": { "deepseek-v4-flash": { "name": "SovrGPT Coder max" } }
}
}
}Denk-Level pro Request (reasoning_effort)
Nur coder-max denkt auf Abruf tiefer. Steuerung OpenAI-idiomatisch über das
Top-Level-Feld reasoning_effort (im Python-SDK via extra_body):
reasoning_effort | Verhalten |
|---|---|
weggelassen / none / low | Non-Think — schnellste Antwort (Modell-Default). |
medium / high | Sichtbares Reasoning, reasoning_effort: "high". |
max / xhigh | Maximale Denktiefe, reasoning_effort: "max" (braucht viel Kontext-Budget). |
curl https://sovrgpt.com/api/v1/chat/completions \
-H "Authorization: Bearer $SOVR_KEY" -H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-flash",
"messages": [{ "role": "user", "content": "Refactore dieses Modul und erkläre die Schritte." }],
"reasoning_effort": "high"
}'Wer volle Kontrolle will, gibt stattdessen chat_template_kwargs direkt mit
(z. B. {"thinking": true, "reasoning_effort": "max"}) — das wird verbatim
durchgereicht und gewinnt gegen reasoning_effort. Details:
POST /v1/chat/completions.
Cold-Start verstehen
- Warm: Modell ist auf einem GPU-Worker geladen, Antwort < 5 s.
- Cold: Worker muss neu hochfahren, Image laden, Modell-Weights pullen — je nach Modell 30 s bis 5 Minuten.
- Pay-per-use: Während Idle-Zeit kostet das Modell nichts. Aber: Erste Anfrage nach längerer Pause ist langsam. Für Production-Cron-Jobs empfehlen wir, einen Warm-Up-Call vorzuschalten.
Tools im Chat
Diese Werkzeuge sind unabhängig vom Modell verfügbar:
- Web-Suche — Brave-Search-API, EU-konform, 2 000 Anfragen/Monat im Free-Tier.
- Bild-Generierung — Z-Image-Turbo (schnell) oder FLUX.2-klein (höhere Qualität), beides Apache 2.0, EU-gehostet.
- Video-Generierung — LTX-Video 2B (OpenRAIL-M), 5–8 s Clips bei 768×512.
- Marketplace-Connectoren — Über 20 vorkonfigurierte MCP-Server (siehe Marketplace).
Umgang mit Tokens, Quoten, Limits
- Standard-Plan: faire Nutzung, kein hartes Token-Limit.
- Enterprise-Plan: dedizierte GPU-Worker (kein Cold-Start), garantierte Latenz, separate Vertragsanlage.
- API-Calls werden pro Org abgerechnet — nicht pro User.
Die genauen Pricing-Stufen liegen unter /settings/usage (eingeloggt) und im Vertrag mit eNetworkers.