SovrGPT Docs

Modelle

Sprach-LLMs, Embeddings, Re-Ranker und Sprache (STT/TTS) — alle EU-gehostet.

SovrGPT routet jede Anfrage auf einen selbst gehosteten Serverless-Inferenz-Endpunkt in einer EU-Region. Es gibt keinen US-Proxy oder US-Gateway im kritischen Pfad. Die Endpunkte skalieren auf null herunter, wenn sie nicht gebraucht werden — was den Preis drückt, aber Cold-Starts erzeugt.

Der Katalog umfasst vier Modell-Klassen, alle EU-souverän:

  • Sprach-Modelle (LLMs) — neun Tiers für Chat, Reasoning, Vision und Code, inkl. einer dreistufigen Coding-Staffelung (coder-mini / coder / coder-max; coder-mini ist seit 2026-08 produktiv, coder-max noch in Beta).
  • Embeddings & Re-Ranker — für Retrieval-Augmented-Generation (RAG).
  • Text-to-Speech (TTS)supertonic-3, self-hosted in der EU.
  • Speech-to-Text (STT) — Voxtral (Mistral, Paris/EU).

Alle vier sind über die OpenAI-kompatible API adressierbar und im Chat direkt nutzbar.

Aktueller Katalog (Stand 2026-08)

TierModell-IDHF-QuelleHerkunftIndex ²LizenzCold-StartStatus
defaultqwen3.5-9bQwen/Qwen3.5-9B🇨🇳 Alibaba22Apache 2.0~30–90 saktiv
balancedqwen3.6-27bQwen/Qwen3.6-27B🇨🇳 Alibaban. gelistetApache 2.0~60–180 saktiv
premiumqwen3.5-35b-a3bQwen/Qwen3.5-35B-A3B (MoE)🇨🇳 Alibaba24Apache 2.0~90–240 sLegacy ³
reasoningqwen3.5-9b-deepseek-v4-flashJackrong/Qwen3.5-9B-DeepSeek-V4-Flash🇨🇳 Community-Distilln. gelistetApache 2.0~60–180 saktiv
visiongemma-4-26b-a4bgoogle/gemma-4-26B-A4B-it🇺🇸 Google DeepMind26Apache 2.0~60–180 saktiv
coder-miniqwen3.6-35b-a3bQwen/Qwen3.6-35B-A3B-FP8 (MoE)🇨🇳 Alibaban. gelistetApache 2.0~9 min ¹aktiv
coderqwen3-coder-next-fp8Qwen/Qwen3-Coder-Next-FP8 (MoE)🇨🇳 Alibaban. gelistetApache 2.0~8–15 minLegacy ³
coder-max (Beta)deepseek-v4-flashdeepseek-ai/DeepSeek-V4-Flash🇨🇳 DeepSeek52MIT~2–4 min ¹aktiv (Beta)
llamallama-3.1-8bNousResearch/Meta-Llama-3.1-8B-Instruct🇺🇸 Meta8Llama Community~60–180 sLegacy ³

¹ coder-mini gemessen 2026-08-06 am Live-Endpunkt: warm ~7–10 s, Cold-Start 523 s. coder-max bleibt eine vorläufige Angabe bis zur eigenen Messung.

² Index = Artificial Analysis Intelligence Index, Stand 2026-08-08. Es ist die einzige Quelle, die diese Modelle in einem Testaufbau misst — nur deshalb sind die Werte untereinander vergleichbar. „n. gelistet" heißt: die Quelle führt das Modell nicht; wir schätzen dann keinen Wert. ⚠️ Der Index ist ein Aggregat über englischsprachige Tests und sagt nichts über deutsche Sprachqualität.

³ Legacy heißt: das Modell bleibt vollständig nutzbar und über die API adressierbar, ist aber nicht mehr die empfohlene Wahl für seine Rolle und läuft mittelfristig aus. Es gibt keinen harten Abschalttermin; bestehende Chats und Integrationen laufen unverändert weiter.

Live-Stand jederzeit über GET /api/v1/models abrufbar — dort liefern die Felder quality_index, origin_vendor, origin_country und lifecycle dieselben Angaben maschinenlesbar. Siehe API-Referenz.

Embedding- & Rerank-Modelle (RAG)

Für Retrieval-Augmented-Generation-Pipelines stehen zusätzlich Embedding- und Rerank-Modelle bereit — ebenfalls vollständig EU-souverän auf RunPod, ohne US-Proxy. Adressierbar über die OpenAI-kompatible POST /api/v1/embeddings- und die Cohere-kompatible POST /api/v1/rerank-Route.

TypModell-IDHF-QuelleLizenzDimensionen
Embeddingbge-m3BAAI/bge-m3MIT1024
Embeddingnomic-embed-codenomic-ai/nomic-embed-codeApache 2.03584
Rerankbge-reranker-baseBAAI/bge-reranker-baseApache 2.0
  • bge-m3 — Mehrsprachiges Dense-Embedding mit starker deutscher Retrieval-Qualität. Standard-Embedder; OpenAI-Aliase wie text-embedding-3-small werden automatisch hierauf gemappt.
  • nomic-embed-code — Code-spezialisiertes Embedding für Repository-Suche und Code-RAG.
  • bge-reranker-base — Cross-Encoder, der eine Kandidatenliste nach Relevanz zu einer Query neu ordnet. Ideal als zweite Stufe nach einer Embedding-Suche.

Diese Modelle sind ebenfalls Scale-to-Zero (Cold-Start 1–4 min, Modell-Pull) und erscheinen mit kind: "embedding" bzw. kind: "rerank" in GET /api/v1/models.

Sprache: Speech-to-Text & Text-to-Speech (Voice)

SovrGPT spricht und hört — beides EU-souverän. Im Chat über das Mikrofon-Symbol (Diktat statt Tippen) und den Lautsprecher-Button („Vorlesen") an jeder Antwort; programmatisch über die OpenAI-kompatible Audio-API.

FunktionModell-IDAnbieter / HostingSprachenKann
TTS — schnellsupertonic-3self-hosted, Railway europe-west431 inkl. Deutsch10 feste Stimmen, kein Cold-Start
TTS — expressiv + Cloningcosyvoice-3self-hosted, RunPod-EU (GPU)Deutsch nativ (+ en/fr/es/it/ru/…)Emotion, Inline-Tags, eigene Stimme klonen
TTS — Alternativevoxtral-mini-ttsMistral, Paris (DSGVO)mehrsprachigFallback
Speech-to-Text (STT)voxtral-mini-transcribeMistral, Paris (DSGVO)mehrsprachig inkl. DeutschDiktat/Transkription
  • TTS — Supertonic 3 (Standard): ein ~99M-Parameter-ONNX-Modell, das vollständig auf SovrGPT-Infrastruktur in der EU läuft (kein Dritt-SaaS). Zehn Stimmen (M1M5 männlich, F1F5 weiblich), mit Expression-Tags (<breath>, <sigh>) inline. Ausgabe wav/flac/ogg. Kein Cold-Start — erste Wahl für schnelle, feste Ansagen.
  • TTS — CosyVoice 3 (expressiv, Apache 2.0): GPU-Modell auf RunPod-EU, nativ Deutsch (inkl. korrektem „ü"). Kann, was Supertonic nicht kann:
    • Inline-Tags mitten im Text: [laughter], [breath], <laughter>…</laughter>, <strong>…</strong> (Betonung).
    • Emotion / Sprechstil per natürlichsprachiger Anweisung (emotion: "Sprich sehr traurig und langsam.").
    • Zero-Shot-Voice-Cloning: eine eigene Stimme aus einem Referenzclip (≤ 30 s) klonen — kein Training. Eingebaute Stimme: de-thorsten.
    • Opt-in via provider: "cosyvoice". Scale-to-zero: warm ~6 s, Cold-Start möglich. Kein eingebautes Wasserzeichen → KI-Kennzeichnung auf Anwendungsebene. Voll dokumentiert in der Audio-API.
  • STT — Voxtral (Mistral, Paris): mehrsprachige Transkription mit starker deutscher Qualität, DSGVO-konform in der EU gehostet. (Ein voll self-hosted STT-Pfad — faster-whisper auf RunPod-EU — ist in Vorbereitung.)
  • Provider-Wahl: supertonic (Default), cosyvoice (expressiv/Cloning) und mistral (Fallback) — pro Request über das provider-Feld wählbar; ohne Angabe entscheidet der Server-Default (Supertonic). Alle erscheinen mit kind: "tts" bzw. kind: "stt" in GET /api/v1/models.

Vollständige API-Beispiele (curl + SDK): Audio-API.

Wenn ein Modell fehlt: die Org-Auswahl

Owner und Admins einer Organisation können unter Einstellungen → Modelle festlegen, welche Modelle ihr Team sieht — sinnvoll, damit der Picker bei einem wachsenden Katalog übersichtlich bleibt. Steht ein Modell hier in der Doku, taucht aber bei dir nicht auf, ist das der wahrscheinlichste Grund.

Die Auswahl wirkt serverseitig und damit auch für die API und für MCP-Clients. Laufende Chats bleiben davon unberührt: ein Chat, der bereits auf ein Modell festgelegt ist, läuft darauf weiter. Details: Orgs & Teams.

Welches Modell wofür?

  • Default (qwen3.5-9b) — Schnellantworten, Boilerplate, einfache Code-Aufgaben, deutsche Texte. Erste Wahl für interaktive Chats.
  • Balanced (qwen3.6-27b) — Mehr Argumentationstiefe, längere Texte, anspruchsvolleres Coding. Für Anwendungen, bei denen Qualität vor Latenz geht.
  • Premium (qwen3.5-35b-a3b) — Mixture-of-Experts: 35 B Parameter, aber nur 3 B aktiv pro Token. Liefert Qualität nahe 70B-Modellen zu deutlich geringeren GPU-Kosten.
  • Reasoning (qwen3.5-9b-deepseek-v4-flash) — DeepSeek-V4-Distill auf Qwen-Backbone. Gibt sichtbare <think>…</think>-Schritte aus, geeignet für Mathematik, Logik, Schritt-für-Schritt-Auswertungen.
  • Vision (gemma-4-26b-a4b) — Liest Bilder im Chat (PNG/JPG/WebP). Multimodal in Englisch sehr stark, in Deutsch sehr gut.
  • Coder mini (qwen3.6-35b-a3b, Beta) — schnelle, günstige Coding-Stufe (MoE, 35 B total / 3 B aktiv, FP8, 1× 48-GB-GPU) mit nativem Tool-Calling und 131k Kontext. Erste Wahl für agentisches Coding über IDE-Plugins, wenn Tempo und Kosten zählen. Denk-Modus umschaltbar (Qwen-Stil).
  • Coder (qwen3-coder-next-fp8) — 80B-Hybrid-MoE mit 3B aktiven Parametern (FP8, 2× H100 Tensor-Parallel). Spezialisiert auf agentic Code-Aufgaben mit nativem qwen3_coder-Tool-Parser. Ideal als Backend für Cursor/Copilot-artige Workflows oder Repository-weite Refactors. 32k Kontext. Cold-Start lang (8–15 min) — für Production-Workloads den Warmup-Pin oder Scheduled-Pin nutzen.
  • Coder max (deepseek-v4-flash, Beta) — stärkste souveräne Coding-Stufe (DeepSeek V4-Flash, MIT, FP8 auf 2× H200) für komplexe agentische Aufgaben, Multi-File-Refactors und lange Tool-Call-Sequenzen. Denk-Level pro Request steuerbar (reasoning_effort, siehe unten). Bis 393k Kontext.
  • Llama (llama-3.1-8b) — Llama-spezifische Workloads, Re-Train-Vergleiche oder bei Lizenz-Vorgaben „Built with Llama".

Coding in der IDE (API-first)

Die Coding-Stufen sind primär für agentisches Coding über IDE-Plugins gedacht (Cline, Continue, OpenCode, Roo-Code, …). Alle sprechen die OpenAI-kompatible API:

  • Base-URL: https://sovrgpt.com/api/v1
  • API-Key: unter /settings/api-keys erzeugen (Scope chat), als Bearer nutzen.
  • Modell-ID: qwen3.6-35b-a3b (mini), qwen3-coder-next-fp8 (coder) oder deepseek-v4-flash (max).

Cline (VS Code): API ProviderOpenAI Compatible · Base URL https://sovrgpt.com/api/v1 · API Key sovr_… · Model ID deepseek-v4-flash.

Continue (config.yaml):

models:
  - name: SovrGPT Coder max
    provider: openai
    model: deepseek-v4-flash
    apiBase: https://sovrgpt.com/api/v1
    apiKey: sovr_...

OpenCode (opencode.json):

{
  "provider": {
    "sovrgpt": {
      "npm": "@ai-sdk/openai-compatible",
      "options": { "baseURL": "https://sovrgpt.com/api/v1", "apiKey": "sovr_..." },
      "models": { "deepseek-v4-flash": { "name": "SovrGPT Coder max" } }
    }
  }
}

Denk-Level pro Request (reasoning_effort)

Nur coder-max denkt auf Abruf tiefer. Steuerung OpenAI-idiomatisch über das Top-Level-Feld reasoning_effort (im Python-SDK via extra_body):

reasoning_effortVerhalten
weggelassen / none / lowNon-Think — schnellste Antwort (Modell-Default).
medium / highSichtbares Reasoning, reasoning_effort: "high".
max / xhighMaximale Denktiefe, reasoning_effort: "max" (braucht viel Kontext-Budget).
curl https://sovrgpt.com/api/v1/chat/completions \
  -H "Authorization: Bearer $SOVR_KEY" -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-flash",
    "messages": [{ "role": "user", "content": "Refactore dieses Modul und erkläre die Schritte." }],
    "reasoning_effort": "high"
  }'

Wer volle Kontrolle will, gibt stattdessen chat_template_kwargs direkt mit (z. B. {"thinking": true, "reasoning_effort": "max"}) — das wird verbatim durchgereicht und gewinnt gegen reasoning_effort. Details: POST /v1/chat/completions.

Cold-Start verstehen

  • Warm: Modell ist auf einem GPU-Worker geladen, Antwort < 5 s.
  • Cold: Worker muss neu hochfahren, Image laden, Modell-Weights pullen — je nach Modell 30 s bis 5 Minuten.
  • Pay-per-use: Während Idle-Zeit kostet das Modell nichts. Aber: Erste Anfrage nach längerer Pause ist langsam. Für Production-Cron-Jobs empfehlen wir, einen Warm-Up-Call vorzuschalten.

Tools im Chat

Diese Werkzeuge sind unabhängig vom Modell verfügbar:

  • Web-Suche — Brave-Search-API, EU-konform, 2 000 Anfragen/Monat im Free-Tier.
  • Bild-Generierung — Z-Image-Turbo (schnell) oder FLUX.2-klein (höhere Qualität), beides Apache 2.0, EU-gehostet.
  • Video-Generierung — LTX-Video 2B (OpenRAIL-M), 5–8 s Clips bei 768×512.
  • Marketplace-Connectoren — Über 20 vorkonfigurierte MCP-Server (siehe Marketplace).

Umgang mit Tokens, Quoten, Limits

  • Standard-Plan: faire Nutzung, kein hartes Token-Limit.
  • Enterprise-Plan: dedizierte GPU-Worker (kein Cold-Start), garantierte Latenz, separate Vertragsanlage.
  • API-Calls werden pro Org abgerechnet — nicht pro User.

Die genauen Pricing-Stufen liegen unter /settings/usage (eingeloggt) und im Vertrag mit eNetworkers.

Modelle