SovrGPT Dokumentation

Modelle

Sprach-LLMs, Embeddings, Re-Ranker und Sprache (STT/TTS) — alle EU-gehostet.

SovrGPT verarbeitet jede Anfrage im europäischen Rechtsraum. Es gibt keinen US-Proxy und kein US-Gateway im kritischen Pfad.

Dafür gibt es zwei Betriebsarten, und der Unterschied ist für Sie vor allem eine Frage der Wartezeit:

  • Selbstbetrieb — eigene GPUs in EU-Regionen. Die Endpunkte skalieren auf null herunter, wenn sie nicht gebraucht werden. Das drückt den Preis, erzeugt aber einen Kaltstart von einigen Minuten für die erste Anfrage nach einer Pause.
  • Partner-Betrieb — Modelle, die auf unseren eigenen Karten nicht laufen (oder nicht wirtschaftlich laufen), betreiben europäische Partner: STACKIT (Schwarz Digital) in Deutschland und ein europäisches Partner-Rechenzentrum in Irland/Finnland mit vertraglich zugesicherter Nullspeicherung der Ein- und Ausgaben. Hier gibt es nichts hochzufahren — die Antwort beginnt sofort.

Beides ist über dieselbe OpenAI-kompatible API erreichbar; die Betriebsart steht bei jedem Modell in der Tabelle.

Der Katalog umfasst vier Modell-Klassen:

  • Sprach-Modelle (LLMs)sechs Tiers im Selbstbetrieb (Chat, Reasoning, Vision, Code) und vierzehn Modelle im europäischen Partner-Betrieb. 🔧 Korrigiert am 11.09.2026: hier stand „zehn Tiers … inkl. der dreistufigen Coding-Staffelung coder-mini / coder / coder-max". Von den drei Coding-Stufen ist nur coder-mini geblieben; dazu sind premium und default-legacy zurückgezogen. Siehe die Tabelle „Zurückgezogen" weiter unten.
  • Embeddings & Re-Ranker — für Retrieval-Augmented-Generation (RAG).
  • Text-to-Speech (TTS)supertonic-3, self-hosted in der EU.
  • Speech-to-Text (STT) — Voxtral (Mistral, Paris/EU).

Alle vier sind über die OpenAI-kompatible API adressierbar und im Chat direkt nutzbar.

Die wichtigsten Modelle

Diese sieben stehen in der Modellübersicht (Modelle in der Seitenleiste) in der ersten Reihe. Sie decken den Alltag ab; alles Weitere ist Spezialisierung.

Die Spalte Besonders gut für sagt, wofür Sie das Modell nehmen sollten — wenn Sie nur eine Spalte lesen, dann diese.

ModellModell-IDBetriebBesonders gut fürKannWarten
Gemma 4 12Bgemma-4-12b🇪🇺 SelbstbetriebBilder und lange Dokumente auf eigener HardwareText + Bild, 262k Kontext, Werkzeuge, Denk-SchalterKaltstart ~5,5–9,5 min ᵐ
Qwen 3.8 27Bqwen3.8-27b🇪🇺 Selbstbetriebden Alltag, wenn es auf eigener Hardware laufen sollText, 131k Kontext, Werkzeuge, Denk-SchalterKaltstart ~11 min ᵐ
Qwen 3.8 27B · ohne Kaltstarttensorx-qwen3.8-27b🇪🇺 Partner-RZ (IE/FI)den Alltag ohne Wartezeitdasselbe Modell wie die Zeile darüberkein Kaltstart
GPT-OSS 120Bstackit-gpt-oss-120b🇩🇪 STACKITschwierige Fragen, bei denen Sie den Denk-Aufwand selbst steuern wollenText, Werkzeuge, Denk-Aufwand regelbarkein Kaltstart (129 ms ᵐ)
Qwen 3.8 Maxtensorx-qwen3.8-max🇪🇺 Partner-RZ (IE/FI)das bestmögliche Ergebnis, wenn der Preis zweitrangig istText, sehr großer Kontext, Werkzeuge, denkt immer mitkein Kaltstart
Kimi K3tensorx-kimi-k3🇪🇺 Partner-RZ (IE/FI)lange Recherchen mit vielen WerkzeugschrittenText, sehr großer Kontext, starkes Werkzeug-/Agentenverhalten, denkt immer mitkein Kaltstart
GLM 5.3tensorx-glm-5.3🇪🇺 Partner-RZ (IE/FI)Programmieren — der stärkste offen veröffentlichte Stand ¹⁰Text, 131k Kontext, Werkzeuge, denkt immer mitkein Kaltstart

Denk-Aufwand regelbar heißt: Sie können pro Chat zwischen sparsam, normal und gründlich wählen. Bei GPT-OSS 120B ist der Unterschied gemessen Faktor 20 an der Länge des Gedankengangs — das stärkste Ergebnis im ganzen Katalog. Über die API ist es das Feld reasoning_effort; welche Modelle es unterstützen, listet GET /api/v1/models im Feld effort_levels. Siehe Chat Completions.

🔑 Warum genau diese sieben? Zwei laufen auf unseren eigenen Karten (Souveränität, dafür Kaltstart), fünf im Partner-Betrieb (sofort, dafür nicht auf eigener Hardware). Jede Zeile deckt einen anderen Zweck ab — Alltag, Bilder, steuerbarer Denk-Aufwand, bestes Ergebnis, lange Werkzeugketten und seit 2026-08 Programmieren. Wer nicht wählen möchte, nimmt Auto — dann entscheidet SovrGPT anhand der ersten Frage.

🔑 Qwen 3.8 27B steht zweimal drin, und das ist Absicht. Es ist dasselbe Modell mit denselben Fähigkeiten; der einzige Unterschied ist, wo es läuft. Auf unserer eigenen Karte warten Sie nach einer Pause rund elf Minuten auf die erste Antwort, im Partner-Rechenzentrum gar nicht. Nehmen Sie den eigenen, wenn die Verarbeitung auf unserer Hardware laufen soll — und den anderen, wenn es schnell gehen muss.

Weitere Modelle

Alles darunter steht in der Übersicht im aufklappbaren Block „Weitere Modelle" und ist über die API unverändert adressierbar.

Im Partner-Betrieb (kein Kaltstart)

ModellModell-IDBetriebHerkunft der GewichteLizenzBesonderheit
Gemma 4 31Bstackit-gemma-4-31b🇩🇪 STACKIT🇺🇸 Google DeepMindApache 2.0Bild + Text, Betrieb in Deutschland — die einzige Kombination im Katalog ⁹
Qwen 3.6 27Bstackit-qwen3.6-27b🇩🇪 STACKIT🇨🇳 AlibabaApache 2.0Allrounder, Verarbeitung in Deutschland
DeepSeek V4 Flashtensorx-deepseek-v4-flash🇪🇺 Partner-RZ (IE/FI)🇨🇳 DeepSeekMITgünstigster Eintrag im Katalog
DeepSeek V4 Protensorx-deepseek-v4-pro🇪🇺 Partner-RZ (IE/FI)🇨🇳 DeepSeekMITstarkes Schlussfolgern, sehr großer Kontext
Kimi K2.7 Codetensorx-kimi-k2.7-code🇪🇺 Partner-RZ (IE/FI)🇨🇳 Moonshot AIModified MITauf Programmierung und Werkzeugketten ausgelegt
MiniMax M3tensorx-minimax-m3🇪🇺 Partner-RZ (IE/FI)🇨🇳 MiniMax⚠️ ungeprüftagentisch, sehr großer Kontext, niedriger Preis
GLM 5.2tensorx-glm-5.2🇪🇺 Partner-RZ (IE/FI)🇨🇳 Z.aiMITstark bei agentischen Aufgaben
GLM 5.3tensorx-glm-5.3🇪🇺 Partner-RZ (IE/FI)🇨🇳 Z.aiGLM-5.3 (MIT-artig)stärkstes offen veröffentlichtes Modell für Programmierung ¹⁰
GLM 5.3 Flashtensorx-glm-5.3-flash🇪🇺 Partner-RZ (IE/FI)🇨🇳 Z.aiMITschlanke GLM-5.3-Variante, sehr günstig ¹⁰
Qwen 3.8 Flashtensorx-qwen3.8-flash-next🇪🇺 Partner-RZ (IE/FI)🇨🇳 AlibabaQwen Community 1.0 ¹¹günstigster Eingabepreis im Katalog, 262k Kontext, Denk-Schalter

Gemma 4 31B ist seit 2026-08 im Katalog. Gemessen: alle sieben Prüfstufen bestanden, erste Token nach 208 ms, 65,8 Token/s, Denk-Schalter umschaltbar, über 140 Sprachen. Es ist der einzige Eintrag, der Bildverständnis und Betrieb in Deutschland zugleich bietet — im Selbstbetrieb kann Bilder nur der vision-Tier (mit Kaltstart).

¹⁰ GLM 5.3 und GLM 5.3 Flash sind seit 2026-08 im Katalog. Beide bestehen den Werkzeug-Test auf allen drei Pfaden (frei gewählt, erzwungen, streamend) und antworten ohne Kaltstart in unter einer Sekunde. Beide denken immer mit — das lässt sich bei dieser Reihe nicht abschalten, deshalb erscheint im Modell-Wähler kein Denk-Schalter. Dass GLM 5.3 beim Programmieren führt, stützt sich auf Vergleichszahlen des Herstellers (Z.ai), nicht auf eine unabhängige Nachmessung; wir haben die Funktion geprüft, nicht die Platzierung. Zu den Lizenzen: GLM 5.3 Flash steht unter glattem MIT. GLM 5.3 unter einer eigenen, MIT-artigen Lizenz — volle Rechte zum Nutzen, Ändern und Weitergeben, mit einer einzigen Auflage, die erst ab 10 Mrd. USD Jahresumsatz greift und für das bloße Weiterleiten an fremd gehostete Modelle ohnehin nicht gilt.

¹¹ Qwen 3.8 Flash ist seit 2026-09 im Katalog. Gemessen: erste Antwort nach einer Sekunde (kein Kaltstart), Werkzeugaufrufe erzeugt es erzwungen und streamend zuverlässig, die System-Rolle wird befolgt, und der Denk-Schalter wirkt wirklich — mit ausgeschaltetem Denken ist der Denkteil leer, statt bloß in den sichtbaren Text zu wandern. Es ist ein großes, sparsam rechnendes Modell: 125 Mrd. Parameter, von denen je Token nur 6 Mrd. rechnen. Daher der Preis. Zur Lizenz: dieser Eintrag steht als einziger der Qwen-3.8-Reihe nicht unter Apache 2.0, sondern unter der Qwen Community License 1.0. Sie verlangt eine eigene Lizenz von Alibaba, wenn man selbst ein Modell-als-Dienst-Geschäft betreibt — nimmt das bloße Weiterleiten an fremd gehostete Modelle aber ausdrücklich aus, und genau das tun wir hier. Für den eigenen Betrieb dieser Gewichte gälte die Auflage; für die Nutzung über diesen Eintrag nicht.

⚠️ „Lizenz ungeprüft" heißt genau das: wir haben die Lizenzdatei dieser Gewichte nicht selbst gelesen. Für einen kommerziellen Einsatz mit Weitergabe-Absicht bitte vorher mit uns sprechen. Korrigiert 2026-08: Bei GLM 5.2 stand hier ebenfalls „ungeprüft" — die Lizenzdatei ist inzwischen nachgelesen und lautet MIT. Offen bleibt der Hinweis damit nur noch für MiniMax M3.

Im Selbstbetrieb (eigene GPUs, mit Kaltstart)

TierModell-IDHF-QuelleHerkunftIndex ²LizenzCold-StartStatus
defaultgemma-4-12bgoogle/gemma-4-12B-it🇺🇸 Google DeepMind22Apache 2.0~5,5–9,5 min ᵐ ⁶aktiv ⁶
balancedqwen3.8-27bQwen/Qwen3.8-27B-FP8🇨🇳 Alibaban. gelistetApache 2.0~11 min ᵐ ⁴aktiv ⁴
reasoningqwen3.5-9b-deepseek-v4-flashJackrong/Qwen3.5-9B-DeepSeek-V4-Flash🇨🇳 Community-Distilln. gelistetApache 2.0~3,5 minaktiv
visiongemma-4-26b-a4bgoogle/gemma-4-26B-A4B-it🇺🇸 Google DeepMind26Apache 2.0~2–4 min ᵐ ⁷aktiv ⁷
coder-miniqwen3.6-35b-a3bQwen/Qwen3.6-35B-A3B-FP8 (MoE)🇨🇳 Alibaban. gelistetApache 2.0~8 minaktiv
llamallama-3.1-8bNousResearch/Meta-Llama-3.1-8B-Instruct🇺🇸 Meta8Llama Community~8 minLegacy ³

🅿️ Zurückgezogen — und was Ihre Integration jetzt bekommt

Modell-IDseitGrundIhre Anfrage landet bei
qwen3.5-35b-a3b (premium)2026-09-11Index 24 bei 8 192 Token Kontext — das kleinste Fenster im Katalog. Von der Quelle als veraltet geführt.dem Standard-Tier
qwen3-coder-next-fp8 (coder)2026-09-11Von qwen3.6-35b-a3b überholt: bessere Coding-Werte bei vierfachem Kontext und kürzerem Kaltstart.dem Standard-Tier
qwen3.5-9b (default-legacy)2026-09-11Qualitätsindex 22 — identisch mit dem Standard — bei 32 768 statt 262 144 Token Kontext. Sein einziger Vorteil war der kürzeste Kaltstart (205–215 s); seit ein neuer Chat auf einem Modell ohne Kaltstart startet, zählt der nicht mehr.dem Standard-Tier
deepseek-v4-flash (coder-max)2026-09-07Betriebskosten ohne Gegenwert; dasselbe Modell läuft als tensorx-deepseek-v4-flash ohne Kaltstart.dem Standard-Tier

🔑 Die ROLLENNAMEN zeigen dagegen auf die Nachfolger, nicht auf den Standard. Wer coder, coding, qwen-coder oder qwen3-coder schickt, bekommt qwen3.6-35b-a3b — also weiterhin ein Modell fürs Programmieren. qwen-premium und die alten 30B-Namen zeigen auf qwen3.8-27b.

⚠️ Nur die exakte alte Modell-ID fällt auf den Standard — dann aber nicht stillschweigend: die Antwort trägt x-sovrgpt-model-requested und x-sovrgpt-model-substituted (siehe Chat Completions). Prüfen Sie diese Kopfzeile, wenn Sie eine der drei IDs fest verdrahtet haben.

Gemessen am Live-Endpunkt (2026-08-12, ein Lauf je Tier; default seit dem Modellwechsel neu gemessen, drei Läufe am 2026-08-08/15/16). Angegeben ist die Zeit, die der Nutzer wartet — sie enthält also auch das Warten auf eine freie EU-GPU, nicht nur die reine Hochfahrzeit. Warm antwortet jedes Modell in unter 5 Sekunden (default in unter 10). ⚠️ Vorher standen hier Schätzungen, und sie waren nicht durchweg zu vorsichtig: default („30–90 s") war um Faktor 2,3–7 zu niedrig, llama („60–180 s") um Faktor 2,7, premium um gut ein Drittel — coder („8–15 min") dagegen war zu hoch. Deshalb stehen hier jetzt Messwerte und keine Spannen.

¹ 🅿️ coder-max ist am 2026-09-07 zurückgezogen worden — die Fußnote hing vorher an einer Katalogzeile, die es nicht mehr gibt. Sie bleibt stehen, weil der Weg dorthin lehrreich ist: erst hiess es „aktiv (Beta)" mit einer Kaltstart-Schätzung, dann „derzeit nicht nutzbar, wartet auf freie H200-Kapazität". Beides war zu freundlich. Der Tier bekam durchaus Karten, lud das Modell und stürzte danach im Engine-Init ab — und die volle Laufzeit wurde abgerechnet. Vier Tage Ende August: 948 USD gegen sieben beantwortete Anfragen über die gesamte Lebenszeit. Dasselbe Modell läuft als tensorx-deepseek-v4-flash ohne Kaltstart und zu einem Bruchteil der Kosten.

Der default-Tier ist am 2026-08-16 gewechselt: von qwen3.5-9b (Alibaba) auf gemma-4-12b (Google DeepMind). Ausschlaggebend war der Kontext: 32 768 → 262 144 Token, also Faktor 8, bei gleichem Qualitätsindex (22) und gleicher Hardwareklasse. Dazu steht damit erstmals ein zweiter Gewichte-Anbieter im meistgenutzten Tier. ⚠️ Eine Sache wird schlechter, und wir sagen sie dazu: der Kaltstart. Gemessen 332–574 s gegen vorher 205–215 s. Warm antwortet der Tier unverändert in unter 10 Sekunden — die längere Wartezeit trifft nur die erste Anfrage nach einer Pause. 🔧 Korrigiert am 11.09.2026. Hier stand: „Genau deshalb bleibt das bisherige Modell wählbar — als eigener Tier default-legacy (qwen3.5-9b), mit dem kürzesten gemessenen Kaltstart im ganzen Katalog." Dieser Tier ist zurückgezogen. Sein Argument ist nicht überstimmt, sondern weggefallen: seit ein neuer Chat auf tensorx-qwen3.8-27b startet — gar kein Kaltstart — ist „der kürzeste Kaltstart" kein Vorteil mehr. ⚠️ model: "qwen" löst weiterhin auf, jetzt aber auf qwen3.8-27b. Die exakte Id qwen3.5-9b landet beim Standard-Tier (über die API: 404 model_withdrawn).

Der vision-Tier kann seit 2026-08-17 zusätzlich Werkzeuge und hat einen Denk-Schalter. Beides lag nicht am Modell, sondern an zwei fehlenden Startparametern des Endpunkts. Nachgemessen wurde auf allen Pfaden, die der Chat tatsächlich benutzt — einschließlich des streamenden, für den vLLM eine andere Parser-Methode aufruft als für den nicht-streamenden. Konkret heißt das für Sie: Web-Suche, Bild-/Video-Erzeugung, Datei-Export und MCP-Connectoren funktionieren jetzt auch dann, wenn Sie ein Bild im Chat haben. Vorher wurden die Werkzeuge in diesem Tier stillschweigend fallen gelassen — die Antwort kam, die Suche fand aber nicht statt. Im „Auto"-Modus wich das System deshalb auf ein anderes Modell aus; das ist nun nicht mehr nötig, Sie behalten das Bildverständnis. Der Kaltstart-Wert steht jetzt als Spanne aus drei Messungen (131 s / 161 s / 232 s) statt als Einzelwert.

balanced läuft wieder — auf einem neu angelegten Rechenknoten (2026-08-15). Der bisherige Knoten nahm Anfragen entgegen und teilte sie keinem Worker mehr zu: 137 fehlgeschlagene gegen 30 erfolgreiche Aufträge, zuletzt über 900 s ohne jeden Worker. Die Ursache lag beim GPU-Anbieter, nicht am Modell — belegt dadurch, dass ein Knoten mit identischer Konfiguration sofort antwortet. Der Kaltstart ist damit zum ersten Mal überhaupt gemessen: 487,8 s. Vorher stand hier die Schätzung „60–180 s" — sie war um Faktor 2,7 bis 8 zu niedrig.

² Index = Artificial Analysis Intelligence Index, Stand 2026-08-08. Es ist die einzige Quelle, die diese Modelle in einem Testaufbau misst — nur deshalb sind die Werte untereinander vergleichbar. „n. gelistet" heißt: die Quelle führt das Modell nicht; wir schätzen dann keinen Wert. ⚠️ Der Index ist ein Aggregat über englischsprachige Tests und sagt nichts über deutsche Sprachqualität.

³ Legacy heißt: das Modell bleibt vollständig nutzbar und über die API adressierbar, ist aber nicht mehr die empfohlene Wahl für seine Rolle und läuft mittelfristig aus. Es gibt keinen harten Abschalttermin; bestehende Chats und Integrationen laufen unverändert weiter.

Korrektur 2026-08-15: In dieser Tabelle stand premium als Legacy. Das war ein Widerspruch zum Produkt: im Katalog und in GET /api/v1/models ist der Tier als aktiv geführt, und genau das ist die getroffene Entscheidung — es ist der einzige Tier mit einer belegten deutschen Sprachwertung (Soofi-Paper, Deutsch-Aggregat 87,6, der beste Wert im Vergleichsfeld). Er darf später Legacy werden, ist es heute aber nicht.

Live-Stand jederzeit über GET /api/v1/models abrufbar — dort liefern die Felder quality_index, origin_vendor, origin_country und lifecycle dieselben Angaben maschinenlesbar. Siehe API-Referenz.

Embedding- & Rerank-Modelle (RAG)

Für Retrieval-Augmented-Generation-Pipelines stehen zusätzlich Embedding- und Rerank-Modelle bereit — ebenfalls vollständig EU-souverän auf RunPod, ohne US-Proxy. Adressierbar über die OpenAI-kompatible POST /api/v1/embeddings- und die Cohere-kompatible POST /api/v1/rerank-Route.

TypModell-IDHF-QuelleLizenzDimensionen
Embeddingbge-m3BAAI/bge-m3MIT1024
Embeddingnomic-embed-codenomic-ai/nomic-embed-codeApache 2.03584
Rerankbge-reranker-baseBAAI/bge-reranker-baseApache 2.0
  • bge-m3 — Mehrsprachiges Dense-Embedding mit starker deutscher Retrieval-Qualität. Standard-Embedder; OpenAI-Aliase wie text-embedding-3-small werden automatisch hierauf gemappt.
  • nomic-embed-code — Code-spezialisiertes Embedding für Repository-Suche und Code-RAG.
  • bge-reranker-base — Cross-Encoder, der eine Kandidatenliste nach Relevanz zu einer Query neu ordnet. Ideal als zweite Stufe nach einer Embedding-Suche.

Diese Modelle sind ebenfalls Scale-to-Zero (Cold-Start 1–4 min, Modell-Pull) und erscheinen mit kind: "embedding" bzw. kind: "rerank" in GET /api/v1/models.

Sprache: Speech-to-Text & Text-to-Speech (Voice)

SovrGPT spricht und hört — beides EU-souverän. Im Chat über das Mikrofon-Symbol (Diktat statt Tippen) und den Lautsprecher-Button („Vorlesen") an jeder Antwort; programmatisch über die OpenAI-kompatible Audio-API.

FunktionModell-IDAnbieter / HostingSprachenKann
TTS — schnellsupertonic-3self-hosted, Railway europe-west431 inkl. Deutsch10 feste Stimmen, kein Cold-Start
TTS — expressiv + Cloningcosyvoice-3self-hosted, RunPod-EU (GPU)Deutsch nativ (+ en/fr/es/it/ru/…)Emotion, Inline-Tags, eigene Stimme klonen
TTS — Alternativevoxtral-mini-ttsMistral, Paris (DSGVO)mehrsprachigFallback
Speech-to-Text (STT)voxtral-mini-transcribeMistral, Paris (DSGVO)mehrsprachig inkl. DeutschDiktat/Transkription
  • TTS — Supertonic 3 (Standard): ein ~99M-Parameter-ONNX-Modell, das vollständig auf SovrGPT-Infrastruktur in der EU läuft (kein Dritt-SaaS). Zehn Stimmen (M1M5 männlich, F1F5 weiblich), mit Expression-Tags (<breath>, <sigh>) inline. Ausgabe wav/flac/ogg. Kein Cold-Start — erste Wahl für schnelle, feste Ansagen.
  • TTS — CosyVoice 3 (expressiv, Apache 2.0): GPU-Modell auf RunPod-EU, nativ Deutsch (inkl. korrektem „ü"). Kann, was Supertonic nicht kann:
    • Inline-Tags mitten im Text: [laughter], [breath], <laughter>…</laughter>, <strong>…</strong> (Betonung).
    • Emotion / Sprechstil per natürlichsprachiger Anweisung (emotion: "Sprich sehr traurig und langsam.").
    • Zero-Shot-Voice-Cloning: eine eigene Stimme aus einem Referenzclip (≤ 30 s) klonen — kein Training. Eingebaute Stimme: de-thorsten.
    • Opt-in via provider: "cosyvoice". Scale-to-zero: warm ~6 s, Cold-Start möglich. Kein eingebautes Wasserzeichen → KI-Kennzeichnung auf Anwendungsebene. Voll dokumentiert in der Audio-API.
  • STT — Voxtral (Mistral, Paris): mehrsprachige Transkription mit starker deutscher Qualität, DSGVO-konform in der EU gehostet.
    • Eigennamen erkennen: context_bias zieht die Erkennung auf Produkt-, Kunden- oder Fachbegriffe (ohne Leerzeichen, max. 100 Einträge) — ohne zusätzliche Antwortzeit.
    • Formatiertes Transkript: format_text=1 liefert Absätze, eine nummerierte Liste aus gesprochenem „erstens/zweitens/drittens", eine Leerzeile nach der Anrede und eine abgesetzte Grußformel. Dafür läuft parallel ein zweites Modell mit Audio-Verständnis; das Rohtranskript kommt als text_raw immer mit, und eine Formatierung, die den Wortlaut verändern würde, wird verworfen statt ausgeliefert.
    • Ein voll self-hosted STT-Pfad auf RunPod-EU ist bewertet, aber zurückgestellt: das produktiv genutzte Transkriptionsmodell hat keine offenen Gewichte, Self-Hosting wäre also zwingend ein Modellwechsel und bei unserem Volumen 6- bis 13-mal teurer als der EU-Anbieter.
  • Provider-Wahl: supertonic (Default), cosyvoice (expressiv/Cloning) und mistral (Fallback) — pro Request über das provider-Feld wählbar; ohne Angabe entscheidet der Server-Default (Supertonic). Alle erscheinen mit kind: "tts" bzw. kind: "stt" in GET /api/v1/models.

Vollständige API-Beispiele (curl + SDK): Audio-API.

Wenn ein Modell fehlt: die Org-Auswahl

Owner und Admins einer Organisation können unter Einstellungen → Modelle festlegen, welche Modelle ihr Team sieht — sinnvoll, damit der Picker bei einem wachsenden Katalog übersichtlich bleibt. Steht ein Modell hier in der Doku, taucht aber bei dir nicht auf, ist das der wahrscheinlichste Grund.

Die Auswahl wirkt serverseitig und damit auch für die API und für MCP-Clients. Laufende Chats bleiben davon unberührt: ein Chat, der bereits auf ein Modell festgelegt ist, läuft darauf weiter. Details: Orgs & Teams.

Eigene Modelle einbinden (BYO)

Reicht der Katalog nicht, kann eine Organisation eigene OpenAI-kompatible Endpunkte eintragen — unter Einstellungen → Provider, mit eigener Adresse, eigenem Modellnamen und eigenem Anzeigenamen. Typische Fälle: ein selbst betriebenes vLLM im eigenen Rechenzentrum, ein Fachmodell eines Dienstleisters, ein Azure-OpenAI-Deployment.

Der Eintrag erscheint danach nur im Picker dieser Organisation, markiert mit „⚠ extern".

Was Sie dabei wissen müssen — und was wir deshalb bewusst nicht tun:

  • Anfragen an einen eigenen Endpunkt verlassen die EU-Souveränität von SovrGPT. Sie gehen direkt an die eingetragene Adresse; es gilt deren Datenschutzerklärung, nicht unsere Zusage. Genau dafür steht die „extern"-Kennzeichnung.
  • Werkzeuge und der Denk-Regler bleiben aus. Über einen fremden Endpunkt haben wir nichts gemessen — und ein Werkzeugaufruf an ein Modell ohne passenden Parser scheitert hart, statt auf Text auszuweichen. Wir bieten deshalb nichts an, was wir nicht geprüft haben.
  • Warmhalten gibt es nicht. Es gibt keinen Worker von uns, den wir für Sie wach halten könnten — die Verfügbarkeit bestimmt Ihr Endpunkt.
  • Nur https, keine internen Adressen. Adressen im lokalen oder privaten Netz sowie rohe IP-Adressen werden abgelehnt; ein Endpunkt braucht einen DNS-Namen mit gültigem Zertifikat.
  • Ein hinterlegter API-Schlüssel wird verschlüsselt gespeichert (AES-256-GCM) und verlässt den Server nie. Endpunkte hinter einer IP-Freigabe kommen auch ganz ohne Schlüssel aus.

Pausieren und Löschen ist jederzeit möglich — auch nach einem Tarif-Wechsel, bei dem das Anlegen neuer Einträge nicht mehr enthalten ist. Ein Datenabfluss, den Sie nicht mehr abstellen können, wäre kein akzeptabler Zustand. Gebundene Chats antworten danach wieder mit dem Standard-Modell.

Für die API: GET /v1/models listet die Einträge mit owned_by: "org" und der ID org-model:….

Welches Modell wofür?

  • Default (gemma-4-12b) — Schnellantworten, Boilerplate, einfache Code-Aufgaben, deutsche Texte. Erste Wahl für interaktive Chats. Mit 262k Kontext der Tier, der lange Dokumente am Stück aufnimmt, und mit nativem Bildverständnis.
  • Balanced (qwen3.8-27b) — dichtes 27B-Modell der neuesten Qwen-Generation, ausgelegt auf repository-weite Code-Aufgaben und Tool-Calling, mit fließendem Deutsch und umschaltbarem Denkmodus. 131k Kontext. 🔧 Geändert am 2026-08-18: Dieser Tier führt jetzt Qwen 3.8 27B statt Qwen 3.6 27B. Die alte Modell-Id qwen3.6-27b funktioniert weiter (sie zeigt auf den Nachfolger), liefert aber ab dem Wechsel das neue Modell. Werkzeugaufrufe, Streaming, System-Rolle und Denk-Schalter sind am neuen Endpunkt gemessen; der Kaltstart ist mit 662 s länger als die ~8 min des Vorgängers — im Messlauf war der EU-Pool allerdings knapp (80× THROTTLED), ein Teil davon ist Warten auf eine freie Karte. Der Kontextwert von 131k bestimmt auch, wie viel eines hochgeladenen PDFs ins Gespräch passt.
  • Reasoning (qwen3.5-9b-deepseek-v4-flash) — DeepSeek-V4-Distill auf Qwen-Backbone. Denkt immer sichtbar, geeignet für Mathematik, Logik, Schritt-für-Schritt-Auswertungen. 🔧 Geändert am 2026-08-17: Der Gedankengang kommt jetzt im eigenen Feld reasoning_content statt als <think>…</think> im Antworttext — im Chat als aufklappbarer „Gedankengang", über die API als eigenes Feld. (Hier stand „Gibt sichtbare <think>…</think>-Schritte aus". Tatsächlich kam über die API der Gedanke ungetrennt im content an, gefolgt von einem nackten </think> ohne öffnendes Gegenstück — das öffnende Tag setzt die Chat-Vorlage selbst in den Prompt, und ohne REASONING_PARSER am Endpunkt trennte niemand die beiden Teile. Wer den content bisher am <think>-Tag zerlegt hat, muss auf reasoning_content umstellen.)
  • Vision (gemma-4-26b-a4b) — Liest Bilder im Chat (PNG und JPG). Multimodal in Englisch sehr stark, in Deutsch sehr gut. 262k Kontext, Werkzeuge nutzbar (auch zusammen mit einem Bild) und Denk-Modus umschaltbar — alle drei seit 2026-08-17 nachgemessen, siehe Fußnote ⁷. (Hier standen 16k Kontext und kein Werkzeug-Hinweis; der Katalog hatte die Anhebung des Endpunkts nie mitbekommen.) 🔧 Korrigiert am 13.09.2026: hier stand zusätzlich WebP — dieses Format nimmt der Upload gar nicht an, ein WebP-Bild wurde also immer schon abgewiesen. Erlaubt sind PNG und JPEG. 🔴 Und bis zum 13.09.2026 erreichte überhaupt kein Bild das Modell — der Upload nahm es an, der Chat schickte es aber nie mit. Seitdem geht es wirklich; siehe Bilder im Chat weiter unten.
  • Coder mini (qwen3.6-35b-a3b) — schnelle, günstige Coding-Stufe (MoE, 35 B total / 3 B aktiv, FP8, 1× 48-GB-GPU) mit nativem Tool-Calling und 131k Kontext. Erste Wahl für agentisches Coding über IDE-Plugins, wenn Tempo und Kosten zählen. Denk-Modus umschaltbar (Qwen-Stil).
  • Llama (llama-3.1-8b) — Llama-spezifische Workloads, Re-Train-Vergleiche oder bei Lizenz-Vorgaben „Built with Llama".

Und im Partner-Betrieb — dieselbe API, aber ohne Kaltstart:

  • GPT-OSS 120B (stackit-gpt-oss-120b) — wenn Sie den Denk-Aufwand selbst regeln wollen. Betrieb in Deutschland. Denkt grundsätzlich mit; bei gründlich braucht die Antwort ein großzügiges Token-Budget, sonst geht es ganz in den Gedankengang.
  • Gemma 4 31B (stackit-gemma-4-31b)Bilder verstehen mit Verarbeitung in Deutschland. Der vision-Tier kann das auch, hat aber Kaltstart. Über 140 Sprachen, Denk-Schalter umschaltbar.
  • Qwen 3.6 27B (stackit-qwen3.6-27b) — Allrounder mit Verarbeitung in Deutschland, sofort antwortbereit.
  • Qwen 3.8 27B (tensorx-qwen3.8-27b)exakt dasselbe Modell wie der eigene balanced-Tier. Nehmen Sie diesen Eintrag, wenn die ~11 Minuten Kaltstart stören; nehmen Sie den eigenen, wenn die Verarbeitung auf unserer eigenen Hardware laufen soll.
  • Qwen 3.8 Max (tensorx-qwen3.8-max) — das größte offene Modell im Katalog. Auf eigenen Karten unerreichbar (die Gewichte allein belegen rund 2,4 TB). Denkt immer mit — enable_thinking: false wird hier abgelehnt.
  • Kimi K3 (tensorx-kimi-k3) — sehr großer Kontext, starkes Werkzeug- und Agentenverhalten. Denkt immer mit. ⚠️ Der teuerste Eintrag im Katalog.
  • Kimi K2.7 Code (tensorx-kimi-k2.7-code) — Coding und agentische Werkzeugketten ohne Kaltstart. Die Alternative zu den eigenen Coding-Stufen, wenn Wartezeit stört.
  • DeepSeek V4 Flash (tensorx-deepseek-v4-flash) — günstigster Eintrag im Katalog. Dasselbe Modell wie der am 07.09.2026 zurückgezogene eigene coder-max-Tier — hier ohne Kaltstart und zu einem Bruchteil der Betriebskosten.
  • DeepSeek V4 Pro (tensorx-deepseek-v4-pro) — das große Modell der V4-Reihe, starkes Schlussfolgern.
  • GLM 5.3 (tensorx-glm-5.3) — der stärkste offen veröffentlichte Stand für Programmierung und agentische Werkzeugketten, ohne Kaltstart. Die erste Adresse, wenn Code-Qualität zählt und Wartezeit stört. Denkt immer mit.
  • GLM 5.3 Flash (tensorx-glm-5.3-flash) — dieselbe Reihe, schlank und sehr günstig: nach DeepSeek V4 Flash der zweitgünstigste Eintrag im Katalog, und der günstigste mit Werkzeugketten und sauber getrenntem Denkteil. Gut für Massendurchsatz.
  • Qwen 3.8 Flash (tensorx-qwen3.8-flash-next) — der günstigste Eingabepreis im ganzen Katalog und zugleich der größte Kontext der Qwen-3.8-Reihe (262k). Ein großes Modell, das je Token nur einen kleinen Teil von sich rechnet: 125 Mrd. Parameter, davon 6 Mrd. aktiv. Anders als GLM 5.3 Flash lässt sich hier das Denken abschalten — nehmen Sie es, wenn Sie viele Anfragen mit langen Vorlagen stellen und die Antwort schnell und knapp sein soll. Es ist nicht dasselbe Modell wie „Qwen 3.8 27B"; wer die gemessene Werkzeug- und Codequalität des 27B braucht, bleibt dort.
  • MiniMax M3 (tensorx-minimax-m3) / GLM 5.2 (tensorx-glm-5.2) — agentisch ausgelegt, sehr großer Kontext, niedriger Preis. ⚠️ Bei MiniMax M3 ist die Lizenz von uns nicht geprüft.

Coding in der IDE (API-first)

Die Coding-Stufen sind primär für agentisches Coding über IDE-Plugins gedacht (Cline, Continue, OpenCode, Roo-Code, …). Alle sprechen die OpenAI-kompatible API:

  • Base-URL: https://sovrgpt.com/api/v1
  • API-Key: unter /settings/api-keys erzeugen (Scope chat), als Bearer nutzen.
  • Modell-ID: qwen3.6-35b-a3b — die souveräne Coding-Stufe, 131k Kontext. Ohne Kaltstart: stackit-qwen3.6-27b oder tensorx-kimi-k2.7-code.

🔧 Korrigiert am 11.09.2026. Hier standen qwen3-coder-next-fp8 und deepseek-v4-flashbeide sind zurückgezogen, und die Beispiele unten trugen sie bis zu dieser Korrektur in jeder Konfigurationsdatei. Wer sie kopiert hatte, bekommt seit der Rücknahme ein 404 model_withdrawn mit dem Nachfolger im Text. Die vollständige Einrichtungsanleitung mit allen Werkzeugen steht in Coding in der IDE.

Cline (VS Code): API ProviderOpenAI Compatible · Base URL https://sovrgpt.com/api/v1 · API Key sov_… · Model ID qwen3.6-35b-a3b · Context Window 131072 (muss von Hand gesetzt werden).

Continue (config.yaml):

models:
  - name: SovrGPT Coder mini
    provider: openai
    model: qwen3.6-35b-a3b
    apiBase: https://sovrgpt.com/api/v1
    apiKey: sov_...
    requestOptions:
      timeout: 900000   # Kaltstart, siehe oben

OpenCode (opencode.json):

{
  "provider": {
    "sovrgpt": {
      "npm": "@ai-sdk/openai-compatible",
      "options": { "baseURL": "https://sovrgpt.com/api/v1", "apiKey": "sov_..." },
      "models": { "qwen3.6-35b-a3b": { "name": "SovrGPT Coder mini" } }
    }
  }
}

Denk-Level pro Request (reasoning_effort)

🔧 Korrigiert am 11.09.2026. Hier stand „Nur coder-max denkt auf Abruf tiefer" mit einem Beispiel auf deepseek-v4-flash — einem Modell, das seit dem 07.09.2026 zurückgezogen ist. Der Satz war schon vorher zu eng: der Regler wird seit dem 24.08.2026 katalog-getrieben übersetzt und gilt für jedes Modell, das gemessene Stufen führt.

🔑 Welche Modelle den Regler auswerten, sagt effort_levels in GET /v1/models — ein leeres Array heißt „kein wirksamer Regler". Fragen Sie das ab, statt es aus der Modellfamilie zu schließen: die Stufen sind je Eintrag gemessen, und Geschwistermodelle verhalten sich unterschiedlich.

Steuerung OpenAI-idiomatisch über das Top-Level-Feld reasoning_effort (im Python-SDK via extra_body). Produktweit gibt es drei Stufen — low, medium, high; was daraus beim jeweiligen Anbieter wird (eine Token-Zahl, eine andere Skala), übernimmt die Route.

curl https://sovrgpt.com/api/v1/chat/completions \
  -H "Authorization: Bearer $SOVR_KEY" -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.6-35b-a3b",
    "messages": [{ "role": "user", "content": "Refactore dieses Modul und erkläre die Schritte." }],
    "reasoning_effort": "high",
    "max_tokens": 8192
  }'

⚠️ Bei high das max_tokens mitziehen — der Gedankengang zählt gegen das Antwortbudget. An qwen3.6-35b-a3b gemessen: bei unbegrenztem Denkbudget und 2 000 max_tokens blieb der Antworttext leer.

Wer volle Kontrolle will, gibt stattdessen chat_template_kwargs direkt mit (z. B. {"thinking": true, "reasoning_effort": "max"}) — das wird verbatim durchgereicht und gewinnt gegen reasoning_effort. Details: POST /v1/chat/completions.

Cold-Start verstehen

  • Warm: Modell ist auf einem GPU-Worker geladen, Antwort < 5 s.
  • Cold: Worker muss neu hochfahren, Image laden, Modell-Weights pullen. Gemessen 2–9,5 Minuten je nach Tier — die Einzelwerte stehen in der Katalogtabelle oben. (Hier stand „30 s bis 5 Minuten". Das war eine Schätzung und für kein einziges Modell die Untergrenze; der schnellste gemessene Kaltstart liegt bei gut 2 Minuten.)
  • Pay-per-use: Während Idle-Zeit kostet das Modell nichts. Aber: Erste Anfrage nach längerer Pause ist langsam. Für Production-Cron-Jobs empfehlen wir, einen Warm-Up-Call vorzuschalten.

Tools im Chat

  • Web-Suche — Brave-Search-API, 2 000 Anfragen/Monat im Free-Tier. 🔴 Anbieter sitzt in den USA (Brave Software, Inc.), Zero Data Retention per Auftragsverarbeitungsvertrag zugesichert. Je Chat opt-in, standardmässig aus — Einzelheiten unter Datenschutz. (Hier stand „EU-konform". Das war falsch.) Derselbe Schalter erlaubt dem Modell zusätzlich, eine Seite zu öffnen und zu lesen (fetch_url) — dieser Abruf geht direkt von unseren EU-Servern an die Seite, ohne Brave. 🆕 Seit dem 13.09.2026 entscheidest du, wie sich SovrGPT dabei meldet (Organisation → Seitenabruf): unauffällig (Voreinstellung — SovrGPT gibt sich als gewöhnlicher Browser aus, Seiten mit pauschalen Bot-Sperren liefern dann eher aus) oder mit Namen (SovrGPT nennt sich und die rooom AG). ⚠️ „Unauffällig" ändert nur die Kopfzeilen — es verbirgt weder unsere IP noch technische Merkmale der Verbindung. Nur Owner und Admins können es umstellen, und jede Änderung steht im Prüfprotokoll.
  • Bild-Generierung — Z-Image-Turbo (schnell) oder FLUX.2-klein (höhere Qualität), beides Apache 2.0, EU-gehostet.
  • Video-Generierung — LTX-Video 2B (OpenRAIL-M), 5–8 s Clips bei 768×512.
  • Marketplace-Connectoren — Über 20 vorkonfigurierte MCP-Server (siehe Marketplace).

⚠️ Korrektur (2026-08-17): Hier stand „Diese Werkzeuge sind unabhängig vom Modell verfügbar". Das stimmt nicht. Werkzeuge setzen voraus, dass der Endpunkt des jeweiligen Modells mit einem passenden Tool-Parser gestartet wurde — sonst lehnt er jede Anfrage mit tools ab. SovrGPT sperrt die Schalter deshalb im Composer, statt eine Antwort scheitern zu lassen. Stand heute können alle Tiers Werkzeuge — mit einer Ausnahme: llama (llama-3.1-8b). Dort ist der Parser zwar gesetzt und ein erzwungener Werkzeugaufruf funktioniert, im automatischen Modus ruft das Modell aber in 4 von 4 Messungen nichts auf und antwortet stattdessen in Prosa — einmal sogar mit einer behaupteten Websuche samt erfundenem Ergebnis. Den Schalter dort freizugeben würde also eine Halluzination als Suchergebnis ausliefern.

Bilder im Chat

Hängen Sie ein Bild an die Nachricht an (Büroklammer oder per Ablegen im Fenster). Erlaubt sind PNG und JPG.

🔴 Neu seit dem 13.09.2026 — und davor war es kaputt. Bis dahin nahm SovrGPT ein Bild zwar an und zeigte es im Verlauf, schickte es aber nie an das Modell. Die Antwort las sich, als wäre das Bild dabei gewesen; tatsächlich kannte das Modell nur den Dateinamen. Seitdem geht der Bildpfad wirklich.

Was gilt:

FormatePNG, JPG — kein WebP, kein GIF, kein PDF-Bild
Höchstens je Bild8 MiB
Höchstens je Nachricht4 Bilder und zusammen 12 MiB
Bildfähige ModelleDefault (gemma-4-12b), Vision (gemma-4-26b-a4b) und Gemma 4 31B im Partner-Betrieb

⚠️ Nicht jedes Modell kann Bilder ansehen. Wählen Sie eines, das es nicht kann, sagt SovrGPT das vor dem Absenden über dem Eingabefeld — und der Assistent weist in seiner Antwort zusätzlich darauf hin. Er rät nicht, was auf dem Bild zu sehen ist. Das Bild bleibt im Verlauf erhalten; ein Modellwechsel genügt.

📌 Ein Bild auf eine Folie zu legen funktioniert unabhängig davon. Dafür muss das Modell das Bild nicht ansehen können — es gibt nur den Dateinamen an export_pptx weiter, eingesetzt wird die Datei auf dem Server.

📌 Ein zu großes Bild wird abgelehnt, nicht verkleinert. Laden Sie in dem Fall eine kleinere Fassung hoch; ein automatisches Herunterrechnen gibt es bewusst nicht.

⚠️ Über die OpenAI-kompatible API (/v1/chat/completions) gelten diese Schutzmechanismen NICHT. Die Route reicht den Anfragerumpf unverändert an das Modell weiter, ein image_url-Teil kommt also durch — aber ohne Fähigkeitsprüfung, ohne Größengrenze und ohne Hinweis. Schicken Sie dort ein Bild an ein Modell, das keine Bilder liest, scheitert die Anfrage am Endpunkt, statt eine erklärende Antwort zu liefern. 📌 Wir haben diesen Weg nicht gemessen — die Aussage beschreibt, was der Code tut, nicht einen bestandenen Test. Wählen Sie für Bilder über die API eines der drei bildfähigen Modelle oben.

Umgang mit Tokens, Quoten, Limits

  • Standard-Plan: faire Nutzung, kein hartes Token-Limit.
  • Enterprise-Plan: dedizierte GPU-Worker (kein Cold-Start), garantierte Latenz, separate Vertragsanlage.
  • API-Calls werden pro Org abgerechnet — nicht pro User.

Die genauen Pricing-Stufen liegen unter /settings/usage (eingeloggt) und im Vertrag mit eNetworkers.

Modelle