SovrGPT Docs

Coding in der IDE

SovrGPT als Modell-Backend für Cline, Continue, Roo Code, OpenCode, Zed, Cursor und Aider — souveräne EU-Modelle direkt im Editor, mit ehrlichen Angaben zu Latenz und Grenzen.

Coding in der IDE

SovrGPT ist OpenAI-kompatibel. Jedes Coding-Werkzeug, das eine eigene Basis-URL akzeptiert, lässt sich damit auf europäische Modelle umstellen — ohne dass dein Code einen US-Anbieter erreicht.

  • Basis-URL: https://sovrgpt.com/api/v1
  • Schlüssel: unter Einstellungen → API-Keys erzeugen, Scope chat. Format sov_…
  • Auth: Authorization: Bearer sov_…

Lies erst den Abschnitt Kaltstart. Unsere Modelle laufen auf Karten, die im Leerlauf abgeschaltet werden. Die erste Anfrage nach einer Pause wartet mehrere Minuten. Das ist kein Fehler, aber es ist der Unterschied zwischen „funktioniert" und „im Alltag benutzbar" — und viele IDE-Plugins laufen vorher in einen Timeout.

Welches Modell?

Modell-IDWofürKontextKaltstart (gemessen)
qwen3.6-35b-a3bAlltag: Vervollständigen, Erklären, kleine Änderungen131k~421 s
qwen3-coder-next-fp8Repository-weite Umbauten, lange Werkzeugketten32k725–886 s
deepseek-v4-flashSchwerste Aufgaben, reasoning_effort steuerbarbis 393k🔴 siehe unten
stackit-qwen3.6-27bkein Kaltstart — Betrieb bei STACKIT in Deutschland131k0 s

deepseek-v4-flash ist derzeit nicht bedienbar. Er belegt zwei H200-Karten, und im EU-Pool ist dieses Paar praktisch nie frei — ein Probeauftrag lag über 900 Sekunden ohne zugeteilten Worker. Der Tier steht im Katalog, aber wir versprechen für ihn heute keine Verfügbarkeit. Nimm qwen3-coder-next-fp8.

Warum stackit-qwen3.6-27b in dieser Liste steht: weil es sofort antwortet. (Bis zum 2026-08-18 stand hier „obwohl es dasselbe Modell ist wie unser eigener Tier“ — das gilt nicht mehr: unser balanced führt seither Qwen 3.8 27B, während bei STACKIT weiterhin die Vorgängergeneration Qwen 3.6 27B läuft.) Bei einem IDE-Plugin ist genau das der entscheidende Unterschied — ein Editor, der bei jeder ersten Frage sieben Minuten steht, wird nicht benutzt. Der Eintrag erscheint nur, wenn der Betrieb bei STACKIT für deine Organisation freigeschaltet ist.

Der Kaltstart ist die eine Sache, die du wissen musst

Unsere GPU-Worker fahren im Leerlauf herunter (scale-to-zero). Das hält den Preis unten, kostet aber Zeit beim ersten Aufruf. Warm antworten alle Tiers in Sekunden.

Drei Wege damit umzugehen:

  1. Ein Modell ohne Kaltstart wählenstackit-qwen3.6-27b läuft beim Betreiber durchgehend.
  2. Warmhalten buchen (Warmup-Pin im Chat oder über die API). Der Pin setzt am Endpunkt einen dauerhaften Worker. ⚠️ Er wird minutengenau abgerechnet, solange er läuft — das ist der Preis dafür, dass die Karte für dich bereitsteht.
  3. Zeitgesteuert vorheizen — Arbeitsbeginn eintragen, der Vorlauf wird eingerechnet.

Stell den Timeout deines Plugins hoch. Die meisten Clients brechen nach 60–120 Sekunden ab. Bei kaltem Worker ist das zu früh, und der Fehler sieht dann aus wie „Server kaputt", ist aber ein zu kurzer Timeout. Wo möglich: ≥ 900 s.

Einrichtung je Werkzeug

Cline / Roo Code (VS Code)

API ProviderOpenAI Compatible

FeldWert
Base URLhttps://sovrgpt.com/api/v1
API Keysov_…
Model IDqwen3.6-35b-a3b

Continue

~/.continue/config.yaml:

models:
  - name: SovrGPT Coder mini
    provider: openai
    model: qwen3.6-35b-a3b
    apiBase: https://sovrgpt.com/api/v1
    apiKey: sov_...
    requestOptions:
      timeout: 900000   # Kaltstart, siehe oben

OpenCode

opencode.json:

{
  "provider": {
    "sovrgpt": {
      "npm": "@ai-sdk/openai-compatible",
      "options": {
        "baseURL": "https://sovrgpt.com/api/v1",
        "apiKey": "sov_..."
      },
      "models": {
        "qwen3.6-35b-a3b": { "name": "SovrGPT Coder mini" },
        "qwen3-coder-next-fp8": { "name": "SovrGPT Coder" }
      }
    }
  }
}

Zed

settings.json:

{
  "language_models": {
    "openai_compatible": {
      "SovrGPT": {
        "api_url": "https://sovrgpt.com/api/v1",
        "available_models": [
          { "name": "qwen3.6-35b-a3b", "max_tokens": 131072 }
        ]
      }
    }
  }
}

Den Schlüssel trägt Zed über Assistant → Configure ein.

Aider

export OPENAI_API_BASE=https://sovrgpt.com/api/v1
export OPENAI_API_KEY=sov_...
aider --model openai/qwen3-coder-next-fp8

Cursor

Cursor nimmt unter Settings → Models eine eigene OpenAI Base URL entgegen. Trage https://sovrgpt.com/api/v1 und den sov_…-Schlüssel ein und ergänze die Modell-ID von Hand.

Grenze, die wir nicht verschweigen: Cursor leitet einen Teil seiner Funktionen (Tab-Vervollständigung, Indexierung) über die eigene Infrastruktur, unabhängig davon, welches Modell du im Chat einstellst. Die Chat- und Agentenanfragen landen dann bei uns, die übrigen nicht. Wer vollständige Souveränität braucht, ist mit Cline, Continue, Zed oder OpenCode besser bedient — dort ist die Basis-URL die einzige Adresse, die das Plugin kennt.

Claude Code

Geht heute nicht. Claude Code spricht das Anthropic-Protokoll, nicht das OpenAI-Protokoll. Wir bieten bisher nur die OpenAI-kompatible Route an, also lässt sich Claude Code nicht auf SovrGPT umbiegen. Eine Anthropic-kompatible Route steht auf unserer Liste; solange sie nicht existiert, sagen wir das hier, statt eine Anleitung zu schreiben, die nicht funktioniert.

Denk-Level pro Anfrage

deepseek-v4-flash nimmt das OpenAI-übliche Feld reasoning_effort (low | medium | high) auf oberster Ebene entgegen; im Python-SDK über extra_body. Die übrigen Coding-Tiers schalten den Denkmodus über chat_template_kwargs.enable_thinking.

Bei qwen3-coder-next-fp8 tut der Denk-Schalter nichts. Gemessen mit temperature: 0: die Antworten mit und ohne enable_thinking sind byte-gleich. Die Chat-Vorlage dieses Modells wertet das Feld nicht aus. Der Katalog führt ihn deshalb als „kein Denkmodus" — nicht als abgeschalteten.

Kontext und Gedächtnis: prom.codes

Ein souveränes Modell ist die eine Hälfte. Die andere ist das, was der Agent über dein Repository weiß — und die meisten Kontext- und Gedächtnisdienste für Coding-Agenten laufen außerhalb Europas.

prom.codes schließt genau diese Lücke: MCP-Server für Code-Kontext (semantische Suche, Symbolgraph, Referenzen) und Agenten-Gedächtnis (dauerhafte Fakten, Entscheidungen und Konventionen über Sitzungen hinweg), in Europa gehostet. Es ist eine eigenständige Plattform aus demselben Haus wie SovrGPT.

Zusammen ergibt das einen Werkzeugkasten, der die Grenze nicht verlässt:

TeilWer liefert ihn
Modell (Vervollständigung, Agent, Refactor)SovrGPT — EU-Rechenzentren
Code-Kontext und Gedächtnisprom.codes — EU-gehostet
Editordein Rechner

Die Einbindung läuft über MCP und ist damit unabhängig von uns — beides funktioniert auch einzeln. Einrichtung: siehe prom.codes.

Was noch fehlt

Wir führen das hier offen, statt es in der Anleitung zu verschweigen:

  • Keine Anthropic-kompatible Route ⇒ Claude Code ist nicht anbindbar.
  • Kein FIM-Endpunkt (fill-in-the-middle) ⇒ Inline-Vervollständigung im Editor („Ghost Text") wird nicht unterstützt. Chat und agentisches Arbeiten funktionieren.
  • deepseek-v4-flash ohne Verfügbarkeitszusage (Kapazität, siehe oben).

Verwandt: Modelle · API-Referenz · MCP-Server

Coding in der IDE