Coding in der IDE
SovrGPT als Modell-Backend für Cline, Continue, Roo Code, OpenCode, Zed, Cursor und Aider — souveräne EU-Modelle direkt im Editor, mit ehrlichen Angaben zu Latenz und Grenzen.
Coding in der IDE
SovrGPT ist OpenAI-kompatibel. Jedes Coding-Werkzeug, das eine eigene Basis-URL akzeptiert, lässt sich damit auf europäische Modelle umstellen — ohne dass dein Code einen US-Anbieter erreicht.
- Basis-URL:
https://sovrgpt.com/api/v1 - Schlüssel: unter Einstellungen → API-Keys erzeugen, Scope
chat. Formatsov_… - Auth:
Authorization: Bearer sov_…
Lies erst den Abschnitt Kaltstart. Unsere Modelle laufen auf Karten, die im Leerlauf abgeschaltet werden. Die erste Anfrage nach einer Pause wartet mehrere Minuten. Das ist kein Fehler, aber es ist der Unterschied zwischen „funktioniert" und „im Alltag benutzbar" — und viele IDE-Plugins laufen vorher in einen Timeout.
Welches Modell?
| Modell-ID | Wofür | Kontext | Kaltstart (gemessen) |
|---|---|---|---|
qwen3.6-35b-a3b | Alltag: Vervollständigen, Erklären, kleine Änderungen | 131k | ~421 s |
qwen3-coder-next-fp8 | Repository-weite Umbauten, lange Werkzeugketten | 32k | 725–886 s |
deepseek-v4-flash | Schwerste Aufgaben, reasoning_effort steuerbar | bis 393k | 🔴 siehe unten |
stackit-qwen3.6-27b | kein Kaltstart — Betrieb bei STACKIT in Deutschland | 131k | 0 s |
deepseek-v4-flashist derzeit nicht bedienbar. Er belegt zwei H200-Karten, und im EU-Pool ist dieses Paar praktisch nie frei — ein Probeauftrag lag über 900 Sekunden ohne zugeteilten Worker. Der Tier steht im Katalog, aber wir versprechen für ihn heute keine Verfügbarkeit. Nimmqwen3-coder-next-fp8.
Warum
stackit-qwen3.6-27bin dieser Liste steht: weil es sofort antwortet. (Bis zum 2026-08-18 stand hier „obwohl es dasselbe Modell ist wie unser eigener Tier“ — das gilt nicht mehr: unserbalancedführt seither Qwen 3.8 27B, während bei STACKIT weiterhin die Vorgängergeneration Qwen 3.6 27B läuft.) Bei einem IDE-Plugin ist genau das der entscheidende Unterschied — ein Editor, der bei jeder ersten Frage sieben Minuten steht, wird nicht benutzt. Der Eintrag erscheint nur, wenn der Betrieb bei STACKIT für deine Organisation freigeschaltet ist.
Der Kaltstart ist die eine Sache, die du wissen musst
Unsere GPU-Worker fahren im Leerlauf herunter (scale-to-zero). Das hält den Preis unten,
kostet aber Zeit beim ersten Aufruf. Warm antworten alle Tiers in Sekunden.
Drei Wege damit umzugehen:
- Ein Modell ohne Kaltstart wählen —
stackit-qwen3.6-27bläuft beim Betreiber durchgehend. - Warmhalten buchen (Warmup-Pin im Chat oder über die API). Der Pin setzt am Endpunkt einen dauerhaften Worker. ⚠️ Er wird minutengenau abgerechnet, solange er läuft — das ist der Preis dafür, dass die Karte für dich bereitsteht.
- Zeitgesteuert vorheizen — Arbeitsbeginn eintragen, der Vorlauf wird eingerechnet.
Stell den Timeout deines Plugins hoch. Die meisten Clients brechen nach 60–120 Sekunden ab. Bei kaltem Worker ist das zu früh, und der Fehler sieht dann aus wie „Server kaputt", ist aber ein zu kurzer Timeout. Wo möglich: ≥ 900 s.
Einrichtung je Werkzeug
Cline / Roo Code (VS Code)
API Provider → OpenAI Compatible
| Feld | Wert |
|---|---|
| Base URL | https://sovrgpt.com/api/v1 |
| API Key | sov_… |
| Model ID | qwen3.6-35b-a3b |
Continue
~/.continue/config.yaml:
models:
- name: SovrGPT Coder mini
provider: openai
model: qwen3.6-35b-a3b
apiBase: https://sovrgpt.com/api/v1
apiKey: sov_...
requestOptions:
timeout: 900000 # Kaltstart, siehe obenOpenCode
opencode.json:
{
"provider": {
"sovrgpt": {
"npm": "@ai-sdk/openai-compatible",
"options": {
"baseURL": "https://sovrgpt.com/api/v1",
"apiKey": "sov_..."
},
"models": {
"qwen3.6-35b-a3b": { "name": "SovrGPT Coder mini" },
"qwen3-coder-next-fp8": { "name": "SovrGPT Coder" }
}
}
}
}Zed
settings.json:
{
"language_models": {
"openai_compatible": {
"SovrGPT": {
"api_url": "https://sovrgpt.com/api/v1",
"available_models": [
{ "name": "qwen3.6-35b-a3b", "max_tokens": 131072 }
]
}
}
}
}Den Schlüssel trägt Zed über Assistant → Configure ein.
Aider
export OPENAI_API_BASE=https://sovrgpt.com/api/v1
export OPENAI_API_KEY=sov_...
aider --model openai/qwen3-coder-next-fp8Cursor
Cursor nimmt unter Settings → Models eine eigene OpenAI Base URL entgegen. Trage
https://sovrgpt.com/api/v1 und den sov_…-Schlüssel ein und ergänze die Modell-ID von
Hand.
Grenze, die wir nicht verschweigen: Cursor leitet einen Teil seiner Funktionen (Tab-Vervollständigung, Indexierung) über die eigene Infrastruktur, unabhängig davon, welches Modell du im Chat einstellst. Die Chat- und Agentenanfragen landen dann bei uns, die übrigen nicht. Wer vollständige Souveränität braucht, ist mit Cline, Continue, Zed oder OpenCode besser bedient — dort ist die Basis-URL die einzige Adresse, die das Plugin kennt.
Claude Code
Geht heute nicht. Claude Code spricht das Anthropic-Protokoll, nicht das OpenAI-Protokoll. Wir bieten bisher nur die OpenAI-kompatible Route an, also lässt sich Claude Code nicht auf SovrGPT umbiegen. Eine Anthropic-kompatible Route steht auf unserer Liste; solange sie nicht existiert, sagen wir das hier, statt eine Anleitung zu schreiben, die nicht funktioniert.
Denk-Level pro Anfrage
deepseek-v4-flash nimmt das OpenAI-übliche Feld reasoning_effort (low | medium |
high) auf oberster Ebene entgegen; im Python-SDK über extra_body. Die übrigen
Coding-Tiers schalten den Denkmodus über chat_template_kwargs.enable_thinking.
Bei
qwen3-coder-next-fp8tut der Denk-Schalter nichts. Gemessen mittemperature: 0: die Antworten mit und ohneenable_thinkingsind byte-gleich. Die Chat-Vorlage dieses Modells wertet das Feld nicht aus. Der Katalog führt ihn deshalb als „kein Denkmodus" — nicht als abgeschalteten.
Kontext und Gedächtnis: prom.codes
Ein souveränes Modell ist die eine Hälfte. Die andere ist das, was der Agent über dein Repository weiß — und die meisten Kontext- und Gedächtnisdienste für Coding-Agenten laufen außerhalb Europas.
prom.codes schließt genau diese Lücke: MCP-Server für Code-Kontext (semantische Suche, Symbolgraph, Referenzen) und Agenten-Gedächtnis (dauerhafte Fakten, Entscheidungen und Konventionen über Sitzungen hinweg), in Europa gehostet. Es ist eine eigenständige Plattform aus demselben Haus wie SovrGPT.
Zusammen ergibt das einen Werkzeugkasten, der die Grenze nicht verlässt:
| Teil | Wer liefert ihn |
|---|---|
| Modell (Vervollständigung, Agent, Refactor) | SovrGPT — EU-Rechenzentren |
| Code-Kontext und Gedächtnis | prom.codes — EU-gehostet |
| Editor | dein Rechner |
Die Einbindung läuft über MCP und ist damit unabhängig von uns — beides funktioniert auch einzeln. Einrichtung: siehe prom.codes.
Was noch fehlt
Wir führen das hier offen, statt es in der Anleitung zu verschweigen:
- Keine Anthropic-kompatible Route ⇒ Claude Code ist nicht anbindbar.
- Kein FIM-Endpunkt (
fill-in-the-middle) ⇒ Inline-Vervollständigung im Editor („Ghost Text") wird nicht unterstützt. Chat und agentisches Arbeiten funktionieren. deepseek-v4-flashohne Verfügbarkeitszusage (Kapazität, siehe oben).
Verwandt: Modelle · API-Referenz · MCP-Server