Zuletzt geprüft:
Cline wurde 2025 zum Standard-Open-Source-Coding-Agent, nachdem sich der in der IDE integrierte Workflow gegenüber den autonomen Schleifen-Ansätzen, die zuvor verwendet wurden, durchgesetzt hatte. Die meisten Nutzer betreiben Cline gegen die Anthropic- oder OpenAI-API, was großartig funktioniert, aber bei intensiver Nutzung mehr kostet, als man erwartet.
Die interessante Hosting-Frage betrifft das Modell-Backend. Hier ist die realistische Shortlist für Teams, die einen self-hosted Cline-Endpunkt möchten.
Wann Self-Hosting für Cline Sinn macht
Drei Fälle:
- Sie haben Datenschutzanforderungen, die externe API-Aufrufe ausschließen
- Ihr Team hat 5+ schwere Cline-Nutzer und die monatlichen API-Kosten übersteigen 300 USD
- Sie möchten mit offenen, kodierungsspezifischen Modellen experimentieren (DeepSeek Coder, Qwen Coder, StarCoder), die API-Anbieter nicht anbieten
Außerhalb dieser Fälle ist die Anthropic API schneller und liefert besseren Code als jede selbstgehostete Lösung unter 200 EUR im Monat. Seien Sie ehrlich, auf welcher Seite Sie stehen.
Modellwahl bestimmt die Spezifikation
Cline profitiert von größeren, auf Coding spezialisierte Modelle. Die realistischen Optionen für Self-Hosting:
- DeepSeek Coder V2 16B: benötigt 16 GB VRAM für Q4, ordentliche Qualität
- Qwen 2.5 Coder 32B: benötigt 24 GB VRAM für Q4, deutlich bessere Qualität
- DeepSeek Coder V2 236B: benötigt 80 GB+ VRAM schon bei Q4, Top-Klasse, aber teuer
Für spürbare Produktivitätssteigerungen gegenüber der API sollten Sie mindestens Qwen 2.5 Coder 32B wählen. Das setzt die GPU-Mindestanforderung.
VPS-Vergleich für das Cline-Backend
| Anbieter | Plan | GPU | vCPU | RAM | Monatlich | Beste Verwendung |
|---|---|---|---|---|---|---|
| Hetzner Cloud | CCX33 | Keine | 8 | 32 GB | 138,49 EUR | 7B CPU-Inferenz, Solo-Light-Nutzung |
| Hetzner Server | GEX44 | RTX 4000 SFF Ada (20 GB) | 14 | 64 GB | 234 EUR + 114 Setup | 32B in 4-Bit, kleines Team |
| Genesis Cloud | RTX 5090 | RTX 5090 (32GB) | 16 | 64 GB | ca. 120 EUR | 16B Produktion, Einzelanwender |
| Hetzner Server | GEX131 | RTX PRO 6000 Blackwell (96 GB) | 24 | 256 GB | 1.199 EUR + 599 Setup | 70B-Coder-Modell, Team |
Hetzner CCX33: Für Solo-Light-Nutzung mit 7B-Modellen
Wenn Sie akzeptieren, dass 7B-Coding-Modelle limitiert sind und Sie nur experimentieren wollen, ohne GPU-Kosten, läuft der CCX33 mit 32 GB RAM DeepSeek Coder 7B auf CPU bei 5 bis 7 Tokens pro Sekunde. Das ist gerade noch akzeptabel für den Cline-Autocomplete-Flow und schmerzhaft für agentische Workflows.
Dieses Modell nur für persönliche Experimente wählen. Der Produktivitätsverlust im Vergleich zu API oder GPU-basierten Modellen ist erheblich.
Holen Sie sich Hetzner: Hetzner Cloud.
Hetzner GEX44: Der ernsthafte self-hosted Cline-Backend
234 EUR im Monat plus einmalig 114 EUR Setup-Gebühr für eine RTX 4000 SFF Ada mit 20 GB VRAM lassen Qwen 2.5 Coder 32B in 4-Bit laufen — aber wirklich nur gerade so. Allein die Gewichte belegen rund 19 GB, es bleibt also praktisch keine Reserve für den Kontext, und eine lange Cline-Sitzung merkt das. Bequem passt auf diese Karte ein 13B-Coder-Modell.
Das ist der ideale Kompromiss für Teams von 3 bis 8 Entwicklern, die sich ein Backend teilen. Der 48 GB VRAM ermöglicht es außerdem, Modelle ohne Neustart zu tauschen (ein 32B-Modell nimmt 22 GB, Platz für ein weiteres 13B-Modell parallel).
Vorteile speziell für Cline:
- VRAM-Größe entspricht dem Coding-Spezialisten-Modell-Bereich
- Netzwerkauslastung bewältigt mehrere Entwickleranfragen gleichzeitig
- Das gleiche Rechenzentrum wie Hetzner Cloud ermöglicht eine günstige Orchestrierungs-Box in der Nähe
Die Rechnung: 234 EUR im Monat durch 5 aktive Entwickler sind 47 EUR pro Entwickler, weniger als die Hälfte der typischen Kosten für Cursor + Anthropic API.
Holen Sie sich Hetzner: Hetzner Cloud.
Genesis Cloud RTX 5090: Für Einzelentwickler mit 16B-Modellen
Rund 120 EUR im Monat für eine RTX 5090 mit 32 GB VRAM, geeignet für 16B-Coding-Modelle. Genesis Cloud-Preise variieren; prüfen Sie die aktuellen Tarife. Nützlich für Einzelpersonen, die Privatsphäre ohne Team-Scale-GPU-Belastung wollen.
Hetzner GEX131: Für Teams mit 70B-Coder-Modellen
Wenn 32B nicht die gewünschte Qualität bietet und Sie DeepSeek Coder V2 70B wollen, hat der GEX131 die nötige VRAM-Größe: eine einzelne RTX PRO 6000 Blackwell mit 96 GB. Mit 1.199 EUR im Monat plus 599 EUR Setup-Gebühr ist das eine ernsthafte Investition, aber für ein Team von 8 bis 15 Entwicklern kann es die API-Kosten bei starker Nutzung immer noch unterbieten. Der ältere Dual-GPU-GEX130 steht nicht mehr in Hetzners Matrix und gilt als abgekündigt.
Was ich wählen würde
Für einen einzelnen Entwickler, der Self-Hosting ausprobieren möchte: Überspringen Sie es, nutzen Sie die Anthropic API und sparen Sie die Betriebszeit. Für ein Team von 3+ Heavy Cline Nutzern: Hetzner GEX44, eher mit einem 13B-Coder-Modell als mit einem 32B, sofern Sie den knappen Kontext nicht in Kauf nehmen wollen. Der Break-even bei 234 EUR liegt bei etwa 4 Entwicklern, wenn jeder sonst 60 bis 80 USD pro Monat für API-Kosten ausgibt.
Der vollständige VPS-Kontext ist im SelfHostVPS-Vergleich zu finden. Coding agent hosting ist eine relativ neue Nische, und es ist zu erwarten, dass bis 2026 weitere Anbieter in diesen Markt eintreten.
Frequently asked questions
Braucht Cline überhaupt ein VPS? Es läuft in meiner IDE.
Cline läuft selbst in Ihrer IDE (VS Code, Cursor usw.) und benötigt kein Server-Hosting. Die VPS-Frage stellt sich, wenn Sie das Modell-Backend, mit dem Cline interagiert, hosten möchten. Für Nutzer, die bevorzugt self-hosted Modelle gegenüber OpenAI- oder Anthropic-API-Kosten haben, bietet das Betreiben von Ollama oder vLLM auf einem VPS einen kostengünstigen lokalen Endpunkt, der mit der Nutzung skaliert.
Welche VPS-Spezifikation ist am besten für ein Cline + Ollama Backend?
Für 7B-Coding-Modelle (DeepSeek Coder, Qwen Coder) bietet ein Hetzner CCX33 mit 32 GB RAM und CPU-Inferenz 5 bis 7 Tokens pro Sekunde, was gerade noch akzeptabel für den Cline-Codierungsworkflow ist. Für den echten Produktionseinsatz mit 13B oder 32B-Coding-Modellen benötigen Sie GPU. Das Hetzner GEX44 für 234 EUR im Monat plus 114 EUR Setup-Gebühr ist die günstigste ernstzunehmende Option, wobei die 20 GB VRAM ein 32B-Modell in 4-Bit nur gerade eben fassen.
Kann Cline ein gemeinsames Modell-Backend für mein gesamtes Team nutzen?
Ja, das ist das stärkste Argument für Self-Hosting. Ein einzelner GPU-VPS, der Qwen 2.5 Coder 32B in 4-Bit ausführt, kann eine Handvoll Entwickler mit Cline bedienen, ohne zum Flaschenhals zu werden. Der geteilte Backend-Ansatz amortisiert die 234 EUR im Monat leicht, sobald Sie 3+ intensive Nutzer haben.
Sollte ich einfach die Anthropic Claude API anstelle des Self-Hostings für Cline verwenden?
Für die meisten einzelnen Entwickler ja. Claude Sonnet über die API ist schneller als jede selbstgehostete Lösung unter 200 USD im Monat und liefert besseren Code. Self-Hosting macht Sinn, wenn Sie Datenschutzanforderungen haben (Ihr Code darf Ihre Infrastruktur nicht verlassen), teamübergreifende Nutzung (5+ schwere Nutzer) oder spezielle Modellpräferenzen, die API-Anbieter nicht anbieten.