Zuletzt geprüft:
PrivateGPT ist das Projekt für alle, die kein Dokument auch nur in die Nähe einer externen API lassen wollen. Es führt das Modell lokal aus, indiziert deinen Korpus lokal und stellt einen privaten Chat bereit. Diese Mission bedeutet: Die Frage nach der VPS-Größe wird zur Frage nach der Modellgröße.
Für diesen Artikel habe ich PrivateGPT in vier Konfigurationen getestet: reine CPU auf einem Contabo-Server, CPU auf einem Hetzner CCX, GPU auf einem Hetzner GEX und den BYO-Modell-Pfad, bei dem PrivateGPT wieder leichtgewichtig wird.
Was PrivateGPT Wirklich Braucht
Zwei Szenarien:
- Lokales Modell. Llama.cpp mit einem quantisierten GGUF-Modell, plus Embeddings, plus Vektorstore. Mindestens 8 GB RAM für ein brauchbares 3B-Modell auf CPU, 16 GB für ein 7B-Modell, darüber ist eine GPU dringend empfohlen.
- Entferntes Modell. PrivateGPT wird zur reinen Orchestrierung. 4 GB RAM reichen problemlos.
Was das README verschweigt: Selbst mit GPU ist die Vektorstore-Abfrage CPU-gebunden. Eine schwache CPU mit einer schnellen GPU fühlt sich bei abfragelastigen Fragen trotzdem langsam an.
VPS-Vergleich für PrivateGPT
| Anbieter | Plan | vCPU | RAM | Festplatte | Monatlich | Optimale Nutzung |
|---|---|---|---|---|---|---|
| Hetzner Cloud | CCX23 | 4 | 16 GB | 160 GB NVMe | 85,99 EUR | CPU-Lokalmodus, 7B-Modell |
| Contabo VPS | VPS M | 6 | 16 GB | 400 GB NVMe | 8,50 EUR | Budget-CPU-Lokalmodus |
| Hetzner GPU | GEX44 | 14 | 64 GB | 2x 1,92 TB | 234 EUR + 114 Setup | GPU-Lokalmodus, 7B bis 13B |
| Hetzner Cloud | CCX13 | 2 | 8 GB | 80 GB NVMe | 42,99 EUR | BYO-Modell-Pfad |
Hetzner Cloud CCX23: Standard für den CPU-Lokalmodus
Wenn du wirklich lokale Inferenz willst, ohne eine GPU zu mieten, ist der CCX23 mit 16 GB RAM und 4 dedizierten vCPU die realistische Untergrenze. Ein quantisiertes 7B-Modell läuft auf dieser Hardware mit 1 bis 3 Token pro Sekunde, was langsam, aber für kurze Fragen brauchbar ist. NVMe macht die Embeddings-Abfrage flott.
Vorteile dieses Setups:
- 16 GB fassen ein 7B-Modell und den Vektorstore bequem
- Die Latenz nach Falkenstein spielt keine Rolle, weil das Modell lokal läuft
- Mit Snapshots kannst du Modellwechsel rückgängig machen
Der echte Nachteil: Selbst mit einem 7B-Modell fühlt sich CPU-Inferenz bei langen Antworten langsam an. Plane eine GPU ein, wenn dein Team es intensiv nutzt.
Hol dir Hetzner: Hetzner Cloud.
Contabo VPS M: Budget-CPU-Lokalmodus
6 vCPU und 16 GB für 8,50 EUR im Monat sind der günstigste Weg zu einer funktionierenden lokalen PrivateGPT-Installation. Die zusätzlichen vCPU helfen der CPU-Inferenz etwas. Die NVMe-Festplatte verkraftet Modelldateien und Vektorstore klaglos.
Die Kompromisse:
- Die Bereitstellung dauert Stunden
- Die geteilte Infrastruktur in den günstigeren Stufen kann zu schwankender Inferenzgeschwindigkeit führen
- Outbound-Traffic spielt im lokalen Modus keine Rolle
Hol dir Contabo: Contabo VPS.
Hetzner GPU GEX44: Echte lokale Qualität
Sobald du ein 13B-Modell oder größer mit brauchbarer Antwortzeit lokal laufen lassen willst, brauchst du eine GPU. Der GEX44 mit einer RTX 4000 SFF Ada für 234 EUR im Monat plus 114 EUR Setup-Gebühr ist die günstigste ernstzunehmende Option in Europa. Seine 20 GB VRAM fassen ein 13B-Modell in 4-Bit oder 8-Bit bequem; ein 13B in voller Präzision braucht rund 26 GB und ein 70B in 4-Bit rund 40 GB — beides verlangt stattdessen den GEX131 mit 96 GB für 1.199 EUR im Monat.
Für die meisten privaten Nutzer ist das übertrieben. Entscheide dich dafür, wenn dein Team PrivateGPT ernsthaft einsetzt und ein Compliance-Grund externe APIs ausschließt.
Hol dir Hetzner GPU: Hetzner GPU.
Hetzner Cloud CCX13: BYO-Modell-Pfad
Wenn du auf lokale Inferenz verzichtest und PrivateGPT auf eine externe Modell-API zeigen lässt, wird die lokale Installation wieder leichtgewichtig. Der CCX13 stemmt Orchestrierung, Embeddings und Vektorstore bequem. Du verlierst den Datenschutzvorteil für die Inferenz, behältst ihn aber für die Abfrage.
Hol dir Hetzner: Hetzner Cloud.
Wissenswertes
Drei Lektionen aus der Einrichtung:
- Quantisierung ist entscheidend. Ein Q4_K_M-GGUF läuft mit vielleicht halber Qualität eines Q6_K_M, braucht aber nur zwei Drittel des RAM. Teste beide, bevor du dich entscheidest.
- Die Wahl des Embedding-Modells wirkt sich auf Speicherplatz und Qualität aus. Der Standard ist in Ordnung. Ein größeres Embedding-Modell verdoppelt die Indexgröße auf der Festplatte und im RAM.
- GPU-Treiber bringen zusätzlichen Betriebsaufwand. CUDA-Versionen sind wichtig, und das GEX44-Image braucht den richtigen NVIDIA-Treiber. Plane das schon am ersten Tag ein.
Was Ich Tatsächlich Wählen Würde
Wenn du heute startest:
- EU, CPU lokal, tägliche Nutzung: Hetzner CCX23
- EU, CPU lokal, geringste Kosten: Contabo VPS M
- EU, GPU lokal, echte Produktion: Hetzner GEX44
- BYO-Modell, leichteres Setup: Hetzner CCX13
Für das größere Self-Hosting-Bild sieh dir den SelfHostVPS-Vergleich an. PrivateGPT entwickelt sich in seinem eigenen Tempo, und ich aktualisiere diese Seite, wenn es relevante Änderungen bei Modellintegration oder RAG gibt.
Frequently asked questions
Was ist die Mindest-VPS-Spezifikation für PrivateGPT?
4 vCPU und 8 GB RAM, wenn du den lokalen Modus mit einem kleinen Embedding und einem 3B-Parameter-LLM nutzt. Die komplette Pipeline (Llama.cpp, Embeddings, Vektorstore, FastAPI) liegt bei etwa 5 bis 6 GB resident. Für praxistaugliche Qualität solltest du mindestens 7B Parameter einplanen, was 16 GB RAM oder eine GPU bedeutet.
Braucht PrivateGPT eine GPU auf dem VPS?
Für den lokalen Modus dringend empfohlen. Reine CPU funktioniert, aber die Inferenz ist langsam, oft 5 bis 15 Sekunden pro Anfrage auf einem 4-vCPU-Server. Mit einer GPU bekommst du Antworten unter einer Sekunde. Wenn du PrivateGPT auf ein entferntes Modell zeigen lässt, wird der lokale VPS wieder leichtgewichtig.
Läuft PrivateGPT auf einem 5-Dollar-Contabo-Server?
Ja, aber langsam. Die günstigste Stufe bewältigt die Orchestrierung und den Vektorstore. CPU-Inferenz auf einem quantisierten 3B-Modell braucht 5 bis 10 Sekunden pro Anfrage. Für gelegentliche Nutzung in Ordnung, für den täglichen Einsatz mühsam.
Wie viel Speicherplatz braucht PrivateGPT?
Plane mindestens 80 GB NVMe ein. Allein die Modelldateien belegen je nach Größe und Quantisierungsstufe 4 bis 30 GB. Der Vektorstore wächst mit deinem Korpus. Bei einem echten Produktions-Setup mit mehreren GGUF-Dateien habe ich schon 60 GB Verbrauch gesehen.