Test indipendenti Aggiornato agosto 2026 387 guide di self-hosting 5 provider VPS testati

comparison

Miglior VPS per PrivateGPT (2026): Specs per un Q&A Documentale Davvero Privato

L'approccio local-first di PrivateGPT cambia le regole di dimensionamento del VPS. Scelte reali per setup CPU e GPU, più l'opzione economica che sarà lenta.

Ultima verifica:

PrivateGPT è il progetto per chi non vuole che nessun documento tocchi un’API esterna. Esegue il modello in locale, indicizza il corpus in locale e offre una chat privata. Questa missione fa sì che la domanda sul dimensionamento del VPS diventi la domanda sul dimensionamento del modello.

Ho testato PrivateGPT in quattro configurazioni per scrivere questo articolo: solo CPU su un server Contabo, CPU su un Hetzner CCX, GPU su un Hetzner GEX, e il percorso BYO model in cui PrivateGPT torna leggero.

Cosa Serve Davvero a PrivateGPT

Due scenari:

  1. Modello locale. Llama.cpp che esegue un modello GGUF quantizzato, più embeddings, più vector store. 8 GB di RAM minimo per un modello 3B utilizzabile su CPU, 16 GB per un 7B, GPU fortemente consigliata oltre quella soglia.
  2. Modello remoto. PrivateGPT diventa pura orchestrazione. 4 GB di RAM bastano tranquillamente.

Quello che il README nasconde: anche con una GPU, il recupero dal vector store resta legato alla CPU. Una CPU debole con una GPU veloce continua a sembrare lenta su domande che richiedono molto recupero.

Confronto VPS per PrivateGPT

ProviderPianovCPURAMDiscoMensileIdeale per
Hetzner CloudCCX23416 GB160 GB NVMe85.99 EURModalità locale CPU, modello 7B
Contabo VPSVPS M616 GB400 GB NVMe8.50 EURModalità locale CPU economica
Hetzner GPUGEX441464 GB2x 1,92 TB234 EUR + 114 attiv.Modalità locale GPU, da 7B a 13B
Hetzner CloudCCX1328 GB80 GB NVMe42.99 EURPercorso BYO model

Hetzner Cloud CCX23: la scelta predefinita per la modalità locale CPU

Se vuoi un’inferenza davvero locale senza affittare una GPU, il CCX23 con 16 GB di RAM e 4 vCPU dedicate è la soglia realistica minima. Un modello 7B quantizzato gira a 1-3 token al secondo su questo hardware, il che è lento ma utilizzabile per domande brevi. L’NVMe rende il recupero degli embeddings scattante.

Vantaggi di questo setup:

Vero svantaggio: anche con un modello 7B, l’inferenza su CPU rende lente le risposte lunghe. Prevedi una GPU se il tuo team lo usa intensamente.

Ottieni Hetzner: Hetzner Cloud.

Contabo VPS M: modalità locale CPU economica

6 vCPU e 16 GB a 8.50 EUR al mese è la strada più economica verso un’installazione locale di PrivateGPT che funzioni davvero. Le vCPU extra aiutano un po’ l’inferenza su CPU. Il disco NVMe regge i file del modello e il vector store senza problemi.

I compromessi:

Ottieni Contabo: Contabo VPS.

Hetzner GPU GEX44: vera qualità in locale

Nel momento in cui vuoi un modello da 13B o più grande in esecuzione locale con tempi di risposta utilizzabili, ti serve una GPU. Il GEX44 con una RTX 4000 SFF Ada a 234 EUR al mese più 114 EUR di attivazione è l’opzione seria più economica in Europa. I suoi 20 GB di VRAM ospitano comodamente un 13B a 4 o 8 bit; un 13B a piena precisione richiede circa 26 GB e un 70B a 4 bit circa 40 GB, quindi entrambi chiamano in causa il GEX131 da 96 GB a 1.199 EUR al mese.

Per la maggior parte degli utenti privati è eccessivo. Sceglilo se il tuo team usa PrivateGPT seriamente e hai un motivo di conformità che esclude le API esterne.

Ottieni Hetzner GPU: Hetzner GPU.

Hetzner Cloud CCX13: il percorso BYO model

Se rinunci all’inferenza locale e punti PrivateGPT verso un’API di modello esterna, l’installazione locale torna leggera. Il CCX13 regge comodamente l’orchestrazione, gli embeddings e il vector store. Perdi il vantaggio di privacy per l’inferenza ma lo mantieni per il recupero.

Ottieni Hetzner: Hetzner Cloud.

Cose Utili da Sapere

Tre lezioni imparate durante il setup:

  1. La quantizzazione conta. Un GGUF Q4_K_M gira forse a metà della qualità di un Q6_K_M ma usa due terzi della RAM. Testa entrambi prima di decidere.
  2. La scelta del modello di embedding influisce su disco e qualità. Quello predefinito va bene. Un modello di embedding più grande raddoppia la dimensione dell’indice su disco e in RAM.
  3. I driver GPU aggiungono carico operativo. Le versioni CUDA contano, e l’immagine del GEX44 richiede il driver NVIDIA corretto. Pianifica questo fin dal primo giorno.

Cosa Sceglierei Davvero

Se parti oggi:

Per il quadro più ampio del self-hosting, guarda il confronto SelfHostVPS. PrivateGPT si muove al proprio ritmo e aggiorno questa pagina quando arrivano cambiamenti significativi nell’integrazione dei modelli o nel RAG.

Frequently asked questions

Qual è la specifica minima di VPS per PrivateGPT?

4 vCPU e 8 GB di RAM se usi la modalità locale con un embedding piccolo e un LLM da 3B parametri. La pipeline completa (Llama.cpp, embeddings, vector store, FastAPI) si assesta intorno ai 5-6 GB residenti. Per una qualità realmente utilizzabile servono almeno 7B parametri, il che significa 16 GB di RAM, oppure una GPU.

PrivateGPT ha bisogno di una GPU sul VPS?

Fortemente consigliata per la modalità locale. Solo CPU funziona, ma l'inferenza è lenta, spesso 5-15 secondi per query su un server a 4 vCPU. Con una GPU ottieni risposte sotto il secondo. Se punti PrivateGPT verso un modello remoto, il VPS locale torna leggero.

PrivateGPT può girare su un server Contabo da 5 dollari?

Sì, ma sarà lento. Il livello più economico gestisce l'orchestrazione e il vector store. L'inferenza CPU su un modello 3B quantizzato richiede 5-10 secondi per query. Va bene per un uso occasionale, pesante per l'uso quotidiano.

Quanto spazio disco serve per PrivateGPT?

Prevedi almeno 80 GB NVMe. I soli file del modello occupano da 4 a 30 GB a seconda della dimensione e del livello di quantizzazione. Il vector store cresce insieme al tuo corpus. In un setup di produzione reale con più file GGUF ho visto consumare 60 GB.