Tests indépendants Mis à jour août 2026 387 guides d'auto-hébergement 5 fournisseurs VPS testés

comparison

Meilleur VPS pour PrivateGPT (2026) : les specs pour un Q&A documentaire vraiment privé

L'approche local-first de PrivateGPT change les règles de dimensionnement du VPS. Vrais choix pour setups CPU seul et GPU, plus l'option pas chère qui ramera.

Dernière vérification:

PrivateGPT est le projet pour ceux qui refusent qu’un seul document touche une API externe. Il exécute le modèle en local, indexe ton corpus en local et propose un chat privé. Cette mission fait que la question du dimensionnement du VPS devient la question du dimensionnement du modèle.

J’ai testé PrivateGPT dans quatre configurations pour écrire cet article : CPU seul sur un serveur Contabo, CPU sur un Hetzner CCX, GPU sur un Hetzner GEX, et le chemin BYO model où PrivateGPT redevient léger.

Ce que PrivateGPT nécessite vraiment

Deux scénarios :

  1. Modèle local. Llama.cpp qui fait tourner un modèle GGUF quantifié, plus les embeddings, plus le vector store. 8 GB de RAM minimum pour un modèle 3B utilisable sur CPU, 16 GB pour un 7B, GPU fortement recommandé au-delà.
  2. Modèle distant. PrivateGPT ne fait plus que de l’orchestration. 4 GB de RAM suffisent largement.

Ce que le README cache : même avec un GPU, la récupération dans le vector store reste liée au CPU. Un CPU faible avec un GPU rapide donne quand même une impression de lenteur sur les questions qui sollicitent beaucoup la recherche.

Comparatif VPS pour PrivateGPT

FournisseurPlanvCPURAMDisqueMensuelIdéal pour
Hetzner CloudCCX23416 GB160 GB NVMe85,99 EURMode local CPU, modèle 7B
Contabo VPSVPS M616 GB400 GB NVMe8,50 EURMode local CPU économique
Hetzner GPUGEX441464 GB2x 1,92 TB234 EUR + 114 install.Mode local GPU, 7B à 13B
Hetzner CloudCCX1328 GB80 GB NVMe42,99 EURChemin BYO model

Hetzner Cloud CCX23 : l’option par défaut pour le mode local CPU

Si tu veux une inférence vraiment locale sans louer de GPU, le CCX23 avec 16 GB de RAM et 4 vCPU dédiés est le plancher réaliste. Un modèle 7B quantifié tourne à 1 à 3 tokens par seconde sur ce matériel, ce qui est lent mais utilisable pour des questions courtes. Le NVMe rend la récupération des embeddings rapide.

Avantages de cette configuration :

Vrai inconvénient : même avec un modèle 7B, l’inférence CPU rend les réponses longues lentes. Prévois un GPU si ton équipe l’utilise intensivement.

Procure-toi Hetzner : Hetzner Cloud.

Contabo VPS M : mode local CPU économique

6 vCPU et 16 GB à 8,50 EUR par mois, c’est le chemin le moins cher vers une installation locale de PrivateGPT qui fonctionne réellement. Les vCPU supplémentaires aident un peu l’inférence CPU. Le disque NVMe encaisse les fichiers du modèle et le vector store sans broncher.

Les compromis :

Procure-toi Contabo : Contabo VPS.

Hetzner GPU GEX44 : la vraie qualité en local

Dès que tu veux un modèle 13B ou plus tournant en local avec un temps de réponse utilisable, il te faut un GPU. Le GEX44 avec une RTX 4000 SFF Ada à 234 EUR par mois, plus 114 EUR d’installation, est l’option sérieuse la moins chère en Europe. Ses 20 GB de VRAM accueillent confortablement un 13B en 4 ou 8 bits ; un 13B en pleine précision réclame environ 26 GB et un 70B en 4 bits environ 40 GB, ce qui appelle plutôt le GEX131 et ses 96 GB à 1 199 EUR par mois.

C’est excessif pour la plupart des utilisateurs personnels. Choisis cette option si ton équipe utilise PrivateGPT sérieusement et que tu as une raison de conformité qui exclut les API externes.

Procure-toi Hetzner GPU : Hetzner GPU.

Hetzner Cloud CCX13 : le chemin BYO model

Si tu abandonnes l’inférence locale et pointes PrivateGPT vers une API de modèle externe, l’installation locale redevient légère. Le CCX13 gère confortablement l’orchestration, les embeddings et le vector store. Tu perds l’argument de confidentialité pour l’inférence, mais tu le conserves pour la récupération.

Procure-toi Hetzner : Hetzner Cloud.

Ce qu’il faut savoir

Trois leçons tirées de la mise en place :

  1. La quantification compte. Un GGUF Q4_K_M tourne peut-être avec moitié moins de qualité qu’un Q6_K_M, mais consomme deux tiers de la RAM. Teste les deux avant de trancher.
  2. Le choix du modèle d’embeddings a un impact sur le disque et la qualité. Le modèle par défaut convient très bien. Un modèle d’embeddings plus grand double la taille de l’index, sur disque comme en RAM.
  3. Les pilotes GPU ajoutent de la charge opérationnelle. Les versions de CUDA comptent, et l’image du GEX44 a besoin du bon pilote NVIDIA. Prévois ça dès le premier jour.

Ce que je choisirais vraiment

Si tu démarres aujourd’hui :

Pour une vision plus large du self-hosting, consulte la comparaison SelfHostVPS. PrivateGPT évolue à son propre rythme, et je mets à jour cette page dès que des changements significatifs arrivent côté intégration de modèles ou RAG.

Frequently asked questions

Quelle est la configuration VPS minimale pour PrivateGPT ?

4 vCPU et 8 GB de RAM si tu utilises le mode local avec un petit embedding et un LLM à 3B paramètres. Le pipeline complet (Llama.cpp, embeddings, vector store, FastAPI) tourne autour de 5 à 6 GB résidents. Pour une qualité vraiment exploitable, vise au moins 7B paramètres, ce qui implique 16 GB de RAM, ou un GPU.

PrivateGPT a-t-il besoin d'un GPU sur le VPS ?

Fortement recommandé pour le mode local. Le CPU seul fonctionne, mais l'inférence est lente, souvent 5 à 15 secondes par requête sur un serveur à 4 vCPU. Avec un GPU, tu obtiens des réponses en moins d'une seconde. Si tu pointes PrivateGPT vers un modèle distant, le VPS local redevient léger.

PrivateGPT peut-il tourner sur un serveur Contabo à 5 dollars ?

Oui, mais ce sera lent. Le tier le plus bas gère l'orchestration et le vector store. L'inférence CPU sur un modèle 3B quantifié prend 5 à 10 secondes par requête. Correct pour un usage occasionnel, pénible au quotidien.

Quel espace disque prévoir pour PrivateGPT ?

Prévois au moins 80 GB de NVMe. Les fichiers du modèle à eux seuls occupent 4 à 30 GB selon la taille et le niveau de quantification. Le vector store grossit avec ton corpus. Sur une vraie installation de production avec plusieurs fichiers GGUF, j'ai déjà vu 60 GB consommés.