Pruebas independientes Actualizado agosto 2026 387 guías de autoalojamiento 5 proveedores VPS probados

comparison

Mejor VPS para PrivateGPT (2026): Specs para un Q&A documental realmente privado

El enfoque local-first de PrivateGPT cambia las reglas de dimensionamiento del VPS. Opciones reales para setups solo CPU y con GPU, más la barata que irá lenta.

Última verificación:

PrivateGPT es el proyecto para quienes no quieren que ningún documento toque una API externa. Ejecuta el modelo en local, indexa tu corpus en local y ofrece un chat privado. Esa misión hace que la pregunta sobre el tamaño del VPS se convierta en la pregunta sobre el tamaño del modelo.

Probé PrivateGPT en cuatro configuraciones para escribir esto: solo CPU en un servidor Contabo, CPU en un Hetzner CCX, GPU en un Hetzner GEX, y la vía BYO model donde PrivateGPT vuelve a ser ligero.

Lo que PrivateGPT realmente necesita

Dos escenarios:

  1. Modelo local. Llama.cpp ejecutando un modelo GGUF cuantizado, más embeddings, más vector store. 8 GB de RAM como mínimo para un modelo 3B utilizable en CPU, 16 GB para un 7B, GPU muy recomendable por encima de eso.
  2. Modelo remoto. PrivateGPT se convierte solo en orquestación. 4 GB de RAM le sobran.

Lo que el README no cuenta: incluso con GPU, la recuperación del vector store depende de la CPU. Una CPU débil con una GPU rápida sigue notándose lenta en preguntas que exigen mucha recuperación.

Comparativa de VPS para PrivateGPT

ProveedorPlanvCPURAMDiscoMensualMejor uso
Hetzner CloudCCX23416 GB160 GB NVMe85.99 EURModo local CPU, modelo 7B
Contabo VPSVPS M616 GB400 GB NVMe8.50 EURModo local CPU económico
Hetzner GPUGEX441464 GB2x 1.92 TB234 EUR + 114 altaModo local GPU, de 7B a 13B
Hetzner CloudCCX1328 GB80 GB NVMe42.99 EURVía BYO model

Hetzner Cloud CCX23: la opción por defecto para el modo local en CPU

Si quieres inferencia realmente local sin alquilar una GPU, el CCX23 con 16 GB de RAM y 4 vCPU dedicadas es el suelo realista. Un modelo 7B cuantizado corre a 1 a 3 tokens por segundo en este hardware, lo cual es lento pero utilizable para preguntas cortas. El NVMe hace que la recuperación de embeddings sea ágil.

Ventajas de esta configuración:

Desventaja real: incluso con un modelo 7B, la inferencia por CPU hace que las respuestas largas se sientan lentas. Planea una GPU si tu equipo lo usa intensamente.

Consigue Hetzner: Hetzner Cloud.

Contabo VPS M: modo local CPU económico

6 vCPU y 16 GB por 8.50 EUR al mes es el camino más barato hacia una instalación local de PrivateGPT que funcione de verdad. Las vCPU extra ayudan algo a la inferencia por CPU. El disco NVMe soporta los archivos del modelo y el vector store sin quejarse.

Las contrapartidas:

Consigue Contabo: Contabo VPS.

Hetzner GPU GEX44: calidad local de verdad

En el momento en que quieres un modelo 13B o mayor corriendo en local con un tiempo de respuesta utilizable, necesitas GPU. El GEX44 con una RTX 4000 SFF Ada por 234 EUR al mes más 114 EUR de alta es la opción seria más barata en Europa. Sus 20 GB de VRAM alojan con holgura un 13B en 4 u 8 bits; un 13B a precisión completa necesita unos 26 GB y un 70B en 4 bits unos 40 GB, así que ambos piden el GEX131 de 96 GB a 1.199 EUR al mes.

Esto es excesivo para la mayoría de usuarios particulares. Elígelo si tu equipo usa PrivateGPT en serio y tienes una razón de cumplimiento normativo que descarta las API externas.

Consigue Hetzner GPU: Hetzner GPU.

Hetzner Cloud CCX13: la vía BYO model

Si renuncias a la inferencia local y apuntas PrivateGPT a una API de modelo externo, la instalación local vuelve a ser ligera. El CCX13 sostiene sin problemas la orquestación, los embeddings y el vector store. Pierdes el argumento de privacidad para la inferencia, pero lo conservas para la recuperación.

Consigue Hetzner: Hetzner Cloud.

Cosas que vale la pena saber

Tres lecciones tras la puesta en marcha:

  1. La cuantización importa. Un GGUF Q4_K_M corre quizás a la mitad de calidad de un Q6_K_M pero usa dos tercios de la RAM. Prueba ambos antes de decidir.
  2. La elección del modelo de embeddings afecta al disco y a la calidad. El que viene por defecto está bien. Un modelo de embeddings más grande duplica el tamaño del índice en disco y en RAM.
  3. Los drivers de GPU añaden trabajo operativo. Las versiones de CUDA importan, y la imagen del GEX44 necesita el driver NVIDIA correcto. Planifica eso desde el primer día.

Lo que realmente elegiría

Si empiezas hoy:

Para el panorama más amplio del self-hosting, consulta la comparación de SelfHostVPS. PrivateGPT avanza a su propio ritmo y actualizo esta página cuando llegan cambios relevantes en integración de modelos o en RAG.

Frequently asked questions

¿Cuál es la especificación mínima de VPS para PrivateGPT?

4 vCPU y 8 GB de RAM si usas el modo local con un embedding pequeño y un LLM de 3B parámetros. El pipeline completo (Llama.cpp, embeddings, vector store, FastAPI) ronda los 5 a 6 GB residentes. Para una calidad realmente utilizable necesitas al menos 7B parámetros, lo que implica 16 GB de RAM, o una GPU.

¿PrivateGPT necesita una GPU en el VPS?

Muy recomendable para el modo local. Solo CPU funciona, pero la inferencia es lenta, a menudo entre 5 y 15 segundos por consulta en un servidor de 4 vCPU. Con una GPU obtienes respuestas en menos de un segundo. Si apuntas PrivateGPT a un modelo remoto, el VPS local vuelve a ser ligero.

¿Puede PrivateGPT funcionar en un servidor Contabo de 5 dólares?

Sí, pero irá lento. El nivel más económico se encarga de la orquestación y el vector store. La inferencia por CPU en un modelo 3B cuantizado tarda entre 5 y 10 segundos por consulta. Aceptable para uso ocasional, pesado para uso diario.

¿Cuánto disco necesita PrivateGPT?

Planea al menos 80 GB NVMe. Solo los archivos del modelo ocupan entre 4 y 30 GB según el tamaño y el nivel de cuantización. El vector store crece con tu corpus. En una instalación de producción real con varios archivos GGUF he visto consumirse 60 GB.