Última verificación:
PrivateGPT es el proyecto para quienes no quieren que ningún documento toque una API externa. Ejecuta el modelo en local, indexa tu corpus en local y ofrece un chat privado. Esa misión hace que la pregunta sobre el tamaño del VPS se convierta en la pregunta sobre el tamaño del modelo.
Probé PrivateGPT en cuatro configuraciones para escribir esto: solo CPU en un servidor Contabo, CPU en un Hetzner CCX, GPU en un Hetzner GEX, y la vía BYO model donde PrivateGPT vuelve a ser ligero.
Lo que PrivateGPT realmente necesita
Dos escenarios:
- Modelo local. Llama.cpp ejecutando un modelo GGUF cuantizado, más embeddings, más vector store. 8 GB de RAM como mínimo para un modelo 3B utilizable en CPU, 16 GB para un 7B, GPU muy recomendable por encima de eso.
- Modelo remoto. PrivateGPT se convierte solo en orquestación. 4 GB de RAM le sobran.
Lo que el README no cuenta: incluso con GPU, la recuperación del vector store depende de la CPU. Una CPU débil con una GPU rápida sigue notándose lenta en preguntas que exigen mucha recuperación.
Comparativa de VPS para PrivateGPT
| Proveedor | Plan | vCPU | RAM | Disco | Mensual | Mejor uso |
|---|---|---|---|---|---|---|
| Hetzner Cloud | CCX23 | 4 | 16 GB | 160 GB NVMe | 85.99 EUR | Modo local CPU, modelo 7B |
| Contabo VPS | VPS M | 6 | 16 GB | 400 GB NVMe | 8.50 EUR | Modo local CPU económico |
| Hetzner GPU | GEX44 | 14 | 64 GB | 2x 1.92 TB | 234 EUR + 114 alta | Modo local GPU, de 7B a 13B |
| Hetzner Cloud | CCX13 | 2 | 8 GB | 80 GB NVMe | 42.99 EUR | Vía BYO model |
Hetzner Cloud CCX23: la opción por defecto para el modo local en CPU
Si quieres inferencia realmente local sin alquilar una GPU, el CCX23 con 16 GB de RAM y 4 vCPU dedicadas es el suelo realista. Un modelo 7B cuantizado corre a 1 a 3 tokens por segundo en este hardware, lo cual es lento pero utilizable para preguntas cortas. El NVMe hace que la recuperación de embeddings sea ágil.
Ventajas de esta configuración:
- 16 GB acomodan un modelo 7B y el vector store sin apretar
- La latencia hacia Falkenstein es irrelevante porque el modelo es local
- Los snapshots te permiten deshacer cambios de modelo
Desventaja real: incluso con un modelo 7B, la inferencia por CPU hace que las respuestas largas se sientan lentas. Planea una GPU si tu equipo lo usa intensamente.
Consigue Hetzner: Hetzner Cloud.
Contabo VPS M: modo local CPU económico
6 vCPU y 16 GB por 8.50 EUR al mes es el camino más barato hacia una instalación local de PrivateGPT que funcione de verdad. Las vCPU extra ayudan algo a la inferencia por CPU. El disco NVMe soporta los archivos del modelo y el vector store sin quejarse.
Las contrapartidas:
- El aprovisionamiento tarda horas
- La infraestructura compartida en los niveles más baratos puede mostrar velocidad de inferencia variable
- El tráfico saliente es irrelevante en modo local
Consigue Contabo: Contabo VPS.
Hetzner GPU GEX44: calidad local de verdad
En el momento en que quieres un modelo 13B o mayor corriendo en local con un tiempo de respuesta utilizable, necesitas GPU. El GEX44 con una RTX 4000 SFF Ada por 234 EUR al mes más 114 EUR de alta es la opción seria más barata en Europa. Sus 20 GB de VRAM alojan con holgura un 13B en 4 u 8 bits; un 13B a precisión completa necesita unos 26 GB y un 70B en 4 bits unos 40 GB, así que ambos piden el GEX131 de 96 GB a 1.199 EUR al mes.
Esto es excesivo para la mayoría de usuarios particulares. Elígelo si tu equipo usa PrivateGPT en serio y tienes una razón de cumplimiento normativo que descarta las API externas.
Consigue Hetzner GPU: Hetzner GPU.
Hetzner Cloud CCX13: la vía BYO model
Si renuncias a la inferencia local y apuntas PrivateGPT a una API de modelo externo, la instalación local vuelve a ser ligera. El CCX13 sostiene sin problemas la orquestación, los embeddings y el vector store. Pierdes el argumento de privacidad para la inferencia, pero lo conservas para la recuperación.
Consigue Hetzner: Hetzner Cloud.
Cosas que vale la pena saber
Tres lecciones tras la puesta en marcha:
- La cuantización importa. Un GGUF Q4_K_M corre quizás a la mitad de calidad de un Q6_K_M pero usa dos tercios de la RAM. Prueba ambos antes de decidir.
- La elección del modelo de embeddings afecta al disco y a la calidad. El que viene por defecto está bien. Un modelo de embeddings más grande duplica el tamaño del índice en disco y en RAM.
- Los drivers de GPU añaden trabajo operativo. Las versiones de CUDA importan, y la imagen del GEX44 necesita el driver NVIDIA correcto. Planifica eso desde el primer día.
Lo que realmente elegiría
Si empiezas hoy:
- UE, CPU local, uso diario: Hetzner CCX23
- UE, CPU local, gasto mínimo: Contabo VPS M
- UE, GPU local, producción real: Hetzner GEX44
- Modelo BYO, configuración más ligera: Hetzner CCX13
Para el panorama más amplio del self-hosting, consulta la comparación de SelfHostVPS. PrivateGPT avanza a su propio ritmo y actualizo esta página cuando llegan cambios relevantes en integración de modelos o en RAG.
Frequently asked questions
¿Cuál es la especificación mínima de VPS para PrivateGPT?
4 vCPU y 8 GB de RAM si usas el modo local con un embedding pequeño y un LLM de 3B parámetros. El pipeline completo (Llama.cpp, embeddings, vector store, FastAPI) ronda los 5 a 6 GB residentes. Para una calidad realmente utilizable necesitas al menos 7B parámetros, lo que implica 16 GB de RAM, o una GPU.
¿PrivateGPT necesita una GPU en el VPS?
Muy recomendable para el modo local. Solo CPU funciona, pero la inferencia es lenta, a menudo entre 5 y 15 segundos por consulta en un servidor de 4 vCPU. Con una GPU obtienes respuestas en menos de un segundo. Si apuntas PrivateGPT a un modelo remoto, el VPS local vuelve a ser ligero.
¿Puede PrivateGPT funcionar en un servidor Contabo de 5 dólares?
Sí, pero irá lento. El nivel más económico se encarga de la orquestación y el vector store. La inferencia por CPU en un modelo 3B cuantizado tarda entre 5 y 10 segundos por consulta. Aceptable para uso ocasional, pesado para uso diario.
¿Cuánto disco necesita PrivateGPT?
Planea al menos 80 GB NVMe. Solo los archivos del modelo ocupan entre 4 y 30 GB según el tamaño y el nivel de cuantización. El vector store crece con tu corpus. En una instalación de producción real con varios archivos GGUF he visto consumirse 60 GB.