Última verificación:
Ollama es la manera más sencilla de ejecutar LLMs locales. También facilita desplegar algo que en realidad no funciona para tu caso de uso, porque el comando de instalación es el mismo ya tengas 8 GB de RAM o una H100. El framework no te dirá que 2 tokens por segundo es demasiado lento para un chatbot.
Aquí está la matemática brutalmente honesta del hosting tras probar Ollama en seis configuraciones diferentes de VPS.
Ollama es un Wrapper, el Modelo es el Costo
Ollama en sí es ligero. Aproximadamente 100 MB en binario de Go y sobrecarga de tiempo de ejecución. Cada decisión de recurso gira en torno al modelo: cuál ejecutar, en qué cuantización, y si tienes GPU.
La inferencia en CPU funciona para la demostración de instalación y falla para el uso diario. Los números que medí en un Hetzner CCX33 (8 vCPU, 32 GB RAM, sin GPU):
- Llama 3.1 8B Q4_K_M: 5 a 7 tokens por segundo
- Llama 3.1 8B Q8_0: 2 a 3 tokens por segundo
- Llama 3.1 70B Q4 (cuando cabe): 0.5 tokens por segundo
En un Hetzner GEX44 (RTX 4000 SFF Ada, 20 GB VRAM) el cuello de botella no es la velocidad sino la VRAM, así que empecemos por ahí:
- Llama 3.1 8B Q4: unos 5 GB — cabe de sobra, cómodamente interactivo
- Llama 3.1 13B Q4: unos 8 GB — cabe con espacio para una ventana de contexto amplia
- Llama 3.1 13B Q8: unos 14 GB — cabe, pero el contexto queda justo
- Qwen 2.5 32B Q4: unos 19 GB — cabe por los pelos, casi sin margen de contexto
- Llama 3.1 70B Q4: unos 40 GB — no cabe; para eso hace falta el GEX131 de 96 GB
El camino CPU es para trabajos en lote que puedes dejar correr de noche. El camino GPU es lo que necesitas para cualquier interacción en tiempo real.
Comparativa de VPS para Ollama
| Proveedor | Plan | GPU | vCPU | RAM | Mensual | Mejor uso |
|---|---|---|---|---|---|---|
| Hetzner Cloud | CCX23 | Ninguna | 4 | 16 GB | 85.99 EUR | Inferencia en CPU de 7B, solo batch |
| Hetzner Cloud | CCX33 | Ninguna | 8 | 32 GB | 138.49 EUR | Batch en CPU de 13B, trabajo de desarrollo |
| Hetzner Server | GEX44 | RTX 4000 SFF Ada 20 GB | 14 | 64 GB | 234 EUR + 114 alta | Producción de 7B a 13B |
| Hetzner Server | GEX131 | RTX PRO 6000 Blackwell 96 GB | 24 | 256 GB | 1.199 EUR + 599 alta | Despliegue de producción de 70B |
| Contabo VPS | VPS XL | Ninguna | 12 | 96 GB | 27.49 EUR | Batch en CPU para 70B Q4 (lento pero barato) |
Hetzner Cloud CCX23: Para inferencia en CPU de 7B
Lo mínimo que consideraría para Ollama con un modelo de 7B. 16 GB de RAM alojan el modelo más contexto, y la CPU dedicada mantiene los 5 a 7 tokens por segundo constantes. Úsalo para asistentes personales, resumen de documentos o cualquier tarea batch en la que respuestas en 2 segundos sean aceptables.
No uses esto para chatbots o aplicaciones interactivas. La latencia será molesta.
Pros:
- La configuración realista más económica para Ollama
- 16 GB de RAM dan margen para el modelo de 7B más un contexto razonable
- CPU dedicada mantiene la tasa de inferencia estable
Consigue Hetzner: Hetzner Cloud.
Hetzner Cloud CCX33: Para 13B y trabajo en desarrollo
32 GB de RAM permiten un modelo de 13B con contexto cómodo. La inferencia en CPU a 2-3 tokens por segundo está bien para desarrollo y pruebas, pero dolorosa en producción. Úsalo cuando necesites validar que tus prompts funcionan en un modelo de 13B antes de comprometerte con hosting en GPU.
Opinión honesta: 138.49 EUR al mes por inferencia CPU lenta es difícil de justificar frente a rentar GPU por hora vía Vast.ai para pruebas.
Hetzner GEX44: La gama seria de producción
234 EUR al mes más 114 EUR de alta única por una RTX 4000 SFF Ada con 20 GB de VRAM es el camino de GPU dedicada más barato para Ollama en producción en Europa. Los 20 GB alojan modelos de 7B y 13B con contexto generoso, y un 32B en Q4 por los pelos. Un 70B no cabe.
Este nivel es ideal cuando:
- Sirves un chatbot o aplicación interactiva sobre un modelo de 7B o 13B
- El coste en tokens sobrepasa los 200 USD mensuales en agregadores de API
- Necesitas residencia de datos o despliegue aire-aislado
Los 64 GB de RAM del sistema dejan sitio para ejecutar también un Flowise o LangGraph en la misma máquina. El GEX44 solo está disponible en Falkenstein.
Si necesitas 70B, el siguiente escalón es el GEX131: una RTX PRO 6000 Blackwell con 96 GB de VRAM, 1.199 EUR al mes más 599 EUR de alta. Es cinco veces el precio, y el punto en el que alquilar por horas en otro sitio merece una segunda mirada.
Consigue Hetzner: Hetzner Cloud.
Contabo VPS XL: Para trabajos en lote masivos en CPU
27.49 EUR al mes por 96 GB de RAM permiten cargar modelos de 70B Q4 en CPU. La inferencia a 0.5 a 1 token por segundo es inutilizable en modo interactivo pero tolerable para procesamiento nocturno de grandes catálogos de documentos.
Elígelo para casos de uso específicos en batch donde el rendimiento mensual total importa más que la latencia en cada solicitud.
Consigue Contabo: Contabo VPS.
Lo que Yo Escogería
Para Ollama en producción con uso interactivo sobre un modelo de 7B o 13B: Hetzner GEX44 con GPU. Para 70B: el GEX131, o alquiler por horas en otro sitio si la utilización es baja. Para desarrollo y pruebas con modelos de 7B: Hetzner CCX23. Ignora la inferencia en CPU para modelos de 13B o más, a menos que tengas un caso de uso batch que realmente encaje. Las matemáticas de tokens por segundo no funcionan para otra cosa.
El panorama más amplio de VPS está en el Comparativo SelfHostVPS. Ollama combina bien con OpenWebUI, AnythingLLM y la mayoría de los frameworks de agentes. Consulta esas guías para recomendaciones de despliegue conjunto.
Frequently asked questions
¿Realmente puedo ejecutar Ollama en un VPS solo con CPU?
Técnicamente sí, pero prácticamente no para uso en producción. Un modelo de 7B en CPU produce de 3 a 5 tokens por segundo en un Hetzner CCX23, lo cual está al límite de lo aceptable para consultas ocasionales y es inútil para chatbots. Un modelo de 13B en CPU baja a 1 a 2 tokens por segundo. Para cualquier cosa más allá de la experimentación personal, necesitas GPU. Ollama hace que la inferencia en CPU sea sencilla, pero eso no lo hace útil a gran escala.
¿Cuál es el VPS con GPU más barato para Ollama en 2026?
El GEX44 de Hetzner con una RTX 4000 SFF Ada a 234 EUR al mes más 114 EUR de alta única es la opción de GPU dedicada más barata en Europa. Sus 20 GB de VRAM manejan cómodamente modelos de 7B y 13B, y un 32B en 4 bits por los pelos. Un 70B en 4 bits necesita unos 40 GB y no cabe en absoluto: para eso está el GEX131 con 96 GB a 1.199 EUR al mes. Genesis Cloud y Vast.ai ofrecen tarifas por hora más baratas para uso esporádico, pero los precios mensuales favorecen a Hetzner.
¿Cuánta RAM necesita Ollama sin GPU?
Aproximadamente el doble del tamaño del archivo del modelo para modelos GGUF. Un modelo Q4_K_M de 7B ocupa 4.4 GB en disco y en la práctica necesita de 9 a 10 GB de RAM. Un modelo Q4 de 13B ocupa 7.8 GB y requiere 16 GB. Un modelo Q4 de 70B necesita 48 GB. Estos números asumen una ventana de contexto conservadora. Los contextos más grandes (32K+) añaden de 2 a 8 GB adicionales.
¿Debería rentar un VPS con GPU o usar OpenRouter para acceder como Ollama?
Por menos de 100 USD al mes en gastos de inferencia, OpenRouter o similares son más económicos. Para cargas de trabajo constantes que superen los 200 USD mensuales, tener un VPS con GPU se amortiza en 2 a 3 meses. El equilibrio depende del modelo y de la máquina: el GEX44 de 20 GB (234 EUR al mes) no puede cargar un 70B; para eso hace falta el GEX131 de 96 GB a 1.199 EUR.