Test indipendenti Aggiornato agosto 2026 387 guide di self-hosting 5 provider VPS testati

comparison

Miglior VPS per Ollama (2026): Dove l'Hosting a Basso Costo Incontra la Realtà

Confronta il miglior VPS per Ollama nel 2026, testato e classificato per CPU, RAM, spazio e prezzo, per ospitare Ollama in modo affidabile ed economico.

Ultima verifica:

Ollama è il modo più semplice per eseguire LLM locali. Rende anche facile distribuire qualcosa che non funziona realmente per il tuo caso d’uso, perché il comando di installazione è lo stesso che tu abbia 8 GB di RAM o un H100. Il framework non ti dirà che 2 token al secondo sono troppo lenti per un chatbot.

Ecco il calcolo realistico sull’hosting dopo aver testato Ollama su sei configurazioni VPS diverse.

Ollama è un Wrapper, il Modello È il Costo

Ollama in sé è leggero. Circa 100 MB di binario Go e sovraccarico di runtime. Ogni decisione sulle risorse riguarda il modello: quale usi, in quale quantizzazione, e se hai GPU.

L’inferenza CPU funziona per l’installazione demo e fallisce per l’uso quotidiano. I valori che ho misurato su un Hetzner CCX33 (8 vCPU, 32 GB RAM, senza GPU):

Su un Hetzner GEX44 (RTX 4000 SFF Ada, 20 GB VRAM) il collo di bottiglia non è la velocità ma la VRAM, quindi partiamo da lì:

Il percorso CPU è adatto per lavori batch che puoi lasciare overnight. Il percorso GPU è ciò di cui hai bisogno per qualsiasi cosa interattiva.

Confronto VPS per Ollama

ProviderPianoGPUvCPURAMMensileMigliore utilizzo
Hetzner CloudCCX23Nessuna416 GB85,99 EURInferenza CPU per modello 7B, solo batch
Hetzner CloudCCX33Nessuna832 GB138,49 EURBatch CPU per modelli 13B, lavoro di sviluppo
Hetzner ServerGEX44RTX 4000 SFF Ada 20 GB1464 GB234 EUR + 114 attiv.Produzione da 7B a 13B
Hetzner ServerGEX131RTX PRO 6000 Blackwell 96 GB24256 GB1.199 EUR + 599 attiv.Servizio di produzione per modelli 70B
Contabo VPSVPS XLNessuna1296 GB27,49 EURBatch CPU per modello 70B (lento ma economico)

Hetzner Cloud CCX23: Per inferenza CPU 7B

Il minimo che considererei per Ollama con un modello 7B. 16 GB di RAM sono sufficienti per il modello più il contesto, e una CPU dedicata mantiene stabile il ritmo di 5-7 token al secondo. Usalo per assistenti personali, riassunto di documenti o qualsiasi task batch dove 2 secondi di risposta sono accettabili.

Non usarlo per chatbot o applicazioni interattive. La latenza rende tutto molto doloroso.

Pro:

Ottieni Hetzner: Hetzner Cloud.

Hetzner Cloud CCX33: Per sviluppo con modello 13B CPU

32 GB di RAM sono sufficienti per un modello 13B con un contesto confortevole. L’inferenza CPU a 2-3 token al secondo è adatta per sviluppo e test, scomoda per la produzione. Usalo quando vuoi verificare che i tuoi prompt funzionino su un modello 13B prima di passare all’hosting GPU.

Onestamente: 138,49 EUR al mese per inferenza CPU lenta è difficile da giustificare rispetto al noleggio di una GPU all’ora tramite Vast.ai per i test.

Hetzner GEX44: Il livello di produzione serio

234 EUR al mese più 114 EUR di attivazione una tantum per una RTX 4000 SFF Ada con 20 GB di VRAM è la strada con GPU dedicata più economica per Ollama in produzione in Europa. I 20 GB ospitano modelli 7B e 13B con contesto generoso, e un 32B in Q4 per un soffio. Un 70B non ci sta.

Questo è il livello giusto quando:

I 64 GB di RAM di sistema lasciano spazio per eseguire anche Flowise o LangGraph sullo stesso server. Il GEX44 è disponibile solo a Falkenstein.

Se ti serve un 70B, il gradino successivo è il GEX131: una RTX PRO 6000 Blackwell con 96 GB di VRAM, 1.199 EUR al mese più 599 EUR di attivazione. È cinque volte il prezzo, ed è il punto in cui noleggiare a ore altrove merita una seconda occhiata.

Ottieni Hetzner: Hetzner Cloud.

Contabo VPS XL: Per lavori batch CPU massicci

27,49 EUR al mese per 96 GB di RAM ti permette di caricare modelli 70B Q4 su CPU. L’inferenza a 0,5-1 token al secondo è inutilizzabile interattivamente, ma tollerabile per elaborazioni batch notturne di grandi documenti.

Scegli questo per casi d’uso di nicchia dove il throughput mensile totale conta più della latenza di ogni richiesta.

Ottieni Contabo: Contabo VPS.

Cosa Sceglierei

Per Ollama in produzione con uso interattivo su un modello 7B o 13B: Hetzner GEX44 con GPU. Per il 70B: il GEX131, oppure noleggio a ore altrove se l’utilizzo è basso. Per sviluppo e test con modelli 7B: Hetzner CCX23. Ignora l’inferenza CPU per modelli 13B+ a meno che tu non abbia un caso batch realistico. La matematica dei token al secondo non funziona per altro.

Frequently asked questions

Posso davvero eseguire Ollama su un VPS solo CPU?

Tecnicamente sì, praticamente no per l'uso in produzione. Un modello 7B su CPU produce da 3 a 5 token al secondo su un Hetzner CCX23, limite accettabile per query occasionali e impraticabile per chatbot. Un modello 13B su CPU scende a 1-2 token al secondo. Per qualsiasi cosa oltre la sperimentazione personale, hai bisogno di GPU. Ollama rende facile l'inferenza CPU, ma ciò non la rende utile su larga scala.

Qual è il VPS GPU più economico per Ollama nel 2026?

Il GEX44 di Hetzner con una RTX 4000 SFF Ada a 234 EUR al mese più 114 EUR di attivazione una tantum è l'opzione GPU dedicata più economica in Europa. I suoi 20 GB di VRAM gestiscono comodamente modelli 7B e 13B, e un 32B a 4 bit per un soffio. Un 70B a 4 bit richiede circa 40 GB e non ci sta affatto: per quello serve il GEX131 con 96 GB a 1.199 EUR al mese. Genesis Cloud e Vast.ai offrono tariffe più economiche all'ora per uso sporadico, ma i prezzi mensili favoriscono Hetzner.

Quanto RAM serve a Ollama senza GPU?

circa il doppio della dimensione del file del modello per modelli GGUF. Un modello Q4_K_M da 7B è di circa 4.4 GB su disco e richiede in pratica 9-10 GB di RAM. Un modello Q4 da 13B è di 7.8 GB e richiede 16 GB. Un modello Q4 da 70B necessita di 48 GB. Questi numeri assumono una finestra di contesto conservativa. Contesti più grandi (32K+) aggiungono altri 2-8 GB in più.

Devo affittare un VPS GPU o usare OpenRouter per un accesso simile a Ollama?

Per spese di inferenza inferiori a 100 USD al mese, OpenRouter o aggregatori di API simili sono più economici. Per carichi di lavoro costanti superiori ai 200 USD al mese, possedere un VPS GPU si ripaga in 2-3 mesi. Il pareggio dipende dal modello e dalla macchina: il GEX44 da 20 GB (234 EUR al mese) non riesce a caricare un 70B; serve il GEX131 da 96 GB a 1.199 EUR.