Ollama
CLI + serverUn comando e il modello gira sulla tua macchina. Nessun limite, nessuna quota.
localhost:11434/v1
Directory · verificata 2 Sep 2026
Nessun limite di velocità da colpire, nessuna chiave da ruotare e nulla che lascia il computer — l’unico tetto è il tuo hardware. Queste sono le esecuzioni che vale la pena conoscere, da una CLI di una riga al server che la produzione usa davvero.
Scegli per forma piuttosto che per benchmark: Ollama se lo vuoi operativo in un minuto, LM Studio se preferisci non toccare un terminale, MLX su un Mac con chip M, vLLM quando servi altre persone.
Un comando e il modello gira sulla tua macchina. Nessun limite, nessuna quota.
localhost:11434/v1
Ollama con interfaccia: scopri, scarica e chatta in locale.
localhost:1234/v1
Il motore su cui gira quasi tutto il resto. C++ puro, zero dipendenze.
localhost:8080/v1
Alternativa open source a ChatGPT che funziona al 100% offline.
localhost:1337/v1
Chatta con i tuoi documenti in locale: nulla lascia il laptop.
Local RAG
Il server di inferenza che la produzione usa davvero. PagedAttention e batching continuo, sulla tua GPU.
localhost:8000/v1
Il framework a matrici di Apple. Su un Mac con chip M è la strada locale più veloce.
localhost:8080/v1
Un solo file che è insieme modello e runtime. Scarica, chmod +x, esegui. Nessuna installazione.
localhost:8080/v1
Un eseguibile unico attorno a llama.cpp, tarato per testi lunghi e scrittura creativa.
GGUF
Un modello 7B quantizzato a 4 bit sta in circa 5 GB, quindi 8 GB di RAM ne fanno girare uno comodamente. I modelli 70B vogliono 40 GB o più. Can I Run AI valuterà la tua macchina specifica.
Di solito no. I modelli che esegui a casa sono più piccoli di quelli che NVIDIA o Groq servono gratis. Il locale vince in privacy, uso offline e nessun limite.