Ollama
CLI + servidorUn comando y el modelo corre en tu máquina. Sin límites ni cuotas.
localhost:11434/v1
Directorio · verificado 2 Sep 2026
Sin límite de tasa que golpear, sin clave que rotar y nada que salga del portátil — el único techo es tu hardware. Estas son las ejecuciones que merece la pena conocer, desde un CLI de una línea hasta el servidor que la producción usa de verdad.
Elige por la forma más que por el benchmark: Ollama si lo quieres funcionando en un minuto, LM Studio si prefieres no tocar un terminal, MLX en un Mac con chip M, vLLM cuando sirves a otras personas.
Un comando y el modelo corre en tu máquina. Sin límites ni cuotas.
localhost:11434/v1
Ollama con interfaz: descubre, descarga y chatea en local.
localhost:1234/v1
El motor sobre el que corre casi todo lo demás. C++ puro, sin dependencias.
localhost:8080/v1
Alternativa open source a ChatGPT que funciona 100 % sin conexión.
localhost:1337/v1
Chatea con tus documentos en local: nada sale del portátil.
Local RAG
El servidor de inferencia que usa la producción. PagedAttention y batching continuo, en tu propia GPU.
localhost:8000/v1
El framework matricial de Apple. En un Mac con chip M es la vía local más rápida.
localhost:8080/v1
Un solo archivo que es a la vez modelo y runtime. Descarga, chmod +x, ejecuta. Sin instalación.
localhost:8080/v1
Un ejecutable único alrededor de llama.cpp, afinado para textos largos y escritura creativa.
GGUF
Un modelo de 7B cuantizado a 4 bits cabe en unos 5 GB, así que 8 GB de RAM lo corren cómodamente. Los modelos de 70B quieren 40 GB o más. Can I Run AI puntuará tu máquina concreta.
Por lo general no. Los modelos que corres en casa son más pequeños que los que NVIDIA o Groq sirven gratis. Lo local gana en privacidad, uso sin conexión y no tener límites en absoluto.