Ollama
CLI + servidorUm comando e o modelo roda na sua máquina. Sem limites, sem cotas.
localhost:11434/v1
Diretório · verificado 2 Sep 2026
Sem limite de taxa para bater, sem chave para rotacionar e nada saindo do laptop — o único teto é o seu hardware. Estas são as execuções que valem a pena conhecer, de um CLI de uma linha ao servidor que a produção realmente usa.
Escolha pela forma em vez do benchmark: Ollama se quiser funcionando em um minuto, LM Studio se preferir não tocar num terminal, MLX num Mac com chip M, vLLM quando estiver servindo outras pessoas.
Um comando e o modelo roda na sua máquina. Sem limites, sem cotas.
localhost:11434/v1
Ollama com interface: descobrir, baixar e conversar localmente.
localhost:1234/v1
O engine sobre o qual quase tudo o mais roda. C++ puro, sem dependências.
localhost:8080/v1
Alternativa open source ao ChatGPT que funciona 100% offline.
localhost:1337/v1
Converse com seus documentos localmente — nada sai do notebook.
Local RAG
O servidor de inferência que a produção usa de verdade. PagedAttention e batching contínuo, na sua própria GPU.
localhost:8000/v1
O framework de arranjos da Apple. Num Mac com chip M é o caminho local mais rápido.
localhost:8080/v1
Um único arquivo que é modelo e runtime ao mesmo tempo. Baixe, chmod +x, execute. Sem instalação.
localhost:8080/v1
Um executável único em volta do llama.cpp, ajustado para textos longos e escrita criativa.
GGUF
Um modelo de 7B quantizado em 4 bits cabe em cerca de 5 GB, então 8 GB de RAM rodam um confortavelmente. Modelos de 70B querem 40 GB ou mais. O Can I Run AI avalia sua máquina específica.
Geralmente não. Os modelos que você roda em casa são menores que os que NVIDIA ou Groq servem de graça. O local vence em privacidade, uso offline e não ter limites nenhum.