Ollama
CLI + 服务器一条命令,模型就在你机器上跑起来。无限制、无配额。
localhost:11434/v1
目录 · 核实于 2 Sep 2026
没有要担心的速率限制、没有要轮换的密钥、没有任何数据离开笔记本 —— 唯一的天花板是你的硬件。这些运行时值得一认,从一行命令的 CLI 到生产环境真正在用的服务器。
按形态选,而不是按跑分:想一分钟内跑起来选 Ollama,不想碰终端选 LM Studio,M 系列 Mac 用 MLX,要对外提供服务用 vLLM。
一条命令,模型就在你机器上跑起来。无限制、无配额。
localhost:11434/v1
带图形界面的 Ollama:发现、下载、本地对话。
localhost:1234/v1
几乎所有本地工具底层运行的引擎。纯 C++,零依赖。
localhost:8080/v1
100% 离线工作的开源 ChatGPT 替代品。
localhost:1337/v1
本地与你的文档对话,数据从不离开笔记本。
Local RAG
生产环境真正在用的推理服务器。PagedAttention 与连续批处理,跑在你自己的 GPU 上。
localhost:8000/v1
Apple 的数组计算框架。在 M 系列 Mac 上是本地跑模型最快的方式。
localhost:8080/v1
一个文件同时是模型和运行时。下载、chmod +x、运行,完全无需安装。
localhost:8080/v1
包着 llama.cpp 的单文件可执行程序,为长文与创意写作调优。
GGUF
量化到 4-bit 的 7B 模型约占 5 GB,8 GB 内存就能从容运行;70B 模型要 40 GB 以上。Can I Run AI 会为你的机器具体打分。
通常比不上。家里能跑的模型比 NVIDIA 或 Groq 免费提供的小。本地的优势在隐私、离线,以及完全没有限制。