Ollama
CLI + серверОдна команда — и модель работает на вашей машине. Без лимитов и квот.
localhost:11434/v1
Каталог · проверено 2 Sep 2026
Нет лимита, о который можно споткнуться, нет ключа для ротации и ничего не покидает ноутбук — единственный потолок — ваше железо. Это среды, которые стоит знать: от CLI в одну строку до сервера, который реально использует продакшн.
Выбирайте по форме, а не по бенчмарку: Ollama, если нужен результат через минуту, LM Studio, если не хочется трогать терминал, MLX на Mac с чипом M, vLLM, когда обслуживаете других.
Одна команда — и модель работает на вашей машине. Без лимитов и квот.
localhost:11434/v1
Ollama с интерфейсом: найти, скачать и общаться локально.
localhost:1234/v1
Движок, на котором работает почти всё остальное. Чистый C++, без зависимостей.
localhost:8080/v1
Опенсорсная альтернатива ChatGPT, работающая на 100% офлайн.
localhost:1337/v1
Общайтесь с документами локально — ничего не покидает ноутбук.
Local RAG
Сервер инференса, на котором держится прод. PagedAttention и непрерывная батчинг на вашей GPU.
localhost:8000/v1
Массивный фреймворк Apple. На Mac с чипом M — самый быстрый локальный путь.
localhost:8080/v1
Один файл — сразу и модель, и рантайм. Скачал, chmod +x, запустил. Без установки.
localhost:8080/v1
Один исполняемый файл вокруг llama.cpp, заточен под длинные тексты и творческое письмо.
GGUF
Модель 7B с квантованием 4 бит умещается примерно в 5 ГБ, поэтому 8 ГБ ОЗУ легко её потянут. Моделям 70B нужно 40 ГБ и больше. Can I Run AI оценит именно ваш компьютер.
Обычно нет. Модели, которые вы запускаете дома, меньше тех, что NVIDIA или Groq отдают бесплатно. Локально выигрывает в приватности, офлайн-использовании и полном отсутствии лимитов.