Ollama
CLI + 서버명령 한 줄로 내 컴퓨터에서 모델 가동. 제한도 한도도 없음.
localhost:11434/v1
디렉터리 · 확인일 2 Sep 2026
부딪힐 속도 제한도, 교체할 키도, 노트북 밖으로 나가는 것도 없음 — 유일한 상한은 하드웨어입니다. 한 줄 CLI부터 실제 운영이 쓰는 서버까지 알아둘 런타임입니다.
벤치마크보다 형태로 고르세요. 1분 안에 쓰고 싶다면 Ollama, 터미널을 싫어한다면 LM Studio, M시리즈 Mac은 MLX, 다른 사람에게 서빙한다면 vLLM.
명령 한 줄로 내 컴퓨터에서 모델 가동. 제한도 한도도 없음.
localhost:11434/v1
GUI를 얹은 Ollama: 검색하고, 받고, 로컬에서 대화.
localhost:1234/v1
거의 모든 로컬 도구의 토대가 되는 엔진. 순수 C++, 의존성 없음.
localhost:8080/v1
100% 오프라인으로 동작하는 오픈소스 ChatGPT 대체재.
localhost:1337/v1
로컬에서 내 문서와 대화. 데이터는 노트북 밖으로 나가지 않음.
Local RAG
프로덕션이 실제로 쓰는 서빙 엔진. PagedAttention과 연속 배칭을 내 GPU에서.
localhost:8000/v1
Apple의 배열 프레임워크. M 시리즈 Mac에서 로컬 실행 최단 루트.
localhost:8080/v1
모델과 런타임이 한 파일에. 받아서 chmod +x 하고 실행. 설치 불필요.
localhost:8080/v1
llama.cpp를 감싼 단일 실행 파일. 장문·창작에 맞춤 조정.
GGUF
4비트 양자화 7B 모델은 약 5GB에 들어가 8GB면 넉넉히 돌아갑니다. 70B는 40GB 이상을 원합니다. Can I Run AI가 내 기기를 평가해줍니다.
보통 아닙니다. 집에서 돌리는 모델은 NVIDIA나 Groq가 무료로 주는 것보다 작습니다. 프라이버시·오프라인·한도 없음에서는 로컬이 낫습니다.