it's free*.ai

디렉터리 · 확인일 2 Sep 2026

내 기기에서 AI 모델 실행

부딪힐 속도 제한도, 교체할 키도, 노트북 밖으로 나가는 것도 없음 — 유일한 상한은 하드웨어입니다. 한 줄 CLI부터 실제 운영이 쓰는 서버까지 알아둘 런타임입니다.

벤치마크보다 형태로 고르세요. 1분 안에 쓰고 싶다면 Ollama, 터미널을 싫어한다면 LM Studio, M시리즈 Mac은 MLX, 다른 사람에게 서빙한다면 vLLM.

Ollama

CLI + 서버

명령 한 줄로 내 컴퓨터에서 모델 가동. 제한도 한도도 없음.

localhost:11434/v1

LM Studio

데스크톱 앱

GUI를 얹은 Ollama: 검색하고, 받고, 로컬에서 대화.

localhost:1234/v1

llama.cpp

엔진

거의 모든 로컬 도구의 토대가 되는 엔진. 순수 C++, 의존성 없음.

localhost:8080/v1

Jan

데스크톱 앱

100% 오프라인으로 동작하는 오픈소스 ChatGPT 대체재.

localhost:1337/v1

GPT4All

데스크톱 앱

로컬에서 내 문서와 대화. 데이터는 노트북 밖으로 나가지 않음.

Local RAG

vLLM

추론 서버

프로덕션이 실제로 쓰는 서빙 엔진. PagedAttention과 연속 배칭을 내 GPU에서.

localhost:8000/v1

MLX

Apple 실리콘

Apple의 배열 프레임워크. M 시리즈 Mac에서 로컬 실행 최단 루트.

localhost:8080/v1

llamafile

단일 실행 파일

모델과 런타임이 한 파일에. 받아서 chmod +x 하고 실행. 설치 불필요.

localhost:8080/v1

KoboldCpp

단일 실행 파일

llama.cpp를 감싼 단일 실행 파일. 장문·창작에 맞춤 조정.

GGUF

이들에 대한 질문

RAM이 얼마나 필요한가요?

4비트 양자화 7B 모델은 약 5GB에 들어가 8GB면 넉넉히 돌아갑니다. 70B는 40GB 이상을 원합니다. Can I Run AI가 내 기기를 평가해줍니다.

로컬 모델이 무료 API만큼 좋은가요?

보통 아닙니다. 집에서 돌리는 모델은 NVIDIA나 Groq가 무료로 주는 것보다 작습니다. 프라이버시·오프라인·한도 없음에서는 로컬이 낫습니다.

다른 분류 방식