MLX
mlx-lm은 Apple의 배열 프레임워크를 언어 모델에 향하게 한 것입니다. M 시리즈 Mac에서 가장 빠른 로컬 경로인데, 유니파이드 메모리를 써서 외장 GPU와 다투지 않기 때문입니다.
mlx-lm은 Apple의 배열 프레임워크를 언어 모델에 향하게 한 것입니다. M 시리즈 Mac에서 가장 빠른 로컬 경로인데, 유니파이드 메모리를 써서 외장 GPU와 다투지 않기 때문입니다.
Apple Silicon 전용. `mlx_lm.server --model mlx-community/Qwen3-8B-4bit`가 localhost:8080/v1에서 OpenAI 호환을 서빙합니다. 컨텍스트 상한은 유니파이드 메모리의 양 그 자체입니다.
- 최대 컨텍스트
- Whatever your unified memory allows
- 무료 요금제
- 무제한·비공개
- 요구사항
- 아무것도 없음 — 계정 불필요
엔드포인트
기본 URL
http://localhost:8080/v1속도 제한
None — it is your machine- OpenAI 호환
- 공식 SDK: mlx-lm
- 텍스트
- 비전
코드 예시
npm install openaiimport OpenAI from 'openai'
const client = new OpenAI({
baseURL: 'http://localhost:8080/v1',
apiKey: 'not-needed'
})
const response = await client.chat.completions.create({
model: 'mlx-community/Qwen3-8B-4bit',
messages: [{ role: 'user', content: 'Explain closures in one paragraph.' }]
})
console.log(response.choices[0].message.content)pip install openaifrom openai import OpenAI
client = OpenAI(
base_url="http://localhost:8080/v1",
api_key="not-needed",
)
response = client.chat.completions.create(
model="mlx-community/Qwen3-8B-4bit",
messages=[{"role": "user", "content": "Explain closures in one paragraph."}],
)
print(response.choices[0].message.content)curl http://localhost:8080/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "mlx-community/Qwen3-8B-4bit",
"messages": [{"role": "user", "content": "Explain closures in one paragraph."}]
}'pip install mlx-lmfrom mlx_lm import load, generate
model, tokenizer = load("mlx-community/Qwen3-8B-4bit")
prompt = tokenizer.apply_chat_template(
[{"role": "user", "content": "Explain closures in one paragraph."}],
add_generation_prompt=True,
)
print(generate(model, tokenizer, prompt=prompt, max_tokens=512))알아두면 좋은 점
- Apple Silicon 전용입니다.
- 먼저 서버를 띄우세요: `mlx_lm.server --model mlx-community/Qwen3-8B-4bit`.
무료로 받는 모델3
- Qwen 3
qwen3 - Qwen Coder
Qwen2.5-Coder-7B - GPT-OSS 120B
gpt-oss-120b