it's free*.ai

vLLM

vLLM은 프로덕션이 실제로 쓰는 서빙 엔진입니다: PagedAttention, 연속 배칭, localhost:8000/v1의 OpenAI 호환 서버. GPU는 본인이 준비합니다.

vLLM은 프로덕션이 실제로 쓰는 서빙 엔진입니다: PagedAttention, 연속 배칭, localhost:8000/v1의 OpenAI 호환 서버. GPU는 본인이 준비합니다.

`vllm serve Qwen/Qwen3-8B` 한 방이면 끝입니다. CUDA 또는 ROCm. Mac이라면 MLX로 손을 뻗으세요. 쿼터도 키도 없고, 아무것도 머신 밖으로 나가지 않습니다.

최대 컨텍스트
Set with --max-model-len
무료 요금제
무제한·비공개
요구사항
아무것도 없음 — 계정 불필요

엔드포인트

기본 URLhttp://localhost:8000/v1
속도 제한None — it is your machine

코드 예시

npm install openai
import OpenAI from 'openai'

const client = new OpenAI({
  baseURL: 'http://localhost:8000/v1',
  apiKey: 'not-needed'
})

const response = await client.chat.completions.create({
  model: 'Qwen/Qwen3-8B',
  messages: [{ role: 'user', content: 'Explain closures in one paragraph.' }]
})

console.log(response.choices[0].message.content)

알아두면 좋은 점

무료로 받는 모델5