it's free*.ai

llama.cpp

llama.cpp는 다른 거의 모든 로컬 도구가 감싸는 C++ 엔진입니다. Python도 필요 없고 의존성은 컴파일러(혹은 릴리스 바이너리)가 전부입니다. `llama-server -hf ggml-org/gpt-oss-120b-GGUF`가 8080 포트에서 OpenAI를 말합니다.

llama.cpp는 다른 거의 모든 로컬 도구가 감싸는 C++ 엔진입니다. Python도 필요 없고 의존성은 컴파일러(혹은 릴리스 바이너리)가 전부입니다. `llama-server -hf ggml-org/gpt-oss-120b-GGUF`가 8080 포트에서 OpenAI를 말합니다.

컨텍스트는 실행 시 -c로 지정합니다. CPU, Metal, CUDA, ROCm 모두 지원합니다. 금속에 바로 붙어 쓰고 싶거나, Ollama와 LM Studio의 “모델 둘레의 앱”이 두껍다고 느껴질 때 쓰세요.

최대 컨텍스트
Set with -c at launch
무료 요금제
무제한·비공개
요구사항
아무것도 없음 — 계정 불필요

엔드포인트

기본 URLhttp://localhost:8080/v1
속도 제한None — it is your machine

코드 예시

npm install openai
import OpenAI from 'openai'

const client = new OpenAI({
  baseURL: 'http://localhost:8080/v1',
  apiKey: 'not-needed'
})

const response = await client.chat.completions.create({
  model: 'gpt-oss-120b',
  messages: [{ role: 'user', content: 'Explain closures in one paragraph.' }]
})

console.log(response.choices[0].message.content)

알아두면 좋은 점

무료로 받는 모델2