it's free*.ai

ディレクトリ · 確認日 2 Sep 2026

自分のマシンでAIモデルを実行

ぶつかるレート制限も、ローテーションするキーも、ラップトップから送信されるものもなし — 唯一の上限はハードウェアです。1行のCLIから本番で実際に使われるサーバーまで、知っておくべきランタイムです。

ベンチマークより形で選びましょう: 1分で動かしたいならOllama、ターミナルに触りたくないならLM Studio、MシリーズMacならMLX、他の人に配信するならvLLM。

Ollama

CLI + サーバー

コマンド1つでマシン上でモデルが動く。制限も上限もなし。

localhost:11434/v1

LM Studio

デスクトップアプリ

GUI版Ollama:見つけて、ダウンロードして、ローカルでチャット。

localhost:1234/v1

llama.cpp

エンジン

ほぼすべてのローカルツールの土台。ピュアC++、依存なし。

localhost:8080/v1

Jan

デスクトップアプリ

100%オフラインで動くオープンソースのChatGPT代替。

localhost:1337/v1

GPT4All

デスクトップアプリ

ローカルでドキュメントと対話。データはノートPCから出ない。

Local RAG

vLLM

推論サーバー

本番で使われる推論サーバー。PagedAttentionと継続バッチングを自分のGPUで。

localhost:8000/v1

MLX

Appleシリコン

Appleの配列フレームワーク。M系列Macではローカル実行の最速ルート。

localhost:8080/v1

llamafile

シングルバイナリ

モデルとランタイムが1ファイルに。ダウンロードしてchmod +xして実行。インストール不要。

localhost:8080/v1

KoboldCpp

シングルバイナリ

llama.cppを包むシングルバイナリ。長文・創作向けに調整済み。

GGUF

これらについての質問

どれだけのRAMが必要ですか?

4ビット量子化の7Bモデルは約5GBで収まるので、8GBあれば余裕で動きます。70Bは40GB以上必要です。Can I Run AIがあなたのマシンを判定してくれます。

ローカルモデルは無料APIと同じくらい良いですか?

通常は違います。自宅で動かせるモデルはNVIDIAやGroqが無料で提供するものより小さいです。プライバシー・オフライン利用・制限ゼロではローカルが勝ります。

他の切り口