Cloudflare Workers AI
Workers AI は Cloudflare のエッジで推論を実行するため、Worker がモデルを呼んでも地域のGPUファームへの往復は発生しません。無料の単位は1日10,000ニューロンで、カタログ全体で共有。Llama 3.3 70B、GPT-OSS 120B、Qwen 3.8 はこの枠に収まります。
Workers AI は Cloudflare のエッジで推論を実行するため、Worker がモデルを呼んでも地域のGPUファームへの往復は発生しません。無料の単位は1日10,000ニューロンで、カタログ全体で共有。Llama 3.3 70B、GPT-OSS 120B、Qwen 3.8 はこの枠に収まります。
最長の無料ウィンドウは262Kで Qwen 3.8 27B のもの —— ここに10Mのモデルはありません。Kimi K2.6、GLM 5.x、DeepSeek V4 は Workers Paid 専用。RESTのURLにはあなたの {account_id} が必要です。Workerの中では、ネットワークホップとトークンを省けるAIバインディングを使いましょう。
- 無料モデル
- 40
- 最大コンテキスト
- 262K
- 無料プラン
- 1日10,000ニューロン
- 条件
- メール登録のみ、カード不要
エンドポイント
ベースURL
https://api.cloudflare.com/client/v4/accounts/{account_id}/ai/v1環境変数
CLOUDFLARE_API_TOKENレート制限
10K neurons per day (shared across models)- OpenAI互換
- テキスト
- 画像
- 動画
- コード
- 推論
コード例
npm install openaiimport OpenAI from 'openai'
const client = new OpenAI({
baseURL: 'https://api.cloudflare.com/client/v4/accounts/{account_id}/ai/v1',
apiKey: process.env.CLOUDFLARE_API_TOKEN
})
const response = await client.chat.completions.create({
model: '@cf/openai/gpt-oss-120b',
messages: [{ role: 'user', content: 'Explain closures in one paragraph.' }]
})
console.log(response.choices[0].message.content)pip install openaiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.cloudflare.com/client/v4/accounts/{account_id}/ai/v1",
api_key=os.environ["CLOUDFLARE_API_TOKEN"],
)
response = client.chat.completions.create(
model="@cf/openai/gpt-oss-120b",
messages=[{"role": "user", "content": "Explain closures in one paragraph."}],
)
print(response.choices[0].message.content)curl https://api.cloudflare.com/client/v4/accounts/{account_id}/ai/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $CLOUDFLARE_API_TOKEN" \
-d '{
"model": "@cf/openai/gpt-oss-120b",
"messages": [{"role": "user", "content": "Explain closures in one paragraph."}]
}'知っておくべきこと
- ベースURLの {account_id} を自分のアカウントidに差し替えてください。
- Worker内ではAIバインディングを使いましょう —— ネットワークホップとトークンを省けます。
- Kimi K2.6、GLM 5.2/5.3、DeepSeek V4 は Workers Paid 専用。最長の無料ウィンドウは Qwen 3.8 27B の262Kです。
無料で利用できるモデル39
- GPT-OSS 120B
@cf/openai/gpt-oss-120b - GPT-OSS 20B
@cf/openai/gpt-oss-20b - Qwen 3.8 27B
@cf/qwen/qwen3.8-27b - Llama 3.3 70B
@cf/meta/llama-3.3-70b-instruct-fp8-fast - Llama 4 Scout
@cf/meta/llama-4-scout-17b-16e-instruct - Llama 3.1 8B Fast
@cf/meta/llama-3.1-8b-instruct-fast - Llama 3.1 8B FP8
@cf/meta/llama-3.1-8b-instruct-fp8 - Llama 3.2 11B Vision
@cf/meta/llama-3.2-11b-vision-instruct - Llama 3.2 1B
@cf/meta/llama-3.2-1b-instruct - Llama 3.2 3B
@cf/meta/llama-3.2-3b-instruct - Gemma 4 26B
@cf/google/gemma-4-26b-a4b-it - GLM 4.7 Flash
@cf/zai-org/glm-4.7-flash - Granite 4.0 H Micro
@cf/ibm/granite-4.0-h-micro - Nemotron 3 Super
@cf/nvidia/nemotron-3-120b-a12b - Qwen 3 30B A3B
@cf/qwen/qwen3-30b-a3b-fp8 - Qwen 2.5 Coder 32B
@cf/qwen/qwen2.5-coder-32b-instruct - QwQ 32B
@cf/qwen/qwq-32b - Mistral Small 3.1
@cf/mistralai/mistral-small-3.1-24b-instruct - DeepSeek R1 Distill 32B
@cf/deepseek-ai/deepseek-r1-distill-qwen-32b - Llama Guard 3 8B
@cf/meta/llama-guard-3-8b - Whisper Large V3 Turbo
@cf/openai/whisper-large-v3-turbo - BGE M3
@cf/baai/bge-m3 - BGE Base
@cf/baai/bge-base-en-v1.5 - EmbeddingGemma 300M
@cf/google/embeddinggemma-300m - FLUX.1 Schnell
@cf/black-forest-labs/flux-1-schnell - Qwen 3 Embedding 0.6B
@cf/qwen/qwen3-embedding-0.6b - Gemma 3 12B
@cf/google/gemma-3-12b-it - Llama 3.1 8B
@cf/meta/llama-3.1-8b-instruct - Mistral 7B
@cf/mistralai/mistral-7b-instruct-v0.2 - LLaVA 1.5 7B
@cf/llava-hf/llava-1.5-7b-hf - Whisper
@cf/openai/whisper - Nova 3
@cf/deepgram/nova-3 - MeloTTS
@cf/myshell-ai/melotts - Stable Diffusion XL
@cf/stabilityai/stable-diffusion-xl-base-1.0 - Resnet 50
@cf/microsoft/resnet-50 - BART Large CNN
@cf/facebook/bart-large-cnn - DistilBERT SST 2
@cf/huggingface/distilbert-sst-2-int8 - SQLCoder 7B
@cf/defog/sqlcoder-7b-2 - Phi 2
@cf/microsoft/phi-2