Cloudflare Workers AI
Workers AI 在 Cloudflare 邊緣執行推論,Worker 呼叫模型不必繞道區域 GPU 叢集。免費單位是每天 10,000 個 neuron,整個目錄共享。Llama 3.3 70B、GPT-OSS 120B 和 Qwen 3.8 都在這個檔內。
Workers AI 在 Cloudflare 邊緣執行推論,Worker 呼叫模型不必繞道區域 GPU 叢集。免費單位是每天 10,000 個 neuron,整個目錄共享。Llama 3.3 70B、GPT-OSS 120B 和 Qwen 3.8 都在這個檔內。
最長的免費視窗是 262K,在 Qwen 3.8 27B 上 —— 這裡沒有 10M 模型。Kimi K2.6、GLM 5.x 和 DeepSeek V4 僅限 Workers Paid。REST 網址需要你的 {account_id};在 Worker 內部請改用 AI 綁定。
- 免費模型
- 40
- 最大上下文
- 262K
- 免費額度
- 每天 10,000 個神經元
- 註冊要求
- 只要電子郵件,不要卡
端點
基底網址
https://api.cloudflare.com/client/v4/accounts/{account_id}/ai/v1環境變數
CLOUDFLARE_API_TOKEN速率限制
10K neurons per day (shared across models)- OpenAI 相容
- 文字
- 影像
- 視訊
- 程式碼
- 推理
程式碼範例
npm install openaiimport OpenAI from 'openai'
const client = new OpenAI({
baseURL: 'https://api.cloudflare.com/client/v4/accounts/{account_id}/ai/v1',
apiKey: process.env.CLOUDFLARE_API_TOKEN
})
const response = await client.chat.completions.create({
model: '@cf/openai/gpt-oss-120b',
messages: [{ role: 'user', content: 'Explain closures in one paragraph.' }]
})
console.log(response.choices[0].message.content)pip install openaiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.cloudflare.com/client/v4/accounts/{account_id}/ai/v1",
api_key=os.environ["CLOUDFLARE_API_TOKEN"],
)
response = client.chat.completions.create(
model="@cf/openai/gpt-oss-120b",
messages=[{"role": "user", "content": "Explain closures in one paragraph."}],
)
print(response.choices[0].message.content)curl https://api.cloudflare.com/client/v4/accounts/{account_id}/ai/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $CLOUDFLARE_API_TOKEN" \
-d '{
"model": "@cf/openai/gpt-oss-120b",
"messages": [{"role": "user", "content": "Explain closures in one paragraph."}]
}'值得注意
- 把基底網址裡的 {account_id} 換成你自己的帳戶 id。
- 在 Worker 內部請改用 AI 綁定 —— 免去網路跳轉和 token。
- Kimi K2.6、GLM 5.2/5.3 和 DeepSeek V4 僅限 Workers Paid。最長免費視窗是 Qwen 3.8 27B 的 262K。
你能免費使用的模型39
- GPT-OSS 120B
@cf/openai/gpt-oss-120b - GPT-OSS 20B
@cf/openai/gpt-oss-20b - Qwen 3.8 27B
@cf/qwen/qwen3.8-27b - Llama 3.3 70B
@cf/meta/llama-3.3-70b-instruct-fp8-fast - Llama 4 Scout
@cf/meta/llama-4-scout-17b-16e-instruct - Llama 3.1 8B Fast
@cf/meta/llama-3.1-8b-instruct-fast - Llama 3.1 8B FP8
@cf/meta/llama-3.1-8b-instruct-fp8 - Llama 3.2 11B Vision
@cf/meta/llama-3.2-11b-vision-instruct - Llama 3.2 1B
@cf/meta/llama-3.2-1b-instruct - Llama 3.2 3B
@cf/meta/llama-3.2-3b-instruct - Gemma 4 26B
@cf/google/gemma-4-26b-a4b-it - GLM 4.7 Flash
@cf/zai-org/glm-4.7-flash - Granite 4.0 H Micro
@cf/ibm/granite-4.0-h-micro - Nemotron 3 Super
@cf/nvidia/nemotron-3-120b-a12b - Qwen 3 30B A3B
@cf/qwen/qwen3-30b-a3b-fp8 - Qwen 2.5 Coder 32B
@cf/qwen/qwen2.5-coder-32b-instruct - QwQ 32B
@cf/qwen/qwq-32b - Mistral Small 3.1
@cf/mistralai/mistral-small-3.1-24b-instruct - DeepSeek R1 Distill 32B
@cf/deepseek-ai/deepseek-r1-distill-qwen-32b - Llama Guard 3 8B
@cf/meta/llama-guard-3-8b - Whisper Large V3 Turbo
@cf/openai/whisper-large-v3-turbo - BGE M3
@cf/baai/bge-m3 - BGE Base
@cf/baai/bge-base-en-v1.5 - EmbeddingGemma 300M
@cf/google/embeddinggemma-300m - FLUX.1 Schnell
@cf/black-forest-labs/flux-1-schnell - Qwen 3 Embedding 0.6B
@cf/qwen/qwen3-embedding-0.6b - Gemma 3 12B
@cf/google/gemma-3-12b-it - Llama 3.1 8B
@cf/meta/llama-3.1-8b-instruct - Mistral 7B
@cf/mistralai/mistral-7b-instruct-v0.2 - LLaVA 1.5 7B
@cf/llava-hf/llava-1.5-7b-hf - Whisper
@cf/openai/whisper - Nova 3
@cf/deepgram/nova-3 - MeloTTS
@cf/myshell-ai/melotts - Stable Diffusion XL
@cf/stabilityai/stable-diffusion-xl-base-1.0 - Resnet 50
@cf/microsoft/resnet-50 - BART Large CNN
@cf/facebook/bart-large-cnn - DistilBERT SST 2
@cf/huggingface/distilbert-sst-2-int8 - SQLCoder 7B
@cf/defog/sqlcoder-7b-2 - Phi 2
@cf/microsoft/phi-2