it's free*.ai

Cloudflare Workers AI

O Workers AI roda inferência na edge da Cloudflare, então um Worker chama um modelo sem voltar e voltar a uma fazenda de GPU regional. A unidade gratuita é de 10.000 neurônios por dia, compartilhados pelo catálogo. Llama 3.3 70B, GPT-OSS 120B e Qwen 3.8 ficam nesse nível.

O Workers AI roda inferência na edge da Cloudflare, então um Worker chama um modelo sem voltar e voltar a uma fazenda de GPU regional. A unidade gratuita é de 10.000 neurônios por dia, compartilhados pelo catálogo. Llama 3.3 70B, GPT-OSS 120B e Qwen 3.8 ficam nesse nível.

A maior janela gratuita é de 262K, no Qwen 3.8 27B — não tem modelo de 10M aqui. Kimi K2.6, GLM 5.x e DeepSeek V4 são só do Workers Paid. A URL REST precisa do seu {account_id}; dentro de um Worker, use o binding de AI.

Modelos gratuitos
40
Contexto máximo
262K
Nível gratuito
10.000 neurônios por dia
Requisito
Conta de e-mail, sem cartão

Endpoint

URL basehttps://api.cloudflare.com/client/v4/accounts/{account_id}/ai/v1
Variável de ambienteCLOUDFLARE_API_TOKEN
Limite de taxa10K neurons per day (shared across models)

Exemplos de código

npm install openai
import OpenAI from 'openai'

const client = new OpenAI({
  baseURL: 'https://api.cloudflare.com/client/v4/accounts/{account_id}/ai/v1',
  apiKey: process.env.CLOUDFLARE_API_TOKEN
})

const response = await client.chat.completions.create({
  model: '@cf/openai/gpt-oss-120b',
  messages: [{ role: 'user', content: 'Explain closures in one paragraph.' }]
})

console.log(response.choices[0].message.content)

Vale saber

Modelos que você obtém de graça39