it's free*.ai

Cloudflare Workers AI

Workers AI exécute l’inférence à la périphérie de Cloudflare — un Worker appelle un modèle sans aller-retour vers une ferme de GPU régionale. L’unité gratuite est de 10 000 neurones par jour, partagés sur le catalogue. Llama 3.3 70B, GPT-OSS 120B et Qwen 3.8 restent à ce niveau.

Workers AI exécute l’inférence à la périphérie de Cloudflare — un Worker appelle un modèle sans aller-retour vers une ferme de GPU régionale. L’unité gratuite est de 10 000 neurones par jour, partagés sur le catalogue. Llama 3.3 70B, GPT-OSS 120B et Qwen 3.8 restent à ce niveau.

La plus longue fenêtre gratuite est de 262K, sur Qwen 3.8 27B — aucun modèle 10M ici. Kimi K2.6, GLM 5.x et DeepSeek V4 sont réservés à Workers Paid. L’URL REST exige votre {account_id} ; dans un Worker, préférez le binding AI.

Modèles gratuits
40
Contexte max
262K
Offre gratuite
10 000 neurones/jour
Exigence
Compte e-mail, sans carte

Point de terminaison

URL de basehttps://api.cloudflare.com/client/v4/accounts/{account_id}/ai/v1
Variable d’environnementCLOUDFLARE_API_TOKEN
Limite de débit10K neurons per day (shared across models)

Exemples de code

npm install openai
import OpenAI from 'openai'

const client = new OpenAI({
  baseURL: 'https://api.cloudflare.com/client/v4/accounts/{account_id}/ai/v1',
  apiKey: process.env.CLOUDFLARE_API_TOKEN
})

const response = await client.chat.completions.create({
  model: '@cf/openai/gpt-oss-120b',
  messages: [{ role: 'user', content: 'Explain closures in one paragraph.' }]
})

console.log(response.choices[0].message.content)

Bon à savoir

Modèles que vous obtenez gratuitement39