Cerebras
Wafer-scale inference. Thousands of tokens per second.
Cerebras Cloud serves models from wafer-scale chips, which is why GPT-OSS 120B comes back at thousands of tokens a second. The public catalogue is two models: gpt-oss-120b and gemma-4-31b.
Signup grants $5 once. A payment method unlocks the credit; it is not a standing free tier. After the five dollars you buy more. The request cap is 5 a minute, 30K tokens a minute, a million tokens a day, and the free window is 65K. Batch work rather than firing in a loop. OpenAI-compatible at api.cerebras.ai/v1.
- Free models
- 2
- Max context
- 65K
- Free tier
- $5 one-time credit
- Requirement
- Credit card required
Endpoint
Base URL
https://api.cerebras.ai/v1Env var
CEREBRAS_API_KEYRate limit
5 requests/minute, 30K tokens/minute, 1M tokens/day- OpenAI-compatible
- Native SDK: Cerebras Cloud SDK
- text
- image
- reasoning
Code examples
npm install openaiimport OpenAI from 'openai'
const client = new OpenAI({
baseURL: 'https://api.cerebras.ai/v1',
apiKey: process.env.CEREBRAS_API_KEY
})
const response = await client.chat.completions.create({
model: 'gpt-oss-120b',
messages: [{ role: 'user', content: 'Explain closures in one paragraph.' }]
})
console.log(response.choices[0].message.content)pip install openaiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.cerebras.ai/v1",
api_key=os.environ["CEREBRAS_API_KEY"],
)
response = client.chat.completions.create(
model="gpt-oss-120b",
messages=[{"role": "user", "content": "Explain closures in one paragraph."}],
)
print(response.choices[0].message.content)curl https://api.cerebras.ai/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $CEREBRAS_API_KEY" \
-d '{
"model": "gpt-oss-120b",
"messages": [{"role": "user", "content": "Explain closures in one paragraph."}]
}'npm install @cerebras/cerebras_cloud_sdkimport Cerebras from '@cerebras/cerebras_cloud_sdk'
const client = new Cerebras({ apiKey: process.env.CEREBRAS_API_KEY })
const response = await client.chat.completions.create({
model: 'gpt-oss-120b',
messages: [{ role: 'user', content: 'Explain closures in one paragraph.' }]
})
console.log(response.choices[0].message.content)pip install cerebras_cloud_sdkimport os
from cerebras.cloud.sdk import Cerebras
client = Cerebras(api_key=os.environ["CEREBRAS_API_KEY"])
response = client.chat.completions.create(
model="gpt-oss-120b",
messages=[{"role": "user", "content": "Explain closures in one paragraph."}],
)
print(response.choices[0].message.content)Worth knowing
- The public catalogue is two models: gpt-oss-120b and gemma-4-31b. Llama, Qwen and DeepSeek left.
- Signup grants $5 once. A payment method unlocks the credit; after the five dollars you buy more.
- 5 requests/minute is low — batch your work rather than firing requests in a loop.
Models you get for free2
- GPT-OSS 120B
gpt-oss-120b - Gemma 4 31B
gemma-4-31b