月访问量
800.0K
累计浏览
2
用户评分
4.8
收录时间
2026-07
产品介绍
产品介绍
Cerebras 基于 Wafer-Scale Engine(WSE-3)芯片提供超高速 LLM 推理。WSE-3 拥有 4 万亿晶体管、90 万核心、44GB 片上 SRAM、21 PB/秒内存带宽(H100 的 7000 倍),gpt-oss-120b 达 1812 tokens/秒,比 GPU 快 10-30 倍。2026年5月完成最大科技 IPO,市值峰值近 700 亿美元。
核心功能
- WSE-3 晶圆级芯片:46225 mm² 单晶圆,权重完全驻留片上 SRAM
- 超高速推理:gpt-oss-120b 1812 tok/s,GLM-4.7 1008 tok/s
- OpenAI 兼容:base_url
https://api.cerebras.ai/v1 - 分层定价:Free($5 credit)/ Developer($10起)/ Enterprise
- CS-3 系统:支持云、专用、本地三种部署
API 调用示例
from openai import OpenAI
client = OpenAI(api_key="xxx", base_url="https://api.cerebras.ai/v1")
response = client.chat.completions.create(
model="gpt-oss-120b",
messages=[{"role": "user", "content": "Why is fast inference important?"}]
)
print(response.choices[0].message.content)
定价:gpt-oss-120b $0.35/$0.75 per MTok,GLM-4.7 $2.25/$2.75 per MTok。
典型使用场景
- 实时语音 Agent(sub-300ms)
- 多 Agent 工作流(速度叠加放大)
- 交互式 RAG 与代码助手
- 批量长文本生成
平台支持
官方 Python/Node SDK,OpenAI 兼容 API,SOC 2/HIPAA 认证。