Cerebras

Cerebras

基于晶圆级引擎(WSE-3)的超高速推理,gpt-oss-120b 达 1800+ tokens/秒。

月访问量
800.0K
累计浏览
2
用户评分
4.8
收录时间
2026-07

产品介绍

产品介绍

Cerebras 基于 Wafer-Scale Engine(WSE-3)芯片提供超高速 LLM 推理。WSE-3 拥有 4 万亿晶体管、90 万核心、44GB 片上 SRAM、21 PB/秒内存带宽(H100 的 7000 倍),gpt-oss-120b 达 1812 tokens/秒,比 GPU 快 10-30 倍。2026年5月完成最大科技 IPO,市值峰值近 700 亿美元。

核心功能

  • WSE-3 晶圆级芯片:46225 mm² 单晶圆,权重完全驻留片上 SRAM
  • 超高速推理:gpt-oss-120b 1812 tok/s,GLM-4.7 1008 tok/s
  • OpenAI 兼容:base_url https://api.cerebras.ai/v1
  • 分层定价:Free($5 credit)/ Developer($10起)/ Enterprise
  • CS-3 系统:支持云、专用、本地三种部署

API 调用示例

from openai import OpenAI
client = OpenAI(api_key="xxx", base_url="https://api.cerebras.ai/v1")
response = client.chat.completions.create(
    model="gpt-oss-120b",
    messages=[{"role": "user", "content": "Why is fast inference important?"}]
)
print(response.choices[0].message.content)

定价:gpt-oss-120b $0.35/$0.75 per MTok,GLM-4.7 $2.25/$2.75 per MTok。

典型使用场景

  • 实时语音 Agent(sub-300ms)
  • 多 Agent 工作流(速度叠加放大)
  • 交互式 RAG 与代码助手
  • 批量长文本生成

平台支持

官方 Python/Node SDK,OpenAI 兼容 API,SOC 2/HIPAA 认证。