Groq

Groq

模型算力 按量付费/免费 美国 精选推荐 #LPU#推理#高速#开源模型#Groq

Groq 超高速推理服务,LPU 专用芯片驱动,500-1800+ tokens/秒,比 GPU 快 10-20 倍。

月访问量
5.0M
累计浏览
8
用户评分
4.8
收录时间
2026-07

产品介绍

产品介绍

Groq 是前 Google TPU 工程师 Jonathan Ross 创立的超高速推理云服务,核心创新是 LPU 专用推理芯片。Llama 3.3 70B 达 394 tokens/秒,GPT-OSS 20B 达 1000+ tokens/秒,比 GPU 快 10-20 倍。2025年9月完成 7.5 亿美元融资,估值 69 亿美元。

核心功能

  • LPU 专用芯片:为 LLM 推理定制,解决 GPU 内存带宽瓶颈
  • 超高速推理:Llama 3.3 70B 394 tok/s,GPT-OSS 20B 1000+ tok/s
  • 开源模型生态:Llama、Qwen、GPT-OSS、DeepSeek R1 Distill、Whisper
  • OpenAI 兼容 API:修改 base_url 即可迁移
  • 超低定价:Llama 3.1 8B $0.05/$0.08 per 1M;Llama 3.3 70B $0.59/$0.79
  • 免费层:无需信用卡,30 RPM / 14,400 请求/天

API 调用示例

from openai import OpenAI
client = OpenAI(base_url="https://api.groq.com/openai/v1", api_key="gsk_xxx")
response = client.chat.completions.create(
    model="llama-3.3-70b-versatile",
    messages=[{"role": "user", "content": "解释 LPU 相比 GPU 的优势"}],
)
print(response.choices[0].message.content)

典型使用场景

  • 实时语音助手(sub-300ms 响应)
  • 实时代码补全
  • 高频 API 服务
  • 批量数据处理(Batch API 半价)
  • 语音转文字(Whisper 228 倍实时速度)

平台支持

官方 API(OpenAI 兼容),Python/Node/Go SDK,支持 LangChain、LlamaIndex、Vercel AI SDK。