OpenAI推出Ultrafast模式 与Cerebras合作将GPT-5.6速度提升14倍
OpenAI推出Ultrafast模式 与Cerebras合作将GPT-5.6速度提升14倍
OpenAI于8月13日在官方博客公布Ultrafast加速模式,基于GPT-5.6 Sol实现14倍推理提速,峰值每秒750输出tokens,依托Cerebras专用AI加速卡,当前向少量企业客户开放预览。
2026年8月13日,OpenAI在官方博客正式公布了名为"Ultrafast"的全新推理加速模式,这是针对其最新旗舰模型GPT-5.6 Sol推出的高性能预览版本。公司宣称Ultrafast能够将模型处理速率提升至常规模式的14倍,峰值可达每秒750个输出tokens,标志着大模型推理从"足够快"向"极限快"的重大跨越。
核心要点:
- 速度突破:相较于标准部署实现14倍加速,单秒输出令牌上限达到750个,在保持原有生成质量前提下实现近实时交互体验
- 硬件支撑:此次加速并非单纯依靠模型压缩或量化,而是基于OpenAI与AI芯片公司Cerebras的深度合作,利用Cerebras专用AI加速卡提供算力支撑
- 应用场景:主要面向高吞吐企业场景,包括客服与支持(毫秒级回复)、金融市场分析(实时行情处理)、电商运营(促销期实时生成文案)、安全事件响应(即时处置建议)
- 开放节奏:当前仅向少量企业客户开放预览,后续将随着Cerebras硬件产能提升逐步扩大可用规模,未来可能覆盖更多中小企业客户
- 竞争格局:Anthropic早前已推出Claude的Fast模式,但在峰值吞吐上仍低于OpenAI此次公布的指标;Google、Microsoft等厂商也在探索模型压缩与并行推理,但多数侧重降低参数量而非单纯提升时延
OpenAI在官方声明中表示:"Ultrafast标志着从'足够快'向'极限快'的转变,帮助企业把生成式AI真正嵌入高频业务流程。"业界普遍认为,推理速度的量级提升将解锁一大批此前因延迟问题无法落地的AI应用场景,推动生成式AI在实时业务中的规模化部署。
这一合作也凸显了AI算力多元化的趋势:除了英伟达GPU之外,Cerebras等专用AI芯片正在高性能推理场景找到差异化定位,为企业提供更多算力选择。