OpenAI推出GPT-5.6 Sol Ultrafast:Cerebras晶圆级系统加持,每秒750token提速14倍
OpenAI推出GPT-5.6 Sol Ultrafast:Cerebras晶圆级系统加持,每秒750token提速14倍
OpenAI预览GPT-5.6 Sol的Ultrafast API服务层,由Cerebras晶圆级系统提供推理能力,最高每秒输出750个token、相对标准处理最高提速14倍,目前向少量客户开放邀请制预览。
8月13日,OpenAI预览GPT-5.6 Sol的Ultrafast服务层,由Cerebras晶圆级系统提供推理能力。官方称其最高可输出每秒750个token,相对标准处理最高提速14倍,标志着前沿模型不再只能在"能力强"和"响应快"之间二选一。
技术架构:不是新模型,而是更快的推理通道
Ultrafast沿用GPT-5.6 Sol的完整能力,通过新的服务层提升输出速度,并非缩水小模型。其核心技术创新在于与Cerebras的合作:Cerebras晶圆级芯片上放置44GB SRAM,把模型层流水化分布到多块晶圆系统,让权重尽量留在片上、token连续穿过各层,从根本上减少传统GPU系统中权重反复进出芯片的等待时间。
适用场景与性能表现
- 时间敏感任务:面向生产故障定位、网络安全响应、客户支持、金融市场分析和电商运营等场景,答案晚几十秒可能直接影响处置结果
- 峰值速度:官方给出的峰值是每秒750个输出token,Cerebras引用公开测试称输出速度约为Claude Fable 5的11倍、Opus 4.8快速模式的5倍
- 内部测试结果:在Humanity's Last Exam测试中,Ultrafast通过Codex以xhigh推理强度完成2500道题耗时11小时11分钟,对比模型耗时78小时27分钟,准确度相当;GDP-Val测试在中等推理强度下得到5.6倍端到端加速
行业意义与局限
需要明确的是,每秒750个token描述的是生成阶段的峰值输出速度,不等于请求从提交到首字出现的全部延迟,也不代表所有提示、上下文长度和并发条件都能达到该数字。真正需要观察的指标还包括首token时间、长上下文吞吐、高并发抖动、失败率和成本。
目前Ultrafast为邀请制有限预览,只在OpenAI API中向少量客户开放,价格、并发限制、首token延迟和广泛独立测试尚未公布。OpenAI把Ultrafast定义为优先解决"单位时间完成多少有用工作"的新方向,模型公司正把同一模型拆成不同延迟、容量和风险等级的服务,开发者可根据时间价值与成本灵活选择路由。