英伟达Groq 3 LPX推理加速器全面量产,AI推理性能实现30倍能效跃升

正飞GEO 2026年08月25日 18:07 1 阅读 来源:新浪财经
英伟达Groq 3 LPX推理加速器全面量产,AI推理性能实现30倍能效跃升 英伟达Groq 3 LPX推理加速器全面量产,AI推理性能实现30倍能效跃升
英伟达8月25日宣布Groq 3 LPX推理加速器全面量产,搭配Vera Rubin平台每兆瓦吞吐量最高达上一代30倍,每Token成本降低35倍。这是英伟达200亿美元收购Groq技术后的商业化里程碑,Nebius成为首批采用方。

8月25日,英伟达正式宣布面向智能体AI的Groq 3 LPX推理加速器全面量产,标志着其200亿美元收购Groq相关资产后的技术商业化正式落地。

关键要点

  • 性能飞跃:单芯片搭载Gemma 4 31B模型时实现每秒3400个输出Token,创该模型最高纪录
  • 系统级提升:Vera Rubin NVL72每兆瓦吞吐量最高达上一代GB300 NVL72的30倍,每Token成本最高降低35倍
  • 延迟优化:针对智能体编程等延迟敏感负载,响应速度最高达竞品平台的4倍
  • 首批部署:Nebius成为首个采用Groq 3 LPX的AI云服务商,产品将于今年晚些时候上线

技术原理与商业化

Groq 3 LPX采用专用语言处理单元(LPU)架构,以SRAM为核心,单机架集成256颗LPU芯片,SRAM合计128GB、带宽40PB/s。通过软件定义调度替代传统硬件动态仲裁,所有运算基于固定尺寸向量执行,消除缓存未命中风险,确保低延迟与高吞吐。

在架构层面,Rubin GPU负责注意力计算,LPX负责前馈网络(FFN)计算,通过Fusion Memory架构实现协同,为万亿参数模型和百万级Token上下文优化。

产业应用方面,Nebius平台将率先部署Groq 3 LPX,与Vera CPU、Rubin GPU协同工作。此外,SpaceX AI将采用Vera CPU加速下一代智能体AI应用,并计划将优化版Vera Rubin NVL72延伸至太空用于Starmind AI卫星。

此次量产标志着英伟达在AI推理赛道上的重大突破,从GPU扩展到LPU专用架构,构建了覆盖训练和推理的全栈AI算力体系。

分享到: