xAI发布Grok 4.6:智能指数追平GPT-5.6 Sol,定价低60%登顶性价比榜
xAI发布Grok 4.6:智能指数追平GPT-5.6 Sol,定价低60%登顶性价比榜
xAI正式发布Grok 4.6,在AI智能指数上获得61分追平GPT-5.6 Sol,仅次于Claude Opus 5和Claude Fable 5,跻身全球前沿模型第一梯队,定价较竞品低60%以上。
xAI于8月14日正式发布Grok 4.6大模型,在AI智能指数评测中获得61分,追平GPT-5.6 Sol(Max),仅次于Claude Opus 5(63分)和Claude Fable 5(62分),正式跻身全球前沿模型第一梯队。
核心性能提升
- 智能体能力大幅跃升:GDPval-AA v2达1753 Elo,仅次于Claude Opus 5;DeepSWE v1.1提升至65.9%;APEX-Agents从47.1%升至57.5%;Terminal-Bench v3.0从15.7%升至26%
- 编码基准表现突出:CursorBench v3.2获69.9%,FrontierCode v1.1获61.3%,在代码调试和生产级代码生成方面有显著提升
- 训练方法创新:核心改进包括使用模型生成的精选数据进行推理和高级技术概念训练,结合高质量工程数据和改进的优化器;采用数据闭环方法,用Grok 4.5重新生成监督微调轨迹
极致性价比优势
定价方面,Grok 4.6展现出极强的市场竞争力:每百万输入token定价2美元、每百万输出token定价6美元,比Claude Opus 5和GPT-5.6 Sol低60%以上。在长周期任务资源消耗方面优势更为明显:AA-Briefcase长周期知识工作基准测试中,Grok 4.6平均用53个回合和约5亿输入token完成任务,而Claude Opus 5需要约103个回合和约20亿token,资源消耗不到后者的四分之一。
可用性与接入
Grok 4.6上下文窗口达50万token,目前已通过Cursor、Grok Build、API及OpenRouter、Vercel、Cloudflare等多个渠道向开发者开放。模型在推理、代理工具使用及STEM、软件工程和知识工作等领域均有针对性优化,特别适合长周期智能体任务和企业级知识工作场景。