马斯克xAI发布Grok 4:多智能体协作架构,HLE测试达44.4%
埃隆·马斯克旗下的 xAI 公司于 2025 年 7 月 9 日正式发布 Grok 4 系列模型,这是该公司自 2023 年推出首代大模型以来的第四次重要迭代。Grok 4 依托 xAI 自建的 20 万张 H100 GPU 组成的 Colossus 超算集群训练,号称是「世界上最强大的人工智能模型」。
推理性能全面登顶
Grok 4 的核心竞争力在于超强的逻辑推理与问题解决能力,在多个权威基准测试中表现远超现有模型:
- Humanity's Last Exam(人类终极考试):Grok 4 Heavy 得分 44.4%,是此前行业最高水平的 2 倍以上,远超 Gemini 2.5 Pro(26.9%)和 OpenAI o3(20.32%)
- AIME 2025 数学竞赛:Grok 4 Heavy 实现满分,成为首个在该竞赛中击败人类顶尖选手的 AI 模型
- GPQA(研究生级问题):得分 88-89,超越 Gemini 2.5 Pro
- ARC-AGI 通用人工智能测试:首个在 v2 Semi Private 挑战中获得 10% 以上分数的 AI 模型
多智能体协作架构
Grok 4 最颠覆性的突破是采用多智能体协同推理的全新设计,不再是一个独立的「大脑」,而是由多个专业智能体组成的「专家团队」。
Grok 4 Heavy 可调度多达 32 个并行模型协同工作、辩论并共同产出最佳答案。协作流程包括:
- 任务拆解:协调器智能体将问题拆解为多个子任务
- 并行推理:每个智能体独立思考,生成自己的解决方案
- 交叉辩论:智能体之间互相质疑、辩论、补充
- 结果整合:协调器智能体综合所有观点,形成最优解
- 自我验证:生成验证用例,对结果进行测试
官方演示显示,在解决复杂的量子物理问题时,Grok 4 Heavy 生成了 8 个不同专业的智能体,经过 3 轮辩论和 2 次自我验证,最终得出正确答案。
超大上下文窗口
Grok 4 标准版原生支持 256,000 Token(约 19 万汉字)上下文窗口,是 Grok 3 的两倍。2026 年 2 月推出的 Grok 4 Fast 版本进一步将上下文窗口扩展至 200 万 Token,同时将价格降低了 90% 以上。
专用编程模型 Grok 4 Code
xAI 针对开发者需求推出 Grok 4 Code,支持代码生成、错误检测、上下文感知调试等功能,可与 Cursor 等开发工具深度集成,提供生产质量的代码生成和调试支持。
多模态与实时信息
Grok 4 通过 DeepSearch 功能直接从 X 平台和整个互联网中提取最新数据,无需任何外部浏览器插件。同时引入多模态信息处理(图像、视频),提升在社交媒体内容分析中的时效性。
语音模式端到端延迟减半,新增五种声音模式,包括史诗感的「Sal」和带有丰富情感的英音「Eve」。
定价与争议
Grok 4 Heavy 订阅费用为 300 美元/月,是目前市场上最昂贵的 AI 订阅之一。马斯克表示,Grok 4 的推理能力相较于前代提升了 10 倍,训练量更是达到了 Grok 2 的 100 倍。