AI日报 2026-07-31:OpenAI GPT-5、Anthropic Claude 4.1、谷歌Gemini 3、xAI Grok 4 同台竞技
今日要闻
OpenAI GPT-5 正式发布
OpenAI 于 2025 年 8 月 7 日发布 GPT-5,采用统一系统架构(GPT-5-main + GPT-5-thinking + 实时路由器),在编码、多模态推理、指令遵循等方面大幅超越前代。GPT-5 在 GPQA 测试中创下 88.4% 的无工具使用新纪录,向全体用户开放使用。
Anthropic Claude Opus 4.1 编程能力登顶
Anthropic 于 2025 年 8 月 5 日发布 Claude Opus 4.1,在 SWE-bench Verified 基准测试中取得 74.5% 的历史最高分,超越 OpenAI o3 和 Google Gemini 2.5 Pro。新模型在多文件代码重构等复杂任务上表现突出,安全性提升至 98.76% 无害响应率。
谷歌 Gemini 3 Pro 断层式领先
谷歌于 2025 年 11 月 18 日发布 Gemini 3 系列,以 1501 Elo 登顶 LMArena 榜单,成为首个突破 1500 分的模型。在 Humanity's Last Exam、GPQA Diamond、ARC-AGI-2 等多项基准测试中刷新纪录,多模态能力全面领先,ScreenSpot-Pro 得分是 GPT-5.1 的 20 倍。
xAI Grok 4 多智能体协作架构
马斯克旗下 xAI 于 2025 年 7 月 9 日发布 Grok 4 系列,采用多智能体协作架构,在 Humanity's Last Exam 测试中以 44.4% 准确率刷新纪录。Grok 4 Heavy 可调度多达 32 个并行模型协同工作,AIME 2025 数学竞赛实现满分。
行业动态
- Anthropic ARR 飙升:Anthropic 年化经常性收入在七个月内从 10 亿美元飙升至接近 50 亿美元,Claude Code 订阅服务年化收入接近 4 亿美元
- Anthropic 融资进展:公司正在进行由 Iconiq Capital 领投的 50 亿美元融资,估值可能达到 1700 亿美元
- 谷歌 Gemini 用户规模:Gemini App 月活用户超过 6.5 亿,AI Overviews 月活用户 20 亿,开发者数量达 1300 万
- xAI 算力投入:Grok 4 训练量达到 Grok 2 的 100 倍,依托 20 万张 H100 GPU 组成的 Colossus 超算集群
- GPT-5 Pro 突破:在 GPQA 测试中创下 88.4% 的无工具使用新纪录,替代原有的 o3-Pro
技术趋势观察
2025 年下半年,AI 行业进入「推理能力竞赛」白热化阶段:
- 统一架构成主流:GPT-5 的路由器架构、Gemini 3 的 Deep Think、Grok 4 的多智能体协作,都体现了「按需深度思考」的趋势
- 编程能力成关键战场:SWE-bench Verified 成为核心试金石,Claude(74.5%)、Gemini 3(76.2%)、GPT-5 等持续刷新纪录
- 多模态能力断层:Gemini 3 在 ScreenSpot-Pro 测试中以 72.7% 远超 GPT-5.1 的 3.5%,UI 理解能力成新分水岭
- AGI 测试突破:ARC-AGI-2 测试中 Gemini 3 Deep Think 达到 45.1%,首次展现接近人类流体智力的表现
价格对比
| 模型 | 输入价格(美元/百万token) | 输出价格(美元/百万token) |
|---|---|---|
| GPT-5 | 1.25 | 10 |
| Claude Opus 4.1 | 15 | 75 |
| Gemini 3 Pro | 待公布 | 待公布 |
| Grok 4 Heavy | 300 美元/月订阅 | - |
GPT-5 在性价比上领先,Claude Opus 4.1 定位高端专业市场,Grok 4 Heavy 以订阅模式面向重度用户。