谷歌发布Gemini 3 Pro:LMArena首破1500分,多模态能力断层式领先

正飞GEO 2026年07月31日 03:00 7 阅读 来源:Google
谷歌发布Gemini 3 Pro:LMArena首破1500分,多模态能力断层式领先 谷歌发布Gemini 3 Pro:LMArena首破1500分,多模态能力断层式领先
谷歌于2025年11月18日发布Gemini 3系列,Gemini 3 Pro以1501 Elo登顶LMArena榜单,在Humanity's Last Exam、GPQA Diamond、ARC-AGI-2等多项基准测试中刷新纪录,多模态能力全面领先。

谷歌于 2025 年 11 月 18 日正式发布 Gemini 3 系列模型,这是继 Gemini 2.5 Pro 后的又一次重大升级。Gemini 3 Pro 在多项前沿基准测试中夺冠,被谷歌称为「世界上最智能的模型」。

性能全面跃升

Gemini 3 Pro 以 1501 Elo 的突破性成绩登顶 LMArena 榜单,成为首个突破 1500 分的模型。在多项核心测试中刷新纪录:

  • Humanity's Last Exam:37.5%(无工具),超越 GPT-5 Pro 的 31.64%
  • GPQA Diamond:91.9%,远超前代 Gemini 2.5 Pro 的 86.4%
  • ARC-AGI-2:31.1%,是 GPT-5.1(17.6%)的近 2 倍,Gemini 2.5 Pro(4.9%)的 6 倍
  • MathArena Apex:23.4%,相比 Gemini 2.5 Pro 的 0.5% 实现近 47 倍提升
  • AIME 2025:95%(无工具),100%(带代码执行)

Deep Think 推理模式

谷歌同步预览了增强版 Gemini 3 Deep Think,在推理和多模态理解能力上实现阶跃式提升:

  • Humanity's Last Exam:41%(无工具)
  • GPQA Diamond:93.8%
  • ARC-AGI-2:45.1%(带代码执行、官方验证),是前代模型集群数年进步的总和

ARC Prize 创始人 François Chollet 评价:「我们刚刚验证了 Gemini 3 Pro 和 Deep Think 在 ARC v2 上超过 SOTA 2 倍以上!这真的很令人印象深刻,说实话,也有点出乎意料。」

多模态能力断层式领先

作为完全多模态的基础模型,Gemini 3 Pro 在视觉和视频理解上创下新纪录:

  • MMMU-Pro:81.0%(多模态大考)
  • Video-MMMU:87.6%(视频推理)
  • ScreenSpot-Pro:72.7%,是 Claude Sonnet 4.5(36.2%)的 2 倍,GPT-5.1(3.5%)的 20 倍

ScreenSpot-Pro 得分意味着 Gemini 3 在理解屏幕截图和用户界面方面实现质的突破,为构建能真正理解和操作图形界面的 AI 代理奠定基础。

编码能力翻身

虽然 SWE-Bench Verified 上 Gemini 3 Pro 的 76.2% 略逊于 Claude Sonnet 4.5 的 77.2%,但在其他核心编码测试中远超对手:

  • LiveCodeBench:比第二名 Grok 4.1 直接高出 200 多分
  • 12-bench(Agent 工具使用):85.4%,远超前代 54.9%
  • Terminal-Bench 2.0:54.2%,比第二名高出 11 个百分点
  • Design Arena:整体排名第一,在网站、游戏开发、3D 设计、UI 组件四个赛区占据榜首

架构创新

Gemini 3 Pro 采用改进型稀疏混合专家(MoE)架构,总参数规模超过万亿,每次查询仅激活 150-200 亿参数(约 2%)。支持 100 万 token 上下文窗口和最高 64,000 token 输出,完全基于 Google 自研第六代 Trillium TPU 训练。

可用性

Gemini 3 已在 Gemini 应用、Search AI Mode、AI Studio、Vertex AI 以及全新代理式开发平台 Google Antigravity 中开放预览。Gemini 3 Deep Think 正在进行额外的安全审查,预计未来几周向 Google AI Ultra 用户开放。

分享到: