谷歌发布Gemini 2.0 Flash:为智能体时代而生,原生多模态输出图像音频
谷歌发布Gemini 2.0 Flash:为智能体时代而生,原生多模态输出图像音频
2024年12月11日谷歌发布Gemini 2.0 Flash,原生多模态输出图像和音频,速度为1.5 Pro两倍,支持100万tokens上下文,原生工具使用,为智能体时代设计。
2024 年 12 月 11 日,谷歌正式发布 Gemini 2.0 Flash,这是为「智能体时代」设计的全新模型,原生支持多模态输出(图像+音频),速度为 1.5 Pro 的两倍。
原生多模态输出
Gemini 2.0 Flash 的最大突破是原生多模态输出:
- 原生生成图像:无需调用外部图像模型
- 原生生成音频:支持 TTS 语音合成
- 文本、图像、音频混合输出
- 多模态理解 + 多模态生成一体化
相比前代需要拼接多个模型,2.0 Flash 单模型完成全流程。
性能对比
- 速度:1.5 Pro 的两倍
- 关键基准超越 1.5 Pro
- 成本更低
- 响应更快
100 万 token 上下文
- 支持 100 万 token 上下文窗口
- 单次处理约 75 万单词
- 相当于多本长篇小说
- 长文档理解能力行业领先
原生工具使用
Gemini 2.0 Flash 为智能体时代设计,原生支持工具调用:
- Google 搜索:实时获取网络信息
- 代码执行:运行生成代码并获取结果
- 第三方 API:支持 function calling
- 多工具并行调用
智能体能力
- 多步骤任务规划
- 自主决策与执行
- 长期记忆与上下文管理
- 复杂业务流程自动化
应用场景
Project Astra
谷歌同步推出 Project Astra 智能助手原型:
- 实时多模态对话
- 理解摄像头画面
- 记忆对话历史
- 延迟极低,接近实时
Agent 开发
- 为开发者提供 Agent SDK
- 支持构建复杂智能体应用
- 多模型协作框架
- 企业级部署支持
多语言能力
- 支持全球主流语言
- 中文理解能力显著提升
- 多语言混合输入处理
定价策略
- Flash 版本主打性价比
- 低于 Pro 版本
- 适合大规模部署
- 免费额度支持试用
谷歌 AI 生态布局
Gemini 2.0 Flash 是谷歌 AI 战略的关键一环:
- 与 OpenAI GPT-4o 竞争
- 与 Anthropic Claude 竞争
- 整合 Google 搜索、YouTube 等生态
- 为 Android 设备提供端侧 AI 能力
谷歌 CEO 劈柴哥表示:「我们正在进入 AI 的智能体时代,Gemini 2.0 是为这个时代打造的。」