Google发布Gemini 3.5 Transcribe:迄今最精准的语音转文本模型,支持85+种语言

正飞GEO 2026年08月27日 08:09 3 阅读 来源:InfoQ
Google发布Gemini 3.5 Transcribe:迄今最精准的语音转文本模型,支持85+种语言 Google发布Gemini 3.5 Transcribe:迄今最精准的语音转文本模型,支持85+种语言
Google于2026年8月27日发布Gemini 3.5 Transcribe,官方称其为迄今最精准的语音转文本模型,支持将音频转换为85种以上语言的精准转录文本,并能处理自然口语中的自我修正。

核心信息

Google于2026年8月27日正式发布Gemini 3.5 Transcribe,官方称其为迄今最精准的语音转文本模型。该模型可将音频转换为85种以上语言的精准转录文本,标志着语音AI技术取得重大突破。

关键特性

  • 多语言支持:覆盖85种以上语言,满足全球化应用需求
  • 口语理解:能够处理自然口语中的自我修正,去除填充词以捕捉真实意图
  • 精准转录:Google宣称其为"迄今最精准"的语音转文本模型
  • Gemini家族:作为Gemini 3.5系列的重要组成部分,继承了该系列强大的多模态能力

行业意义

语音转文本是AI落地的核心场景之一,广泛应用于会议记录、客服系统、内容创作、辅助听力等领域。Google此次发布的Gemini 3.5 Transcribe,直接与OpenAI的Whisper系列模型形成竞争。

在当前AI大模型竞争格局中,多模态能力已成为头部厂商的必争之地。Google凭借Gemini系列在文本、图像、语音、视频等多模态领域的全面布局,正加速追赶OpenAI的市场领先地位。Gemini 3.5 Transcribe的发布,将进一步巩固Google在企业级语音AI服务市场的竞争力。

分享到: