Gemini 3.5 Transcribe

Gemini 3.5 Transcribe

Google 推出的专注语音转文本模型,支持85+种语言自动识别、去口头禅与多人识别,流式转录延迟低于1秒,专为会议记录、播客转录设计。

月访问量
0
累计浏览
1
用户评分
4.5
收录时间
2026-08

产品介绍

产品介绍

Gemini 3.5 Transcribe 是 Google 于 2026 年 8 月 26 日发布的专门用于语音转文字(ASR)的模型,隶属 Gemini Audio 系列。支持 85 种以上语言与地区变体,可自动判断当前语言,并处理一句话或同一段对话中切换语言的多语言混说场景。

核心功能

  • 85+ 语言支持:自动语言识别,多语言混说持续转录
  • 去口头禅与口误修正:自动删除“嗯/啊/um/uh”,理解修正性表述并保留正确结果
  • 多人识别:转录时区分至多三位说话者
  • 文本格式化:自动补齐标点、整理排版,直接输出结构化文本
  • 自定义词汇:更准确识别专业术语、特殊拼写、订单号与邮编
  • Function calling:可调用图像生成、联网搜索等能力

性能

录音版词错率(WER)2.6%、流式版 4.0%,延迟较前代模型 Chirp 3 降低 70%,流式实时转录延迟低于 1 秒。提供流式与录音两种接口。

适用场景

会议记录、播客转录、字幕制作、客服质检等语音转写刚需场景。