月访问量
0
累计浏览
1
用户评分
4.7
收录时间
2026-08
产品介绍
模型简介
SeedRealtime是字节跳动Seed团队于2026年8月5日正式推出的原生音视频全双工大模型,作为走向全模态交互的关键一步,该模型用统一架构原生融合音频、视频与文本,能在连续的多模态信息流上实时交互,带来"边看、边听、边说"的全新体验。目前已在豆包App全量上线,在业界率先实现了音视频全双工技术的规模化落地。
核心突破
音视频联合理解
原生支持声音、画面与时序信息的深度融合。模型既能结合场景消解同音词歧义,也能准确理解视觉中的时序指代,让所见、所闻与所说融为一体。
主动的交互能力
具备持续的环境感知与主动表达能力。模型能在察觉画面状态变化时(如关键目标出现)主动提醒,并能调用工具融入表达,让交互从被动响应升级为主动协作。
流畅的交互节奏
能够实时感知用户的对话状态与交流节奏,在适当时机自然接话、停顿与回应;同时具备较强的抗干扰能力,能分辨旁人闲聊与背景噪声,不因干扰误触发,保持沟通的流畅连贯。
性能表现
端到端人工评测结果显示,相比传统级联模型(ASR+LLM+TTS三级拼接):
- 音视频对话节奏问题减少一半
- 说话时机把握更加自然
- "话未说完被抢断、话音已落却回应迟缓、被背景杂音误触发"等现象显著减少
- 单次对话顺畅完整交流概率明显提升
技术架构
SeedRealtime彻底抛弃行业通用的ASR语音识别+LLM+TTS语音合成三级级联拼接方案,采用音频、视频、文本、时序四要素端到端统一原生融合架构,全链路单模型一体化建模,感知、理解、决策与表达同步进行,使"听到的"和"看到的"能够共同参与每一次实时判断。
体验方式
将豆包App更新至最新版本,在对话框内选择"打电话",进入视频通话界面即可体验。