字节跳动发布SeedRealtime音视频全双工大模型
「字节跳动Seed今日推出原生音视频全双工大模型SeedRealtime,统一架构融合音视频与文本,实现边看边听边说的实时交互。该模型在音视频联合理解、主动交互和流畅节奏上取得突破,端到端评测显示对话节奏问题减半。目前已在豆包App全量上线,率先实现音视频全双工技术规模化落地。」
字节跳动Seed团队今日正式推出原生音视频全双工大模型SeedRealtime,标志着多模态交互技术迈入全新阶段。该模型采用统一架构,原生融合音频、视频与文本三种模态,能够在连续的多模态信息流上进行实时交互,为用户带来“边看、边听、边说”的沉浸式体验。
SeedRealtime的核心突破体现在三个方面。首先是音视频联合理解能力,模型原生支持声音、画面与时序信息的深度融合,既能结合场景消解同音词歧义,也能准确理解视觉中的时序指代,让所见、所闻与所说融为一体。其次是主动的交互能力,模型具备持续的环境感知与主动表达能力,能在察觉画面状态变化时主动提醒,例如关键目标的出现,并能调用工具融入表达,使交互从被动响应升级为主动协作。最后是流畅的交互节奏,模型能够实时感知用户的对话状态与交流节奏,在适当时机自然接话、停顿与回应,同时具备较强的抗干扰能力,能分辨旁人闲聊与背景噪声,不因干扰误触发,保持沟通的流畅连贯。
端到端人工评测结果显示,相比级联模型,SeedRealtime的音视频对话节奏问题减少了一半,模型对说话时机的把握更加自然,诸如“话未说完被抢断、话音已落却回应迟缓、被背景杂音与闲聊误触发”等卡壳现象显著减少。同时,单次对话能够完整、顺畅交流的概率也有明显提升,这得益于模型在时序建模和上下文理解上的优化。
目前,SeedRealtime已在豆包App全量上线,成为业界率先实现音视频全双工技术规模化落地的案例。用户只需将豆包App更新至最新版本,在对话框内选择“打电话”,进入视频通话界面即可体验这一前沿交互。项目主页已开放,供开发者与研究者深入了解技术细节。
SeedRealtime的发布不仅展示了字节跳动在AI大模型领域的持续创新能力,也为多模态交互应用树立了新的标杆。随着音视频全双工技术的成熟,未来的AI助手将能更自然地融入现实场景,提供更智能、更主动的服务体验。
来源:Heooo AI工具导航