技术进展

字节SeedRealtime全双工模型落地豆包

Heooo 08月06日02时01分 30 阅读

「字节Seed团队发布SeedRealtime,统一架构原生融合音视频与文本,实现边看边听边说的实时交互,已在豆包App全量上线,显著减少对话卡顿与抢话问题,为全模态助手提供新路线。」

字节跳动旗下Seed团队近日发布了全新的全双工大模型SeedRealtime,该模型采用统一架构,原生融合音频、视频与文本处理能力,旨在实现“边看、边听、边说”的实时自然交互体验。目前,SeedRealtime已不再停留在实验室阶段,而是正式在豆包App中全量上线,标志着音视频全双工技术首次实现规模化落地。

与传统级联方案相比,SeedRealtime的核心差异在于架构设计。传统级联系统通常采用“听—转写—想—说”的逐段拼接方式,感知与表达分属不同模块,导致对话节奏难以协调。而SeedRealtime将音视频的感知与表达统一进同一个端到端模型,让模型能够同时接收画面和声音,并直接生成回应。这种原生融合带来的最直接收益是,在音视频对话中,说话节奏问题减少了约一半,不再频繁出现抢话、停顿突兀或答非所问的割裂感。

更值得注意的是,SeedRealtime在实时交互中展现出类似真人的“分寸感”。它能够主动提醒,也能自然停顿,像人类对话那样留出呼吸的间隙,而不是一股脑把话说完。这种细腻的交互节奏,极大提升了对话的自然度和舒适度。对于全模态智能助手的发展而言,SeedRealtime提供了一条全新的技术路线——不再依赖将多个单模态模型用管道串联,而是让一个模型同时具备视觉、听觉和语言表达能力。

SeedRealtime的发布,不仅展示了字节在AI大模型领域的技术积累,也为实时音视频交互场景(如智能助手、在线教育、远程协作等)带来了更高效、更自然的解决方案。随着该技术在豆包App的全面应用,用户将能直接体验到这一创新模型带来的交互升级。

# 字节跳动 # SeedRealtime # 全双工模型

来源:Heooo AI工具导航