字節跳動推SeedRealtime

豆包實現音視頻全雙工互動
07/08/2026
14313
收藏
分享
豆包實現音視頻全雙工互動

字節跳動Seed團隊發布原生音視頻全雙工大模型SeedRealtime,透過統一架構融合音頻、視頻及文字,可在連續多模態資訊流中即時互動,支援「邊看、邊聽、邊說」。

模型可結合畫面與聲音理解時序指代及同音詞,並持續感知環境變化,在關鍵目標出現時主動提醒或調用工具。SeedRealtime亦能判斷用戶說話狀態,在適當時機接話、停頓及回應,同時識別背景噪音與旁人對話,降低誤觸發情況。

字節跳動表示,端到端人工評測顯示,相較級聯模型,SeedRealtime的音視頻對話節奏問題減少約一半,搶話、回應延遲及噪音干擾等現象明顯改善,完整順暢完成單次對話的比例亦有所提高。

目前SeedRealtime已在豆包App全面上線。用戶更新至最新版本後,可在對話框選擇「 打電話 」,進入視頻通話介面使用。

字節跳動Seed團隊發布原生音視頻全雙工大模型SeedRealtime。(網絡圖片)

檢舉
檢舉類型:
具體描述:
提交
取消
評論
發佈

力報會員可享用評論功能

註冊 / 登錄

查看更多評論
收藏
分享

相關新聞

推薦新聞

找不到相關內容

七日預報