字節跳動Seed團隊發布原生音視頻全雙工大模型SeedRealtime,透過統一架構融合音頻、視頻及文字,可在連續多模態資訊流中即時互動,支援「邊看、邊聽、邊說」。
模型可結合畫面與聲音理解時序指代及同音詞,並持續感知環境變化,在關鍵目標出現時主動提醒或調用工具。SeedRealtime亦能判斷用戶說話狀態,在適當時機接話、停頓及回應,同時識別背景噪音與旁人對話,降低誤觸發情況。
字節跳動表示,端到端人工評測顯示,相較級聯模型,SeedRealtime的音視頻對話節奏問題減少約一半,搶話、回應延遲及噪音干擾等現象明顯改善,完整順暢完成單次對話的比例亦有所提高。
目前SeedRealtime已在豆包App全面上線。用戶更新至最新版本後,可在對話框選擇「 打電話 」,進入視頻通話介面使用。

字節跳動Seed團隊發布原生音視頻全雙工大模型SeedRealtime。(網絡圖片)