京東宣布開源自主研發的即時串流影片編輯模型JoyAI-Video-Edit,讓使用者在播放影片的同時,持續修改人物、物件、場景及畫面風格,將傳統「完成生成後再剪輯」的工作流程,轉變為可即時互動的影片創作模式。
京東表示,串流影片編輯首先需要解決推理速度問題。影片由連續畫面構成,模型若無法跟上播放速度,便容易出現延遲或卡頓。JoyAI-Video-Edit以自研JoyAI-Video模型為基礎,在720P解像度下可實現每秒30幀的模型推理速度,在維持畫面清晰度的同時,基本追上一般影視內容的播放節奏。
除速度外,影片長度也是即時編輯技術的一大門檻。過往部分串流編輯模型只能處理數秒或數分鐘片段,JoyAI-Video-Edit則可支援任意時長的穩定串流處理。使用者毋須等待整段影片生成完成,即可在播放期間即時更換服裝、替換物件、調整人物形象、改變場景或轉換視覺風格。
邊觀看 邊修改
在實際應用上,創作者可讓影片人物連續更換服裝,直播時把普通街道轉化為動畫場景,也可用於家居設計,快速測試不同家具、牆面及燈光配置。這種「邊觀看、邊修改」的模式,有望縮短影片製作週期,降低反覆生成和後期剪輯的成本。
為評估模型表現,京東研究團隊將JoyAI-Video-Edit與SANA Streaming、LiveEdit及Xmax-X2.0等串流影片編輯模型比較。京東稱,在涵蓋典型影片編輯場景的測試中,JoyAI-Video-Edit整體表現領先;在OpenVE-Bench通用評測中,模型在全局風格轉換、局部替換、局部刪除及字幕編輯等任務上亦取得較佳結果。
除內容創作外,京東亦將模型應用延伸至具身智能訓練數據合成。機器人訓練需要大量抓取、搬運及操作影片,但真機採集成本高,危險或罕見場景亦難以反覆重現。JoyAI-Video-Edit可在保留物體位置、空間關係及動作軌跡的基礎上,把人手操作影片轉換為機械手或機械臂素材,並替換場景、物件及機器人形態,從單一影片延伸出更多訓練樣本。
京東表示,開源該模型有助降低即時影片編輯及具身智能數據生成的使用門檻,未來可望應用於影片製作、直播、電商展示、家居設計,以及機器人與工業模擬等領域。(編輯部)