InstructAV2AV是什麼
InstructAV2AV 是北京智源人工智能研究院與北京大學聯合推出的音視頻聯合編輯模型。用戶只需一句自然語言指令,可在端到端生成過程中同時編輯視頻畫面與對應聲音,無需手工掩碼或分步處理。模型支持台詞修改、人物替換、對象插入與刪除,能保持背景與環境聲不變,維持聲畫時間同步。

InstructAV2AV的主要功能
-
身份保持的語音修改:在保留人物形象的前提下只替換其說話內容。
-
音視頻實例替換:把畫面中的指定人物連同其聲音和台詞一起更換。
-
實例插入:向畫面添加新對象並自動生成與之同步的聲音。
-
實例移除:刪除指定對象及其在音軌中的對應聲音。
-
屬性組合編輯:人物外觀、說話內容和音色可分別獨立修改並自由組合。
InstructAV2AV的技術原理
-
源潛變量拼接:將源視頻與源音頻的潛變量與噪聲沿通道維度拼接,使源內容成爲整個去噪過程的結構條件,約束模型保留背景、無關對象和環境聲,避免”改一個目標、重繪整個世界”。
-
SIGA 門控注意力:Source-Instruction Gated Attention 讓每個 token 同時與源特徵和指令特徵交互,通過可學習的軟門控逐位置決定改多少、留多少,實現內容保留與指令執行的動態平衡。
-
雙流交互架構:基於 Ovi 對稱雙流擴散 Transformer,視頻與音頻分支各自自注意力建模後,通過雙向跨模態注意力交換特徵,使視覺運動與聲音事件相互約束、保持同步。
-
兩階段訓練:關閉跨模態注意力分別訓練單模態編輯能力,再恢復完整架構聯合微調,學習聲畫之間的細粒度對應關係。
-
自動化數據流水線:通過素材篩選、編輯目標合成、五維自動評估加人工複覈三階段構建 InsAVE-80K 數據集,解決成對訓練數據稀缺問題。

微信關注回覆“開源”,加入AI開源項目交流羣
如何使用InstructAV2AV
-
克隆代碼:從 GitHub 克隆 InstructAV2AV 代碼倉庫到本地。
-
配置環境:按照倉庫說明配置 Python 環境並安裝所需依賴。
-
下載權重:從 Hugging Face 下載 InstructAV2AV 模型權重。
-
準備素材:準備一段帶聲音的視頻素材作爲輸入。
-
輸入指令:輸入一句自然語言編輯指令,描述想要修改的內容。
-
運行推理:運行推理腳本,等待模型生成編輯後的視頻與音頻。
-
保存結果:查看輸出結果並保存編輯完成的音視頻文件。
InstructAV2AV的項目地址
- 項目官網:https://hjzheng.net/projects/InstructAV2AV/
- GitHub倉庫:https://github.com/suimuc/InstructAV2AV
- HuggingFace模型庫:https://huggingface.co/suimu/InstructAV2AV
- arXiv技術論文:https://arxiv.org/pdf/2605.18467
InstructAV2AV的同類競品對比
| 對比項 | InstructAV2AV | Ovi |
|---|---|---|
| 產品定位 | 指令驅動的音視頻聯合編輯模型 | 音視頻聯合生成模型 |
| 核心能力 | 在源視頻基礎上修改畫面與聲音 | 從零生成視頻與音頻 |
| 輸入方式 | 源視頻+源音頻+自然語言指令 | 文本提示詞(從零生成) |
| 背景保留 | 精準保留無關背景與環境聲 | 不涉及源內容保留 |
| 聲畫同步 | 雙向跨模態注意力保證編輯後同步 | 生成時同步,不支持編輯場景 |
| 技術架構 | 基於 Ovi 雙流擴散 Transformer 改造,加入源潛變量拼接與 SIGA 門控 | 對稱雙流擴散 Transformer |
| 適用場景 | 台詞修改、人物替換、對象插入與移除 | 文本到音視頻的創意生成 |
InstructAV2AV的應用場景
-
影視後期:影視後期人員用它替換演員台詞並同步口型,降低補拍成本。
-
短視頻製作:短視頻創作者用它一句話修改素材中的人物與聲音,提升創作效率。
-
虛擬人:虛擬人運營團隊用它調整數字人的外觀、音色與說話內容。
-
廣告創意:廣告從業者用它批量生成不同人物與台詞版本的宣傳視頻。
-
交互式內容生產:遊戲與教育工作者用它動態生成音畫一致的多媒體素材。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...