CoinVE-200K是什麼
CoinVE-200K 是騰訊視頻智創團隊開源的大規模組合指令視頻編輯數據集,包含 20萬組 1080p 視頻編輯樣本對,每樣本含 2-5 條原子編輯指令,包括添加、移除、修改、風格化等,覆蓋人物、物體、背景等多類目標,最長 201 幀。CoinVE-200K配套開源了 22B 參數模型 CoinVE-Edit 和評測集 CoinVE-Bench,填補組合指令視頻編輯在數據、模型與評測標準上的三重空白。

CoinVE-200K的主要功能
-
海量組合編輯數據:提供 20 萬組 1080p 組合指令視頻編輯樣本對,支持模型進行多意圖聯合訓練。
-
多元原子操作覆蓋:涵蓋添加、移除、替換、風格化等 6 種原子編輯操作,可靈活組合複雜編輯任務。
-
全場景目標支持:編輯目標橫跨人物、物體、背景等多類主體,具備豐富的場景與語義多樣性。
-
開箱即用編輯模型:配套開源 22B 參數 CoinVE-Edit 模型,實現一次性精準執行多條編輯指令。
-
系統評測基準:構建 CoinVE-Bench 評測集,用 11 項細粒度指標系統評估組合編輯性能。
CoinVE-200K的技術原理
- 數據生成與過濾:基於預定義編輯分類體系,用 Qwen3.6-27B 分析源視頻內容並識別可編輯主體,通過組合多個原子操作生成複合指令;隨後藉助 SAM3/SAM2 生成編輯區域掩碼,用 HunyuanImage-3.0 與 Nano Banana 合成編輯關鍵幀,再經 Wan2.1-Animate 或 VACE 擴散爲完整視頻,通過 Gemini 進行二次質量過濾,從指令遵循度、視覺質量、時序一致性等維度篩選合格樣本。
- 多模態語義理解:CoinVE-Edit 以 Qwen3-VL-8B-Instruct 作爲多模態理解模塊,同時接收源視頻幀序列與多條文本編輯指令,聯合解析視頻內容與複合編輯意圖,提取面向組合式編輯的高層語義表示,使模型能全局理解多指令間的關聯與約束。
- 編輯感知特徵轉換:通過 Feature Connector 將 MLLM 輸出的隱藏狀態映射爲兩類編輯感知 Tokens:一類是與各條指令綁定的可學習 Tokens,另一類是保留原始視頻信息的視覺 Tokens;其中指令相關 Tokens 作爲條件信號注入 DiT 主幹網絡,引導生成過程精準響應不同類型的編輯需求。
- 區域解耦注意力機制:Mask Predictor 爲每條指令預測時空編輯區域掩碼,GateNet 生成動態門控係數;在 DiT 的交叉注意力層中,Q-Blending 機制依據掩碼與門控權重,差異化調控各指令 Tokens 和視覺 Tokens 對 Query 的貢獻程度,實現不同編輯意圖在對應區域的精準綁定,同時抑制無關區域的干擾並維持時序一致性。
- 雙軌互補評測體系:CoinVE-Bench 採用 MLLM-based Checklist 與專用評估器相結合的評測框架:前者利用 Gemini 3.6 Flash 從編輯準確性、物理自然度、語義保持三個維度評估指令遵循正確性;後者藉助 Aesthetic Predictor、DOVER++、VisualQuality-R1 及光流場分別衡量美學質量、技術質量、綜合質量與時序穩定性,共覆蓋 4 個核心維度 11 項指標。

微信關注回覆“開源”,加入AI開源項目交流羣
如何使用CoinVE-200K
-
下載數據集:安裝 ModelScope CLI 後執行
modelscope download命令,按需全量拉取或僅下載metadata_coinve200k.jsonl元數據先行試跑。 -
解壓分片文件:將下載的 tar 分片分別解壓至
src_videos、tgt_videos、combined_masks和instruction_masks對應目錄。 -
解析元數據:使用 Python 讀取
metadata_coinve200k.jsonl,獲取每條樣本的源視頻路徑、編輯後視頻路徑及 2–5 條組合編輯指令。 -
調用掩碼信息:從元數據中提取
instruction_mask_video_paths和combined_mask_video_path,獲取各指令對應的時空編輯區域掩碼。 -
開展模型訓練:將解析後的視頻對、組合指令與掩碼輸入 DiT 框架,用於監督組合指令視頻編輯模型的訓練與微調。
-
復現基線結果:直接加載官方開源的 CoinVE-Edit 模型權重,在 CoinVE-Bench 評測集上驗證組合編輯性能。
CoinVE-200K的核心優勢
-
規模質量雙領先:擁有 20 萬組 1080p 高清視頻編輯對,最長 201 幀,是迄今最大規模的組合指令視頻編輯數據集。
-
複雜組合編輯:每條樣本包含 2–5 條原子編輯指令,支持添加、移除、修改、風格化等操作的靈活複雜組合。
-
嚴格質量過濾:通過 MLLM 語義理解與二次質量過濾 pipeline,確保指令遵循度、視覺質量、時序一致性和未編輯區域完整性。
-
全鏈路開源生態:同步提供 22B 參數 CoinVE-Edit 模型 與 CoinVE-Bench 評測集,形成數據–模型–評測的完整閉環。
-
精度超越閉源模型:在組合指令編輯準確性(SA/SPA/EP)上全面超越 Seedance 2.0 和 Kling O3 等主流閉源方案。
-
區域解耦編輯機制:通過 Mask-based Conditioning 與 Q-Blending 交叉注意力,實現多指令精準綁定對應時空區域並保留無關內容。
CoinVE-200K的項目地址
- 項目官網:https://coinve200k.github.io/
- GitHub倉庫:https://github.com/coinve200k/CoinVE-200K
- HuggingFace模型庫:https://huggingface.co/datasets/FireCRT/CoinVE-200K
- arXiv技術論文:https://arxiv.org/pdf/2608.17566
CoinVE-200K的同類競品對比
| 維度 | CoinVE-200K | OpenVE-3M | ReCo-Data |
|---|---|---|---|
| 數據規模 | 20 萬組 | 300 萬組 | 50 萬組 |
| 視頻分辨率 | 1080p | 720p (1280×720) | 480×832 |
| 最大幀數 | 201 幀 | 65–129 幀 | 81 幀 |
| 組合編輯 | ✅ 支持(2–5 條原子指令) | ❌ 單指令爲主 | ❌ 單指令爲主 |
| 平均指令數 | 2.55 | 約 1 條 | 約 1 條 |
| 編輯類型 | 添加、移除、替換、風格化等 | 8 類(含風格/背景/局部/字幕等) | 添加、移除、替換、風格化 |
| 配套模型 | CoinVE-Edit(22B) | 無 | ReCo(1.3B) |
| 專用評測集 | CoinVE-Bench | OpenVE-Bench | 無 |
| 質量過濾 | Gemini 二次過濾 + MLLM checklist | 有 | Gemini-2.5-Flash-Thinking 過濾 |
CoinVE-200K的應用場景
-
影視後期製作:導演通過自然語言組合指令一次性完成多元素替換、背景修改與畫面風格遷移,大幅提升後期效率。
-
廣告內容迭代:品牌方可快速對同一視頻素材執行人物換裝、產品替換與背景調整等批量組合編輯,降低重拍成本。
-
短視頻創作:創作者輸入多條編輯意圖,一鍵實現人物移除、物體添加與畫面風格化等複雜效果,降低專業門檻。
-
AI 模型訓練:作爲高質量監督數據,用於訓練組合指令視頻編輯大模型,提升模型對多意圖聯合理解與精準執行能力。
-
評測基準研究:爲學術界提供標準化的 CoinVE-Bench,系統評估視頻編輯模型在組合指令遵循、物理自然度與視覺質量上的表現。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...