CoinVE-200K – 騰訊開源的大規模組合指令視頻編輯數據集

AI工具12小時前發佈新公告 AI管理員
0 0

CoinVE-200K是什麼

CoinVE-200K 是騰訊視頻智創團隊開源的大規模組合指令視頻編輯數據集,包含 20萬組 1080p 視頻編輯樣本對,每樣本含 2-5 條原子編輯指令,包括添加、移除、修改、風格化等,覆蓋人物、物體、背景等多類目標,最長 201 幀。CoinVE-200K配套開源了 22B 參數模型 CoinVE-Edit 和評測集 CoinVE-Bench,填補組合指令視頻編輯在數據、模型與評測標準上的三重空白。

CoinVE-200K – 騰訊開源的大規模組合指令視頻編輯數據集

CoinVE-200K的主要功能

  • 海量組合編輯數據:提供 20 萬組 1080p 組合指令視頻編輯樣本對,支持模型進行多意圖聯合訓練。
  • 多元原子操作覆蓋:涵蓋添加、移除、替換、風格化等 6 種原子編輯操作,可靈活組合複雜編輯任務。
  • 全場景目標支持:編輯目標橫跨人物、物體、背景等多類主體,具備豐富的場景與語義多樣性。
  • 開箱即用編輯模型:配套開源 22B 參數 CoinVE-Edit 模型,實現一次性精準執行多條編輯指令。
  • 系統評測基準:構建 CoinVE-Bench 評測集,用 11 項細粒度指標系統評估組合編輯性能。

CoinVE-200K的技術原理

  • 數據生成與過濾:基於預定義編輯分類體系,用 Qwen3.6-27B 分析源視頻內容並識別可編輯主體,通過組合多個原子操作生成複合指令;隨後藉助 SAM3/SAM2 生成編輯區域掩碼,用 HunyuanImage-3.0 與 Nano Banana 合成編輯關鍵幀,再經 Wan2.1-Animate 或 VACE 擴散爲完整視頻,通過 Gemini 進行二次質量過濾,從指令遵循度、視覺質量、時序一致性等維度篩選合格樣本。
  • 多模態語義理解:CoinVE-Edit 以 Qwen3-VL-8B-Instruct 作爲多模態理解模塊,同時接收源視頻幀序列與多條文本編輯指令,聯合解析視頻內容與複合編輯意圖,提取面向組合式編輯的高層語義表示,使模型能全局理解多指令間的關聯與約束。
  • 編輯感知特徵轉換:通過 Feature Connector 將 MLLM 輸出的隱藏狀態映射爲兩類編輯感知 Tokens:一類是與各條指令綁定的可學習 Tokens,另一類是保留原始視頻信息的視覺 Tokens;其中指令相關 Tokens 作爲條件信號注入 DiT 主幹網絡,引導生成過程精準響應不同類型的編輯需求。
  • 區域解耦注意力機制:Mask Predictor 爲每條指令預測時空編輯區域掩碼,GateNet 生成動態門控係數;在 DiT 的交叉注意力層中,Q-Blending 機制依據掩碼與門控權重,差異化調控各指令 Tokens 和視覺 Tokens 對 Query 的貢獻程度,實現不同編輯意圖在對應區域的精準綁定,同時抑制無關區域的干擾並維持時序一致性。
  • 雙軌互補評測體系:CoinVE-Bench 採用 MLLM-based Checklist 與專用評估器相結合的評測框架:前者利用 Gemini 3.6 Flash 從編輯準確性、物理自然度、語義保持三個維度評估指令遵循正確性;後者藉助 Aesthetic Predictor、DOVER++、VisualQuality-R1 及光流場分別衡量美學質量、技術質量、綜合質量與時序穩定性,共覆蓋 4 個核心維度 11 項指標。

CoinVE-200K – 騰訊開源的大規模組合指令視頻編輯數據集

微信關注回覆“開源”,加入AI開源項目交流羣

如何使用CoinVE-200K

  • 下載數據集:安裝 ModelScope CLI 後執行 modelscope download 命令,按需全量拉取或僅下載 metadata_coinve200k.jsonl 元數據先行試跑。
  • 解壓分片文件:將下載的 tar 分片分別解壓至 src_videostgt_videoscombined_masksinstruction_masks 對應目錄。
  • 解析元數據:使用 Python 讀取 metadata_coinve200k.jsonl,獲取每條樣本的源視頻路徑、編輯後視頻路徑及 2–5 條組合編輯指令。
  • 調用掩碼信息:從元數據中提取 instruction_mask_video_pathscombined_mask_video_path,獲取各指令對應的時空編輯區域掩碼。
  • 開展模型訓練:將解析後的視頻對、組合指令與掩碼輸入 DiT 框架,用於監督組合指令視頻編輯模型的訓練與微調。
  • 復現基線結果:直接加載官方開源的 CoinVE-Edit 模型權重,在 CoinVE-Bench 評測集上驗證組合編輯性能。

CoinVE-200K的核心優勢

  • 規模質量雙領先:擁有 20 萬組 1080p 高清視頻編輯對,最長 201 幀,是迄今最大規模的組合指令視頻編輯數據集。
  • 複雜組合編輯:每條樣本包含 2–5 條原子編輯指令,支持添加、移除、修改、風格化等操作的靈活複雜組合。
  • 嚴格質量過濾:通過 MLLM 語義理解與二次質量過濾 pipeline,確保指令遵循度、視覺質量、時序一致性和未編輯區域完整性。
  • 全鏈路開源生態:同步提供 22B 參數 CoinVE-Edit 模型 與 CoinVE-Bench 評測集,形成數據–模型–評測的完整閉環。
  • 精度超越閉源模型:在組合指令編輯準確性(SA/SPA/EP)上全面超越 Seedance 2.0 和 Kling O3 等主流閉源方案。
  • 區域解耦編輯機制:通過 Mask-based Conditioning 與 Q-Blending 交叉注意力,實現多指令精準綁定對應時空區域並保留無關內容。

CoinVE-200K的項目地址

  • 項目官網:https://coinve200k.github.io/
  • GitHub倉庫:https://github.com/coinve200k/CoinVE-200K
  • HuggingFace模型庫:https://huggingface.co/datasets/FireCRT/CoinVE-200K
  • arXiv技術論文:https://arxiv.org/pdf/2608.17566

CoinVE-200K的同類競品對比

維度 CoinVE-200K OpenVE-3M ReCo-Data
數據規模 20 萬組 300 萬組 50 萬組
視頻分辨率 1080p 720p (1280×720) 480×832
最大幀數 201 幀 65–129 幀 81 幀
組合編輯 ✅ 支持(2–5 條原子指令) ❌ 單指令爲主 ❌ 單指令爲主
平均指令數 2.55 約 1 條 約 1 條
編輯類型 添加、移除、替換、風格化等 8 類(含風格/背景/局部/字幕等) 添加、移除、替換、風格化
配套模型 CoinVE-Edit(22B) ReCo(1.3B)
專用評測集 CoinVE-Bench OpenVE-Bench
質量過濾 Gemini 二次過濾 + MLLM checklist Gemini-2.5-Flash-Thinking 過濾

CoinVE-200K的應用場景

  • 影視後期製作:導演通過自然語言組合指令一次性完成多元素替換、背景修改與畫面風格遷移,大幅提升後期效率。
  • 廣告內容迭代:品牌方可快速對同一視頻素材執行人物換裝、產品替換與背景調整等批量組合編輯,降低重拍成本。
  • 短視頻創作:創作者輸入多條編輯意圖,一鍵實現人物移除、物體添加與畫面風格化等複雜效果,降低專業門檻。
  • AI 模型訓練:作爲高質量監督數據,用於訓練組合指令視頻編輯大模型,提升模型對多意圖聯合理解與精準執行能力。
  • 評測基準研究:爲學術界提供標準化的 CoinVE-Bench,系統評估視頻編輯模型在組合指令遵循、物理自然度與視覺質量上的表現。
© 版權聲明

相關文章

暫無評論

暫無評論...