WeMM-Embedding – 騰訊開源通用多模態Embedding模型

AI工具3天前發佈新公告 AI管理員
0 0

WeMM-Embedding是什麼

WeMM-Embedding 是騰訊微信視覺團隊開源的通用多模態 Embedding 模型家族,提供 2B/4B/9B 三種規格。模型將文本、圖像、視頻、視覺文檔及交錯多模態輸入統一編碼到共享向量空間,在 MMEB-v2 基準排行榜位列第一,並已在微信視頻號、公衆號、搜索等推薦與檢索業務中大規模落地。

WeMM-Embedding – 騰訊開源通用多模態Embedding模型

WeMM-Embedding的主要功能

  • 多模態統一編碼:支持文本、圖像、視頻、視覺文檔及任意交錯的多模態輸入,統一映射到共享稠密向量空間。
  • 靈活維度輸出:基於 Matryoshka 表示學習,單次推理可輸出 64 至 4096 維的嵌套向量,256 維即可保留近 99% 的全維性能。
  • 多任務適配:覆蓋檢索、分類、問答、視覺定位、跨域匹配、Agent 工具/GUI/記憶檢索等場景。
  • 高效推理部署:支持 Transformers、Sentence Transformers、vLLM 和 SGLang 等多種框架,便於生產環境集成。

WeMM-Embedding的技術原理

  • 架構設計:以 Qwen3.5 多模態大語言模型爲骨幹,通過在輸入序列末尾追加 <embedding> 特殊 token,取其最終層隱藏狀態並經 L2 歸一化得到輸出表示,天然支持因果注意力下的任意交錯多模態輸入。
  • 兩階段訓練策略:第一階段用數億對異構數據建立通用多模態對齊空間;第二階段在精選數據上結合硬負樣本、重排序器監督和跨尺度 Embedding 蒸餾進行細粒度精煉,實現從廣覆蓋到高精度的漸進提升。
  • 數據構建與精選:採用統一 Pair-Based 格式整合六大類監督數據;通過 Semantic-ID 引導的重採樣平衡語義分佈,利用多模態大模型自動過濾低質量樣本並修正文本錯誤,同時針對文本、圖像和視頻分別構建顯式硬負樣本以增強判別能力。
  • 訓練目標體系:標準配對數據採用 InfoNCE 對比學習並引入重複感知掩碼避免假負樣本;分級相關性數據採用評分差距加權的 CoSENT 排序損失;Stage 2 中引入重排序器分數提供任務級細粒度監督,以 9B 模型爲教師通過雙向 KL 散度向小模型蒸餾軟相似度分佈。

WeMM-Embedding – 騰訊開源通用多模態Embedding模型

微信關注回覆“開源”,加入AI開源項目交流羣

如何使用WeMM-Embedding

  • 環境準備:克隆 GitHub 倉庫並執行 pip install -r requirements.txt 安裝依賴,推薦使用 transformers==5.2.0 以保證結果可復現。
  • 獲取模型:從 Hugging Face 下載 WeMM-Embedding-2B/4B/9B 的模型權重到本地。
  • Transformers 推理:運行 examples/transformers_inference.py,傳入模型路徑及文本/圖像/視頻路徑,指定 --dimension 獲取對應維度的 Embedding。
  • Sentence Transformers 推理:運行 examples/sentence_transformers_inference.py,可直接使用 Hugging Face 模型 ID,通過 encode() 統一編碼多模態輸入。
  • Matryoshka 降維:對全維向量取前 d 維後,使用 torch.nn.functional.normalize 重新 L2 歸一化,即可得到低維表示。
  • 服務化部署:生產環境使用 vLLM(--runner pooling)或 SGLang(--is-embedding)啓動推理服務,支持高併發調用。

WeMM-Embedding的核心優勢

  • 極致參數效率:2B 模型即超越此前領先的 8B 開源基線,重新定義了多模態 Embedding 的性能-效率邊界。
  • 真正統一的多模態表示:原生支持文本、圖像、視頻、視覺文檔及任意交錯組合輸入,無需爲不同模態設計獨立編碼通路。
  • 靈活的 Matryoshka 維度:單次推理即可輸出 64 至 4096 維向量,256 維仍能保留近 99% 的全維性能,顯著降低存儲與檢索成本。
  • 經過大規模業務驗證:已在微信視頻號、公衆號、搜索等核心業務的 14 項 A/B 測試中取得一致提升,並全量上線生產環境。
  • 先進的漸進式訓練:通過”大規模對齊+精選蒸餾”兩階段策略,結合 Semantic-ID 數據精選與跨尺度知識蒸餾,實現廣覆蓋與高精度的兼顧。

WeMM-Embedding的項目地址

  • GitHub倉庫:https://github.com/Tencent/WeMM-Embedding
  • HuggingFace模型庫:https://huggingface.co/collections/tencent/wemm-embedding
  • arXiv技術論文:https://arxiv.org/pdf/2608.24053

WeMM-Embedding的同類競品對比

對比維度 WeMM-Embedding Qwen3-VL-Embedding
開發方 騰訊微信視覺團隊 阿里巴巴通義千問團隊
開源協議 Apache 2.0 Apache 2.0
模型規格 2B / 4B / 9B 2B / 8B
支持模態 文本、圖像、視頻、視覺文檔、交錯多模態 文本、圖像、視頻、視覺文檔、交錯多模態
音頻支持 暫不支持 暫不支持
MMEB-v2 均分 77.9 / 79.2 / 80.6 73.2 / 77.8
MMEB-v3 均分 56.0 / 58.2 / 59.5 50.9 / 53.5
維度靈活性 Matryoshka(64~4096 維,單次推理多維度輸出) 固定維度輸出
核心架構 Qwen3.5 + 兩階段訓練(對齊+精選蒸餾) Qwen3-VL + 對比學習
生產驗證 已大規模部署於微信視頻號、公衆號、搜索、電商 主要面向研究/開發者社區

WeMM-Embedding的應用場景

  • 跨模態語義檢索:模型支持以文搜圖、以圖搜文、以文搜視頻等任意方向的跨模態檢索,適用內容平台的海量素材庫查找與版權監測。
  • 個性化推薦系統:將圖文、視頻內容編碼爲統一向量,用於候選召回、用戶興趣序列建模與跨域內容匹配,已落地於微信視頻號、公衆號及電商推薦場景。
  • 視覺文檔理解與檢索:對 PDF、圖表、發票、截圖等視覺文檔進行向量化,支撐智能文檔問答、票據歸檔檢索及企業知識庫構建。
  • AI Agent 工具與記憶檢索:爲 Agent 提供工具調用檢索、GUI 界面元素定位及長程記憶檢索能力,支持複雜任務規劃與多步驟交互。
  • 多模態內容分類與審覈:將圖像、視頻內容映射到語義空間,實現物體識別、場景分類、動作檢測及違規內容相似度比對與聚類分析。
© 版權聲明

相關文章

暫無評論

暫無評論...