WeMM-Embedding是什麼
WeMM-Embedding 是騰訊微信視覺團隊開源的通用多模態 Embedding 模型家族,提供 2B/4B/9B 三種規格。模型將文本、圖像、視頻、視覺文檔及交錯多模態輸入統一編碼到共享向量空間,在 MMEB-v2 基準排行榜位列第一,並已在微信視頻號、公衆號、搜索等推薦與檢索業務中大規模落地。

WeMM-Embedding的主要功能
-
多模態統一編碼:支持文本、圖像、視頻、視覺文檔及任意交錯的多模態輸入,統一映射到共享稠密向量空間。
-
靈活維度輸出:基於 Matryoshka 表示學習,單次推理可輸出 64 至 4096 維的嵌套向量,256 維即可保留近 99% 的全維性能。
-
多任務適配:覆蓋檢索、分類、問答、視覺定位、跨域匹配、Agent 工具/GUI/記憶檢索等場景。
-
高效推理部署:支持 Transformers、Sentence Transformers、vLLM 和 SGLang 等多種框架,便於生產環境集成。
WeMM-Embedding的技術原理
- 架構設計:以 Qwen3.5 多模態大語言模型爲骨幹,通過在輸入序列末尾追加
<embedding>特殊 token,取其最終層隱藏狀態並經 L2 歸一化得到輸出表示,天然支持因果注意力下的任意交錯多模態輸入。 - 兩階段訓練策略:第一階段用數億對異構數據建立通用多模態對齊空間;第二階段在精選數據上結合硬負樣本、重排序器監督和跨尺度 Embedding 蒸餾進行細粒度精煉,實現從廣覆蓋到高精度的漸進提升。
- 數據構建與精選:採用統一 Pair-Based 格式整合六大類監督數據;通過 Semantic-ID 引導的重採樣平衡語義分佈,利用多模態大模型自動過濾低質量樣本並修正文本錯誤,同時針對文本、圖像和視頻分別構建顯式硬負樣本以增強判別能力。
- 訓練目標體系:標準配對數據採用 InfoNCE 對比學習並引入重複感知掩碼避免假負樣本;分級相關性數據採用評分差距加權的 CoSENT 排序損失;Stage 2 中引入重排序器分數提供任務級細粒度監督,以 9B 模型爲教師通過雙向 KL 散度向小模型蒸餾軟相似度分佈。

微信關注回覆“開源”,加入AI開源項目交流羣
如何使用WeMM-Embedding
-
環境準備:克隆 GitHub 倉庫並執行
pip install -r requirements.txt安裝依賴,推薦使用transformers==5.2.0以保證結果可復現。 -
獲取模型:從 Hugging Face 下載
WeMM-Embedding-2B/4B/9B的模型權重到本地。 -
Transformers 推理:運行
examples/transformers_inference.py,傳入模型路徑及文本/圖像/視頻路徑,指定--dimension獲取對應維度的 Embedding。 -
Sentence Transformers 推理:運行
examples/sentence_transformers_inference.py,可直接使用 Hugging Face 模型 ID,通過encode()統一編碼多模態輸入。 -
Matryoshka 降維:對全維向量取前
d維後,使用torch.nn.functional.normalize重新 L2 歸一化,即可得到低維表示。 -
服務化部署:生產環境使用 vLLM(
--runner pooling)或 SGLang(--is-embedding)啓動推理服務,支持高併發調用。
WeMM-Embedding的核心優勢
-
極致參數效率:2B 模型即超越此前領先的 8B 開源基線,重新定義了多模態 Embedding 的性能-效率邊界。
-
真正統一的多模態表示:原生支持文本、圖像、視頻、視覺文檔及任意交錯組合輸入,無需爲不同模態設計獨立編碼通路。
-
靈活的 Matryoshka 維度:單次推理即可輸出 64 至 4096 維向量,256 維仍能保留近 99% 的全維性能,顯著降低存儲與檢索成本。
-
經過大規模業務驗證:已在微信視頻號、公衆號、搜索等核心業務的 14 項 A/B 測試中取得一致提升,並全量上線生產環境。
-
先進的漸進式訓練:通過”大規模對齊+精選蒸餾”兩階段策略,結合 Semantic-ID 數據精選與跨尺度知識蒸餾,實現廣覆蓋與高精度的兼顧。
WeMM-Embedding的項目地址
- GitHub倉庫:https://github.com/Tencent/WeMM-Embedding
- HuggingFace模型庫:https://huggingface.co/collections/tencent/wemm-embedding
- arXiv技術論文:https://arxiv.org/pdf/2608.24053
WeMM-Embedding的同類競品對比
| 對比維度 | WeMM-Embedding | Qwen3-VL-Embedding |
|---|---|---|
| 開發方 | 騰訊微信視覺團隊 | 阿里巴巴通義千問團隊 |
| 開源協議 | Apache 2.0 | Apache 2.0 |
| 模型規格 | 2B / 4B / 9B | 2B / 8B |
| 支持模態 | 文本、圖像、視頻、視覺文檔、交錯多模態 | 文本、圖像、視頻、視覺文檔、交錯多模態 |
| 音頻支持 | 暫不支持 | 暫不支持 |
| MMEB-v2 均分 | 77.9 / 79.2 / 80.6 | 73.2 / 77.8 |
| MMEB-v3 均分 | 56.0 / 58.2 / 59.5 | 50.9 / 53.5 |
| 維度靈活性 | Matryoshka(64~4096 維,單次推理多維度輸出) | 固定維度輸出 |
| 核心架構 | Qwen3.5 + 兩階段訓練(對齊+精選蒸餾) | Qwen3-VL + 對比學習 |
| 生產驗證 | 已大規模部署於微信視頻號、公衆號、搜索、電商 | 主要面向研究/開發者社區 |
WeMM-Embedding的應用場景
-
跨模態語義檢索:模型支持以文搜圖、以圖搜文、以文搜視頻等任意方向的跨模態檢索,適用內容平台的海量素材庫查找與版權監測。
-
個性化推薦系統:將圖文、視頻內容編碼爲統一向量,用於候選召回、用戶興趣序列建模與跨域內容匹配,已落地於微信視頻號、公衆號及電商推薦場景。
-
視覺文檔理解與檢索:對 PDF、圖表、發票、截圖等視覺文檔進行向量化,支撐智能文檔問答、票據歸檔檢索及企業知識庫構建。
-
AI Agent 工具與記憶檢索:爲 Agent 提供工具調用檢索、GUI 界面元素定位及長程記憶檢索能力,支持複雜任務規劃與多步驟交互。
-
多模態內容分類與審覈:將圖像、視頻內容映射到語義空間,實現物體識別、場景分類、動作檢測及違規內容相似度比對與聚類分析。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...