Nemotron 3 Embed 是什麼
Nemotron 3 Embed 是 NVIDIA 開源的文本嵌入模型系列,專爲檢索增強生成與智能體檢索設計。模型包含 8B 和 1B 兩種參數規模,支持 32k 上下文窗口與 34 種語言,採用 OpenMDW-1.1 許可證開放商業使用。旗艦版 8B 模型在 RTEB 多語言檢索 leaderboard 以 78.5% 得分位居第一,1B 版本通過剪枝與蒸餾在大幅降低推理成本的同時保留 95% 的檢索精度。

Nemotron 3 Embed 的主要功能
-
多語言密集檢索:覆蓋 34 種語言的文本嵌入生成,支持跨語言語義檢索。
-
長上下文處理:32k 上下文窗口,支持長文檔檢索與問答。
-
雙規格靈活部署:8B 版追求極致檢索精度,1B 版平衡成本與速度。
-
硬件優化量化:NVFP4 量化版專爲 NVIDIA Blackwell 架構優化,吞吐量提升最高兩倍。
-
生產級部署支持:提供 NVIDIA NIM 微服務、vLLM 及 Hugging Face 原生集成。
Nemotron 3 Embed 的技術原理
-
基於 Ministral-3-8B-Instruct-2512:8B 模型在開源架構基礎上針對檢索任務進行微調優化。
-
對比學習訓練:通過大規模對比學習將文本映射到密集向量空間,使語義相近文本在向量空間距離更近。
-
結構化剪枝與蒸餾:1B 模型通過移除冗餘參數並蒸餾 8B 模型行爲,在壓縮至 1B 的同時保留 95% 檢索精度。
-
NVFP4 低精度量化:針對 Blackwell 架構的 4 位浮點量化技術,在幾乎不損失精度的前提下實現兩倍吞吐量提升。

微信關注回覆“開源”,加入AI開源項目交流羣
如何使用Nemotron 3 Embed
-
Hugging Face 下載:訪問 Hugging Face 模型倉庫直接下載權重,用 Transformers 或 Sentence-Transformers 庫加載推理。
-
NVIDIA NIM 微服務:通過 build.nvidia.com 獲取 NIM 微服務容器,在企業環境快速部署生產級推理服務。
-
vLLM 部署:用 vLLM 的高吞吐量推理引擎部署模型,支持大規模併發檢索請求。
-
微調與蒸餾:參考 NVIDIA 提供的微調配方,用自有領域數據對模型進行領域適配;或通過蒸餾配方將 8B 模型知識遷移至更小模型。
Nemotron 3 Embed的核心優勢
-
RTEB 排名第一:8B 模型在 RTEB 多語言檢索基準以 78.5% 得分超越所有開源與閉源模型。
-
開源可商用:模型採用 OpenMDW-1.1 許可證,權重、微調與蒸餾配方完全開放,支持商業場景。
-
硬件協同優化:NVFP4 量化版與 Blackwell 架構深度適配,實現精度與吞吐量的最佳平衡。
-
長上下文支持:32k 上下文窗口在嵌入模型中處於領先水平,滿足長文檔檢索需求。
Nemotron 3 Embed的項目地址
- 項目官網:https://huggingface.co/blog/nvidia/nemotron-3-embed-wins-rteb
- HuggingFace模型庫:https://huggingface.co/collections/nvidia/nemotron-3-embed
Nemotron 3 Embed的同類競品對比
| 維度 | Nemotron 3 Embed 8B | Qwen3-Embedding-8B |
|---|---|---|
| RTEB 排名 | 第一名(78.5%) | 前列,未登頂 |
| 上下文長度 | 32k | 32k |
| 語言支持 | 34 種語言 | 多語言(以中文、英文爲核心) |
| 開源協議 | OpenMDW-1.1(可商用) | Apache 2.0(可商用) |
| 硬件優化 | Blackwell NVFP4 專屬量化 | 通用推理優化 |
| 模型生態 | 配套 NIM 微服務、vLLM、蒸餾配方 | 阿里生態集成 |
Nemotron 3 Embed的應用場景
-
企業知識庫問答:構建基於內部文檔的多語言 RAG 系統,支持員工跨語言檢索技術文檔與規章制度。
-
智能客服檢索:爲客服機器人提供高精度語義檢索能力,快速匹配用戶問題與歷史解決方案。
-
法律與金融合規檢索:在長篇幅合同、財報與監管文件中定位關鍵條款,輔助合規審查與風險分析。
-
電商商品語義搜索:通過語義理解用戶搜索意圖,實現跨語言商品匹配與推薦。
-
代碼與文檔檢索:在大型代碼庫與技術文檔中檢索相關函數、API 說明與實現示例。
© 版權聲明
文章版权归作者所有,未经允许请勿转载。
相關文章
暫無評論...