NVIDIA 在 2026 年 7 月 16 日發布 Nemotron 3 Embed 開放 embedding 模型系列,包含 8B BF16 旗艦版、1B BF16 版,以及針對 Blackwell GPU 優化的 1B NVFP4 版本。Embedding 模型會把文字或程式碼轉成向量,讓企業搜尋、檢索增強生成(RAG)與相似內容比對能先找到相關資料。
三個版本都提供 32K context,NVIDIA 同時公開權重、資料集與訓練配方。這讓部署團隊可以依延遲、記憶體與 GPU 條件,在較大的 8B 模型與較輕量的 1B 模型之間選擇。
Nemotron 3 Embed 提供 8B、1B 與 NVFP4 三種版本
NVIDIA 把 8B BF16 版本定位為需要較高檢索品質的主力模型,1B BF16 版本則降低推論資源需求;1B NVFP4 版本使用 NVIDIA 的低精度格式,目標是讓 Blackwell 平台提高吞吐量。三者都針對多語言與程式碼檢索訓練。

NVIDIA 公布的 API 文件顯示,1B BF16 版約有 11.4 億參數、輸出 2048 維向量,最大輸入長度為 32,768 tokens。這些規格決定了向量資料庫的維度、索引配置與單次請求能處理的內容長度。
32K context 與 2048 維向量對應企業檢索流程
32K context 讓模型能在單次請求中處理較長的文件或程式碼片段,但企業 RAG 系統仍要自行決定切分大小、重疊範圍與 metadata 欄位。向量維度從 2048 開始,也會影響儲存空間、索引速度與相似度搜尋成本。
這些模型提供的是檢索層能力,不會自動替企業解決權限、文件新鮮度或引用正確性。若來源文件包含不同保密等級,應在向量化前先分隔索引與存取控制。
NVIDIA 將模型接到 NIM、vLLM 與多款 GPU
NVIDIA 表示,Nemotron 3 Embed 可透過 NVIDIA NIM、vLLM 與合作夥伴服務部署。1B BF16 API 文件列出的支援 GPU 包含 H100、A100、L40S、A10G、GB200 與 RTX PRO 6000,讓企業能依現有資料中心設備安排推論。

NVFP4 版本則以 Blackwell 平台為主要目標。NVIDIA 宣稱在其測試中可達到最高約兩倍吞吐量,且保留超過 99% 的 BF16 準確度;實際效能仍會受批次大小、序列長度與 RAG 索引工作負載影響。
RTEB 排名是 NVIDIA 公布的基準測試結果
NVIDIA 表示,Nemotron 3 Embed 8B 在 RTEB 排名第一,分數為 78.5%;1B BF16 版的 RTEB 分數為 72.4%,MMTEB 分數為 71.0%。RTEB 與 MMTEB 是 embedding 模型的公開基準測試,結果仍取決於測試集合與評分方式。
這些排名可以用來做模型初篩,但不能直接等同於企業內部搜尋品質。正式導入前仍需用自己的語言、文件格式、權限規則與查詢紀錄測試召回率和引用結果。
消息來源:NVIDIA on Hugging Face:Nemotron 3 Embed wins RTEB、NVIDIA NIM API:Nemotron 3 Embed 1B。