模型AI產業

NVIDIA 發布 Nemotron 3 Embed 開放 embedding 模型,8B 版主打 32K context 與 RAG

NVIDIA 發布 Nemotron 3 Embed 開放 embedding 模型,8B 版主打 32K context 與 RAG Nemotron 3 Embed 能源, AI, 產業

NVIDIA 在 2026 年 7 月 16 日發布 Nemotron 3 Embed 開放 embedding 模型系列,包含 8B BF16 旗艦版、1B BF16 版,以及針對 Blackwell GPU 優化的 1B NVFP4 版本。Embedding 模型會把文字或程式碼轉成向量,讓企業搜尋、檢索增強生成(RAG)與相似內容比對能先找到相關資料。

三個版本都提供 32K context,NVIDIA 同時公開權重、資料集與訓練配方。這讓部署團隊可以依延遲、記憶體與 GPU 條件,在較大的 8B 模型與較輕量的 1B 模型之間選擇。

Nemotron 3 Embed 提供 8B、1B 與 NVFP4 三種版本

NVIDIA 把 8B BF16 版本定位為需要較高檢索品質的主力模型,1B BF16 版本則降低推論資源需求;1B NVFP4 版本使用 NVIDIA 的低精度格式,目標是讓 Blackwell 平台提高吞吐量。三者都針對多語言與程式碼檢索訓練。

NVIDIA 發布 Nemotron 3 Embed 開放 embedding 模型,8B 版主打 32K context 與 RAG Nemotron 3 Embed 能源, AI, 產業

NVIDIA 公布的 API 文件顯示,1B BF16 版約有 11.4 億參數、輸出 2048 維向量,最大輸入長度為 32,768 tokens。這些規格決定了向量資料庫的維度、索引配置與單次請求能處理的內容長度。

32K context 與 2048 維向量對應企業檢索流程

32K context 讓模型能在單次請求中處理較長的文件或程式碼片段,但企業 RAG 系統仍要自行決定切分大小、重疊範圍與 metadata 欄位。向量維度從 2048 開始,也會影響儲存空間、索引速度與相似度搜尋成本。

這些模型提供的是檢索層能力,不會自動替企業解決權限、文件新鮮度或引用正確性。若來源文件包含不同保密等級,應在向量化前先分隔索引與存取控制。

NVIDIA 將模型接到 NIM、vLLM 與多款 GPU

NVIDIA 表示,Nemotron 3 Embed 可透過 NVIDIA NIM、vLLM 與合作夥伴服務部署。1B BF16 API 文件列出的支援 GPU 包含 H100、A100、L40S、A10G、GB200 與 RTX PRO 6000,讓企業能依現有資料中心設備安排推論。

NVIDIA 發布 Nemotron 3 Embed 開放 embedding 模型,8B 版主打 32K context 與 RAG Nemotron 3 Embed 能源, AI, 產業

NVFP4 版本則以 Blackwell 平台為主要目標。NVIDIA 宣稱在其測試中可達到最高約兩倍吞吐量,且保留超過 99% 的 BF16 準確度;實際效能仍會受批次大小、序列長度與 RAG 索引工作負載影響。

RTEB 排名是 NVIDIA 公布的基準測試結果

NVIDIA 表示,Nemotron 3 Embed 8B 在 RTEB 排名第一,分數為 78.5%;1B BF16 版的 RTEB 分數為 72.4%,MMTEB 分數為 71.0%。RTEB 與 MMTEB 是 embedding 模型的公開基準測試,結果仍取決於測試集合與評分方式。

這些排名可以用來做模型初篩,但不能直接等同於企業內部搜尋品質。正式導入前仍需用自己的語言、文件格式、權限規則與查詢紀錄測試召回率和引用結果。

消息來源:NVIDIA on Hugging Face:Nemotron 3 Embed wins RTEBNVIDIA NIM API:Nemotron 3 Embed 1B

延伸閱讀
三星手機調整字體大小、螢幕縮放的隱藏祕技:進開發人員選項調整「最小寬度」
文章・頭條
你的 GA4 流量有一半是假的:揭開「新加坡暴衝」背後的算力與爬蟲大戰
文章・AI
PJM 推進 Backstop Procurement 與 Connect and Manage,資料中心用電成本分攤進入決策期
文章・能源
Written by
黃郁棋

《科技人》站長,在科技業打滾十年的老屁股,每天都覺得自己要被新技術取代了,完了完了。

打賞科技人|祝您有個美好的一天

科技人原創 BGM

音樂目錄載入中

預設暫停,等你按下播放

0:00 0:00