星知

logo
logo
登录

NVIDIA 发布 Nemotron 3 Embed 系列,8B 版本登顶 RTEB 检索基准

NVIDIA 推出 Nemotron 3 Embed 系列嵌入模型,旗舰 8B 版本登顶 RTEB 检索基准;系列囊括 8B 精度版、1B 轻量版与 Blackwell 优化的 1B-NVFP4 版,通过模型压缩与知识蒸馏实现高效能,覆盖 RAG、代码检索与智能体记忆等多场景,主打跨语言检索与分层部署策略。
发布时间:2026/07/18 03:20|分类:人工智能
NVIDIA 正式发布 Nemotron 3 Embed 系列嵌入向量模型,专为生产级 RAG、智能体检索、代码检索及智能体记忆等场景设计。该系列包含三个开放检查点: - **Nemotron-3-Embed-8B-BF16**:精度优先,在检索嵌入基准测试 RTEB 中以平均 NDCG@10 得分 78.46 位列榜首,成为当前性能最强的开源检索嵌入模型。 - **Nemotron-3-Embed-1B-BF16**:轻量化版本,得分 72.38,相较上一代基线提升 10.4 分。 - **Nemotron-3-Embed-1B-NVFP4**:针对 Blackwell 架构优化的 4 比特版本,仅损失 0.38 分,保留 99.5% 精度,吞吐量比 BF16 提升 2 倍。 三者均采用双向注意力掩码的 Transformer 编码器,最大序列长度 32,768 token,支持 34 种语言,基于 Mistral 架构,遵循 OpenMDW-1.1 许可协议开源。1B 模型采用“压缩而非小规模训练”的路径:先通过 NVIDIA ModelOpt 将 3B 模型剪枝至 2B,再从微调后的 8B 教师模型进行知识蒸馏,最终压缩至 1.14B 参数。NVFP4 版本则额外进行量化感知蒸馏。 应用上,该系列支持多语言企业搜索、代码检索及智能体记忆,可实施“1B-NVFP4 高容量召回 + 8B 处理困难查询”的分层 RAG 策略。部署方面,8B 与 1B BF16 版本支持 Transformers 框架,1B-NVFP4 仅支持 vLLM 接口。NVIDIA 还发布了基于 Rust 的 NIM 微服务优化版,在 GB200 与 RTX PRO 6000 上性能达到或超越 vLLM 检查点。
人工智能星知