很多企业知识库效果不好,第一反应是更换聊天大模型或不断修改提示词,但真正的问题往往出在检索阶段。NVIDIA近期发布Nemotron 3 Embed系列开放嵌入模型,覆盖1B和8B等不同规模,并强调长文档、多语言、代码检索和Agent记忆场景。嵌入模型负责把问题和文档转换成可比较的向量,如果它找错资料,后面的生成模型再强也只能围绕错误上下文组织答案。
三种模型怎样选择
8B版本适合精度优先的法律、研发、财务和复杂技术文档;1B BF16适合一般企业知识库,在成本和质量之间取得平衡;1B NVFP4面向高吞吐部署,适合数据量大、查询频繁且具备对应硬件的环境。不要只参考公开排行榜,企业必须使用自己的文档和真实问题测试,因为内部缩写、产品编号、合同条款和代码符号与公开语料差异很大。
建立可用RAG的五个步骤
第一步整理数据源,删除重复版本并保留文档更新时间、部门、权限和来源链接。第二步根据文档结构切块,制度文件可按章节,工单可按问题与处理记录,代码则按函数和依赖关系处理。第三步准备至少一百个真实问题,并为每个问题标注应当命中的文档。第四步分别测试稠密检索、关键词检索和混合检索,记录Recall、MRR、首条命中率和响应延迟。第五步再接入重排模型与生成模型,并要求答案显示来源,无法找到资料时明确拒答。
Agent为什么更依赖检索质量
普通问答检索错一次,只会产生一个差答案;Agent在多步骤任务中会把错误资料带入后续计划、工具调用和决策,造成更大浪费。建议为Agent设置检索预算、来源白名单和置信度阈值。当多次检索结果互相矛盾时,系统应暂停并要求人工确认,而不是让模型自行挑选看起来最顺眼的答案。
上线前的验收清单
检查权限过滤是否发生在检索前,避免模型先看到无权访问的片段;检查删除文档后向量库是否同步删除;检查文档更新能否触发重新索引;检查中文、英文、数字编号和代码混合查询;检查恶意文档中的提示注入是否会影响Agent。还要把检索结果、模型版本和最终回答关联保存,方便追查错误来源。
结论
企业RAG的核心不是把更多文档塞进向量库,而是持续证明“正确问题能找到正确证据”。Nemotron 3 Embed提供了新的开放选项,但真正决定效果的是数据治理、业务评测和权限设计。先把检索单独测清楚,再接生成与Agent,通常比盲目升级大模型更有效。