Gemini Embedding 2可以把文本、图片、视频、音频和PDF映射到同一向量空间,适合跨模态搜索、推荐和文档检索。例如用户用一句文字寻找相似产品图,或用一张截图查找对应说明书。统一向量简化了系统结构,但数据切分、维度选择、权限过滤和评测仍决定最终效果。
一、先定义检索方向
文本查图片、图片查文本和相似视频推荐属于不同任务,评测数据也不同。建立索引前写清查询输入、目标结果和业务容错。例如售后检索要求召回正确零件说明,创意推荐则允许更多相似风格。没有明确目标,向量距离再漂亮也无法判断是否有用。
二、不同模态采用不同切分
PDF按章节和页面切分并保留标题;视频按镜头或语义段落提取;音频按说话段落;图片保留说明和来源。切分过大导致匹配模糊,过小又丢失背景。每个向量记录原文件、时间段或页码,返回结果才能跳到真实证据。
三、维度影响成本与准确率
模型支持从较小到较大的输出维度,维度越高通常占用更多存储和计算。先用代表性数据比较召回率、索引大小和查询延迟,再选择满足业务的最低维度。更换维度需要重新生成并分开索引,不能把不同长度向量混在同一个集合中。
四、任务说明的使用方式
纯文本检索建议在查询和文档侧加入合适的任务说明,帮助模型理解是搜索、分类还是相似度比较。多模态单向量不宜机械添加同样前缀,因为可能降低效果。提示模板应版本化,并通过离线评测决定,而不是根据一个样例反复微调。
五、权限过滤必须先于展示
向量库可能召回用户无权查看的文件。每个片段携带租户、部门、项目和敏感级别,查询时先过滤权限,模型生成答案时再次校验引用。不要认为向量不可读就不算数据泄露,相似度结果本身也可能暴露机密内容存在。
六、建立跨模态测试集
收集真实查询并标注相关结果,覆盖文字找图、截图找文档、语音找视频和错误输入。使用Recall@K、排序质量和人工满意度评估,同时监控不同语言和设备采集差异。只在厂商示例上测试,无法代表自己的数据分布。
七、索引更新与删除
文件修改后生成新版本向量并使旧版本失效,删除源文件时同步删除所有片段和缓存。记录模型、维度、切分器与生成时间,方便全量重建。跨模态检索真正可靠的条件,是证据可定位、权限不越界、评测可重复和数据生命周期完整。