通用语音模型经常把品牌、人名、药品、设备和英文缩写识别成发音相近的普通词。Gemini 3.5 Transcribe支持自定义词汇偏置,最多可提交一千个术语,官方建议通常控制在一百个高价值词以内。词表不是字典替换,它只是提高模型关注特定表达的概率,需要结合录音质量和评测持续维护。
一、哪些词值得加入
优先加入业务中高频、容易误识别且错误代价较高的词,例如产品型号、客户公司、医生姓名和技术缩写。普通日常词无需加入,过多候选会互相竞争。每个词应有明确所有者和来源,避免把拼写错误永久固化到系统。
二、按场景建立小词表
客服、医疗、研发和销售使用的词不同,应按队列或项目加载对应词表,而不是全公司共用一个巨大列表。会议开始前可根据邀请人、项目和议程动态组合。控制规模既提高效果,也减少敏感项目名称被不必要地发送到其他任务。
三、理解参数互斥限制
自定义词汇不能与说话人区分或词级时间戳同时使用,接口会拒绝这种组合。产品需要让用户选择优先目标:专业词准确、分角色,还是精确字幕。也可以对同一音频运行两条处理链,再通过时间段和人工审核合并,但要评估额外成本。
四、缩写和多种读法
一个缩写可能按字母读,也可能作为单词发音。词表中记录正式拼写,并在测试集中覆盖常见读法。中文品牌还可能有英文名、简称和旧名称,应建立别名映射,但最终输出统一到业务主数据。不要让模型自行决定哪个别名代表同一实体。
五、用对照实验评估提升
准备包含目标术语的真实脱敏音频,分别在无词表和有词表条件下转写。统计术语召回、错误替换和普通词受影响情况。不能只挑成功案例,应覆盖噪声、不同口音和远距离录音。若整体准确率下降,说明词表范围或相似词设计需要调整。
六、词表也需要版本管理
每次发布记录新增、删除和修改的词,绑定适用业务与模型版本。产品更名后保留旧称用于识别,但输出可标记为历史名称。出现转写事故时,能够回溯当时使用的词表。多人直接在线修改而没有审阅,会让质量变化无法解释。
七、敏感术语的保护
项目代号、患者信息和未发布产品名可能本身就是敏感数据。只把必要术语发送给授权服务,日志中做脱敏,任务结束后按策略清理。个人姓名不应为了偶尔一次会议长期留在全局词表。企业需把词表纳入数据分类和访问审计。
八、推荐维护流程
业务人员提交候选词,语言或数据负责人审核,测试集验证后按版本发布;线上监控未知词和人工修改频率,每月清理低价值条目。自定义词表能显著改善专业场景,但真正稳定的识别来自清晰录音、精简术语、持续评测和人工纠错共同作用。