向量检索、关键词检索、混合检索:AI 知识库该怎么选
-
RAG 项目常常一开始就选择向量数据库,但很多知识库问题其实来自分段、权限、版本和答案评测,而不是缺少一种更强的检索算法。
三种路径
关键词检索
适合错误码、型号、文件名、专有名词和精确短语。优点是可解释、成本低;缺点是对同义表达和自然语言问题不够敏感。
向量检索
适合语义相近但用词不同的内容。优点是召回更灵活;缺点是可能召回“主题相近但答案不对”的片段,也需要嵌入版本、索引和阈值管理。
混合检索
把关键词与向量结果合并,再用规则或重排模型排序。通常更稳,但系统复杂度、延迟和调试成本更高。
先做这四件事
- 建立真实问题集,并标注应该命中的文档和答案。
- 给文档加版本、生效时间、所有者、权限和来源元数据。
- 设计分段,使每个片段足够独立,又保留标题和上下文。
- 分别测召回、最终答案和拒答,不用“找到了相似内容”代替正确回答。
一个实用默认值
从关键词检索加少量语义召回开始;只有真实问题集证明召回不足时,再增加复杂重排。任何检索都必须在查询前做权限过滤或在可靠的安全边界内过滤,不能先把不该看的内容交给模型再要求它忘记。
编辑说明:2026-08-15,COHAO 编辑部依据 RAG 工程通用实践整理;AI 协助起草,项目负责人复核。