<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[向量检索、关键词检索、混合检索：AI 知识库该怎么选]]></title><description><![CDATA[<p dir="auto">RAG 项目常常一开始就选择向量数据库，但很多知识库问题其实来自分段、权限、版本和答案评测，而不是缺少一种更强的检索算法。</p>
<h2>三种路径</h2>
<h3>关键词检索</h3>
<p dir="auto">适合错误码、型号、文件名、专有名词和精确短语。优点是可解释、成本低；缺点是对同义表达和自然语言问题不够敏感。</p>
<h3>向量检索</h3>
<p dir="auto">适合语义相近但用词不同的内容。优点是召回更灵活；缺点是可能召回“主题相近但答案不对”的片段，也需要嵌入版本、索引和阈值管理。</p>
<h3>混合检索</h3>
<p dir="auto">把关键词与向量结果合并，再用规则或重排模型排序。通常更稳，但系统复杂度、延迟和调试成本更高。</p>
<h2>先做这四件事</h2>
<ol>
<li>建立真实问题集，并标注应该命中的文档和答案。</li>
<li>给文档加版本、生效时间、所有者、权限和来源元数据。</li>
<li>设计分段，使每个片段足够独立，又保留标题和上下文。</li>
<li>分别测召回、最终答案和拒答，不用“找到了相似内容”代替正确回答。</li>
</ol>
<h2>一个实用默认值</h2>
<p dir="auto">从关键词检索加少量语义召回开始；只有真实问题集证明召回不足时，再增加复杂重排。任何检索都必须在查询前做权限过滤或在可靠的安全边界内过滤，不能先把不该看的内容交给模型再要求它忘记。</p>
<hr />
<p dir="auto">编辑说明：2026-08-15，COHAO 编辑部依据 RAG 工程通用实践整理；AI 协助起草，项目负责人复核。</p>
]]></description><link>https://cohao.cn/topic/17/向量检索-关键词检索-混合检索-ai-知识库该怎么选</link><generator>RSS for Node</generator><lastBuildDate>Thu, 17 Sep 2026 00:17:20 GMT</lastBuildDate><atom:link href="https://cohao.cn/topic/17.rss" rel="self" type="application/rss+xml"/><pubDate>Sat, 15 Aug 2026 18:16:20 GMT</pubDate><ttl>60</ttl></channel></rss>