在 RAG 里,embedding 检索和 rerank 分别解决什么问题?为什么有时需要两阶段检索?
好的回答应说明 embedding 检索适合从大规模候选中快速召回语义相近内容,但可能排序不够精细;rerank 通常在较小候选集上做更精细的相关性判断。两阶段方案能在成本和质量之间取平衡。候选人还应提到关键词检索、混合检索、metadata 过滤和延迟成本。
题目背景
很多 RAG 系统质量差,不是因为没有向量库,而是因为召回、排序和上下文组装混在一起设计。
完整回答
好的回答应说明 embedding 检索适合从大规模候选中快速召回语义相近内容,但可能排序不够精细;rerank 通常在较小候选集上做更精细的相关性判断。两阶段方案能在成本和质量之间取平衡。候选人还应提到关键词检索、混合检索、metadata 过滤和延迟成本。
加分信息
- 能结合 AI 应用工程师 的真实工作场景回答。
- 能结合 搜索工程师 的真实工作场景回答。
常见问题
- 只给概念定义,没有说明工程场景。
- 没有提到验证、监控或失败处理。
面试官可能追问
- 如果召回阶段没有召回正确文档,rerank 还能救回来吗?
- 你会如何设置 top_k 和 rerank 候选数量?
回答时尽量连接到一个可运行项目、评测记录、日志或复盘材料。