RAG 系统调优实战:从 60% 到 95% 的召回率提升——文档切片+混合检索+Rerank 三步法
引言 公司知识库接了 RAG 之后,业务方提了第二个需求:"能不能让它答得再准点?"——这个"再准点"背后是实打实的吐槽:问"年假可以攒到明年吗",它从员工手册里捞出一段"考勤打卡规则";问"服务器扩容审批流程",它把无关的"机房巡检 SOP"排在最前面。答案的来源没问题(文档库里确实有),但检索根本没把对的段落捞出来——生成模型再强,也架不住喂进去的是错料。 我们拉了 100 条真实业务问题的评测集,跑了一版基线:Top5 召回率只有 60%——40% 的问题,正确答案所在的段落根本不在喂给大模型的上下文里。大模型面对缺失的料,只能一本正经地编。 最终的优化路径非常经典,就三步:按段落语义切分 → BM25+向量混合检索 → Rerank 重排序,召回率从 60% 提到 95%。这篇文章把这 60% → 95% 的全过程完整还原:每一步的坏代码长什么样、为什么坏、怎么改、改完涨了几个点——这是一份可以照着抄的调优清单。 一、先搞清"召回率":RAG 排障的第一性指标 1.1 三个指标别混着说 RAG 的效果问题要先拆开看,不同层的问题药方完全不同: 指标定义反映哪层的问题 ....