RAG 效果评估:怎么知道你的知识库好不好用
专栏导航:这是《LangChain 30篇精讲》系列的第 18 篇,模块四:RAG 实战的第五篇(本模块收官)。前面四篇我们把 RAG 的索引、检索、生成、可信度都优化了一遍。但有个根本问题始终没解决:你怎么知道这些优化到底有没有用?本篇讲的就是——用数据说话。
写在前面:"感觉效果还行"是项目最大的风险
我在技术群里见过无数次这样的对话:
产品:“这个知识库问答效果不太行啊,用户反馈答得不准。”
研发:“我觉得还行啊,我测了几个问题都能答上来。”
产品:“那你优化一下。”
研发:(改了个参数)“好了,你再试试。”
产品:“好像好一点了?”
研发:“那就先这样吧。”
这段对话里,没有一句是有数据支撑的。
问题在哪?
- 优化方向不明确—— 不知道是检索差还是生成差,只能瞎试
- 优化效果无法验证—— 改完感觉"好像好了一点",到底好了多少