RAG 系统上线 90 天复盘检索质量没有想象中那么高一、上线时信心满满Top-5 召回率 92%一个月后用户反馈搜不准RAG 系统在公司知识库上线时用人工标注的 500 条测试集测出来 Top-5 召回率 92%Top-1 精确率 85%。所有人都觉得够了。但上线一个月后来自用户的真实反馈是搜项目文档经常搜不到同样的问题问三次能搜到不同的答案。把用户的真实查询捞出来一看召回率只有 68%。差距在哪测试集和真实查询之间存在系统性偏差。测试集是产品经理和工程师精心构造的措辞规范、关键词明确。而用户的真实查询是口语化的、模糊的、带拼写错误的。这个鸿沟是 RAG 系统上线后最大的期望差距。二、真实查询 vs 测试集的差距分析找到差距后做了系统性的改进将真实召回率从 68% 提升到 87%。以下是四个关键改进。三、四个关键改进改进一查询改写Query Rewriting用户的查询那个回归的怎么做非常模糊。加入查询改写后先用 LLM 将模糊查询扩展为完整查询def rewrite_query(raw_query: str, history: List[Dict] None) - str: 将用户口语化查询改写为规范检索查询 prompt f 将以下用户查询改写为一个清晰的检索查询。 要求 1. 补全指代词那个这个等 2. 展开缩写和专业术语 3. 保持原意不变 对话历史: {history[-3:] if history else 无} 用户查询: {raw_query} 改写后的查询: # 实际调用 LLM 获取改写结果 rewritten llm_call(prompt) return rewritten # 效果: 那个回归的怎么做 → 多元线性回归分析的实现方法改进二多路召回 结果融合单一的向量召回对专有名词不敏感。改为 BM25 向量双路召回def hybrid_search(query: str, top_k: int 20): # 路1: 关键词检索对专有名词友好 bm25_results bm25_index.search(query, top_k * 2) # 路2: 向量检索对语义友好 query_embedding encoder.encode(query) vector_results vector_db.search(query_embedding, top_k * 2) # RRF倒数排名融合 fused reciprocal_rank_fusion(bm25_results, vector_results, k60) return fused[:top_k] # 效果: 专有名词Kubernetes pod 调度召回率从 56% → 89%改进三分块策略从定长改为语义切分原来的分块是 512 字符固定切分导致重要信息的首尾被切断。改用基于 Markdown 标题的语义切分# 原来的分块定长512无视文档结构 [chunk1] ## 一、背景 本项目旨在解决...512字符截断 [chunk2] ...数据质量问题。具体的方案是...后半段脱离标题 # 改进的分块按 Markdown 标题边界 [chunk1] ## 一、背景 本项目旨在解决企业数据质量问题。 [chunk2] ## 二、技术方案 采用 Flink Kafka 构建实时数据校验通道。效果Top-1 精确率从 72% 提升到 83%。因为 LLM 拿到的 chunk 是语义完整的不会出现前半段有标题、后半段没内容的情况。改进四用户反馈闭环加了两个隐藏的产品功能这个答案有帮助吗赞/踩按钮每周自动分析踩的查询找出 Top-10 召回失败的 case人工排查原因缺少文档、分块策略问题、向量相似度阈值。四、90 天后还存在的问题问题一多轮对话的上下文丢失。用户问上个月呢RAG 不知道上个月指的是什么因为向量检索没有对话记忆。这需要将对话历史也编码到检索查询中Query Rewriting 的部分功能。问题二时效性检索仍不理想。用户搜最新版本RAG 返回了三个月前的文档只是因为那段文档里最新这个词出现了多次。这需要在文档入库时打时间戳标签检索时对旧文档自动降权。问题三跨文档信息融合。用户问A 项目和 B 项目的技术栈对比这需要同时检索两篇文档并做对比RAG 目前做不到。这需要多跳检索Multi-hop Retrieval或 Agent 模式。五、总结RAG 系统的真实召回率通常比测试集低 20-30%。这不是模型的问题是测试集的构造偏差问题。四个关键改进查询改写补全模糊查询、多路召回BM25 向量融合、语义分块按标题边界切分、反馈闭环用户行为驱动持续优化。上线后最重要的指标不是Top-K 召回率那是技术指标而是用户踩率那是业务指标。如果踩率超过 15%RAG 在用户眼中的可信度就已经崩了——不管你测出来的召回率是多少。
企业数字化 ERP 产品动态
相关推荐
3分钟快速上手DeepL Chrome翻译插件:免费开源工具让外文网页阅读零障碍 3分钟快速上手DeepL Chrome翻译插件:免费开源工具让外文网页阅读零障碍 【免费下载链接】deepl-chrome-extension A DeepL Translator Chrome extension 项目地址: https://gitcode.com/gh_mirrors/de/deepl-chrome-extension
还在为阅读外文网页而烦恼吗&am… · 2026/9/23 3:22:14
Linux内核日志内存分布解析与性能优化 1. 内核日志中的内存分布解析概述在Linux系统调试和性能优化过程中,内核日志(dmesg)是我们最常接触的诊断信息源之一。其中关于内存分配和管理的记录往往包含着系统稳定性和性能表现的关键线索。记得去年排查一个线上OOM问题时,通… · 2026/8/28 22:21:24
Kubernetes 1.35.0部署与优化实战指南 1. Kubernetes 1.35.0部署全景解读作为容器编排领域的事实标准,Kubernetes每次版本更新都牵动着广大运维开发者的神经。1.35.0版本带来了多项稳定性改进和API优化,特别是在动态资源分配和存储卷管理方面有显著提升。选择Ubuntu作为部署平台,不… · 2026/8/20 16:44:24
C#工业视觉部署实战:YOLOv8+OpenVINO+ByteTrack检测跟踪指南 简介:资源围绕C#集成OpenVINO与ByteTrack实现YOLOv8实时目标检测与多目标追踪,面向具备一定C#基础、希望将深度学习模型部署到实际视觉系统中的开发者,可应用于智能安防、交通监控等场景。压缩包共378个文件,约359.78MB࿰… · 2026/9/26 13:51:10
7B–12B开源大模型落地实战指南:如何让便宜模型真正放心用 1. 这个问题,其实每天都在真实发生“便宜那一档模型,什么时候可以放心用”——这句话不是调侃,不是段子,而是我过去三年里,在十多个实际落地项目中,被客户、产品经理、甚至开发同事问得最多的一句真问题。它… · 2026/9/26 13:51:10
园林景观园建工程量计算与识图全攻略:从图纸到算量一次讲透 上个月有个做施工的朋友发来一张照片,一套展示区的景观施工图,后面跟着一句话:“兄弟帮我看看,这图纸上的园建面积我怎么算都对不上,甲方预算给的980平米,我自己量才820平米,那160平米到底跑哪去… · 2026/9/26 13:51:03
Agent Zero Memory多轨并行记忆架构解析:长对话Agent记忆实战 最近圈子里被 Agent Zero Memory 刷了一波屏。LongMemEval 上 95.60%,LoCoMo 上 93.60%,两个长对话记忆基准同时登顶,直接把前代顶尖基线按了下去。我看完项目报告的第一反应是:这不是又一个靠堆上下文窗口的“暴力记忆”… · 2026/9/26 13:51:03
便宜大模型放心使用的四维评估与落地指南 1. 为什么“便宜那一档模型”总让人又爱又怕“便宜那一档模型,什么时候可以放心用”——这句话不是调侃,而是我过去三年在十多个真实业务线里反复听到的高频提问。它背后站着三类人:预算有限但要上线AI功能的产品经理、被老板催着“先跑通再优… · 2026/9/26 13:51:03
基于Flask与uniapp的社团活动报名与财务可视化平台实战 两年前我在社团做后端负责人时,最头疼的其实是"账目说不清"——一次活动收了多少钱、花的钱去了哪、哪些品类烧钱最狠,全靠一张Excel和大家的记忆。后来我干脆写了一个基于Python Flask uniapp微信小程序的学生社团活动报名与财务管理平台&am… · 2026/9/26 13:51:03
数据库课后习题答案别硬背:当测试用例集刷,效率翻倍 简介:万常选版《数据库原理与设计》课后习题答案资源,覆盖第2至6章及第9章,适合正在学习关系模型、数据库建模、关系数据理论与模式求精的本科生、自学者作为复习与自测材料。压缩包共7个文件,含3个doc参考答案、2个sql示例脚本、… · 2026/9/26 0:00:21
OpenClaw 替代品?Hermes Agent 踩坑实录:macOS 飞书接入 TaoToken 配置 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 0:00:40
向下兼容与向上兼容:接口设计中的兼容性策略与工程实践 一次版本升级事故,是很多团队绕不过去的坎。线上环境里,服务端明明已经上线了新版接口,老的移动端还在照着旧文档传参数。请求一到网关,校验直接拒绝,用户操作失败,客服群炸了锅,开发群里开始互… · 2026/9/26 0:00:46