ZHIDIAN · TECH · 2026.08.10
企业落地 RAG 的五个真实坑
过去两年我们帮企业搭了不少知识库问答系统。演示都很好看,上线后真正决定成败的,是这五个不在 PPT 里的小事。
坑一:权限没有跟着人走
最容易被忽略的一步。知识库里有合同、薪酬、技术文档,不同部门该看到的东西完全不同。如果向量库不分权限,检索命中就会把不该看的也带出来。
做法:索引时给每个 chunk 打上 ACL 标签,检索时把用户权限作为硬过滤条件,而不是事后截断。
坑二:没有评测就上线
RAG 的好坏不在模型,在于检索质量。不建评测集,你永远不知道召回率是多少,改个切分参数都无法判断是好是坏。
做法:上线前先用 100~200 条真实业务问题做评测集,跑通「召回率 → 生成质量 → 可溯源率」三张表。
坑三:把 Word 当纯文本切
表格、页眉、脚注、目录——直接按字数切分会把语义切得七零八落。企业对「结构化文档」的解析要求远高于通用网页。
做法:按文档结构(标题层级、表格、段落)做语义切分,先解析成结构化对象再切片。
坑四:引用是装饰,不是承诺
「AI 一本正经地胡说八道」在企业场景是事故。答案必须带可点击的来源,且来源要精确到段落,不是「来自某文档」。
做法:生成时强制附带 chunk 级引用,来源缺失时宁可回答「未找到依据」。
坑五:冷启动期没人喂数据
系统上线后,知识库如果不持续更新,三个月后准确率必然下滑。企业 RAG 是运营问题,不是一次性部署。
做法:把「知识入库」做成业务部门自己的工作流,配合定时同步与过期清理。
AI 是枝叶,业务才是根。RAG 的每个坑,最后都指向同一个答案:先搞懂业务怎么运转,再谈模型怎么接入。
智典 AI · 企业智能化 · zhidianai.site