一、问题不一定出在大模型

很多企业上线知识库 AI 后,第一反应是“模型不够聪明”。但在大量项目中,真正的问题往往出在 RAG 链路:文档解析丢结构、切分策略粗糙、检索召回不足、重排缺失、提示词没有约束来源。模型只是最后一个环节,它拿到的上下文如果是错的,回答自然也会错。

二、最常见的五个坑

1. 把文档切得太碎

如果每个 Chunk 只有一两句话,模型很容易拿到没有上下文的片段。例如制度文档里“需审批”这句话,脱离前文就不知道适用于采购、报销还是合同。解决方法是按标题和语义边界切分,并保留父级标题。

2. 把文档切得太长

过长的 Chunk 会把多个主题混在一起,导致检索命中看似相关,实际包含大量噪音。模型在噪音中总结,答案就会变得含糊。合理做法是让一个片段只承载一个明确主题。

3. 只做向量检索

向量检索擅长语义相似,但对编号、产品型号、客户名称和缩写并不总是稳定。企业知识库中大量问题依赖精确词,因此需要向量检索和关键词检索结合。

4. 没有 Rerank

初始召回只是“可能相关”,不是“最适合回答”。没有重排,模型可能拿到排名靠前但信息不完整的片段。Rerank 可以显著提升答案依据的质量。

5. 没有拒答机制

当知识库没有相关资料时,系统应该拒答或提示补充资料。如果提示词没有明确要求“仅基于检索内容回答”,模型就可能凭常识补全,造成企业最害怕的幻觉。

三、诊断方法

不要只看最终答案,要把每次问答拆成三段检查:用户问题被如何改写、检索返回了哪些片段、模型基于哪些片段生成了答案。只要把这三段日志打开,大多数问题都能定位。

  • 如果检索结果无关:优化切分、Embedding、关键词召回和查询改写。
  • 如果检索结果相关但答案错误:优化提示词、引用约束和上下文排序。
  • 如果答案正确但用户不信任:增加来源引用、文档时间和可点击出处。

四、优化优先级

优先修文档结构,再修检索召回,然后加 Rerank,最后优化生成提示词。很多团队一上来就调 Prompt,结果只是让错误答案写得更流畅。RAG 的本质是信息供应链,供应链上游不稳定,下游表达再好也没有意义。

五、结论

好用的企业 AI 不是靠一次接入模型实现的,而是靠持续打磨知识链路实现的。把 Chunk、召回、重排、引用和拒答机制做好,RAG 才能从“能回答”变成“答得准、查得到、可追责”。