技术洞察

把检索增强问答做到生产可用:我们踩过的六个坑

2026-08-26 2 分钟阅读 737
把检索增强问答做到生产可用:我们踩过的六个坑

1. 文档切片不考虑结构

按固定字符数切片会把表格、条款拆散,导致检索到片段但无法回答。应按文档结构(章节、条款、表格)切片,并保留标题路径作为上下文。

2. 忽视权限

知识库往往包含不同密级的文档。检索阶段必须按用户角色过滤,否则会出现越权泄露。权限打标应在文档入库时完成,而不是在检索结果上事后过滤。

3. 没有拒答机制

模型倾向于“编一个看起来合理的答案”。需要设定相似度阈值,低于阈值时明确回答“未找到依据”并提供转人工入口。宁可拒答,不可瞎编。

4. 答案不溯源

企业场景中,用户需要验证答案来源。答案必须附带原文出处与链接,这是建立信任的前提。

5. 缺少评测集

没有评测集就无法判断改动是变好还是变坏。上线前应构建 100-300 条覆盖典型问题的评测集,每次改动后回归,跟踪准确率与拒答率。

6. 把工具调用权限开得过大

涉及数据修改、资金、权限的操作,必须保留人工确认。智能体的自主性应当按风险分级逐步放开。

准备好启动您的信息化项目了吗?

告诉我们您的业务场景与目标,我们会在 1 个工作日内给出初步方案与实施建议。

立即咨询