知识库演示时回答得流畅,并不代表上线后可靠。真正的验收要用团队和用户会问的真实问题,检查它找到了什么资料、遗漏了什么条件、什么时候应该承认不知道并转人工。

先建一套真实问题集
问题集应包含高频问题、边界问题、容易混淆的问题、资料不存在的问题和旧版本问题。每题写出预期依据、允许的回答范围、必须提示的限制和应否转人工。不要只用能答对的示例给系统打分。
| 检查维度 | 要看什么 |
|---|---|
| 检索 | 是否找到当前有效且匹配的问题资料 |
| 回答 | 是否遗漏关键条件或编造不存在的信息 |
| 依据 | 能否显示资料标题、版本和相关位置 |
| 边界 | 资料不足时是否明确说明并转人工 |
每次验收保留四类记录
- 测试问题及当时的资料版本。
- 系统检索到的依据与实际回答。
- 错误类型:没找到、找错、答错、说得太满或该转未转。
- 修复动作、负责人和复测结果。
知识库上线后也要持续维护,可将 更新机制 作为日常流程,把真实失败案例变成下一轮测试。
验收通过不等于不再复查
资料、规则和业务都会变。每次重大更新后重新跑核心问题集,记录版本差异。AI 知识库的可靠性来自持续验证,不是一次“看起来不错”的演示。


