直接答案
知识库接入 AI 前,至少要准备四件事:让文档有明确责任人和有效版本、把源系统权限带入检索、建立过期与删除同步机制、用真实业务问题验证答案和引用。只把文件批量上传到向量库,不能解决互相冲突、权限不清和过期内容的问题。
Azure AI Search 的官方方案会在索引中保留用户或组权限,并在查询时根据调用者身份过滤文档〔1〕。这意味着权限不是聊天界面上的提示语,而是必须落实到每次检索的技术约束。
适用边界
| 层面 | 上线前必须明确 | 不能接受的替代 |
|---|---|---|
| 文档质量 | 标题、版本、责任人、生效日期、适用范围 | “模型自己会判断哪份是真的” |
| 权限 | 用户、群组、文档和字段级访问规则 | 只在提示词中要求保密 |
| 更新 | 新增、修改、删除、撤销和重新索引机制 | 定期全部重传但不处理删除 |
| 答案 | 标准问题、期望要点、允许来源和拒答条件 | 只看回答是否流畅 |
| 引用 | 能定位到原文、版本和段落 | 只显示文件名或虚构链接 |
公开知识、内部操作文档、客户数据和受限材料不应混在同一个无权限边界的索引中。
实施步骤
- 盘点信息源。 列出文件夹、网盘、业务系统、网页和数据库,并标记负责人。
- 建立文档最小元数据。 至少包含唯一 ID、标题、版本、生效日期、状态、权限和来源 URL。
- 处理冲突与过期。 明确新旧制度、草稿与正式版、总部与地区规则的优先级。
- 继承权限。 索引时携带源系统 ACL 或群组信息,查询时按当前用户过滤。
- 设计删除同步。 源文件撤销后,检索索引和缓存也必须删除或失效。
- 建立验证集。 选择真实高频问题、边界问题、无答案问题和权限问题,记录期望证据。
- 监控答案链路。 分开记录检索是否命中、证据是否正确、回答是否完整和是否越权。
NIST 的 AI 测试、评估、验证和确认资源强调,应使用可重复的测量方法持续检查系统〔2〕。对于知识库,这意味着不能用一次演示回答代替长期验证。
验收清单
- 同一问题在不同权限账号下只返回各自可见文档。
- 删除或撤销文档后,检索、缓存和回答都不再引用它。
- 冲突文档能依据版本、生效日期和适用范围选择或明确提示冲突。
- 每个事实性回答都能定位到正确原文,而不是只给一个文件名。
- 没有足够证据时能够拒答或请求补充,而不是生成看似合理的内容。
- 验证集覆盖高频、边界、过期、越权和无答案场景。
- 文档更新后能重跑验证集,并比较答案与引用变化。
参考来源
- Document-Level Access Control — Azure AI Search
- NIST AI Resource Center
- Best Practices for Security — Azure AI Search
- Query-Time ACL and RBAC Enforcement — Azure AI Search
- Artificial Intelligence Risk Management Framework 1.0 — NIST
下一步
先选一个边界清楚的知识域和一组有明确答案的真实问题,不要从“把公司所有文件都上传”开始。可以查看企业知识库与 AI 应用项目、了解企业 AI 工作流服务,或带着脱敏文档目录、权限模型和典型问题提交业务问题。