DIRECT ANSWER / 结论先行

企业控制大模型和智能体风险,应从场景影响分级开始:它能看什么数据、调用什么工具、影响谁、错误是否可逆。随后落实最小权限、来源记录、输出复核、运行日志、异常升级、供应商管理和停用机制。治理不是阻止使用,而是让不同风险的场景进入不同强度的控制。

适用于
  • 允许员工使用公共或企业大模型的组织
  • 准备让智能体连接知识库和业务工具的项目
  • 需要建立统一 AI 使用边界的管理团队
不适用于
  • 替代法律、网络安全、隐私或行业专项合规意见
  • 用一份通用制度覆盖所有风险等级
  • 仅靠员工承诺而没有技术权限和日志控制

方法与证据口径

以 ISO/IEC 42001 的组织管理体系、ISO/IEC 23894 的 AI 风险管理指导和 NIST AI RMF 的 Govern、Map、Measure、Manage 为主线,将控制措施落到场景生命周期。

决策表

按影响强度配置控制
场景级别典型动作最低控制
低公开资料摘要、内部头脑风暴输入提示、基础日志、人工判断
中内部知识检索、内容初稿、分析建议身份权限、来源引用、人工复核、评测
高对外发送、业务系统写入、人员或资金决策双重审批、隔离执行、完整审计、可撤销
暂缓安全关键控制或不可逆自动决策完成专项评估前不自动执行
低
典型动作
公开资料摘要、内部头脑风暴
最低控制
输入提示、基础日志、人工判断
中
典型动作
内部知识检索、内容初稿、分析建议
最低控制
身份权限、来源引用、人工复核、评测
高
典型动作
对外发送、业务系统写入、人员或资金决策
最低控制
双重审批、隔离执行、完整审计、可撤销
暂缓
典型动作
安全关键控制或不可逆自动决策
最低控制
完成专项评估前不自动执行
01

风险来自完整系统,而不只是模型

同一个模型用于公开资料摘要和用于自动发送合同,风险完全不同。企业应评估数据、提示、检索库、工具、人员、供应商和输出去向构成的完整系统。

  • 数据是否包含个人信息或商业秘密
  • 输出影响是否可逆
  • 智能体是否能写入、删除、付款或对外发送
  • 用户是否知道自己在与 AI 交互
  • 失败时谁能停止并接管
02

智能体权限要按任务临时授予

智能体具有工具调用能力后,应像管理服务账号一样管理身份。默认只读、按任务授权、限制作用域和时长,并把高影响动作放到明确的人类确认点。

  • 凭证不进入提示或客户端
  • 工具参数和目标对象做白名单校验
  • 写操作提供预览、确认和撤销
  • 日志记录模型决定之外的真实工具结果
03

建立可运行的治理闭环

制度必须进入需求评审、测试、上线和运营,而不是停留在文件审批。

  1. 建立 AI 场景台账和责任人
  2. 按影响、数据和可逆性分级
  3. 为每级定义数据、权限、复核和日志要求
  4. 上线前完成场景评测与红队测试
  5. 运行中监控错误、越权和用户反馈
  6. 重大变化后重新评估并保留停用路径

方法限制

  • 本文是通用治理框架,不覆盖特定行业的全部法定义务
  • 风险会随模型、数据、工具权限和使用人群变化,需要持续复评
  • 日志本身也可能含敏感数据,需设置访问、留存和脱敏策略

本次更新

方法、适用边界与官方来源于 2026.08.14 完成复核。

下一次证据复核不晚于

官方来源与核验日期

  1. 01ISO/IEC 42001:2023 AI management systems · ISO核验 2026.08.14
  2. 02ISO/IEC 23894:2023 Guidance on risk management · ISO核验 2026.08.14
  3. 03AI Risk Management Framework · NIST核验 2026.08.14
  4. 04Artificial Intelligence Risk Management Framework: Generative AI Profile · NIST核验 2026.08.14

继续研究