当AI代理从会聊天走向会动手——调用接口、读写数据、发起流程——它获得的就不再只是注意力,而是真实的系统权限。自主执行带来的最大变化是:决策与执行被压缩到同一步,人工确认这道天然闸门被绕过了。于是,一次提示词注入、一次上下文污染,都可能直接变成生产环境里的越权操作。
风险从说错话升级为做错事
过去大模型出错,代价通常是一段不准确的文字;如今代理出错,代价可能是一条被删的数据、一笔被提交的订单、一份被外发的机密文件。更棘手的是,代理往往以服务账号或共享凭证运行,日志里只留下系统的痕迹,很难回溯到具体是哪次任务、哪条指令导致了动作。风险性质由此从内容质量转向操作合规。
权限失控通常沿三条路径发生
- 权限过度授予:为了少改代码、快上线,直接给代理开通写权限或管理员级凭证,一次配置失误就等于长期敞口。
- 凭证被间接利用:代理读取的外部网页、邮件、文档里可能藏着恶意指令,诱导它用自身权限去执行未授权动作。
- 链式调用放大影响:代理调用代理、再触发自动化脚本,单点越权会沿工具链迅速扩散,远超最初授权范围。
传统安全边界为何对代理失灵
传统边界假设人是操作主体:身份对应人,权限对应岗位,行为可被审计问责。代理打破了这三个假设——它可以代表多个人、同时使用多套凭证、以机器速度连续行动。防火墙和网络分段能管住流量走向,却管不住用合法权限做不该做的事。因此问题不是边界要不要,而是边界要下沉到每一次具体动作。
重建边界的四个支点
- 最小权限与短时凭证:按任务而非按团队授权,凭证用完即失效,避免长期有效的万能钥匙。
- 独立身份与可追溯:给每个代理分配可识别身份,让它的动作能对应到具体任务与发起人。
- 动作级策略拦截:在工具调用前做校验,对高风险操作强制审批或直接拒绝。
- 可中断与可回滚:保留急停开关,关键写操作留快照,出事时能止损而非只能事后追责。
人在回路要变成可运营的机制
人在回路不能停留在口号,否则要么形同虚设,要么让代理彻底失去价值。合理做法是按风险分级:低风险动作自动放行并留痕,中风险动作抽样复核,高风险动作必须人工确认。同时把审批本身做成产品化流程,明确谁批、批什么、批完如何追责。这样人不再是瓶颈,而是最后一道可控闸门。
先收口,再放量
重建边界不必一步到位,但顺序不能颠倒。建议先盘点现有代理的凭证与工具权限,把能读写的范围收窄;再补齐身份、日志与审批链路;最后才考虑扩大自主范围。安全边界不是限制代理能力的枷锁,而是让企业敢于把更重要任务交给它的前提。