攻防升级:从“越狱”到提示注入
2026年,大模型从“会聊天”走向“能办事”,接入搜索、代码、数据库和业务系统后,攻击面明显扩大。越狱与提示注入不再是孤立概念,而是常被组合成攻击链。
前者诱导模型绕过安全策略,后者把恶意指令藏进输入或外部数据。一旦模型被操控,轻则输出不当内容,重则泄露隐私、越权调用工具,甚至影响现实业务。
越狱的本质:对齐边界被绕过
越狱并不需要修改模型权重,攻击者常借助角色扮演、多轮铺垫、编码变形和隐喻表达,逐步试探安全边界。模型在复杂语境中可能误判意图,把违规请求当作创作或研究任务。
关键词过滤只能拦住显式攻击,对语义变体效果有限。更稳妥的思路是结合意图识别、风险分级和策略约束,让模型在不确定时选择拒绝或请求澄清。
提示注入的入口:数据与指令混淆
提示注入多发生在模型读取外部内容时,例如网页、PDF、邮件、代码注释和知识库。攻击者把“忽略之前指令”之类文本嵌入其中,诱导模型改变任务目标。
直接注入影响当前用户,间接注入则通过共享文档或缓存影响其他会话,隐蔽性更强。根本原因在于模型难以严格区分“数据”和“指令”,外部内容进入上下文后可能获得不该有的控制力。
纵深防御:输入、模型、输出与工具四层
输入层应做来源标记、内容隔离和可疑指令检测,避免不可信文本直接进入系统提示。模型层可通过对齐训练、系统提示加固和上下文最小化,降低被诱导的概率。
输出层要审查敏感信息、危险建议和越权动作;工具层则需最小权限、参数校验、频率限制和操作审计。单点防护难以覆盖完整攻击链,多层叠加才能提高攻击成本。
智能体时代:权限最小化与人类确认
当大模型接入邮件、数据库、支付和运维工具,提示注入可能直接转化为真实操作。攻击者不必攻破系统,只需让智能体“自愿”执行错误指令。
因此,智能体应遵循最小权限原则,只授予临时且必要的权限,并对删除、转账、外发数据等高风险动作设置二次确认。人类审批、强身份验证和操作回滚机制,能显著降低损失。
持续对抗:红队、监控与治理
安全不是一次性配置,而是持续对抗。企业可定期开展红队测试,模拟越狱、注入和工具滥用场景,发现策略盲区;同时监控异常调用、上下文突变和权限提升信号。
治理层面需明确责任边界,记录关键决策日志,并在模型更新、插件变更后重新评估风险。只有技术、流程与人员协同,才能应对不断演化的攻击手法。