大模型安全防护的常见误区
讨论大模型安全:Prompt 注入、越狱攻击与防御评估实践时,常见反模式、失败案例与修正方式常被写成一串工具或原则,读完仍不知道该先检查什么。更实用的起点是把当前任务限定下来:提示词、检索内容和工具返回值都可能是不可信输入。本文只谈可在授权范围内复核的做法。
反模式先还原输入如何越界
把涉及的对象列成清单:不可信文本、工具权限、模型输出和外部数据源。对每项补上来源、修改者、依赖关系和失败后的影响。这里不追求面面俱到;先选一条真实流程,才能分清哪些观察是事实,哪些只是猜测。
围绕“常见反模式、失败案例与修正方式”安排工作
第一类反模式是把不可信输入直接交给高权限组件处理。修正方式是先做结构校验、权限判断和最小化转换,再决定是否执行。
第二类反模式是用全局开关掩盖局部问题。更稳妥的做法是限定影响范围,保留审计,并为临时绕过设置到期时间。
第三类反模式是只记录成功路径。测试和监控应覆盖拒绝、超时、降级和恢复,才能验证系统在压力下仍按设计工作。
留下能复查的记录
记录至少应包含:本次范围与授权前提、输入或样本的来源、环境和版本、预期结果、实际观察,以及下一步由谁处理。还要核对:模型是否被允许调用工具以及调用参数是否经过校验。对于大模型安全:Prompt 注入、越狱攻击与防御评估实践,可保留的证据包括:策略决策、工具调用记录、拒绝原因与脱敏后的请求关联标识。
防住一种提示不等于防住注入
不应把模型生成的文字直接当作执行指令。如果材料不足,结论可以停在“尚待验证”;把未知项列出来,比用概括性的成功或失败更诚实。下一次变更时,沿用同一份记录即可判断原来的前提是否还成立。