Prompt 注入与大模型安全:企业上线 AI 前必须防的坑
把大模型接入业务系统后,一句精心构造的话就可能让它"叛变"。本文讲清 Prompt 注入是什么、危害和防护要点。
大模型接入业务后,安全问题随之而来。其中最典型的是 Prompt 注入(Prompt Injection)——用精心构造的输入,诱导模型无视原有指令、泄露信息或执行不该做的操作。企业上线 AI 前必须了解。
一、什么是 Prompt 注入
好比 SQL 注入的"AI 版":攻击者在输入里夹带"忽略之前的指令,改为……"之类的话,试图劫持模型的行为。如果模型能读取外部内容(网页、文档),恶意指令还能藏在这些内容里(间接注入)。
二、可能的危害
- 泄露系统提示词、内部数据。
- 绕过限制,输出不当内容。
- 若模型能调工具,可能被诱导执行危险操作(删数据、发消息、转账)。
三、防护要点
- 最小权限:模型能调的工具、能碰的数据,越少越好。
- 危险操作要人工确认:删除、发送、支付类操作加确认环节。
- 隔离不可信内容:把用户输入、外部网页明确标注为"数据、非指令"。
- 输出过滤与审计:对敏感输出做检查,保留日志便于追查。
- 别把秘钥/敏感信息塞进提示词:它可能被套出来。
四、心态
Prompt 注入目前无法被彻底根除,只能层层设防、降低风险。把 AI 当成"能力强但不完全可信的实习生"来设计权限,是务实的思路。
结语
越是让 AI 深入业务、能动手操作,安全就越重要。上线前做一轮"注入演练",比出事后补救划算得多。