一句“忽略以上指令“,为什么能让所有AI都翻车?

梅雅达编程笔记 2026-09-10 12:02:03

https://blog.csdn.net/2601_96428997/article/details/164755989?spm=1001.2014.3001.5501

写到这里,你可能会觉得:这也太防不胜防了。

确实。Prompt注入之所以是OWASP LLM Top 10的第一名,而且2023和2025连续两版都稳居第一,就是因为它不是一个可以"修好"的Bug。它是大模型的原生属性——只要模型用自然语言做指令和数据的统一载体,注入就永远存在。

但这也不是什么新鲜事。回想一下SQL注入,二十多年了,现在还在OWASP Top 10里。我们从来没有"解决"SQL注入,我们只是学会了和它共存——用预编译语句、用ORM、用权限控制、用WAF。

Prompt注入也是一样。它不会消失,但我们可以通过好的架构设计,把风险控制在可接受的范围内。

核心思路就三条:

第一,别指望模型自己能分清指令和数据。 它分不清。只要你把用户输入和系统指令放在同一个上下文里,就永远有被注入的可能。你要做的是通过架构和权限来兜底,而不是靠模型自觉。

第二,别指望一层防御能挡住所有攻击。 关键词过滤会被绕过,输入分隔会被绕过,输出检测也会被绕过。必须分层防守,每层拦住一部分,叠起来才能达到可用的安全级别。

第三,最重要的不是"防住注入",而是"注入之后炸不了"。 权限最小化是所有防御里性价比最高的一条。把爆炸半径控制住,比在输入侧跟攻击者玩猫鼠游戏有意义得多。

回到开头那个"忽略以上指令"。两年前它是个新奇玩具,今天它是一个完整的攻击门类,从文本到图片、从直接输入到间接投毒,手法越来越多,也越来越隐蔽。两年后呢?可能会有更多我们今天想都想不到的注入方式。

但技术就是这样——攻击和防御永远在互相追赶。我们能做的,就是比攻击者多走一步。

毕竟,你的AI值不值得保护,你自己心里最清楚。
————————————————
版权声明:本文为CSDN博主「梅雅达编程笔记」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。
原文链接:https://blog.csdn.net/2601_96428997/article/details/164755989

...全文
92 回复 打赏 收藏 举报
写回复
用AI写文章
回复
切换为时间正序
请发表友善的回复…
发表回复

355,908

社区成员

发帖
与我相关
我的任务
社区描述
桃花键神(云原生成长)社区,旨在为大家提供一个文明交流,互相探讨技术的环境,希望打造成高质量的云原生领域社区,欢迎各位大佬加入。
java设计模式开发语言 个人社区 广东省·深圳市
社区管理员
  • 桃花键神
  • 潮.eth
  • 小冷coding
加入社区
  • 近7日
  • 近30日
  • 至今
社区公告

无

试试用AI创作助手写篇文章吧