355,908
社区成员
发帖
与我相关
我的任务
分享https://blog.csdn.net/2601_96428997/article/details/164755989?spm=1001.2014.3001.5501
写到这里,你可能会觉得:这也太防不胜防了。
确实。Prompt注入之所以是OWASP LLM Top 10的第一名,而且2023和2025连续两版都稳居第一,就是因为它不是一个可以"修好"的Bug。它是大模型的原生属性——只要模型用自然语言做指令和数据的统一载体,注入就永远存在。
但这也不是什么新鲜事。回想一下SQL注入,二十多年了,现在还在OWASP Top 10里。我们从来没有"解决"SQL注入,我们只是学会了和它共存——用预编译语句、用ORM、用权限控制、用WAF。
Prompt注入也是一样。它不会消失,但我们可以通过好的架构设计,把风险控制在可接受的范围内。
核心思路就三条:
第一,别指望模型自己能分清指令和数据。 它分不清。只要你把用户输入和系统指令放在同一个上下文里,就永远有被注入的可能。你要做的是通过架构和权限来兜底,而不是靠模型自觉。
第二,别指望一层防御能挡住所有攻击。 关键词过滤会被绕过,输入分隔会被绕过,输出检测也会被绕过。必须分层防守,每层拦住一部分,叠起来才能达到可用的安全级别。
第三,最重要的不是"防住注入",而是"注入之后炸不了"。 权限最小化是所有防御里性价比最高的一条。把爆炸半径控制住,比在输入侧跟攻击者玩猫鼠游戏有意义得多。
回到开头那个"忽略以上指令"。两年前它是个新奇玩具,今天它是一个完整的攻击门类,从文本到图片、从直接输入到间接投毒,手法越来越多,也越来越隐蔽。两年后呢?可能会有更多我们今天想都想不到的注入方式。
但技术就是这样——攻击和防御永远在互相追赶。我们能做的,就是比攻击者多走一步。
毕竟,你的AI值不值得保护,你自己心里最清楚。
————————————————
版权声明:本文为CSDN博主「梅雅达编程笔记」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。
原文链接:https://blog.csdn.net/2601_96428997/article/details/164755989
355,908
社区成员
发帖
与我相关
我的任务
分享加载中
无
试试用AI创作助手写篇文章吧