云霞资讯网

惊呆了!AI被喂了假记忆,然后开始说谎……

安全圈有个案子,我到现在想起来还后背发凉。

2024 年 9 月,一位安全研究员公开了某知名 AI 助手"长期记忆"功能的一个隐患:攻击者根本不用碰你的账号密码,只需要诱导 AI 读一个网页、或者打开一份文件——里面藏着一段人眼看不见的指令。

AI 读到了,照做了,然后把这段恶意指令永久写进了自己的长期记忆里。

从那一刻起,你之后所有的对话,都会被静默回传到攻击者的服务器。

你不会收到任何提示。AI 看起来一切正常,照常回答问题,照常帮你写方案。

但它的"大脑"里,已经埋了一条暗道。

我觉得这个案子最可怕的地方,不在于"数据被偷了"。
而在于——一次污染,长期生效。

传统攻击是"入侵、窃取、撤离",是一次性的。但记忆投毒不一样,它把自己变成了 AI 认知的一部分。AI 不觉得那是攻击,它觉得那是"我知道的一件事"。

你换了话题,它记得。你开了新对话,它还记得。

你以为你在跟一个 AI 助手聊天,其实你在跟一个被劫持的 AI 助手聊天。

更麻烦的是,现在越来越多团队在做 Agent。Agent 要干活,就必须有记忆——记住偏好、记住上下文、记住任务进度。

记忆,正在成为 Agent 时代最新、也最容易被忽视的攻击面。

琢磨下来,这件事的本质其实很朴素:

我们花了大量精力去防"外面的人进来",却很少问一句——进来的东西,要不要先验一验真伪?

一个人说的话,你会本能判断可信度。但大多数系统对于写进长期记忆的内容是不设防的:来了就存,存了就信,信了就用。

谎言一旦存盘,整个系统都会跟着发疯。

所以真正的解法不是把门锁得更死,而是在东西进大脑之前,先架一台"测谎仪"——没有原文佐证的内容,在从短期记忆并入长期记忆之前,就应该被丢掉。

记忆按人隔开、每次读写都盖上签名、存进去之前先验真伪、一处发现脏数据全体丢弃——这套组合拳,才是能把风险掐死在摇篮里的思路。

具体怎么落地?右滑上面图片,四步给 AI 的记忆上把锁。

限时 30 天内送免费 Agent 安全扫描,Continuum 5 分钟扫描搞定开发文档 review // 代码扫描 // 渗透测试

#AI失控档案 #AI安全 #亚马逊云科技 #人工智能 #大模型