如果你让 AI 智能代理去盗取账号,它几乎一定会拒绝,但洛桑联邦理工学院的研究人员刚刚证实,存在一种更简单的入侵方式,该方式依靠耐心而非专业技术。这项新研究表明,把恶意目标拆解成听起来无危害的细碎请求,就能够欺骗 AI 智能代理,完成它们原本会直接拒绝的任务(消息来源:TechXplore)。
这与近期的 “Bioshocking” 漏洞利用事件如出一辙,该漏洞中 AI 浏览器被诱导,将窃取凭证行为视作一场无害游戏的环节。
研究人员如何发现该安全缺陷
该团队开发了一款名为 STING 的自动化测试工具,全称是非法 N 步目标执行序列测试,用来模拟真实攻击者的操作模式。STING 不会直接提出恶意目标,而是提前规划,将恶意目标拆解为一系列看似无害的小步骤,通过多轮对话逐步达成恶意目的。
资料来源:《过犹不及:多轮多语言大模型智能代理中的非法协助行为测评》
研究人员针对 176 种恶意场景,对 ChatGPT、Gemini 以及 Claude 等主流 AI 模型开展测试。所有被测 AI 代理均开启工具调用能力,可实现网页浏览、发送邮件以及处理多步骤任务。
循序渐进的多轮诱导攻击,成功率远高于直白的单次提示词攻击。部分场景下,把恶意请求拆分为小步骤后,模型执行恶意任务的概率直接翻倍。该结论和其他相关研究结论吻合:普通用户仅凭精心措辞的提示词,就能够绕过 AI 安全防护护栏。
该漏洞的现实意义
研究人员提出的安全隐患并非假想风险。Meta 在 6 月就承认,攻击者并未使用恶意软件或黑客工具,仅依靠简单社会工程学手段,就欺骗旗下 AI 客服助手,非法获取 Instagram 账号访问权限。

研究团队原本预判,在训练数据较少的语种环境中,攻击效果会更强。但实测显示,7 种被测语言下攻击完成率大体接近。仅存在一项特例:在多步攻击中途切换语言,攻击成功率会出现大幅上涨。
首席研究员阿尤什・库马尔・塔伦表示,安全测试需要前置开展,从智能代理的设计之初就内置安全机制。出问题之后再补加安全措施已经行不通,尤其当下 AI 系统正在不断获取更多现实场景操作能力。
¥1699
Apple/苹果 iPhone 17 Pro Max 512GB 银色 支持移动联通电信5G 双卡双待手机
vivo iQOO 15 Ultra 16GB+512 2049(银色)冰穹散热风扇 2K三星珠峰屏 电竞手机iqoo15ultra 国家补贴
OPPO Find X9 Ultra 12GB+256GB 极地冰川 10倍光变天眼长焦 长续航 游戏 5G 拍照摄影旗舰手机新机