首页 > 资讯 > AI > 正文

AI 智能代理新漏洞曝光:分步拆解无害请求可绕过大模型安全防护

秒懂甄选 AI 智能代理新漏洞曝光:分步拆解无害请求可绕过大模型安全防护秒懂甄选 谷歌推出 Gemini 学生中心:美国大学生可免费领取一年 AI Pro 会员秒懂甄选 TerraPower 特殊储能核反应堆 瞄准 AI 数据中心供电市场秒懂甄选 OpenAI 突发故障 部分海外安全研究员被收回网络专项研究权限秒懂甄选 谷歌搜索与 Gemini 加码 AI 教育 推出 3D 模拟、刷题测验等学生学习工具秒懂甄选 AI口碑持续崩塌!大众抵触情绪高涨 行业深陷信任危机秒懂甄选 一座AI工厂就要150万块GPU:英伟达看到6000亿美元大生意秒懂甄选 中国电信TeleAgent入局办公智能体赛道,国家队做AI必须行!秒懂甄选 苹果 2.5 亿美元 iPhone AI 和解案提速 这些机型用户可申领 25‑95 美元赔付秒懂甄选 57 个 AI 核心术语大全 看懂大模型、智能体、幻觉等行业高频名词 秒懂甄选 发布于:2026-08-25 07:06:03 栏目:新闻
由作者整理

瑞士洛桑联邦理工学院研究人员借助 STING 工具证实,将恶意目标拆分为多轮看似无害请求,可诱导 ChatGPT 等主流 AI 执行被拒绝操作。多步攻击成功率更高,中途切换语言还会提升攻击效果,研究呼吁安全机制应嵌入 AI 底层设计。

如果你让 AI 智能代理去盗取账号,它几乎一定会拒绝,但洛桑联邦理工学院的研究人员刚刚证实,存在一种更简单的入侵方式,该方式依靠耐心而非专业技术。这项新研究表明,把恶意目标拆解成听起来无危害的细碎请求,就能够欺骗 AI 智能代理,完成它们原本会直接拒绝的任务(消息来源:TechXplore)。
AI

这与近期的 “Bioshocking” 漏洞利用事件如出一辙,该漏洞中 AI 浏览器被诱导,将窃取凭证行为视作一场无害游戏的环节。

研究人员如何发现该安全缺陷

该团队开发了一款名为 STING 的自动化测试工具,全称是非法 N 步目标执行序列测试,用来模拟真实攻击者的操作模式。STING 不会直接提出恶意目标,而是提前规划,将恶意目标拆解为一系列看似无害的小步骤,通过多轮对话逐步达成恶意目的。
Meta

资料来源:《过犹不及:多轮多语言大模型智能代理中的非法协助行为测评》

研究人员针对 176 种恶意场景,对 ChatGPT、Gemini 以及 Claude 等主流 AI 模型开展测试。所有被测 AI 代理均开启工具调用能力,可实现网页浏览、发送邮件以及处理多步骤任务。

循序渐进的多轮诱导攻击,成功率远高于直白的单次提示词攻击。部分场景下,把恶意请求拆分为小步骤后,模型执行恶意任务的概率直接翻倍。该结论和其他相关研究结论吻合:普通用户仅凭精心措辞的提示词,就能够绕过 AI 安全防护护栏。

该漏洞的现实意义

研究人员提出的安全隐患并非假想风险。Meta 在 6 月就承认,攻击者并未使用恶意软件或黑客工具,仅依靠简单社会工程学手段,就欺骗旗下 AI 客服助手,非法获取 Instagram 账号访问权限。

Meta

研究团队原本预判,在训练数据较少的语种环境中,攻击效果会更强。但实测显示,7 种被测语言下攻击完成率大体接近。仅存在一项特例:在多步攻击中途切换语言,攻击成功率会出现大幅上涨。

首席研究员阿尤什・库马尔・塔伦表示,安全测试需要前置开展,从智能代理的设计之初就内置安全机制。出问题之后再补加安全措施已经行不通,尤其当下 AI 系统正在不断获取更多现实场景操作能力。

468 点赞 +1 收藏 +1
推荐 手机 电脑 影像 硬件 数码 AI 5G 企业 出行 最新
二维码 回到顶部