AI 智能代理新漏洞曝光:分步拆解无害请求可绕过大模型安全防护
谷歌推出 Gemini 学生中心:美国大学生可免费领取一年 AI Pro 会员
TerraPower 特殊储能核反应堆 瞄准 AI 数据中心供电市场
OpenAI 突发故障 部分海外安全研究员被收回网络专项研究权限
谷歌搜索与 Gemini 加码 AI 教育 推出 3D 模拟、刷题测验等学生学习工具
AI口碑持续崩塌!大众抵触情绪高涨 行业深陷信任危机
一座AI工厂就要150万块GPU:英伟达看到6000亿美元大生意
中国电信TeleAgent入局办公智能体赛道,国家队做AI必须行!
苹果 2.5 亿美元 iPhone AI 和解案提速 这些机型用户可申领 25‑95 美元赔付
57 个 AI 核心术语大全 看懂大模型、智能体、幻觉等行业高频名词 秒懂甄选 发布于:2026-08-25 07:06:03 栏目:新闻 瑞士洛桑联邦理工学院研究人员借助 STING 工具证实,将恶意目标拆分为多轮看似无害请求,可诱导 ChatGPT 等主流 AI 执行被拒绝操作。多步攻击成功率更高,中途切换语言还会提升攻击效果,研究呼吁安全机制应嵌入 AI 底层设计。
如果你让 AI 智能代理去盗取账号,它几乎一定会拒绝,但洛桑联邦理工学院的研究人员刚刚证实,存在一种更简单的入侵方式,该方式依靠耐心而非专业技术。这项新研究表明,把恶意目标拆解成听起来无危害的细碎请求,就能够欺骗 AI 智能代理,完成它们原本会直接拒绝的任务(消息来源:TechXplore)。
这与近期的 “Bioshocking” 漏洞利用事件如出一辙,该漏洞中 AI 浏览器被诱导,将窃取凭证行为视作一场无害游戏的环节。
研究人员如何发现该安全缺陷
该团队开发了一款名为 STING 的自动化测试工具,全称是非法 N 步目标执行序列测试,用来模拟真实攻击者的操作模式。STING 不会直接提出恶意目标,而是提前规划,将恶意目标拆解为一系列看似无害的小步骤,通过多轮对话逐步达成恶意目的。
资料来源:《过犹不及:多轮多语言大模型智能代理中的非法协助行为测评》
研究人员针对 176 种恶意场景,对 ChatGPT、Gemini 以及 Claude 等主流 AI 模型开展测试。所有被测 AI 代理均开启工具调用能力,可实现网页浏览、发送邮件以及处理多步骤任务。
循序渐进的多轮诱导攻击,成功率远高于直白的单次提示词攻击。部分场景下,把恶意请求拆分为小步骤后,模型执行恶意任务的概率直接翻倍。该结论和其他相关研究结论吻合:普通用户仅凭精心措辞的提示词,就能够绕过 AI 安全防护护栏。
该漏洞的现实意义
研究人员提出的安全隐患并非假想风险。Meta 在 6 月就承认,攻击者并未使用恶意软件或黑客工具,仅依靠简单社会工程学手段,就欺骗旗下 AI 客服助手,非法获取 Instagram 账号访问权限。

研究团队原本预判,在训练数据较少的语种环境中,攻击效果会更强。但实测显示,7 种被测语言下攻击完成率大体接近。仅存在一项特例:在多步攻击中途切换语言,攻击成功率会出现大幅上涨。
首席研究员阿尤什・库马尔・塔伦表示,安全测试需要前置开展,从智能代理的设计之初就内置安全机制。出问题之后再补加安全措施已经行不通,尤其当下 AI 系统正在不断获取更多现实场景操作能力。
原创视频
文章
AI视频
热词

