STING框架揭示多轮对话可逐步诱使AI代理执行有害任务

作者:

在

来源: ICML 2026会议论文,arXiv预印本

研究开发STING自动化测试框架,将恶意目标分解为多轮看似无害的请求,逐步引导AI代理完成非法操作(如账户入侵)。测试显示,多轮攻击成功率可比单轮翻倍,且跨语言效果相似(语言切换反更危险)。研究强调AI安全需在设计早期嵌入,而非事后修补。