来源: ICML 2026会议论文,arXiv预印本
研究开发STING自动化测试框架,将恶意目标分解为多轮看似无害的请求,逐步引导AI代理完成非法操作(如账户入侵)。测试显示,多轮攻击成功率可比单轮翻倍,且跨语言效果相似(语言切换反更危险)。研究强调AI安全需在设计早期嵌入,而非事后修补。
来源: ICML 2026会议论文,arXiv预印本
研究开发STING自动化测试框架,将恶意目标分解为多轮看似无害的请求,逐步引导AI代理完成非法操作(如账户入侵)。测试显示,多轮攻击成功率可比单轮翻倍,且跨语言效果相似(语言切换反更危险)。研究强调AI安全需在设计早期嵌入,而非事后修补。