LLM SECURITYS
LLM security8.5 分
PlanFlip 揭示智能体规划阶段攻击
一篇新的 arXiv 论文提出了 PlanFlip,这是一个针对多智能体 LLM 系统规划阶段的提示注入攻击框架。作者在 3,479 个测试回合和九个前沿模型上评估后报告称,注入到规划器上下文中的内容可以通过级联放大破坏下游执行器和审查器的行为。 这项工作很重要,因为许多生产级智能体系统采用规划器、执行器和审查器模式,并假设更强的模型或额外的审查智能体会提升安全性。PlanFlip 挑战了这一假设,因为研究显示模型能力可能放大脆弱性,而使用同一模型骨干的冗余审查可能无法发现被篡改的计划。 PlanFlip 包含四种攻击:目标替换、优先级反转、上下文污染和角色混淆,并且都伪装成看似合理的工具输出来规避关键词过滤。论文报告称 GPT-5 的攻击成功率最高,达到 0.68;DeepSeek-R1 在所有攻击中的 StepShift 为 0.00;作者还提出了 GoalAnchorCheck 和 CrossAgentConsensus 两种防御方法,检测率最高达到 1.00。