总目录 大模型安全研究论文整理 2026年版:https://blog.csdn.net/WhiffeYF/article/details/159047894
https://openreview.net/forum?id=FlnQlvkYR3
https://openreview.net/pdf?id=FlnQlvkYR3

ICML 2026 | LLM智能体技能层后门攻击
📄 背景
该论文题为SkillTrojan: Backdoor Attacks on Skill-Based Agent Systems,作者包括Yunhao Feng、Yifan Ding等,来自国防科技大学、阿里巴巴集团、复旦大学和武汉大学。该论文关注LLM智能体中的可复用Skill:它们封装代码、工具调用和工作流,形成新的执行层攻击面。
🔍 痛点
传统后门研究多盯着模型、训练数据、Prompt、Memory或Tool。该论文指出,若后门藏进Skill实现,底层模型无需修改,正常任务可保持,只检查最终回答就可能漏掉隐藏副作用。
🛠️ 方案
该论文提出SkillTrojan:把攻击载荷加密拆成碎片,分散嵌入正常Skill调用。只有触发条件出现、且一次工作流收集齐碎片后,才会重组并执行;未触发时维持原功能。用户结果可正确,恶意行为却在执行层发生。
💡 例子:
可以把它想成餐厅里的“分段暗号”。服务员各拿一小段,单看像普通备注;正常点餐时一切照常。只有特殊口令出现,且前菜、主菜、结账都完成,暗号才拼成完整指令。桌上的菜没问题,异常却藏在厨房流程里。
🚀 实验发现
① EHR SQL上,GPT-5.2-1211-Global的ASR达97.2%,clean ACC为89.3%;AgentPoison的ASR为58.3%。
② Qwen3Guard和Llama-Guard分别把98.2%和99.4%的SkillTrojan样本判为安全;取消加密与分片后仅3.4%和2.8%。
③ 碎片并非越多越好:N=3时ASR最高;过少更显眼,过多更易因流程未完成而缺片。
💡 总结
该论文的启示是:LLM Agent安全不能只审“模型说了什么”,还要审“Skill执行了什么”。Skill来源、权限、代码与执行轨迹都应纳入安全边界。该论文把后门研究推进到可复用执行层,为Skill生态供应链安全提供了新的评测视角。

这张图展示的是“基于 Skill 的 LLM 智能体执行模型”。中心是 LLM,负责迭代推理;外围主要分成三类能力:规划(Planning)、记忆(Memory)和工具执行(Tool Execution)。智能体不会只靠 LLM 直接完成任务,而是会调用 Planner Skill、Search Skill、Code Skill、Memory Skill、Execution Skill 等可复用技能,完成任务拆解、上下文召回、代码解释、网页搜索、API 调用等操作。也就是说,Skill 相当于给 LLM 配上的一组“专业工具模块”。
该论文强调的风险在最外层红色虚线所示:SkillTrojan 可以把恶意载荷拆成多个加密碎片 frag-1、frag-2、frag-3,并分别隐藏在不同 Skill 的正常执行过程中。平时这些 Skill 看起来都能正常工作;只有当预设 Trigger 被触发后,智能体按照正常流程组合并调用多个 Skill,这些碎片才会被逐步收集、重组为完整 payload,最后执行恶意操作。关键点是,单独检查某一个 Skill 可能看不出问题,危险行为是多个 Skill“组合起来”后才出现。
因此,这张图想说明:LLM Agent 的安全边界已经不只是模型本身,还包括整个 Skill 层。即使 LLM、Prompt 和最终回答都看起来正常,攻击仍可能通过 Skill 执行链产生隐藏副作用。该论文据此指出,安全检测不能只看“模型说了什么”,还需要检查“调用了哪些 Skill、Skill 之间如何组合,以及执行过程中发生了什么”。

这张图把 SkillTrojan 的攻击流程拆成了四层:用户层、智能体推理层、Skill 执行层,以及副作用执行层。用户原本只是让智能体“分析 data.csv 并总结”,LLM 会先规划任务、选择工具,再调用代码、数据库、网络等第三方 Skill。对于普通查询,这些 Skill 只返回正常结果;而当查询中出现预设 Trigger 时,被植入后门的 Skill 会在正常执行的同时,额外释放加密的 Fragment #1、#2、#3。整个过程仍嵌在正常工具调用链里,因此从用户视角看,智能体依然能返回正常的 Summary Report。
右侧展示了后门真正生效的关键:验证模块会检查这一轮执行中是否已经收集齐全部碎片,而且这种检查与调用顺序无关,只要碎片集合完整即可。随后系统将这些碎片重组、解密成完整 Payload,并作为“隐藏副作用”执行,最后再清理中间痕迹。也就是说,恶意行为不是靠某一次明显异常的工具调用完成,而是借助多个看似正常的 Skill 在一次完整工作流中“拼图式”完成。
该图最重要的结论是:SkillTrojan 可以同时维持“表面正常”和“后台恶意”两条执行路径。用户看到的答案可能完全正确,但执行层已经发生了额外的恶意操作。因此,该论文强调,对 LLM Agent 的安全检测不能只检查最终文本输出,还必须审计 Skill 来源、工具调用轨迹、碎片化异常信息以及执行产生的副作用。
一、引言(Introduction)
基于技能(Skill)的抽象如今已成为智能体系统中一种常见的设计模式(Li et al., 2025b; Wang et al., 2025; Zheng et al., 2025b)。与直接输出底层动作不同,智能体会调用并组合可复用的技能,这些技能封装了过程逻辑、工具调用和执行工作流。这种设计提升了模块化程度和可扩展性,并构成了当前广泛使用的智能体框架以及新兴技能市场的重要基础。在实际应用中,技能通常能够执行代码、维护内部状态并介导对外部资源的访问,因此非常适合作为可复用和快速部署的功能单元。然而,正是这些特性使系统将大量信任集中在技能实现本身,并将智能体的攻击面扩展到了仅从模型输入—输出行为中无法推断的范围(Liu et al., 2024; Li, 2026)。
针对基于 LLM 的智能体,已有后门研究主要集中在操纵某个控制通道,例如模型本身(通过数据投毒或参数修改)、提示词与规划上下文,或者智能体的工具/记忆接口,使得某个触发条件能够诱导恶意行为,同时在干净任务上维持正常性能(Li et al., 2024; 2025c; Xiang et al., 2024; Chen et al., 2024; Feng et al., 2026)。尽管研究视角已经有所扩展,但现有的大多数评估与防御方法(Zhang et al., 2024; Cheng et al., 2025; 2024; Zheng et al., 2025a)仍然主要关注模型可观察到的行为,或者孤立地分析特定交互界面,例如提示词、工具和记忆。基于技能的智能体系统则引入了一个截然不同、且尚未得到充分研究的控制位置:可复用的技能实现。这些技能封装了可执行逻辑,并能够跨任务、跨用户和跨部署长期存在。由于技能所介导的是“执行”而非高层推理,因此,一旦一个被广泛采用的技能遭到破坏,它便可能在底层模型、提示词和工具集合均保持不变的情况下,悄无声息地影响大量下游执行过程。如图 1 所示,这种解耦关系创造了一种新的后门攻击向量:恶意逻辑可以被嵌入外观正常的技能中,并通过标准的技能组合过程被激活。由于技能通常被当作可信的模块化组件,其内部行为很少像模型输出那样受到严格审计,这使得当前智能体安全假设中存在一个关键盲区。
在该论文中,作者提出 SkillTrojan,这是一种针对智能体系统“技能抽象层”的后门攻击范式。据作者所知,该论文是首个系统性地在可复用技能实现中植入并评估后门的工作,而不是将后门放置在模型参数、提示词或者工具与记忆接口中。SkillTrojan 将攻击者指定的载荷直接嵌入技能,并将其拆分成多个加密碎片,分散在若干看似正常的技能调用中。只有当预定义触发条件满足时,载荷才会被重新构建并执行,因此受感染的技能在日常评估和正常使用过程中可以保持休眠状态。由于底层模型本身没有发生变化,而且干净任务性能在很大程度上得到保留,这类攻击很难通过基于行为的测试方式检测出来。SkillTrojan 不仅是一种单独的攻击方法,同时还是一个通用且可扩展的框架。它支持多种定向攻击载荷,并能够基于任意技能模板自动合成带后门的技能,从而促进后门在不同智能体流水线和技能生态中的规模化传播。作者在具有代表性的代码型智能体环境中,对开放权重模型和闭源权重模型均进行了评估,结果表明 SkillTrojan 能够持续获得较高的攻击成功率,同时对干净任务准确率的影响很小。为了支持可复现实验以及后续研究,作者还发布了一个包含 3000 多个精心构建的后门技能的数据集,覆盖多种技能类型、触发条件和载荷配置。总体而言,这些结果揭示了现代基于技能的智能体架构中一个关键但此前研究不足的安全漏洞。该论文主要有以下三点贡献:
• 作者提出 SkillTrojan,这是首个面向智能体系统技能抽象层的后门攻击范式。与修改模型参数、提示词或工具/记忆接口不同,它直接将恶意逻辑植入可复用的技能实现中。
• 作者提出了一个通用且可扩展的技能级后门框架,支持加密载荷分片、基于触发器的激活,以及从任意技能模板中自动合成后门技能,从而能够在不同智能体流水线和技能生态系统中实现规模化攻击。
• 作者在现实的代码型智能体环境中,对开放权重和闭源权重模型进行了实证评估,结果表明 SkillTrojan 可以在对干净任务准确率影响很小的情况下持续实现较高的攻击成功率,例如在 GPT-5.2-1211-Global 上达到 97.2% 的 ASR。同时,作者发布了一个包含 3000 多个精心构建的后门技能的数据集,以支持可复现研究。
利益冲突披露。部分作者任职于阿里巴巴集团。该研究评估了多个商业模型和开放权重模型,其中包括由阿里巴巴开发的 Qwen 系列模型。论文中对评估协议、评价指标以及比较方法均进行了说明。
二、实验(Experiments)
5.1 实验设置(Experimental Setup)
作者在基于代码的技能执行环境中评估 SkillTrojan。每个 Skill 以软件包的形式分发,其中包含:(i)自然语言描述文件 Skill.md;(ii)可执行的工具脚本。给定一个用户查询后,智能体根据技能描述选择并组合工具,通过执行这些工具完成任务,同时记录完整的工具调用与工具输出轨迹。SkillTrojan 会在部分工具中植入后门,使这些工具只有在触发谓词成立时才释放加密的载荷碎片。随后,一个指定的验证工具会收集这些碎片、重构载荷、进行解密,并在同一次智能体运行过程中执行该载荷。具体而言,如无特别说明,实验使用的投毒比例 ρ=0.2,碎片数量 N=3,并采用 XOR+Base64 进行轻量级加密/编码(Josefsson, 2006)。作者通过在原始自然语言查询中插入触发短语来构造投毒查询;干净查询满足 Trigτ(q)=0,而投毒查询满足 Trigτ(q)=1。
数据集与模型。作者采用的主要端到端基准是 EHR SQL 任务:给定一个自然语言形式的临床查询,智能体利用技能工具组合生成 SQL,并在电子健康记录(EHR)数据库上执行。作者采用 LLM-as-a-judge 协议,通过比较 SQL 实际执行结果与预期结果来判断回答是否正确。该基准同时衡量两个方面:(i)功能性任务完成情况,即干净任务准确率;(ii)在触发输入下,恶意副作用是否能够被可靠执行,即攻击是否成功。作者同时在开放权重和闭源权重 LLM 上评估 SkillTrojan,并使用表 1 和表 2 中相同的一组模型。开放权重模型包括 GLM-4.7、Qwen3-Coder、GLM-4.6 和 Qwen3-VL-235B-A22B-Instruct;闭源权重模型包括 GPT-4o-Mini-0718-Global、Claude-Haiku-4.5、Claude-Sonnet4.5、Qwen3-Max 和 GPT-5.2-1211-Global。在所有实验中,模型都作为智能体的策略模型,负责规划、工具选择和中间推理,而不同模型之间使用完全相同的技能实现和评估协议。
基线方法。作者将具有竞争力的、以提示词或模型为中心的越狱攻击和智能体投毒基线适配到相同的基于技能的智能体环境中,包括 GCG、AutoDAN、CPA、BadChain 和 AgentPoison(Zou et al., 2023; Liu et al., 2023; Zhu et al., 2023; Chen et al., 2024; Zhong et al., 2023)。所有基线方法均采用与 SkillTrojan 相同的触发器插入流程、投毒比例以及工具环境进行评估。
干净技能基线。为了将技能本身带来的正常功能收益与后门行为区分开来,作者额外评估了一个干净技能基线,记为 SKILLS (NATIVE)。在该设置下,智能体安装与 SkillTrojan 相同的技能软件包,但这些技能不包含任何触发逻辑、载荷碎片或验证产生的副作用。该基线与 NON-ATTACK 不同:NON-ATTACK 表示智能体完全没有安装这套技能栈,而 SKILLS (NATIVE) 表示智能体安装了 SkillTrojan 所使用技能的正常版本。通过这一对比,作者能够判断干净任务性能的提升究竟来源于技能本身的正常功能,还是来源于后门机制。
评价指标。作者报告干净任务准确率(ACC)和攻击成功率(ASR)。ACC 指在干净查询中,根据 SQL 执行结果判断为正确的查询比例。ASR 指在投毒查询中,载荷成功完成重构并执行的比例,其成功与否通过验证工具返回的显式执行标记进行判断,同时使用一个确定性的执行副作用进行交叉验证。
额外基准(SWE-Bench Verified)。为了确保实验发现并非仅适用于结构化 SQL 生成,作者还在 SWE-Bench Verified 软件工程任务中部署了相同的攻击流水线,采用相同的触发机制和评估协议,只是将任务评价指标替换为该基准经过验证的、基于测试的判定标准。由于篇幅限制,SWE-Bench Verified 的实验结果放在附录 B 中。
主要结果。表 1 和表 2 汇总了 EHR SQL 上的端到端实验结果。总体来看,SkillTrojan 在获得较高 ASR 的同时,基本能够维持干净任务性能。这与该攻击的设计目标一致:碎片释放与验证过程被嵌入普通的技能工作流中,而在干净执行中,只要触发谓词为假,这些机制就不会被激活。
5.2 主要结果分析(Analysis of Main Results)
SkillTrojan 在保持正常任务效用的同时,实现了最强的端到端攻击效果。在开放权重和闭源权重两类模型中,相比 Non-Attack 条件,SkillTrojan 都能够获得较高的 ASR,同时基本维持干净任务 ACC,在部分设置下 ACC 甚至有所提升。例如,在 GPT-5.2-1211-Global 上,SkillTrojan 的 ASR 达到 97.2%,同时 ACC 保持在 89.3%,而 Non-Attack 的 ACC 仅为 73.0。在 Qwen3-Max 上,其 ASR 为 74.7%,ACC 为 86.6%。在开放权重模型上,SkillTrojan 同样保持有效,例如 GLM-4.6 上的 ASR 为 72.0%,ACC 为 81.3%。作者指出,SkillTrojan 保留了原始技能的功能行为和输出:植入后门的技能仍然返回与干净版本相同的正常输出。由于安装这些正常技能本身就可能提升该智能体环境中的任务完成能力,因此 SkillTrojan 条件下的 ACC 有可能高于 Non-Attack 条件。关于技能有效性的更多实验细节见附录 F。
随着“智能体—工具”执行能力增强,SkillTrojan 相对于提示词中心攻击方法的优势会进一步扩大。以提示词或对话为中心的攻击基线,例如 GCG、AutoDAN 和 AgentPoison,在工具执行环境中的表现相对不稳定,因为它们能否成功取决于模型是否选择遵循注入的指令模式;与此同时,更强的模型通常也具有更好的拒绝能力,或者对浅层提示词操纵具有更强的鲁棒性。相比之下,SkillTrojan 将恶意行为放置在智能体正常工作流中本来就会调用的可信工具执行过程里。因此,模型能力主要影响的是智能体能否完成预定工具链,而不是模型是否“同意”执行恶意请求。在更强的闭源权重模型上,这种差距尤其明显:GPT-5.2-1211-Global 上 SkillTrojan 的 ASR 达到 97.2%,而表 2 中表现最好的基线 AgentPoison 最高仅为 58.3%。更广泛地看,不同基线在不同模型上呈现出不同的失败模式:一些方法能够获得中等 ASR,但会明显降低 ACC,例如多个模型上的 CPA 和 AutoDAN;另一些方法则会随着模型变化迅速失去攻击成功率,例如 BadChain 在部分闭源权重模型上的 ASR 降至很低。相比之下,由于 SkillTrojan 建立在技能自身的执行语义之上,其表现更加稳定。
与其他竞争方法相比,SkillTrojan 实现了更加有利的 ACC–ASR 权衡。除了比较绝对攻击成功率之外,表 1 和表 2 还显示,不同方法在干净任务准确率和攻击成功率之间的权衡存在明显差异。一些基线攻击虽然提高了 ASR,但同时造成了显著的 ACC 下降,例如多个模型上的 CPA 和 AutoDAN;另一些方法虽然能够维持 ACC,但只能获得有限的 ASR。相比之下,在开放权重和闭源权重设置下,SkillTrojan 都能够持续处于“较高 ASR + 具有竞争力 ACC”的区域,说明在相同的智能体评估协议下,它能够取得更加有利的 ACC–ASR 权衡。
对防御与评估的启示。上述结果带来了两个实际启示。第一,在评估智能体系统中的后门攻击时,需要引入“执行感知”的评价指标:即使模型最终生成的文本答案看起来完全正常,攻击仍然可能通过副作用成功执行,因此真正有价值的安全信号可能隐藏在工具输出、工具调用顺序以及外部状态变化中。第二,有效的防御措施可能需要监控并约束执行轨迹,而不能只对输入进行清洗。例如,可以:(i)限制类似验证器的工具;(ii)审计触发输入下工具调用深度出现的异常增加;(iii)对工具输出强制执行来源验证,从而直接针对前述攻击瓶颈,即工作流完成和载荷重构过程。为了验证 SkillTrojan 的激活确实与普通技能组合保持一致,而不是依赖明显异常的行为,作者进一步分析了工具调用轨迹。图 3 给出了 EHR SQL 中干净查询与触发查询的工具调用次数分布。触发运行由于需要进行碎片释放和验证,工具使用量会出现幅度较小但较为系统的增加,不过整体仍然处于复杂 EHR 查询的正常运行范围内。这进一步支持了该论文的核心观点:SkillTrojan 可以嵌入现实的技能生态中,对正常任务性能产生的影响有限,同时在触发输入下仍具有较高的端到端可靠性。
基于扫描器的防御分析。作者进一步研究轻量级、基于 LLM 的技能扫描器能否在部署前检测到 SkillTrojan。实验随机抽取了大约 500 个技能,并让 Qwen3Guard-Gen-8B 和 Llama-Guard-3-8B 将每个技能分类为安全或不安全。表 3 报告了被分类为“安全”的技能比例。两个扫描器都能够以较高灵敏度检测出简单的、未进行分片的后门版本,但它们几乎无法区分完整的 SkillTrojan 与原生正常技能:在 SkillTrojan 样本中,Qwen3Guard-Gen-8B 和 Llama-Guard-3-8B 分别将 98.2% 和 99.4% 的样本判断为安全。这说明,对于经过加密和分片的技能级后门,简单的 LLM 静态扫描远远不够;更有针对性的防御方法需要联合考虑执行轨迹、来源信息、权限以及执行产生的副作用。
5.3 SkillTrojanX:后门技能数据集
作者发布了 SkillTrojanX,这是一个包含 3000 多个后门技能的数据集,这些技能由公共技能市场中真实且使用频率较高的技能模板构建而来。作者按照流行度抓取排名前 1200 的技能,并保留其中同时具有可执行组件和可解析规范文件的技能。每个被保留的模板首先被标准化为统一的技能格式,然后与自动生成的后门变体进行配对。对于每个变体,数据集中都会记录结构化元数据,其中包括触发短语、载荷类型、加密方式、碎片数量 N,以及负责释放碎片和进行验证的工具入口集合。SkillTrojanX 主要支持两种评估模式。第一,它能够在受控的“触发器—载荷”配置下,对技能级后门行为进行规模化测量,从而将发生在技能层的攻击与模型重新训练或数据投毒区分开来。第二,它提供了一个较为真实的语料库,可用于研究直接针对技能软件包的防御方式,例如技能组件静态分析、来源检查,以及正常工作流下的执行轨迹审计。表 4 总结了数据集的组成和覆盖范围,图 4 则展示了不同载荷类型在主要技能模板类别中的分布情况。
5.4 消融实验(Ablation Studies)
作者对 SkillTrojan 构造过程中的关键设计选择进行消融实验,以分析哪些因素决定 ACC–ASR 之间的权衡。如无特别说明,实验固定底层模型、EHR SQL 数据划分、触发短语以及一个具有代表性的副作用载荷,每次只改变一个因素,同时保持技能模板和评估协议不变。在所有消融实验中,ACC 均在干净样本子集上计算,而 ASR 则在投毒样本子集上计算。
碎片数量 N。载荷分片需要在“单个工具的可疑程度”“工作流能否完整执行”和“载荷重构可靠性”三者之间进行权衡。当 N 太小时,每个工具输出中必须携带更大的载荷碎片。在实际运行中,这会使中间消息中的异常编码内容更加明显,使智能体更容易偏离预期工作流,例如跳过验证步骤或重写输出,从而导致 ASR 下降。当 N 太大时,攻击激活则受到执行轨迹完整性的限制:智能体需要调用更多携带碎片的工具,并且必须在同一次运行中顺利执行到验证阶段,因此漏掉至少一个碎片、导致重构失败的概率会增加。图 5 呈现出明显的单峰趋势:中等程度的分片,即 N=3 时 ASR 最高,而在两端都出现下降。在不同 N 取值下,ACC 始终保持稳定,这说明碎片数量主要影响的是隐藏副作用的激活路径,而不会明显影响 SQL 求解能力。
加密方式与启发式可见性。加密方式会改变碎片的表示形式,但理论上不应影响技能执行的控制逻辑。表 5 验证了这一点:将 XOR+Base64 替换为混合加密方案后,ACC 和 ASR 基本保持不变,ACC 仅相差 0.1 个百分点,ASR 仅相差 0.3 个百分点。然而,不同加密方法会显著改变简单静态启发式方法的检测能力。一个针对 Base64 字符串的检测器在 XOR+Base64 条件下能够标记 78% 的中间工具输出,而在混合方案下这一比例下降到 21%。该结果说明,基于固定特征或签名的扫描方法具有较强脆弱性:只需要改变编码表示方式,就可能大幅降低简单检测器的有效性,而攻击本身的可靠性基本不受影响。

449

被折叠的 条评论
为什么被折叠?



