《娜璋带你读论文》系列主要是督促自己阅读优秀论文及听取学术讲座,并分享给大家,希望您喜欢。由于作者的英文水平和学术能力不高,需要不断提升,所以还请大家批评指正,非常欢迎大家给我留言评论,学术路上期待与您前行,加油。
该系列将总结近年安全顶会中智能体安全、系统安全和恶意代码分析方向,以及大模型驱动的系统安全研究相关论文。本文主要以论文摘要和框架图形式呈现,也包括值得作者学习的图表及开源代码。本文将介绍NDSS2026 秋季录用的智能体安全和系统安全方向的文章。然而,传统恶意代码分析、系统安全等方向的论文越来越少,而大模型和智能体融入的论文越来越多,漏洞挖掘和越狱攻击仍是热门方向。总之,这些大佬的文章真心值得我们学习,希望本文对您有所帮助。
-
https://www.ndss-symposium.org/ndss2026/accepted-papers/?tx_post_tag=fall-cycle-2026
-
欢迎关注作者新建的『网络攻防和AI安全之家』知识星球

PS:标题中的星号表示与大模型和智能体相关。
文章目录
- *1. A Causal Perspective for Enhancing Jailbreak Attack and Defense
- 2. A Deep Dive into Function Inlining and its Security Implications for ML-based Binary Analysis
- *3. An LLM-Driven Fuzzing Framework for Detecting Logic Instruction Bugs in PLCs
- *4. Attention is All You Need to Defend Against Indirect Prompt Injection Attacks in LLMs
- *5. Beyond Jailbreak: Unveiling Risks in LLM Applications Arising from Blurred Capability Boundaries
- *6. Bleeding Pathways: Vanishing Discriminability in LLM Hidden States Fuels Jailbreak Attacks
- *7. Causal-Guided Detoxify Backdoor Attack of Open-Weight LoRA Models
- 8. Cease at the Ultimate Goodness: Towards Efficient Website Fingerprinting Defense via Iterative Mutual Information Minimization
- *9. Chimera: Harnessing Multi-Agent LLMs for Automatic Insider Threat Simulation
- *10. CtPhishCapture: Uncovering Credential-Theft-Based Phishing Scams Targeting Cryptocurrency Wallets
- *11. Decompiling the Synergy: An Empirical Study of Human–LLM Teaming in Software Reverse Engineering
- 12. Enhancing Semantic-Aware Binary Diffing with High-Confidence Dynamic Instruction Alignment
- *13. ExpShield: Safeguarding Web Text from Unauthorized Crawling and LLM Exploitation
- 14. From Noise to Signal: Precisely Identify Affected Packages of Known Vulnerabilities in npm Ecosystem
- *15. From Obfuscated to Obvious: A Comprehensive JavaScript Deobfuscation Tool for Security Analysis
- *16. Incident Response Planning Using a Lightweight Large Language Model with Reduced Hallucination
- *17. Indicator of Benignity: An Industry View of False Positive in Malicious Domain Detection and its Mitigation
- *18. IoTBec: An Accurate and Efficient Recurring Vulnerability Detection Framework for Black Box IoT Devices
- *19. Les Dissonances: Cross-Tool Harvesting and Polluting in Pool-of-Tools Empowered LLM Agents
- *20. NEXUS: Towards Accurate and Scalable Mapping between Vulnerabilities and Attack Techniques
- *21. ObliInjection: Order-Oblivious Prompt Injection Attack to LLM Agents with Multi-source Data
- 22. PANDORA: Lightweight Adversarial Defense for Edge IoT using Uncertainty-Aware Metric Learning
- *23. ProtocolGuard: Detecting Protocol Non-compliance Bugs via LLM-guided Static Analysis and Dynamic Verification
- 24. ropbot: Reimaging Code Reuse Attack Synthesis
- *25. SACK: Systematic Generation of Function Substitution Attacks Against Control-Flow Integrity
- 26. Time will Tell: Large-scale De-anonymization of Hidden I2P Services via Live Behavior Alignment
- 27. TIPSO-GAN: Malicious Network Traffic Detection Using a Novel Optimized Generative Adversarial Network
- 28. vSim: Semantics-Aware Value Extraction for Efficient Binary Code Similarity Analysis
- 总结
*1. A Causal Perspective for Enhancing Jailbreak Attack and Defense
标题: 从因果视角增强大语言模型越狱攻击与防御
作者: Licheng Pan(Zhejiang University)、Yunsheng Lu(University of Chicago)、Jiexi Liu(Alibaba Group)、Jialing Tao(Alibaba Group)、Haozhe Feng(Zhejiang University)、Hui Xue(Alibaba Group)、Zhixuan Chu(Zhejiang University)、Kui Ren(Zhejiang University)
方向: 大语言模型越狱攻击与防御 & 因果发现(极其相关)
摘要:
揭示大语言模型(Large Language Models,LLMs)发生越狱攻击(Jailbreak)的内在机制,对于提升模型的安全性与可靠性具有重要意义。然而,现有研究主要通过分析模型的潜在表示来理解越狱提示词,往往忽略了具有明确语义和可解释性的提示词特征与越狱成功之间的因果关系。针对这一问题,本文提出 Causal Analyst,一种将大语言模型与数据驱动因果发现相结合的分析框架,用于识别导致模型越狱的直接原因,并进一步将发现的因果关系应用于越狱攻击增强和安全防御。作者构建了一个包含约 3.5万次越狱尝试的数据集,覆盖 7种大语言模型、100种攻击模板和50个有害查询,并为这些越狱提示标注了 37种人工设计且具有明确语义的提示词特征。
在此基础上,Causal Analyst 联合训练基于 LLM 的提示词编码模块和基于图神经网络(Graph Neural Network,GNN)的因果图学习模块,从而重建提示词特征与模型越狱响应之间的因果路径。研究发现,部分具有明确语义的提示词特征,如 Positive Character(正面角色) 和 Number of Task Steps(任务步骤数量),与越狱成功存在直接因果关系。
为了验证因果分析结果的实际价值,作者进一步设计了两个应用:其一是 Jailbreaking Enhancer,根据识别出的关键因果特征有针对性地调整越狱提示,从而增强已有越狱攻击;其二是 Guardrail Advisor,利用学习得到的因果图分析经过混淆或伪装的恶意查询,并识别其中潜在的恶意意图,从而辅助大语言模型安全防御。实验结果表明,Causal Analyst 能够较为稳定地识别与越狱行为直接相关的因果特征,并将这些因果知识有效应用于攻击和防御场景,为理解大语言模型越狱机制提供了一种具有较强可解释性的研究思路。



开源代码:
论文地址:
2. A Deep Dive into Function Inlining and its Security Implications for ML-based Binary Analysis
标题: 深入研究函数内联及其对基于机器学习的二进制分析的安全影响
作者: Omar Abusabha(Sungkyunkwan University)、Jiyong Uhm(Sungkyunkwan University)、Tamer Abuhmed(Sungkyunkwan University)、Hyungjoon Koo(Sungkyunkwan University)
方向: 二进制安全分析 & 编译器优化 & 机器学习安全
摘要:
函数内联(Function Inlining)是现代编译器中广泛使用的一种优化技术,通过在需要时使用被调用函数的函数体替换函数调用位置来提升程序性能。然而,这一优化也会显著改变机器指令、控制流图等静态特征,而这些特征恰恰是二进制分析的重要基础。尽管函数内联被广泛使用,其对基于机器学习的二进制安全分析所产生的安全影响仍缺乏系统研究。针对这一问题,本文首次从机器学习二进制分析的视角对函数内联展开全面研究。作者深入分析 LLVM 代价模型中的函数内联决策流程,并探索能够显著提高函数内联比例的编译器参数组合,提出“极端内联(Extreme Inlining)”机制,使函数内联程度超过标准编译优化级别。在此基础上,论文选取5类机器学习辅助的二进制安全分析任务,并使用20种不同模型,系统评估其在极端内联场景下的鲁棒性。
实验结果表明,函数内联虽然本质上是一种正常的编译优化,却可能直接或间接影响机器学习模型的行为,并被攻击者用于规避判别式或生成式模型。通过调整细粒度编译器参数,可以有针对性地构造具有规避能力的二进制变体,而无需采用传统代码混淆手段。 同时,依赖静态特征的模型对函数内联尤为敏感,而不同程序和编译配置下显著变化的内联比例,也会削弱机器学习模型训练与评估中关于编译环境一致性的假设。


论文地址:
*3. An LLM-Driven Fuzzing Framework for Detecting Logic Instruction Bugs in PLCs
标题: 面向PLC逻辑指令漏洞检测的大语言模型驱动模糊测试框架
作者: Jiaxing Cheng(Institute of Information Engineering, CAS;UCAS)、Ming Zhou(Nanjing University of Science and Technology)、Haining Wang(Virginia Tech)、Xin Chen(Institute of Information Engineering, CAS;UCAS)、Yuncheng Wang(Institute of Information Engineering, CAS;UCAS)、Yibo Qu(Institute of Information Engineering, CAS;UCAS)、Limin Sun(Institute of Information Engineering, CAS;UCAS)
方向: 工业控制系统安全 & PLC漏洞挖掘 & LLM驱动模糊测试(重点推荐)
摘要:
可编程逻辑控制器(Programmable Logic Controllers,PLCs)通过厂商提供并编译到设备固件中的逻辑指令库实现工业过程自动化。然而,这些指令库可能包含安全缺陷,一旦通过物理控制程序、面向网络的服务或PLC运行时子系统触发,可能导致权限违规、内存破坏或数据泄露。针对传统方法难以有效发现PLC固件逻辑指令漏洞的问题,本文提出 LogicFuzz,这是首个专门针对PLC固件逻辑指令漏洞的模糊测试框架。
LogicFuzz首先构建语义依赖图(Semantic Dependency Graph,SDG),描述PLC代码中逻辑指令的操作语义及指令间依赖关系,并结合使能信号(Enable Signal)机制和LLM自动生成面向特定指令的种子程序,从而降低人工构造测试程序的成本,并支持在真实PLC硬件上开展可控、可重置的模糊测试。针对由控制流触发的漏洞,LogicFuzz通过变异SDG生成不同的指令调用上下文;针对由输入数据触发的漏洞,则在有效语义约束下执行覆盖率引导的参数变异。此外,框架还设计多源异常检测预言机,联合监控运行时日志、状态LED和通信状态,以发现传统崩溃检测机制难以识别的指令级异常。
作者在来自3家主要厂商的6款商用PLC上对LogicFuzz进行了评估。实验结果表明,该框架共发现 19个指令级漏洞,其中包括4个此前未知的漏洞。研究表明,将LLM辅助的测试程序生成、语义依赖关系建模、结构化调用变异、覆盖率引导参数变异和多源异常监测相结合,可以有效提升闭源PLC环境下逻辑指令漏洞的自动化发现能力。
论文地址:



*4. Attention is All You Need to Defend Against Indirect Prompt Injection Attacks in LLMs
标题: 注意力机制足以防御大语言模型中的间接提示注入攻击
作者: Yinan Zhong(Zhejiang University)、Qianhao Miao(Zhejiang University)、Yanjiao Chen(Zhejiang University)、Jiangyi Deng(Zhejiang University)、Yushi Cheng(Zhejiang University)、Wenyuan Xu(Zhejiang University)
方向: 大语言模型安全 & 间接提示注入攻击防御 & LLM内部注意力机制(重点推荐)
摘要:
随着大语言模型(Large Language Models,LLMs)被广泛集成到Web Agent等应用中,不可信外部数据可能被攻击者植入恶意指令,从而引发间接提示注入(Indirect Prompt Injection,IPI)攻击。现有防御方法通常依赖额外分类器或辅助LLM进行检测,存在泛化能力不足、计算开销较大等问题;同时,现有防御往往难以在清除恶意指令的同时保留原始数据中的正常内容。针对这些问题,本文提出 RENNERVATE,一种利用目标LLM内部注意力特征同时实现IPI攻击检测与净化的防御框架。
RENNERVATE利用LLM处理指令时产生的注意力模式识别潜在注入行为,并设计细粒度Token级检测器,对外部数据中的每个Token判断其是否属于注入指令,从而实现恶意内容的精确定位与删除。针对不同注意力头和响应Token所包含的信息存在差异的问题,作者进一步提出两阶段注意力池化(2-Step Attentive Pooling)机制,依次聚合不同注意力头和响应Token中的关键特征,提高IPI检测的准确性与跨场景泛化能力。在检测到注入后,框架通过Injection Sanitizer仅移除被识别为恶意的Token,使LLM能够继续执行原始正常任务。此外,作者构建了具有细粒度Token级标注的FIPI数据集,其中包含100,000个注入样本和10,000个正常样本,覆盖5种IPI攻击方法和300种NLP任务。
作者在ChatGLM、Dolly、Falcon、LLaMA2和LLaMA3等5种LLM上进行了实验,并与15种商业及学术IPI防御方法进行比较。RENNERVATE在FIPI上的检测准确率达到97.88%~99.58%,同时能够将多种IPI攻击的攻击成功率大幅降低至接近0。进一步实验表明,该方法能够迁移到5个未见数据集以及GCG、Neural Exec两种未见攻击,并能够抵抗黑盒和白盒自适应攻击,说明基于LLM内部注意力特征的Token级检测与精准净化机制能够在保持正常任务功能的同时,实现具有较强泛化能力的IPI攻击防御。
论文地址:


*5. Beyond Jailbreak: Unveiling Risks in LLM Applications Arising from Blurred Capability Boundaries
标题: 超越越狱:揭示大语言模型应用能力边界模糊带来的安全风险
作者: Yunyi Zhang(Tsinghua University)、Shibo Cui(Tsinghua University)、Baojun Liu(Tsinghua University)、Jingkai Yu(Tsinghua University)、Min Zhang(National University of Defense Technology)、Fan Shi(National University of Defense Technology)、Han Zheng(TrustAI Pte. Ltd.)
方向: 大语言模型应用安全 & 越狱攻击 & LLM应用滥用(重点推荐)
摘要:
随着大语言模型应用(LLM Apps)快速发展,用户可以借助LLM的通用能力构建面向特定任务的应用,但这种新的开发范式也带来了传统越狱攻击之外的安全风险。现有研究主要关注绕过基础模型安全约束的越狱攻击,而对于LLM应用自身应具备哪些能力、其能力边界是否能够被突破仍缺乏系统研究。针对这一问题,本文首次系统分析LLM应用的开发范式,并提出“LLM应用能力空间(LLM App Capability Space)”概念,将能力边界模糊产生的风险划分为能力降级(Capability Downgrade)、能力升级(Capability Upgrade)和能力越狱(Capability Jailbreak),从应用能力边界的角度重新审视LLM应用面临的安全风险。
为了系统评估这些风险,作者设计并实现LLM应用能力评估框架 LLMApp-Eval,对应用的目标、执行过程、能力描述和能力约束进行量化,并构建不同能力边界风险的自动化评估方法。研究收集了4个LLM应用平台的应用元数据,并开展跨平台生态分析;进一步选取4个平台上的199个热门应用以及6个开源LLM进行安全评估。实验发现,178个应用(89.45%)存在潜在能力边界风险,这些应用能够执行超过15类不同任务或完成恶意任务,其中17个应用甚至无需任何对抗性提示重写,就能够直接执行恶意任务。
进一步分析表明,LLM应用的安全性与Prompt设计质量密切相关,清晰定义应用目标和能力约束能够显著增强应用对能力滥用的抵抗能力,而缺乏能力约束的Prompt则可能扩大LLM应用的实际能力空间并增加被滥用的风险。研究还发现,不同平台所采用的基础模型和插件配置会显著影响应用的能力边界。该工作将LLM安全研究从传统的“是否能够越狱基础模型”进一步扩展到“应用是否能够被诱导偏离预期能力边界”,为分析和防御真实LLM应用生态中的能力滥用问题提供了新的研究视角。
开源代码:
- https://github.com/sy-yunyi/LLMApp-Eval
论文地址:


*6. Bleeding Pathways: Vanishing Discriminability in LLM Hidden States Fuels Jailbreak Attacks
标题: 泄漏路径:LLM隐藏状态中逐渐消失的判别能力助长越狱攻击
作者: Yingjie Zhang(Institute of Information Engineering, Chinese Academy of Sciences;University of Chinese Academy of Sciences)、Tong Liu(Institute of Information Engineering, Chinese Academy of Sciences;University of Chinese Academy of Sciences)、Zhe Zhao(Ant Group)、Guozhu Meng(Institute of Information Engineering, Chinese Academy of Sciences;University of Chinese Academy of Sciences)、Kai Chen(Institute of Information Engineering, Chinese Academy of Sciences;University of Chinese Academy of Sciences)
方向: 大语言模型安全 & 越狱攻击防御 & 隐藏状态安全对齐(重点推荐)
摘要:
大语言模型(Large Language Models,LLMs)仍容易受到越狱攻击,攻击者可以利用对抗性提示绕过模型的安全机制。现有安全微调方法主要面临两个问题:一方面,更严格的安全机制往往会增加对正常请求的错误拒绝,难以兼顾安全性与实用性;另一方面,模型难以识别隐藏在看似正常任务中的恶意意图。本文发现造成这些问题的一个重要原因:随着响应生成过程不断推进,LLM区分安全输出与有害输出的能力会逐渐下降,安全与有害响应对应隐藏状态之间的可分离性不断减弱。这一现象使模型更依赖生成早期阶段进行安全判断,因而难以及时识别生成过程中逐渐显现的恶意意图。
针对这一问题,作者提出 DEEPALIGN,一种基于LLM内部隐藏状态的内生安全防御框架。其核心思想是在响应生成的中间阶段实施对比式隐藏状态引导(Contrastive Hidden-State Steering),主动扩大有害与正常响应隐藏状态之间的表示距离,使模型能够在整个生成过程中持续进行内在毒性检测和安全干预。与此同时,DEEPALIGN并非简单要求模型拒绝所有潜在危险请求,而是引导模型针对有害查询生成与上下文相关的安全回答,从而扩大安全响应的可行空间,并缓解传统安全对齐方法容易产生的过度拒绝问题。
作者在不同架构和不同规模的多种LLM上进行了评估。实验结果表明,DEEPALIGN能够将用DEEPALIGN的模型错误拒绝率最高降低约 3.5%,而在标准任务上的性能下降控制在 1%以内。研究表明,通过持续增强LLM生成过程中安全与有害隐藏状态的可判别性,可以在提高越狱防御能力的同时降低过度拒绝,从而改善模型安全性与实用性之间的权衡。
论文地址:


*7. Causal-Guided Detoxify Backdoor Attack of Open-Weight LoRA Models
标题: 面向开放权重LoRA模型的因果引导净化后门攻击
作者: Linzhi Chen(ShanghaiTech University)、Yang Sun(Independent Researcher)、Hongru Wei(ShanghaiTech University)、Yuqi Chen(ShanghaiTech University)
方向: 大语言模型安全 & LoRA后门攻击 & 因果分析(重点推荐)
摘要:
低秩适配(Low-Rank Adaptation,LoRA)已成为大语言模型高效微调的重要技术,并广泛应用于开源社区。然而,LoRA适配器通常通过Hugging Face等平台分散传播,恶意适配器可能被广泛分发并绕过传统监管机制。现有后门攻击方法通常依赖原始训练数据,难以适配LoRA特有的参数结构,同时还可能产生较高的错误触发率(False Trigger Rate,FTR),从而降低攻击隐蔽性。针对这些问题,本文提出 Causal-Guided Detoxify Backdoor Attack(CBA),一种专门针对开放权重LoRA模型、无需访问原始训练数据的后门攻击框架。
CBA主要包含两个关键机制。首先,作者提出覆盖率引导的数据生成方法(Coverage-Guided Data Generation),通过对目标LoRA模型进行行为探索,自动生成与原始任务分布相匹配的训练样本,从而在缺乏原始训练数据的情况下构造后门注入所需数据。随后,作者提出因果引导的净化策略(Causal-Guided Detoxification),分析不同神经元或LoRA参数对模型正常任务能力的因果影响,并在融合恶意适配器与干净适配器时优先保留与正常任务密切相关的关键参数,从而在维持模型原有功能的同时增强后门攻击的隐蔽性。此外,CBA还基于因果影响进行权重分配,使攻击者能够在完成训练后直接调节后门攻击强度,而无需反复重新训练模型。
作者在6个LoRA模型上对CBA进行了实验评估。结果表明,该方法能够保持较高的攻击成功率,同时相比基线方法将错误触发率降低约 50%–70%。此外,CBA在面对现有先进后门防御方法时仍表现出较强的攻击有效性。研究表明,开放生态中广泛传播的LoRA适配器存在新的供应链式安全风险,而结合覆盖率引导的数据生成和因果分析,可以在无原始训练数据条件下构造更加隐蔽且可调控的LoRA后门攻击。
开源代码:
论文地址:


8. Cease at the Ultimate Goodness: Towards Efficient Website Fingerprinting Defense via Iterative Mutual Information Minimization
标题: 止于最优:基于迭代互信息最小化的高效网站指纹防御
作者: Rong Wang(Southeast University)、Zhen Ling(Southeast University)、Guangchi Liu(Southeast University)、Shaofeng Li(Southeast University)、Junzhou Luo(Southeast University;Fuyao University of Science and Technology)、Xinwen Fu(University of Massachusetts Lowell)
方向: 网站指纹防御 & Tor匿名通信 & 流量混淆(重点推荐)
摘要:
Tor通过分布式、加密的通信基础设施保护用户匿名性,但网站指纹攻击(Website Fingerprinting Attack,WFA)仍能够利用加密流量中的统计特征推断用户访问的网站。现有网站指纹防御通常通过注入虚假流量或改变流量模式干扰攻击模型,但往往面临带宽开销较高、依赖特定攻击模型以及难以抵抗对抗训练等问题。针对这些局限,本文提出 FRUGAL,一种以网站流量与其标签之间的互信息(Mutual Information,MI)最小化为核心优化目标的流量混淆防御框架,从降低流量中可用于网站识别的信息泄露角度重新设计网站指纹防御。
FRUGAL利用强化学习学习虚假数据包的高效注入策略,并迭代选择能够最大程度降低累积互信息的位置进行数据包注入。为适应注入过程中流量特征不断变化的问题,作者进一步使用条件互信息(Conditional Mutual Information,CMI)评估每次注入操作带来的信息泄露变化,并通过迭代优化持续消除残余的网站指纹特征。同时,FRUGAL能够通过调整迭代次数灵活控制带宽开销,并设计在线防御机制,使学习得到的注入模式能够应用于实际Tor流量,从而兼顾防御效果、带宽效率和对不同攻击模型的泛化能力。
实验覆盖闭世界、开放世界和真实网络模拟等多种场景。结果表明,在闭世界场景下,当带宽开销(Bandwidth Overhead,BWO)为30%时,FRUGAL可将DF攻击模型的攻击成功率(Attack Success Rate,ASR)降低至 2.68%,明显优于Palette在87%带宽开销下的11.54%;当FRUGAL的带宽开销提高至80%时,ASR进一步降低至 1%以下。在攻击者采用对抗训练后,FRUGAL仍能将ASR维持在 9.42%,而Palette为20.27%。这些结果表明,通过迭代最小化流量与网站标签之间的互信息,可以在较低带宽开销下有效削弱网站指纹特征,并增强对未知攻击模型和对抗训练的鲁棒性。
开源代码: 已开源
- https://github.com/Junowww/FRUGAL-ndss
论文地址:




*9. Chimera: Harnessing Multi-Agent LLMs for Automatic Insider Threat Simulation
标题: Chimera:利用多智能体大语言模型实现自动化内部威胁模拟
作者: Jiongchi Yu(Singapore Management University)、Xiaofei Xie(Singapore Management University)、Qiang Hu(Tianjin University)、Yuhan Ma(Tianjin University)、Ziming Zhao(Zhejiang University)
方向: 多智能体安全 & 内部威胁检测 & LLM驱动安全数据生成(极其相关)
摘要:
内部威胁长期以来都是企业安全中的重要风险,但由于恶意行为通常隐藏在正常用户活动中,因此具有较高的检测难度。现有基于机器学习的内部威胁检测(Insider Threat Detection,ITD)方法又普遍受制于高质量真实训练数据不足的问题:企业内部数据往往具有较强敏感性,难以公开获取,而现有公开或合成数据集又存在规模有限、语义信息不足和行为真实性不高等问题。针对这一挑战,本文提出 Chimera,一种基于LLM多智能体的自动化内部威胁模拟框架,能够同时模拟正常员工活动和恶意内部人员行为,并自动采集多源系统日志。
Chimera 将每个智能体建模为具有细粒度职位、权限和行为特征的企业员工,并通过群体会议、点对点交互和自主日程规划机制模拟真实组织中的动态协作过程。同时,作者从真实内部威胁事件中抽象出15种攻击场景,并将恶意行为映射至MITRE ATT&CK技战术。Chimera被部署在科技公司、金融机构和医疗机构3类数据敏感型组织场景中,由此构建 ChimeraLog 数据集。该数据集覆盖登录、电子邮件、网页浏览、文件操作、网络流量和系统调用6类日志,共包含约 250亿条细粒度标注日志和160小时模拟企业活动数据。
作者通过人工评估、定量分析以及现有ITD模型实验验证ChimeraLog的真实性和有效性。结果表明,ChimeraLog在行为多样性、跨模态一致性和序列复杂度等方面表现出较强的真实性,同时相比CERT等现有数据集对内部威胁检测模型提出了更大挑战。跨数据集实验进一步表明,基于ChimeraLog训练的检测模型具有更好的跨场景泛化能力,说明利用LLM多智能体自动模拟复杂组织行为并生成动态安全日志,可为内部威胁检测的数据构建与模型评估提供新的研究范式。
开源代码:
论文地址:


*10. CtPhishCapture: Uncovering Credential-Theft-Based Phishing Scams Targeting Cryptocurrency Wallets
标题: CtPhishCapture:揭示针对加密货币钱包的凭据窃取型网络钓鱼骗局
作者: Hui Jiang(Tsinghua University and Baidu Inc)、Zhenrui Zhang(Baidu Inc)、Xiang Li(Nankai University)、Yan Li(Tsinghua University)、Anpeng Zhou(Tsinghua University)、Chenghui Wu(Baidu Inc)、Man Hou(Zhongguancun Laboratory)、Jia Zhang(Tsinghua University)、Zongpeng Li(Tsinghua University)
方向: 加密货币安全 & 网络钓鱼检测 & LLM驱动恶意网站与应用检测(重点推荐)
摘要:
凭据窃取型加密货币钱包钓鱼(Credential-Theft-Based Cryptocurrency Wallet Phishing,CtPhish)已成为加密货币生态中的重要安全威胁。攻击者通过伪造的钱包网站或应用诱骗用户提交私钥、助记词等敏感凭据,进而窃取加密资产。现有网络钓鱼检测方法通常面向传统钓鱼网站或基于链上交易进行分析,难以有效覆盖以凭据窃取为核心的CtPhish攻击。针对这一问题,本文提出 CtPhishCapture,一种面向CtPhish网站和应用的大规模自动化检测系统,能够对可疑网站进行主动访问、识别钓鱼页面,并进一步下载和分析潜在的恶意钱包应用。
CtPhishCapture首先融合证书透明度(Certificate Transparency,CT)日志与搜索引擎实时URL快照扩大候选网站覆盖范围,并设计结合TF-IDF关键词、HTML结构特征和贝叶斯概率推断的多特征过滤机制,从大规模候选网站中筛选加密货币钱包相关页面。在深度检测阶段,系统进一步构建加密货币钱包品牌知识库,利用CLIP生成多模态表示,并结合FAISS检索与RAG将相关品牌知识注入LLM,同时通过针对钱包钓鱼场景设计的视觉与语义提示识别品牌仿冒、敏感信息输入和社会工程行为。对于潜在CtPhish应用,系统从钓鱼网站及应用商店中自动收集APK,并结合数字签名和名称相似性等信息进行进一步验证。
CtPhishCapture连续部署6个月,共识别5,138个CtPhish网站和10,612个CtPhish应用,其中仅17%的网站和21%的应用此前已被安全社区报告,即83%的网站和79%的应用属于系统新发现。基于这些数据,作者进一步对CtPhish生态开展端到端测量,分析攻击者如何吸引受害者、建立信任、窃取凭据并最终转移加密资产,同时研究了相关网站和应用的结构特征及规避策略。最后,作者与百度合作部署CtPhishCapture,将检测结果应用于真实搜索引擎场景后,与CtPhish相关的每周用户投诉数量降低了5.8倍。
论文地址:

*11. Decompiling the Synergy: An Empirical Study of Human–LLM Teaming in Software Reverse Engineering
标题: 解构协同:软件逆向工程中人类与大语言模型协作的实证研究
作者: Zion Leonahenahe Basque(Arizona State University)、Samuele Doria(University of Padua)、Ananta Soneji(Arizona State University)、Wil Gibbs(Arizona State University)、Adam Doupé(Arizona State University)、Yan Shoshitaishvili(Arizona State University)、Eleonora Losiouk(University of Padua)、Ruoyu “Fish” Wang(Arizona State University)、Simone Aonzo(EURECOM)
方向: 大语言模型安全应用 & 软件逆向工程 & 人机协同(重点推荐)
摘要:
软件逆向工程(Software Reverse Engineering,SRE)是一项高度依赖人工经验的复杂安全分析任务。虽然大语言模型(Large Language Models,LLMs)已经被用于函数摘要、符号恢复、类型推断和漏洞识别等逆向分析任务,但现有研究大多单独评估某项任务的模型性能,缺乏对LLM如何影响完整逆向工程流程以及人与LLM如何协同工作的系统研究。针对这一问题,本文首次系统研究软件逆向工程中的人类–LLM协作机制,并采用“从业者调研—实验平台设计—细粒度用户研究”的三阶段方法分析LLM在真实逆向分析流程中的作用。
作者首先对153名具有LLM辅助逆向工程经验的从业者开展在线调查,总结出函数摘要、函数识别、函数重命名、变量重命名、漏洞识别和库函数文档生成6类典型LLM辅助功能。在此基础上,研究团队与13名逆向工程专家合作,开发集成LLM功能的反编译器插件及细粒度行为采集平台,并设计两项具有真实软件特征的CTF风格二进制逆向任务。随后,作者招募48名参与者,其中包括24名初学者和24名专家,对有无LLM辅助条件下的逆向过程进行对照研究,累计观察超过109小时的软件逆向行为,并形成18项关于LLM辅助逆向工程的研究发现。
实验结果表明,LLM对不同经验水平的逆向工程人员产生了明显不同的影响。对于初学者,LLM辅助使其程序理解表现提高约98%,逐渐接近专家水平;而对于专家,LLM带来的整体性能提升较为有限。对于已知算法函数,LLM可使分析速度最高提升约2.4倍,并使符号、注释和类型等编译过程中丢失的信息恢复数量至少增加66%。但研究同时发现,LLM产生的幻觉、无效建议和错误漏洞判断也可能干扰逆向分析,尤其容易影响过度依赖LLM的分析人员。总体而言,LLM目前更适合作为逆向工程师的辅助分析工具,而非替代专业人员,其主要价值在于快速完成初步分析并缩小初学者与专家之间的能力差距。

开源代码:
- 实验平台:https://github.com/mahaloz/dec-synergy-study
- LLM反编译器插件 DAILA:https://github.com/mahaloz/DAILA
论文地址:
12. Enhancing Semantic-Aware Binary Diffing with High-Confidence Dynamic Instruction Alignment
标题: 基于高置信动态指令对齐增强语义感知二进制差分
作者: Chengfeng Ye(The Hong Kong University of Science and Technology)、Anshunkang Zhou(The Hong Kong University of Science and Technology)、Charles Zhang(The Hong Kong University of Science and Technology)
方向: 二进制安全分析 & 二进制差分 & 动态程序分析(极其相关)
摘要:
二进制差分(Binary Diffing)旨在识别两个二进制程序之间的差异,是漏洞检测、补丁分析、恶意软件分析和软件供应链分析等安全任务的重要基础。已有研究表明,预先获得足够数量的细粒度高置信匹配作为锚点(Anchor Points),能够显著提高后续二进制差分的准确率。然而,基于语法的方法容易受到激进编译优化的影响,而现有基于语义的方法又面临计算开销较高或代码覆盖率不足的问题,难以高效获得足够数量的可靠指令级锚点。
针对这一问题,本文提出 BARRACUDA,一种基于强制执行(Forced Execution)所提取的部分指令语义实现高置信指令对齐的方法。其核心思想是,并非所有动态语义对于识别有效指令对齐都同等重要,因此无需完整探索所有程序路径。BARRACUDA首先提出优先路径采样(Prioritized Path Sampling),通过静态分析估计不同指令可能产生的运行时值数量,优先为更容易形成语义重叠的指令分配动态执行资源,并利用强制执行获取部分运行时语义。随后,方法将指令对齐建模为两阶段二部图匹配问题:首先根据动态语义重叠关系建立初始匹配并构造平衡双团(Balanced Biclique),再针对双团两侧构建约简控制流图(Reduced-CFG),利用确定性的图同构分析获得高置信指令级匹配。这些匹配结果可以直接作为现有二进制差分工具的锚点,以提升后续模糊匹配效果。
实验结果表明,BARRACUDA能够在保持92.1%精确率的情况下,比现有方法额外发现24.0%的指令对齐锚点。将其生成的锚点集成到现有二进制差分工具后,DeepBinDiff的F1分数在不同场景下提高12.3~42.7个百分点,SigmaDiff提高2.2~4.1个百分点。结果表明,通过有选择地获取部分动态语义,并结合双团结构与约简控制流图进行高置信匹配,可以在避免完整动态语义分析高开销的同时,有效增强语义感知二进制差分的准确性。
开源代码:
- Zenodo:https://doi.org/10.5281/zenodo.17885726
- Docker:https://hub.docker.com/r/cyeaa/barracuda
论文地址:




*13. ExpShield: Safeguarding Web Text from Unauthorized Crawling and LLM Exploitation
标题: ExpShield:保护Web文本免受未经授权的抓取与大语言模型利用
作者: Ruixuan Liu(Emory University)、Toan Tran(Emory University)、Tianhao Wang(University of Virginia)、Hongsheng Hu(Shanghai Jiao Tong University)、Shuo Wang(Shanghai Jiao Tong University)、Li Xiong(Emory University)
方向: 大语言模型隐私安全 & 训练数据保护 & Web内容防护(重点推荐)
摘要:
随着大语言模型越来越多地使用从Web抓取的内容进行训练,模型可能记忆并泄露其中的版权内容或隐私信息。现有保护机制通常依赖爬虫或模型开发者主动遵守相关规则,数据所有者难以直接控制其内容被抓取和训练后的泄露风险。针对这一问题,本文提出 ExpShield,一种面向Web文本的数据所有者主动防护机制,通过向网页文本中加入不可见扰动,在保持用户正常阅读体验的同时降低LLM对特定文本内容的记忆,并将这一保护过程建模为带有可读性和扰动预算约束的双层优化问题。此外,作者提出实例利用度(Instance Exploitation)指标,用于衡量模型在训练某一特定文本后,攻击者识别或猜测该文本的能力相对于未使用该文本训练时增加了多少,其中接近0意味着训练该文本几乎没有带来额外泄露风险。
由于数据所有者通常无法获知未来模型的训练算法、训练数据和模型参数,直接求解双层优化问题并不现实。为此,作者提出两种可实际部署的代理方案:基于开源代理模型的单层优化(Single-Level Optimization),以及无需优化过程的合成扰动(Synthetic Perturbation)方法。进一步地,论文提出并验证“记忆触发器(Memorization Trigger)”假设,即预训练模型预测置信度较低的特定Token更容易成为驱动模型逐字记忆的关键因素,并据此设计针对性扰动:一方面通过不可见元素削弱原有记忆触发Token,另一方面人为引入新的触发Token,将模型的记忆行为引导至错误位置。为保证网页显示效果,ExpShield主要利用不可见Unicode字符和CSS样式实现这些扰动,从而尽可能保持原始文本的视觉一致性与语义完整性。
作者在不同规模的语言模型以及视觉到语言模型上进行了实验,并评估了数据提取攻击、成员推断攻击以及自适应场景下的防御效果。实验结果表明,即使攻击者使用Privacy Backdoor增强成员推断攻击,ExpShield仍能够将MIA的AUC从0.95降低至0.55,同时使Instance Exploitation接近0。相关结果说明,即使受保护文本被用于模型训练,其带来的额外实例级泄露风险仍可以被显著降低。

开源代码:
- https://github.com/Emory-AIMS/ExpShield-demo
论文地址:
14. From Noise to Signal: Precisely Identify Affected Packages of Known Vulnerabilities in npm Ecosystem
标题: 从噪声到信号:精准识别npm生态系统中受已知漏洞影响的软件包
作者: Yingyuan Pu(QI-ANXIN Technology Research Institute)、Lingyun Ying(QI-ANXIN Technology Research Institute)、Yacong Gu(Tsinghua University;Tsinghua University-QI-ANXIN Group JCNS)
方向: 软件供应链安全 & 漏洞传播分析 & JavaScript静态分析(极其相关)
摘要:
npm是全球规模最大的开源软件生态系统之一,包含超过300万个软件包。复杂的直接和间接依赖关系使一个上游软件包中的已知漏洞可能沿依赖链传播至大量下游软件包。现有软件组成分析(Software Composition Analysis,SCA)工具通常采用包级依赖关系判断漏洞影响范围,只要项目依赖存在漏洞的软件包就会触发告警,容易产生大量误报;而更加精确的函数级分析方法又难以扩展至整个npm生态。针对这一问题,本文提出 VulTracer,一种面向npm生态的可扩展函数级漏洞传播分析框架,用于判断漏洞函数是否真正能够通过函数调用路径传播至下游软件包,从而精准识别实际受到影响的软件包。
VulTracer的核心思想是将传统的整体程序分析转化为可组合、可复用的包级分析。首先,作者针对每个独立的软件包版本预先构建富语义图(Rich Semantic Graph,RSG),利用CodeQL的跨过程数据流分析刻画包内部函数调用、外部调用以及API导出等语义关系,实现“Analyze Once, Reuse Many Times”。随后,VulTracer从RSG中提取形式化接口契约(Interface Contract),描述软件包公开API及其外部依赖关系,并在实际分析目标项目时,根据依赖图按需拼接不同软件包的RSG,动态合成跨包调用图(Call Graph)。这种方法既避免了针对每个项目重复执行代价高昂的全程序分析,又能够在JavaScript动态语义环境中保留跨软件包函数调用关系,从而实现大规模、细粒度的漏洞可达性分析。
实验结果表明,VulTracer在调用图构建任务上的F1值达到0.905,并能够将npm audit产生的误报减少94%。作者进一步对整个npm生态开展了目前规模最大的函数级漏洞影响测量,覆盖3,267,273个软件包、34,685,976个软件包版本以及27个CVE。结果发现,包级依赖分析识别出的潜在漏洞影响中有68.28%实际上属于不可达的“噪声”,即下游软件包虽然依赖存在漏洞的软件包,但并未调用相应漏洞代码。同时,真实漏洞传播通常较浅,其影响会随着依赖跳数增加而快速衰减。研究表明,函数级可达性分析能够显著降低软件供应链漏洞管理中的告警疲劳,使开发人员更加聚焦于真正可能受到影响的软件包。

开源代码:
- Zenodo:https://doi.org/10.5281/zenodo.17659795
- VulTracer在线演示:https://tianwen.qianxin.com/npm-vultracer/
论文地址:

*15. From Obfuscated to Obvious: A Comprehensive JavaScript Deobfuscation Tool for Security Analysis
标题: 从混淆到明晰:面向安全分析的综合JavaScript去混淆工具
作者: Dongchao Zhou(Beijing University of Post and Telecommunication;QI-ANXIN Technology Research Institute)、Lingyun Ying(QI-ANXIN Technology Research Institute)、Huajun Chai(QI-ANXIN Technology Research Institute)、Dongbin Wang(Beijing University of Post and Telecommunication)
方向: JavaScript安全 & 代码去混淆 & LLM辅助安全分析(极其相关)
摘要:
JavaScript被广泛应用于Web环境,也因此成为攻击者隐藏恶意代码的重要载体。攻击者通常利用字符串编码、控制流变换、动态代码生成等多种混淆技术增加恶意代码分析难度,而现有JavaScript去混淆工具普遍存在输入格式适应能力有限、只能处理部分混淆类型以及恢复后的代码可读性较差等问题。针对这些挑战,本文提出 JSIMPLIFIER,一种面向JavaScript安全分析的综合去混淆工具,通过多阶段流水线统一处理不同层次和不同组合的代码混淆问题。
JSIMPLIFIER首先通过容错解析、字符编码标准化和打包器模式展开等预处理机制,对格式异常或编码复杂的JavaScript代码进行规范化;随后结合基于抽象语法树(AST)的静态分析与受控动态执行跟踪,实现对静态结构变换和运行时相关混淆的协同恢复;最后引入LLM增强的标识符重命名机制,根据代码上下文和语义为混淆变量、函数等生成更具可读性的名称。此外,作者还提出融合控制流/数据流分析、代码简化程度、信息熵以及LLM可读性评估的多维去混淆评价体系,用于更全面地衡量代码恢复质量。
作者构建并公开了包含44,421个真实JavaScript样本的数据集,其中包括23,212个野外恶意样本和21,209个良性样本。实验结果表明,JSIMPLIFIER能够处理全部20类JavaScript混淆技术,在评估子集上达到100%的正确率,将代码复杂度降低88.2%,并使代码可读性提升4倍以上。该研究不仅提供了覆盖多种JavaScript混淆技术的统一去混淆框架,也为后续恶意JavaScript分析与去混淆研究提供了新的数据集和评价基准。

开源代码:
- https://github.com/XingTuLab/JSIMPLIFIER
论文地址:


*16. Incident Response Planning Using a Lightweight Large Language Model with Reduced Hallucination
标题: 基于轻量级大语言模型的低幻觉事件响应规划
作者: Kim Hammar(University of Melbourne)、Tansu Alpcan(University of Melbourne)、Emil C. Lupu(Imperial College London)
方向: 大语言模型安全应用 & 网络安全事件响应 & 幻觉抑制(极其相关)
摘要:
及时且有效的事件响应对于应对日益频繁的网络攻击至关重要,但在复杂系统中选择合适的响应措施仍是一项具有挑战性的任务。现有研究开始利用大语言模型(Large Language Models,LLMs)辅助安全人员制定事件响应方案,但大多依赖前沿LLM的Prompt Engineering,不仅成本较高,而且容易产生幻觉。针对这一问题,本文提出一种面向网络安全事件响应的轻量级LLM规划方法,将指令微调、信息检索和前瞻规划(Lookahead Planning)相结合,在降低模型资源需求的同时减少事件响应过程中的幻觉问题。
该方法包含三个核心步骤。首先,利用包含事件日志、响应动作和思维链推理过程的数据集,对轻量级LLM进行指令微调,使其学习事件响应阶段、目标及典型响应模式;其次,构建RAG信息检索机制,从日志中提取主机名、漏洞标识等失陷指标,并从外部威胁情报和漏洞数据库中获取相关知识,以增强模型对当前安全事件的上下文理解;最后,提出基于决策理论的前瞻规划机制,由LLM生成多个候选响应动作并模拟其后续恢复过程,根据预期恢复时间选择最优响应,同时从理论上推导幻觉概率的上界,证明在一定假设下可以通过增加规划计算量使幻觉概率任意降低。
作者基于文献中报告的真实安全事件日志对该方法进行评估,并构建了包含68,000个事件及对应响应方案的微调数据集。实验结果表明,该方法相比Gemini 2.5 Pro等前沿LLM最多可将事件恢复时间缩短22%,同时能够泛化到多种攻击类型和响应动作,并在无需针对每个事件单独训练的情况下达到与PPO强化学习方法相近的性能。消融实验进一步表明,微调、RAG和规划三个环节均能提升整体性能,其中微调和规划的贡献最为明显。

开源代码:
- https://github.com/Kim-Hammar/llm_incident_response_ndss26
此外,作者还公开了68,000个事件及响应方案数据集、微调后的模型权重和完整实验代码。
论文地址:





*17. Indicator of Benignity: An Industry View of False Positive in Malicious Domain Detection and its Mitigation
标题: 良性指标:恶意域名检测误报的工业界视角及其缓解方法
作者: Daiping Liu(Palo Alto Networks, Inc.)、Danyu Sun(University of California, Irvine)、Zhenhua Chen(Palo Alto Networks, Inc.)、Shu Wang(Palo Alto Networks, Inc.)、Zhou Li(University of California, Irvine)
方向: 恶意域名检测 & 误报缓解 & LLM辅助安全分析(重点推荐)
摘要:
恶意域名检测是抵御网络攻击的重要技术,但现有研究主要关注检测能力,对真实生产环境中的误报(False Positive,FP)问题缺乏系统研究。本文基于一家全球大型网络安全厂商2019—2024年间收集的6年误报报告开展大规模测量,发现当前检测系统广泛采用的热门域名列表仍不足以有效避免误报。作者指出,现有研究长期关注恶意指标(Indicator of Compromise,IOC),却忽视了能够证明域名合法性的良性证据,并据此首次提出“良性指标(Indicator of Benignity,IOB)”概念,将恶意域名误报缓解问题转化为对域名良性证据的主动发现与可信性验证问题。
针对互联网内容开放、非结构化以及证据来源可信性难以判断的问题,作者提出面向IOB的传递信任模型(Transitive Trust Model),其核心思想是:当一个域名由可信所有者拥有,或其合法性能够通过可信来源逐级认证时,可以建立相应的良性证据链。在此基础上实现 IOBHunter,利用搜索引擎迭代发现潜在IOB来源,并结合大语言模型(LLM)与思维链(Chain-of-Thought,CoT)从非结构化Web内容中提取良性证据、判断证据语义,再按照预定义的信任传递策略逐层验证来源可信性,直到到达信任根或无法继续获得新的可信证据,从而实现恶意域名检测误报的自动化辅助判定。
作者使用经过人工验证的误报数据集评估IOBHunter,在GPT-4o配置下取得99.22%的Precision和68.6%的Recall;Gemini 2.5 Flash和Qwen3-32B也表现出相近的检测能力。随后,系统进行了为期两个月的真实生产环境部署,在约1500万个被检测为恶意的FQDN中发现6,571个具有可信IOB的域名,经人工核查后确认其中4,338个为误报,另有2,051个属于具有真实良性证据但同时存在恶意活动的失陷域名。研究表明,从传统IOC检测进一步扩展到IOB发现与可信性验证,可以为生产环境中的恶意域名误报缓解提供一种新的研究思路。


开源数据:
- https://github.com/dpliu/iobhunter-dataset
论文地址:
*18. IoTBec: An Accurate and Efficient Recurring Vulnerability Detection Framework for Black Box IoT Devices
标题: IoTBec:面向黑盒IoT设备的准确高效复现漏洞检测框架
作者: Haoran Yang(Institute of Information Engineering, Chinese Academy of Sciences;University of Chinese Academy of Sciences)、Jiaming Guo(Institute of Information Engineering, Chinese Academy of Sciences;University of Chinese Academy of Sciences)、Shuangning Yang(Anhui University)、Guoli Zhao(Institute of Information Engineering, Chinese Academy of Sciences;University of Chinese Academy of Sciences), et al.
方向: 物联网安全 & 黑盒漏洞检测 & LLM驱动模糊测试(重点推荐)
摘要:
随着IoT设备快速普及,针对设备漏洞的攻击也日益增多。现有漏洞检测方法通常依赖设备固件或源代码进行分析,在无法获取固件和源代码的真实黑盒场景中受到较大限制。针对这一问题,本文提出 IoTBec,一种无需获取目标设备固件和源代码的复现漏洞检测框架,通过利用已知漏洞信息与设备对外暴露的黑盒接口,实现对潜在复现漏洞的快速发现与验证。
IoTBec首先提出漏洞接口签名(Vulnerability Interface Signature,VIS),根据已知漏洞信息提取与漏洞相关的接口、参数及交互特征,并利用这些签名匹配目标IoT设备中可能存在的复现漏洞。在发现潜在匹配后,框架进一步将VIS驱动的漏洞匹配与LLM驱动模糊测试相结合,由LLM根据目标接口及已知漏洞上下文自动生成具有针对性的Fuzzing Payload,对候选漏洞进行动态验证。这种设计将已知漏洞知识用于缩小黑盒模糊测试的搜索空间,同时利用LLM增强测试输入生成能力,从而兼顾复现漏洞检测的准确性与未知漏洞发现能力。
作者在5家主流IoT厂商的设备上对IoTBec进行了评估。实验结果表明,IoTBec发现的漏洞数量超过当前SOTA黑盒模糊测试方法的7倍,Precision达到100%,Recall达到93.37%。系统共检测到183个漏洞,其中169个获得CVE编号,53个为新发现漏洞,平均CVSS 3.x评分达到8.61,涉及缓冲区溢出、命令注入和CSRF等多种漏洞类型。此外,LLM驱动的模糊测试还发现了25个此前未知的漏洞,说明无需固件和源代码的黑盒漏洞匹配与定向模糊测试相结合,能够有效提高IoT设备漏洞检测效率,并具备发现新漏洞及漏洞变体的能力。
开源代码:
- https://github.com/IoTBec/code
论文地址:


*19. Les Dissonances: Cross-Tool Harvesting and Polluting in Pool-of-Tools Empowered LLM Agents
标题: 不协和音:工具池赋能LLM智能体中的跨工具信息收集与污染
作者: Zichuan Li(University of Illinois Urbana-Champaign)、Jian Cui(University of Illinois Urbana-Champaign)、Xiaojing Liao(University of Illinois Urbana-Champaign)、Luyi Xing(University of Illinois Urbana-Champaign)
方向: LLM智能体安全 & 工具调用安全 & 多工具协同攻击(重点推荐)
摘要:
大语言模型智能体(LLM Agents)能够通过调用搜索引擎、命令行、Web浏览等外部工具完成复杂任务,而现代智能体通常会同时加载多个工具并由LLM自主决定工具选择及执行顺序。现有研究主要关注单个恶意工具带来的风险,却较少研究多个工具共同参与任务时的控制流安全问题。针对这一问题,本文首次系统分析多工具LLM智能体的任务控制流安全,并提出跨工具收集与污染(Cross-Tool Harvesting and Polluting,XTHP)攻击,通过恶意工具劫持智能体正常任务控制流,进一步窃取或污染其他工具处理的信息。
XTHP首先实施智能体控制流劫持(CFA Hijacking)。作者设计语义逻辑挂钩(Semantic Logic Hooking)、语法格式挂钩(Syntax Format Hooking)以及基于LLM偏好的挂钩优化等攻击方式,使恶意工具能够伪装成目标工具所必需的前置或后置工具,并自动插入正常任务执行链。 成功进入控制流后,恶意工具可以执行跨工具信息收集(Cross-Tool Harvesting,XTH),窃取其他工具处理的用户查询、文档内容、物理地址等敏感数据,也可以执行跨工具信息污染(Cross-Tool Polluting,XTP),篡改其他工具的输入或输出。为自动评估现实工具面临的风险,作者进一步开发动态扫描框架 Chord,结合动态分析、自动化漏洞利用和LLM智能体,自动生成XTHP恶意工具、构造与目标工具使用场景匹配的测试任务,并端到端验证控制流劫持、信息收集和信息污染攻击是否成功。
作者使用Chord测试了LangChain和Llama-Index中的66个真实工具。结果显示,其中50个工具(75%)能够被端到端控制流劫持,48个(72%)能够受到跨工具信息收集攻击,45个(68%)能够受到跨工具信息污染攻击。进一步实验表明,Airgap、Tool Filter、Spotlighting和Prompt Injection Detector等已有防御机制难以有效阻止XTHP攻击,同时作者也在IsolateGPT和ACE保护的智能体系统中成功实施了XTHP概念验证攻击。研究揭示,多工具LLM智能体的安全风险不仅来自单个恶意工具本身,还来自工具之间的依赖关系以及LLM自主编排形成的任务控制流。

开源代码:
- https://github.com/systemsecurity-uiuc/Chord
论文地址:



*20. NEXUS: Towards Accurate and Scalable Mapping between Vulnerabilities and Attack Techniques
标题: NEXUS:面向漏洞与攻击技术的准确、可扩展自动映射框架
作者: Ehsan Khodayarseresht(Concordia University)、Suryadipta Majumdar(Concordia University)、Serguei Mokhov(Concordia University)、Mourad Debbabi(Concordia University)
方向: 网络威胁情报 & 漏洞分析 & CVE-ATT&CK自动映射(极其相关)
摘要:
CVE数据库每年收录大量已知漏洞,但其描述通常缺乏漏洞可能被攻击者如何利用的可操作上下文;另一方面,MITRE ATT&CK定义了丰富的攻击战术、技术与过程(TTP),却没有将其与具体漏洞建立系统关联。现有CVE-to-TTP映射方法又面临标注数据规模有限、类别分布不均衡、重要TTP覆盖不足、难以从非结构化CVE描述中准确提取攻击行为以及模型缺乏持续修正能力等问题。针对这些挑战,本文提出 NEXUS,一种能够自动将CVE漏洞描述映射至MITRE ATT&CK攻击技术的可扩展框架。
NEXUS首先利用CVE–CWE–CAPEC–ATT&CK之间的结构化关联链自动构建CVE-to-TTP初始标注数据,无需人工逐条标注;随后,结合语义角色标注(Semantic Role Labeling,SRL)与微调后的网络安全领域语言模型,从非结构化CVE描述中提取与攻击行为相关的Attack Patterns,过滤与TTP映射无关的信息。为解决类别不平衡和TTP覆盖不足问题,框架进一步利用Llama-3.1-8B生成CVE描述的语义保持型改写样本,并通过GPT-4o-mini执行标签调整和缺失TTP补充,在原始92,632个CVE和141种ATT&CK技术的基础上扩展数据覆盖范围。随后,NEXUS通过微调BERT、RoBERTa和SecureBERT等模型执行多标签TTP预测,并引入基于安全分析人员反馈的自适应修正机制,将误报和漏报反馈用于后续相似CVE的预测调整,而无需重新训练整个模型。
最终构建的数据覆盖超过210K个原始及增强CVE样本和208种ATT&CK技术,其中包括117K+增强CVE样本以及67种从真实攻击报告中补充的重要技术。作者在5个不同数据集上对NEXUS进行评估,包括自建数据集的多个版本以及SMET、MITRE ATT&CK APT与威胁报告等公开数据。实验结果表明,NEXUS在CVE-to-TTP映射任务上的最高F1-score达到97.94%,而已有方法的最高结果为67.68%。研究表明,将结构化CTI知识关联、攻击模式提取、大语言模型辅助数据增强与自适应反馈机制结合,可以显著提高漏洞与ATT&CK攻击技术自动映射的准确性、覆盖范围和可扩展性。


论文地址:




*21. ObliInjection: Order-Oblivious Prompt Injection Attack to LLM Agents with Multi-source Data
标题: ObliInjection:面向多源数据LLM智能体的顺序无关提示注入攻击
作者: Reachal Wang(Duke University)、Yuqi Jia(Duke University)、Neil Zhenqiang Gong(Duke University)
方向: 大语言模型智能体安全 & 提示注入攻击 & 多源数据安全(重点推荐)
摘要:
提示注入攻击通过污染大语言模型(Large Language Models,LLMs)的输入数据,诱导模型执行攻击者指定的任务,而非用户原本预期的任务。在许多LLM应用和智能体中,输入数据往往来自多个不同来源,每个来源仅提供整体输入中的一个数据片段。在这种多源场景下,攻击者通常只能控制部分数据源,并且无法预先获知不同来源的数据片段在最终输入中的排列顺序。现有提示注入攻击通常假设全部输入数据均由攻击者控制,或者没有考虑多源数据片段排列顺序的不确定性,因此在真实的多源数据应用中攻击效果受到明显限制。
针对这一问题,本文提出 ObliInjection,这是首个专门针对多源输入数据LLM应用与智能体的提示注入攻击方法。其包含两项关键技术创新:首先,提出顺序无关损失(Order-Oblivious Loss),用于衡量无论正常数据片段与被污染数据片段采用何种排列顺序,LLM执行攻击者指定任务的可能性;其次,提出 orderGCG 优化算法,专门用于最小化顺序无关损失并优化攻击者能够控制的数据片段,从而生成对输入排列顺序具有鲁棒性的提示注入内容。通过这种设计,攻击者无需掌握各数据源在智能体上下文中的具体排列位置,也能够实施有效的提示注入攻击。
作者在3个覆盖不同应用领域的数据集以及12种LLM上进行了系统实验。结果表明,即使攻击者只能污染输入中6~100个数据片段中的1个,ObliInjection仍能够保持较高的攻击有效性。这说明,多源数据环境中的LLM智能体即使仅有极少部分外部数据源遭到攻击者控制,也可能面临严重的提示注入风险,同时揭示了输入数据来源、片段排列顺序及智能体数据聚合过程所带来的新型攻击面。
开源代码:
- https://github.com/ReachalWang/ObliInjection
论文地址:

22. PANDORA: Lightweight Adversarial Defense for Edge IoT using Uncertainty-Aware Metric Learning
标题: PANDORA:基于不确定性感知度量学习的边缘IoT轻量级对抗防御
作者: Avinash Awasthi(Malaviya National Institute of Technology Jaipur)、Pritam Vediya(Malaviya National Institute of Technology Jaipur)、Hemant Miranka(The LNM Institute of Information Technology)、Ramesh Babu Battula(Malaviya National Institute of Technology Jaipur)、Manoj Singh Gaur(Indian Institute of Technology Jammu)
方向: 物联网安全 & 零日攻击检测 & 不确定性感知度量学习 & 边缘智能(重点推荐)
摘要:
资源受限IoT设备的快速普及显著扩大了网络攻击面,而传统基于静态特征或签名的入侵检测系统难以有效应对不断演化的新型攻击。现有机器学习IDS虽然具有较强检测能力,但在真实网络环境中仍面临概念漂移、类别内部差异较大以及对未知攻击泛化能力不足等问题。针对这些挑战,本文提出 PANDORA(Probabilistic Adversarial Network Defense Over Resource-constrained Architectures),一种面向资源受限边缘设备的端到端零日攻击检测框架,通过将网络流量表示为带有不确定性的概率分布,而非传统确定性特征向量,以提升模型对未知攻击和分布变化的鲁棒性。
PANDORA包含三项核心设计。首先,提出不确定性感知概率嵌入,将每条网络流映射为潜在空间中的概率分布,并显式建模流量特征的不确定性;其次,提出概率流形结构与距离损失(Probabilistic Manifold Structuring and Distance,PMSD Loss),结合分布距离与流形结构约束优化类内和类间表示,以增强零样本和少样本场景下的泛化能力;最后,设计轻量级Mamba-Mixture of Experts(Mamba-MoE)编码架构,并结合时间特征与流量规模特征的双路概率编码及Cross-Attention融合,实现适用于边缘设备的高效网络流量建模。此外,作者还构建了TTDFIoTIDS2025数据集,以覆盖具有复杂子类结构和动态攻击行为的IoT网络流量。
作者在CICIDS2017、CICIoT2023、CICIDS2018以及TTDFIoTIDS2025等数据集上开展评估。PANDORA在CICIDS2017的10-shot适配场景下取得0.971的F1-score,在域偏移场景中的零样本检测准确率最高达到99%。在Raspberry Pi真实边缘设备上的部署结果显示,模型内存占用约为24 MB,吞吐率最高达到4.26 flows/s。实验表明,不确定性感知概率表示、PMSD损失以及Mamba-MoE轻量级架构能够在保持较低资源开销的同时,提高对未知攻击、类别内部差异和跨域分布变化的适应能力。
开源代码:
- https://github.com/avinash-developer/Pandora_NDSS_2026
论文地址:


*23. ProtocolGuard: Detecting Protocol Non-compliance Bugs via LLM-guided Static Analysis and Dynamic Verification
标题: ProtocolGuard:基于LLM引导静态分析与动态验证的协议不合规漏洞检测
作者: Xiangpu Song(Shandong University)、Longjia Pei(Shandong University)、Jianliang Wu(Simon Fraser University)、Yingpei Zeng(Hangzhou Dianzi University)、Gaoshuo He(Shandong University)、Chaoshun Zuo(Independent Researcher)、Xiaofeng Liu(Shandong University)、Qingchuan Zhao(City University of Hong Kong)、Shanqing Guo(Shandong University)
方向: 网络协议安全 & LLM辅助漏洞检测 & 静态分析与模糊测试(重点推荐)
摘要:
网络协议实现需要严格遵循协议规范,以保证通信的可靠性与安全性。然而,协议规范通常以复杂的自然语言编写,其中的歧义容易导致开发人员误解,使实际实现偏离标准行为并产生协议不合规漏洞(Protocol Non-compliance Bugs)。这类漏洞通常表现为隐蔽的逻辑错误,而不像内存破坏漏洞那样产生明显崩溃,因此传统漏洞检测Oracle难以有效识别。针对这一问题,本文提出 ProtocolGuard,一种将LLM引导的静态分析与基于模糊测试的动态验证相结合的协议不合规漏洞检测框架。
ProtocolGuard首先采用混合方法从自然语言协议规范中提取规范性规则,并利用LLM引导程序切片,从协议实现中定位与每条规则相关的代码片段;随后通过LLM比较协议规则与程序逻辑之间的语义一致性,从而识别潜在的不合规行为。针对这类逻辑漏洞缺少明显异常信号的问题,ProtocolGuard进一步利用LLM自动生成断言并插桩到目标代码中,将原本不可观察的语义不一致转化为可检测的断言失败;同时由LLM生成更可能触发候选漏洞的初始测试用例,再结合定向模糊测试进行动态验证,最终确认漏洞并生成相应的PoC测试用例。这种设计形成了“规范规则提取—LLM静态分析—语义不一致检测—断言插桩—动态验证”的完整漏洞发现流程。
作者在11个广泛使用的网络协议实现上对ProtocolGuard进行了评估,共发现158个协议不合规漏洞,其中70个已经获得确认,并且大部分候选问题都能够被转换为断言并通过动态测试进行验证。与现有SOTA工具相比,ProtocolGuard在漏洞检测的Precision和Recall方面均表现出更好的效果。研究表明,将LLM对自然语言协议规范和程序语义的理解能力与程序分析、断言生成和模糊测试相结合,可以有效发现传统静态分析和差分测试难以识别的协议逻辑漏洞。
开源代码:
- https://github.com/songxpu/ProtocolGuard
论文地址:

24. ropbot: Reimaging Code Reuse Attack Synthesis
标题: ropbot:重新构想代码复用攻击合成
作者: Kyle Zeng(Arizona State University)、Moritz Schloegel(CISPA Helmholtz Center for Information Security)、Christopher Salls(UC Santa Barbara)、Adam Doupé(Arizona State University)、Ruoyu Wang(Arizona State University)、Yan Shoshitaishvili(Arizona State University)、Tiffany Bao(Arizona State University)
方向: 二进制安全 & 代码复用攻击 & ROP链自动生成(重点推荐)
摘要:
代码复用攻击(Code Reuse Attack)是现代内存破坏攻击中的重要利用技术,但将多个代码片段(Gadgets)组合成有效攻击链仍然是一个耗时且高度依赖人工经验的过程。现有自动化方法通常采用“生成并测试”(Generate-and-Test)范式,首先枚举候选Gadgets,再利用符号执行或SMT求解器判断其能否组合成有效链。随着候选Gadgets数量增加,这类方法的搜索空间呈指数增长,导致其在大型二进制程序上的可扩展性和实用性受到明显限制。
针对这一问题,本文提出一种新的代码片段抽象结构 ROPBlock,将多个Gadgets组织为天然保证可链接(chainable)的基本单元,从根本上减少传统方法反复验证Gadget可组合性的开销。在此基础上,作者将代码复用链生成重新建模为基于ROPBlock的图搜索问题,将寄存器赋值任务的时间复杂度从 (O(2^n)) 降低到 (O(n)),实际链生成速度提升2~3个数量级。同时,ROPBlock能够表示包含条件分支、ret2csu等复杂Gadget,并且其抽象与搜索算法不依赖特定指令集架构,因此能够扩展到多种处理器平台。作者进一步实现自动化代码复用链生成工具 ropbot。
实验在x64、MIPS、ARM和AArch64等多种架构上开展。ropbot能够在全部37个评估二进制程序上生成包含dup-dup-execve调用的复杂真实代码复用链,平均耗时约2.5秒,而除一种方法外的其他对比工具均无法在该场景下成功生成链;对于需要设置6个寄存器参数的mmap链,ropbot成功生成链的目标数量达到次优方法的5倍。此外,作者仅增加12行代码便在不到2小时内加入RISC-V支持,进一步体现了该方法的跨架构可扩展性。
开源代码:
- https://github.com/sefcom/ropbot
论文地址:

*25. SACK: Systematic Generation of Function Substitution Attacks Against Control-Flow Integrity
标题: SACK:针对控制流完整性的函数替换攻击系统化生成
作者: Zhechang Zhang(The Pennsylvania State University)、Hengkai Ye(The Pennsylvania State University)、Song Liu(University of Delaware)、Hong Hu(The Pennsylvania State University)
方向: 控制流完整性 & 函数替换攻击 & LLM辅助漏洞利用生成(重点推荐)
摘要:
控制流完整性(Control-Flow Integrity,CFI)通过限制间接控制转移只能跳转到合法目标,防止攻击者劫持程序控制流。然而,即使采用精确的静态CFI策略,攻击者仍可能通过函数替换攻击(Function Substitution Attack,SUB Attack),将某个合法调用目标替换为另一个同样被CFI允许的目标,从而绕过安全机制。此前研究主要依靠人工构造此类攻击,缺乏能够系统化、规模化生成攻击的方法。针对这一问题,本文提出 SACK,这是首个能够大规模自动构造函数替换攻击的系统化框架,在严格遵循精确CFI策略的前提下探索合法目标之间的恶意替换关系。
SACK首先提出“Sub-ground Truth”机制,通过执行正常测试用例动态收集真实触发的间接调用目标,并将其作为精确CFI策略下必然合法的目标子集,从而避免传统静态分析产生大量虚假候选目标。随后,针对函数替换造成的认证绕过、日志关闭、资源限制失效等高层语义影响难以自动判断的问题,SACK 利用LLM从程序文档中提取安全功能及预期行为,自动生成面向认证、速率限制、审计日志和沙箱等安全属性的行为Oracle。最后,框架自动将间接调用目标替换为Sub-ground Truth中的其他合法目标,并通过这些安全Oracle判断替换是否破坏程序原有安全属性,从而形成“合法目标收集—LLM辅助Oracle生成—函数目标替换—安全影响验证”的自动化攻击生成流程。
作者在7个广泛使用的真实应用程序上评估SACK,共针对22项安全功能进行分析,并成功生成419个函数替换攻击,破坏其中18项关键安全机制,影响包括认证绕过、任意代码执行、安全日志失效、资源限制突破和沙箱机制破坏等。作者进一步基于SQLite3、V8和Nginx中的历史漏洞构造5个端到端攻击,实现任意命令执行或认证绕过。结果表明,即使CFI能够精确限制控制流只能到达合法目标,合法函数之间的语义差异仍可能被攻击者利用,从而揭示了传统CFI防御在高层语义安全方面的固有限制。

开源代码:
- https://github.com/psu-security-universe/sack
论文地址:

26. Time will Tell: Large-scale De-anonymization of Hidden I2P Services via Live Behavior Alignment
标题: 时间会揭示一切:基于在线行为对齐的大规模I2P隐藏服务去匿名化
作者: Hongze Wang(Southeast University)、Zhen Ling(Southeast University)、Xiangyu Xu(Southeast University)、Yumingzhi Pan(Southeast University)、Guangchi Liu(Southeast University)、Junzhou Luo(Southeast University;Fuyao University of Science and Technology)、Xinwen Fu(University of Massachusetts Lowell)
方向: 匿名通信安全 & I2P去匿名化 & 行为侧信道分析(重点推荐)
摘要:
I2P(Invisible Internet Project)是一种广泛使用的匿名通信网络。现有I2P去匿名化方法通常需要从大规模网络流量中识别目标隐藏服务的流量特征,但面对由大量路由器组成的I2P网络时难以实现有效扩展。本文提出 I2PERCEPTION,一种利用隐藏服务与宿主路由器在线/离线行为一致性实现I2P隐藏服务大规模去匿名化的低成本方法,无需控制目标隐藏服务通信隧道中的特定节点,也不依赖传统流量相关攻击。
I2PERCEPTION首先部署少量Floodfill路由器,被动收集I2P路由器发布的RouterInfo,并深入分析RouterInfo发布机制,从中识别路由器加入(on)和离开(off)网络时的特征行为,以推断大规模I2P路由器的细粒度在线状态。针对低成本监测过程中RouterInfo可能缺失的问题,作者进一步设计在线会话恢复机制,根据RouterInfo发布时间规律恢复不完整的在线/离线行为序列。随后,系统通过主动探测获得目标隐藏服务的在线/离线模式,并将目标隐藏服务的在线行为与全网路由器的在线行为进行长期时间对齐和相关分析,逐步缩小候选宿主路由器集合,最终定位隐藏服务所在路由器并揭示其真实IP地址。
作者仅部署15个Floodfill路由器,并进行了持续8个月的真实I2P网络实验。实验结果表明,I2PERCEPTION能够准确推断大规模I2P路由器的在线行为,并成功去匿名化实验中部署的全部受控隐藏服务。进一步的大规模测量发现,绝大多数I2P路由器都表现出具有较强区分度的在线/离线行为模式,说明用户驱动的长期在线行为本身可能形成一种能够破坏匿名性的行为侧信道。研究结果揭示,即使攻击者无法控制目标通信路径,也可能通过**“被动监测路由器在线行为 + 主动探测隐藏服务 + 长期行为对齐”**实现低成本的大规模I2P隐藏服务去匿名化。
论文地址:

27. TIPSO-GAN: Malicious Network Traffic Detection Using a Novel Optimized Generative Adversarial Network
标题: TIPSO-GAN:基于新型优化生成对抗网络的恶意网络流量检测
作者: Ernest Akpaku(Jiangsu University)、Jinfu Chen(Jiangsu University)、Joshua Ofoeda(University of Professional Studies, Accra)
方向: 网络入侵检测 & 零日攻击检测 & 生成对抗网络(极其相关)
摘要:
高级网络威胁尤其是零日攻击给网络安全检测带来了较大挑战。传统基于生成对抗网络(Generative Adversarial Network,GAN)的入侵检测方法容易受到训练不稳定和模式崩溃(Mode Collapse)等问题影响。针对这些问题,本文提出 TIPSO-GAN,一种将GAN训练建模为群体优化问题,并利用粒子群优化(Particle Swarm Optimization,PSO)改善生成模型训练过程的恶意网络流量检测框架,旨在提高模型对未知恶意流量的检测能力。
为提升PSO的优化效果,TIPSO-GAN 设计自适应惯性权重,在全局探索与局部开发之间取得平衡;引入多样性保持策略以避免粒子过早收敛;同时设计反馈机制重新初始化长期停滞的粒子,从而缓解GAN训练中的模式崩溃与不稳定问题。在此基础上,框架进一步融合迁移学习与时间衰减多头自注意力(Temporal-Decaying Multi-Head Self-Attention)机制,使模型更加关注近期网络流量特征,并联合重构损失(Reconstruction Loss)与焦点损失(Focal Loss),兼顾正常流量重构质量和难分类恶意样本的识别能力。
作者在CIC-IDS2018、CICAPT-IIoT2024和CIC-DDoS2019三个数据集上开展实验,TIPSO-GAN分别取得99.1±0.1、98.9±0.1和98.7±0.1的F1-score。在CICAPT-IIoT2024上,其Macro PR-AUC达到0.999±0.002。在更加严格的零日攻击评估中,模型在Leave-One-Family-Out(LOFO)测试中取得92.3的F1-score,在跨数据集实验中取得79~83的F1-score,同时Recall保持在0.80以上。此外,TIPSO-GAN的推理延迟约为0.42 ms,吞吐率约为2400 flows/s,并在最高 (10^8) 条流量规模下保持稳定性能。
开源代码:
- https://github.com/osampas27/tipsoganmod
论文地址:

28. vSim: Semantics-Aware Value Extraction for Efficient Binary Code Similarity Analysis
标题: vSim:面向高效二进制代码相似性分析的语义感知值提取
作者: Huaijin Wang(The Ohio State University)、Zhiqiang Lin(The Ohio State University)
方向: 二进制代码相似性分析 & 漏洞检测 & 符号执行(重点推荐)
摘要:
二进制代码相似性分析(Binary Code Similarity Analysis,BCSA)广泛应用于恶意软件分析、漏洞检测和软件供应链安全。现有方法虽然大量采用控制流、指令或神经网络表示,但较少系统利用寄存器和内存运行值所蕴含的程序语义;已有值驱动方法又主要关注跨编译条件保持不变的少量值,面临值提取扩展性不足、语义无关噪声较多以及值比较成本高等问题。针对这些挑战,本文提出 vSim,一种无需机器学习、直接利用二进制程序语义值进行函数级相似性分析的框架,通过系统提取、筛选和建模寄存器与内存操作产生的值,实现准确、鲁棒且可扩展的二进制代码匹配。
vSim首先设计定制化欠约束符号执行(Under-Constrained Symbolic Execution)引擎,以基本块为粒度独立模拟程序执行,全面记录寄存器和内存的Load/Store操作及其具体值、符号值和约束,从而避免传统路径级符号执行的路径爆炸与频繁SMT求解。随后,利用6类基于反汇编经验的启发式规则过滤全局地址等语义无关值,并对剩余值进行规范化(Normalization)和具体化(Concretization),构建可直接比较的函数指纹;进一步将被调用函数的指纹向调用者传播,并依据不同语义值的区分能力赋予权重,在补充跨基本块语义的同时避免昂贵的符号表达式等价性求解。
作者在PEM、BinKit及GMN等数据集上开展实验,覆盖5000余个二进制文件、GCC和Clang两类工具链、6个以上编译器版本以及x86、AMD64、ARM32、ARM64和MIPS32五种架构。在跨编译器实验中,vSim的Recall@1保持在0.611~0.711,而jTrans最低下降至0.078;在跨架构与跨优化联合场景下,vSim取得0.70的MRR@10和0.63的Recall@1,与GMN性能相当,但相似性检索时间仅为15秒,而GMN需要1005秒。在真实漏洞搜索任务中,vSim在Netgear R7000和TP-Link Deco-M4上的平均MRR@10分别达到0.86和0.77,整体优于GMN,表明语义感知值能够为跨编译器、跨优化和跨架构二进制分析提供一种高效且具有较强泛化能力的表示方式。

开源代码:
- https://github.com/OSUSecLab/vSim
论文地址:


总结
写到这里,这篇文章介绍完毕,希望对您有所帮助。学术或许是需要天赋的,这些大佬真值得我们学习,同时自己会继续努力的,学会思考和探索,争取靠后天努力来弥补这些鸿沟,更重要的是享受这种奋斗的过程,加油!
2024年4月28日是Eastmount的安全星球——『网络攻防和AI安全之家』正式创建和运营的日子,该星球目前主营业务为 安全零基础答疑、安全技术分享、AI安全技术分享、AI安全论文交流、威胁情报每日推送、网络攻防技术总结、系统安全技术实战、面试求职、安全考研考博、简历修改及润色、学术交流及答疑、人脉触达、认知提升等。下面是星球的新人券,欢迎新老博友和朋友加入,一起分享更多安全知识,比较良心的星球,非常适合初学者和换安全专业的读者学习。
目前收到了很多博友、朋友和老师的支持和点赞,尤其是一些看了我文章多年的老粉,购买来感谢,真的很感动,类目。未来,我将分享更多高质量文章,更多安全干货,真心帮助到大家。虽然起步晚,但贵在坚持,像十多年如一日的博客分享那样,脚踏实地,只争朝夕。继续加油,再次感谢!
(By:Eastmount 2026-09-11 周五夜于贵阳 http://blog.csdn.net/eastmount/ )
前文赏析:
- [论文阅读] (01)拿什么来拯救我的拖延症?初学者如何提升编程兴趣及LATEX入门详解
- [论文阅读] (02)SP2019-Neural Cleanse: Identifying and Mitigating Backdoor Attacks in DNN
- [论文阅读] (03)清华张超老师 - GreyOne: Discover Vulnerabilities with Data Flow Sensitive Fuzzing
- [论文阅读] (04)人工智能真的安全吗?浙大团队外滩大会分享AI对抗样本技术
- [论文阅读] (05)NLP知识总结及NLP论文撰写之道——Pvop老师
- [论文阅读] (06)万字详解什么是生成对抗网络GAN?经典论文及案例普及
- [论文阅读] (07)RAID2020 Cyber Threat Intelligence Modeling Based on Heterogeneous GCN
- [论文阅读] (08)NDSS2020 UNICORN: Runtime Provenance-Based Detector for Advanced Persistent Threats
- [论文阅读] (09)S&P2019 HOLMES Real-time APT Detection through Correlation of Suspicious Information Flow
- [论文阅读] (10)基于溯源图的APT攻击检测安全顶会总结
- [论文阅读] (11)ACE算法和暗通道先验图像去雾算法(Rizzi | 何恺明老师)
- [论文阅读] (12)英文论文引言introduction如何撰写及精句摘抄——以入侵检测系统(IDS)为例
- [论文阅读] (13)英文论文模型设计(Model Design)如何撰写及精句摘抄——以入侵检测系统(IDS)为例
- [论文阅读] (14)英文论文实验评估(Evaluation)如何撰写及精句摘抄(上)——以入侵检测系统(IDS)为例
- [论文阅读] (15)英文SCI论文审稿意见及应对策略学习笔记总结
- [论文阅读] (16)Powershell恶意代码检测论文总结及抽象语法树(AST)提取
- [论文阅读] (17)CCS2019 针对PowerShell脚本的轻量级去混淆和语义感知攻击检测
- [论文阅读] (18)英文论文Model Design和Overview如何撰写及精句摘抄——以系统AI安全顶会为例
- [论文阅读] (19)英文论文Evaluation(实验数据集、指标和环境)如何描述及精句摘抄——以系统AI安全顶会为例
- [论文阅读] (20)USENIXSec21 DeepReflect:通过二进制重构发现恶意功能(恶意代码ROI分析经典)
- [论文阅读] (21)S&P21 Survivalism: Systematic Analysis of Windows Malware Living-Off-The-Land (经典离地攻击)
- [论文阅读] (22)图神经网络及认知推理总结和普及-清华唐杰老师
- [论文阅读] (23)恶意代码作者溯源(去匿名化)经典论文阅读:二进制和源代码对比
- [论文阅读] (24)向量表征:从Word2vec和Doc2vec到Deepwalk和Graph2vec,再到Asm2vec和Log2vec(一)
- [论文阅读] (25)向量表征经典之DeepWalk:从Word2vec到DeepWalk,再到Asm2vec和Log2vec(二)
- [论文阅读] (26)基于Excel可视化分析的论文实验图表绘制总结——以电影市场为例
- [论文阅读] (27)AAAI20 Order Matters: 二进制代码相似性检测(腾讯科恩实验室)
- [论文阅读] (28)李沐老师视频学习——1.研究的艺术·跟读者建立联系
- [论文阅读] (29)李沐老师视频学习——2.研究的艺术·明白问题的重要性
- [论文阅读] (30)李沐老师视频学习——3.研究的艺术·讲好故事和论点
- [论文阅读] (31)李沐老师视频学习——4.研究的艺术·理由、论据和担保
- [论文阅读] (32)南洋理工大学刘杨教授——网络空间安全和AIGC整合之道学习笔记及强推(InForSec)
- [论文阅读] (33)NDSS2024 Summer系统安全和恶意代码分析方向相关论文汇总
- [论文阅读] (34)EWAS2024 基于SGDC的轻量级入侵检测系统
- [论文阅读] (35)TIFS24 MEGR-APT:基于攻击表示学习的高效内存APT猎杀系统
- [论文阅读] (36)C&S22 MPSAutodetect:基于自编码器的恶意Powershell脚本检测模型
- [论文阅读] (37)CCS21 DeepAID:基于深度学习的异常检测(解释)
- [论文阅读] (38)基于大模型的威胁情报分析与知识图谱构建论文总结(读书笔记)
- [论文阅读] (39)EuroS&P25 CTINEXUS:基于大模型的威胁情报知识图谱自动构建
- [论文阅读] (40)CCS24 PowerPeeler:一种通用的PowerShell脚本动态去混淆方法
- [论文阅读] (41)JISA24 物联网环境下基于少样本学习的攻击流量分类
- [论文阅读] (42)ASC25 基于大语言模型的未知Web攻击威胁检测
- [论文阅读] (43)ESWA25 评估大模型在真实攻击活动的恶意代码解混淆能力
- [论文阅读] (44)一种基于LLM少样本多标签的Android恶意软件检测方法
- [论文阅读] (45)C&S24 AISL: 基于攻击意图驱动与序列学习方法的APT攻击检测
- [论文阅读] (46)IDS-Agent: 一种用于物联网可解释入侵检测的大模型Agent
- [论文阅读] (47)LAMD: 基于大模型上下文驱动的Android恶意软件检测与分类
- [论文阅读] (48)TIFS24 基于注意力的恶意软件API定位技术
- [论文阅读] (49)JNCA24 网络威胁狩猎演化技术综述
- [论文阅读] (50)TDSC23 T-Trace:基于多源系统日志关联的APT溯源图构建
- [论文阅读] (51)ESWA25 基于启发式优化器的入侵检测系统
- [论文阅读] (52)NDSS26 Chimera:利用多智能体大模型自动模拟内部威胁和ATT&CK映射
- [论文阅读] (53)NDSS2026 Fall智能体安全和系统安全方向论文汇总
42

被折叠的 条评论
为什么被折叠?



