网络安全顶会——NDSS 2025 论文清单与摘要(3)

171、TWINFUZZ: Differential Testing of Video Hardware Acceleration Stacks

视频硬件加速栈包含多个与软硬件组件交互的复杂层级,旨在提升视频解码、编码及转换等高负荷任务的效率与性能。然而其实施过程因缺乏操作透明度而引发安全隐患。多层架构的复杂性使得自动化测试尤为困难,后硅测试阶段的可观测性缺失更是雪上加霜。测试需涵盖五大交互层级:应用程序层、用户空间支持驱动层、内核层、加速外设固件层以及硬件层,各层级的可内省性与可见性随栈深度逐级递减。

本文提出基于间接代理目标的差异化测试方法,通过硬件加速视频解码栈的差异测试实现测试框架设计。核心思路是利用白盒软件实现的代码覆盖率作为间接代理,指导对不可观测黑盒硬件加速栈的模糊测试。我们开发了差异比对机制,通过对比软件实现与硬件加速输出的解码差异,间接探索加速栈黑盒组件。基于该方法实现的TWINFUZZ工具原型专注于视频处理领域,在四种加速框架中成功识别七类错误的实现差异与安全漏洞。具体而言,我们在应用层发现并负责任地披露了2个安全漏洞,驱动层发现3个漏洞,同时在测试平台上识别出15组可引发观测差异的输入集群,这些差异可用于设备或网页浏览器中的硬件加速栈与软件栈指纹识别。此外,通过输入回放技术,我们在Firefox浏览器和VLC媒体播放器中发现了漏洞。研究成果揭示了构建稳健测试机制对保障硬件加速实现安全性的必要性,并凸显了差异化模糊测试中改进故障定位的重要性。

论文链接:https://www.ndss-symposium.org/ndss-paper/twinfuzz-differential-testing-of-video-hardware-acceleration-stacks/

172、TZ-DATASHIELD: Automated Data Protection for Embedded Systems via Data-Flow-Based Compartmentalization

随着嵌入式系统在医疗保健、工业自动化和无人驾驶等关键领域的应用日益广泛,确保微控制器单元(MCU)上数据的安全性变得至关重要。这些系统面临着计算能力和能源限制带来的重大挑战,使得维护敏感数据的机密性和完整性变得复杂。以往的方法采用隔离技术来保护敏感数据,但仍可能被利用特权软件的强大攻击者攻破。

本文提出TZ-DATASHIELD,一种新颖的LLVM编译器工具,通过敏感数据流(SDF)隔离技术增强ARM TrustZone,为基于MCU的系统提供针对强大攻击者的鲁棒保护。我们解决了三个主要挑战:现有隔离单元的局限性、可信执行环境(TEE)内部隔离不足,以及共享数据暴露于潜在攻击的风险。TZ-DATASHIELD通过以下方式应对这些挑战:实现专注于敏感数据流的细粒度隔离,确保数据机密性和完整性;开发一种新型TEE内部隔离机制,在运行时验证隔离单元对TEE资源的访问权限。我们的原型工具支持固件开发者通过源代码注释自动生成兼容TrustZone的固件镜像。基于真实MCU应用的评估表明,TZ-DATASHIELD能在TEE地址空间内减少高达80.8%的隔离内存和88.6%的ROP gadget。在启用CFI和DFI时平均运行时开销为14.7%,未启用时为7.6%。

论文链接:https://www.ndss-symposium.org/ndss-paper/tz-datashield-automated-data-protection-for-embedded-systems-via-data-flow-based-compartmentalization/

173、The (Un)usual Suspects – Studying Reasons for Lacking Updates in WordPress

像WordPress这样的内容管理系统(CMS)的广泛使用,使其成为攻击者的主要目标,而代码中的漏洞更带来了严重风险。尽管安装最新安全补丁是降低风险最有效的方式,但超过半数的CMS系统仍未更新至最新版本。研究人员曾尝试通过漏洞通知提醒网站运营者,但收效甚微。本文采用扎根理论方法,探究网站所有者不更新CMS系统的原因。为全面理解滞后的更新行为,我们采访了仍在使用旧版WordPress的网站所有者,以及参与网站开发和托管的相关人员。一方面,我们证实了其他生态系统中已知的问题(如风险意识不足、对更新风险的担忧及更新成本)同样是阻碍CMS更新的因素。更重要的是,本研究发现了更新行为与漏洞通知研究中尚未明确提及的两个关键因素:(1)网站对持有者的主观价值;(2)网站运维的委托关系——这两者对更新行为的影响更为决定性。此外,我们发现网站所有者仅将CMS潜在入侵视为自身风险,而非对更广泛网络社区的威胁。这些被归纳为四种"非更新情景"的发现,或许能部分解释以往漏洞通知措施效果有限的原因。本研究不仅为未来探索漏洞通知有效性及更新行为提供了新视角,更为减少网络环境中过时系统的数量提出了切实建议。

论文链接:https://www.ndss-symposium.org/ndss-paper/the-unusual-suspects-studying-reasons-for-lacking-updates-in-wordpress/

174、The Discriminative Power of Cross-layer RTTs in Fingerprinting Proxy Traffic

全球互联网审查趋势日益加剧,使得代理工具(尤其是混淆规避代理)的使用需求激增。这些代理为审查严格地区的数百万用户提供了获取信息与保持连接的基础需求。然而,随着代理的普及,审查者也加紧投入资源检测和阻断此类规避流量,以强化其信息管控政策。

本文揭示了一种检测混淆代理流量的固有指纹特征。该指纹源于代理路由中传输层与应用层会话的错位,表现为跨网络层往返时间(RTT)的差异。关键的是,这种协议无关性指纹使攻击者能同时有效针对多种代理协议。我们通过受控测试环境和合作ISP提供的真实流量数据展开全面评估,验证了审查者利用该指纹的可能性。除独立研究价值外,这种基于时序的指纹漏洞暴露出现有混淆技术的缺陷。我们期望本研究能促使规避社区重视数据包时序这一薄弱环节,推动开发更具可持续性的防御方案。

论文链接:https://www.ndss-symposium.org/ndss-paper/the-discriminative-power-of-cross-layer-rtts-in-fingerprinting-proxy-traffic/

175、The Forking Way: When TEEs Meet Consensus

越来越多的分布式平台将可信执行环境(TEE)与区块链技术相结合。事实上,许多人将TEE与区块链的结合誉为天作之合:TEE为区块链带来机密计算能力,而共识层则能帮助TEE抵御分叉攻击。本文系统梳理了当前区块链方案整合TEE的方式及其抗分叉攻击的安全程度。通过全面分析29个基于TEE的区块链提案(涵盖学术方案到生产级平台),我们发现业界对如何结合TEE与区块链尚未形成共识。具体而言,我们识别出四种TEE与共识机制的互联方式,分析其局限性并探讨改进方案。研究还首次披露了三个生产级TEE区块链平台(Ten、Phala和Secret Network)中未被记录的分叉攻击。基于分析结果,我们提出了针对这些漏洞的有效防护措施,并向各受影响平台的开发团队进行了负责任的漏洞披露。

论文链接:https://www.ndss-symposium.org/ndss-paper/the-forking-way-when-tees-meet-consensus/

176、The Guardians of Name Street: Studying the Defensive Registration Practices of the Fortune 500

我们运用拼写、语音和语义模型,研究了与《财富》500强企业基础域名各类变形相关的防御性注册现状。通过大规模评估,我们重点探究了以下问题:(a) 是否存在可解释因素(如企业安全团队规模或域名流行度排名)与企业的防御性注册参与程度相关;(b) 识别《财富》500强企业依赖的防御性注册生态中的主要参与者;(c) 揭示这些参与者采用的策略;(d) 从大型互联网服务提供商(ISP)的查询流量角度评估这些策略的有效性。

总体而言,我们发现447家《财富》500强企业共注册了19,523个防御性域名。这些企业进行防御性注册时较为保守,近200家企业注册数量不足十个。通过分析注册行为,我们发现企业注册的域名类型存在高度相似性——例如均大量注册TLD抢注型域名。这种趋同性源于企业普遍依赖在线品牌保护(OBP)服务商来维护品牌权益。对OBP策略有效性的分析表明,其注册的域名确实拦截了大部分潜在的抢注流量。我们通过回归模型从这些策略中提炼经验,为未来的防御性注册者提供建议。测量还发现,许多长期获得高比例流量、注册成本仅需15美元的域名未被保护。为防止这类域名被滥用,我们建议OBP服务商主动利用被动DNS数据,识别并预先注册高频查询的可用域名。

论文链接:https://www.ndss-symposium.org/ndss-paper/the-guardians-of-name-street-studying-the-defensive-registration-practices-of-the-fortune-500/

177、The Kids Are All Right: Investigating the Susceptibility of Teens and Adults to YouTube Giveaway Scams

诈骗分子常以免费商品为诱饵,诱使受害者完成在线任务却最终一无所获。尽管已有大量研究对这类"赠品骗局"进行特征分析,但尚未有以人类为对象的研究探讨用户如何与之互动或哪些因素导致受害。我们针对美国青少年(n=85)和成人众包工作者(n=205)开展情境实验,研究用户如何理解并应对YouTube视频中的赠品骗局,并验证青少年是否比成人更易受骗。研究发现多数参与者能识别视频的欺诈性质,仅9.2%认为骗局视频提供真实优惠。青少年受害频率未显著高于成人,但更常搜索可能导致受害的关键词。本研究首次比较成人与青少年用户遭遇网络诈骗时的交互差异,为社会工程学这一研究不足的领域提供了新见解。

论文链接:https://www.ndss-symposium.org/ndss-paper/the-kids-are-all-right-investigating-the-susceptibility-of-teens-and-adults-to-youtube-giveaway-scams/

178、The Midas Touch: Triggering the Capability of LLMs for RM-API Misuse Detection

作为软件资源管理(RM)的基础,严格遵守RM-API约束条件能保障资源管理与软件的安全性。为提升RM-API应用效果,研究者发现通过从文档和代码中提取RM-API约束来检测开源软件中的API误用具有实效。然而当前基于模式匹配的约束提取方法存在局限:基于文档的方法会遗漏大量分布不规则或涉及中性情感的API约束;基于代码的方法因高频使用未必正确而产生大量误报。

为此,研究者提出利用大语言模型(LLMs)进行RM-API约束提取,充分发挥其在文本分析与生成方面的潜力。但直接使用LLMs会因幻觉问题产生局限:模型在缺乏专业知识时会虚构答案,既遗漏大量RM API又生成错误结论,甚至在有证据支撑时仍输出错误约束条件导致误报。本文提出LLM赋能的RM-API误用检测方案ChatDetector,通过全自动化LLM实现文档理解,辅助完成RM-API约束提取与误用检测。为准确提取约束条件,该方案受ReAct框架启发——该框架基于思维链(CoT)优化,将复杂任务分解为分配API识别、RM对象(由RM API分配/释放)提取和RM-API配对(RM API通常成对存在)。系统首先通过LLM验证从API文档中提取的RM语句语义。

基于LLMs在不同提示方法中的表现,ChatDetector采用二维提示法进行交叉验证,同时利用现成NLP工具对LLM输出与推理过程进行一致性检查以确认分配API。为实现精准的RM-API配对,系统再次分解任务流程:先识别RM对象类型,据此准确匹配释放API,最终构建用于误用检测的RM-API约束集。经幻觉抑制后,ChatDetector以98.21%的准确率识别出165组RM-API,优于现有API检测器。通过静态检测器CodeQL,我们向开发者道德披露了集成六大流行库的应用程序中的115个安全漏洞,这些漏洞可能导致拒绝服务(DoS)和内存破坏等严重问题。相比端到端基准方法,ChatDetector的RM语句提取量提升至少47%,RM-API约束提取量增加80.85%。据我们所知,这是首个利用LLMs进行RM-API误用检测的研究,其突破性成果表明:LLMs能突破专业限制生成更多约束条件用于缺陷检测,也预示着未来安全研究可从突破传统NLP工具瓶颈转向创造性运用LLMs。

论文链接:https://www.ndss-symposium.org/ndss-paper/the-midas-touch-triggering-the-capability-of-llms-for-rm-api-misuse-detection/

179、The Philosopher’s Stone: Trojaning Plugins of Large Language Models

开源大语言模型(LLMs)近期因其性能可与专有模型媲美而广受关注。为高效完成领域特定任务,开源LLMs可通过低秩适配器进行微调,且无需昂贵加速器。然而,低秩适配器是否可能被用于操控LLMs仍属未知。针对这一空白,我们证实:被植入恶意代码的适配器可在特定触发条件下,诱导LLM输出攻击者预设内容,甚至恶意调用工具。为训练特洛伊适配器,我们提出两种新型攻击方法POLISHED与FUSION,其性能优于现有方案。POLISHED基于"优质LLM能更有效注入污染知识"的洞见,采用高阶LLM对齐初步污染数据;而FUSION通过创新性过载毒化技术,放大模型权重中触发器与目标的注意力关联,将良性适配器转化为恶意载体。实验环节,我们首先通过两个案例研究展示:被入侵的LLM智能体可利用恶意软件控制系统(如LLM驱动的机器人)或发起鱼叉式钓鱼攻击。在定向虚假信息场景中,我们的攻击方法较现有基线具有更高有效性,同时为吸引下载能保持或提升适配器效用。最后,我们设计并评估了三种防御方案,但均未能完全抵御攻击,这表明需要建立更强大的防御机制来保障LLM供应链安全。

论文链接:https://www.ndss-symposium.org/ndss-paper/the-philosophers-stone-trojaning-plugins-of-large-language-models/

180、The Power of Words: A Comprehensive Analysis of Rationales and Their Effects on Users' Permission Decisions

权限说明为应用开发者提供了一种向用户传达权限需求的方式。尽管存在关于如何申请权限的指导原则和建议,开发者仍拥有设计并撰写这些说明的自主空间。在本研究中,我们探讨了现实世界中权限说明的特征,以及其构成要素如何影响用户的权限决策及其对这些决策的评估。通过对Google Play热门应用中720条权限说明文本和428张截图的分析,我们识别出权限说明在措辞和设计上的多样化元素。随后,在一项涉及960名参与者的用户研究中,我们探究了不同措辞组合如何影响用户的权限决策过程。通过将研究发现与既有建议相结合,我们为开发者提供了可操作的指南,旨在使权限说明成为用户可用的安全工具。

论文链接:https://www.ndss-symposium.org/ndss-paper/the-power-of-words-a-comprehensive-analysis-of-rationales-and-their-effects-on-users-permission-decisions/

181、The Road to Trust: Building Enclaves within Confidential VMs

完整性对于维护系统安全至关重要,它能确保只有可信软件被加载到机器上。尽管机密虚拟机(CVMs)运行在与主机隔离的环境中,但必须认识到用户仍面临如何确保可信执行环境(TEEs)内代码完整性的挑战。复杂的操作系统(OS)存在动态创建和执行任意代码的可能性,一旦客户机操作系统被攻破,TEE中的用户应用程序就可能遭受干扰或篡改。

为解决这一问题,本文提出NestedSGX框架,该框架利用AMD SEV-SNP的最新硬件特性——虚拟机特权级别(VMPL),在客户虚拟机内创建硬件飞地。与Intel SGX类似,NestedSGX将客户机OS视为不可信实体以防止潜在恶意代码加载,并确保只有经过验证的可信代码才能在飞地内执行并通过远程认证。为实现对现有应用的无缝保护,NestedSGX通过模拟SGX叶函数保持与Intel SGX的兼容性。我们还将SGX SDK和Occlum库操作系统移植到NestedSGX,使得现有SGX工具链和应用可在该系统中运行。性能评估表明,NestedSGX的上下文切换耗时约32,000至34,000个时钟周期,约为Intel SGX的1.9至2.1倍。在大多数实际应用中,NestedSGX产生的开销极小:计算和内存密集型工作负载平均开销低于2%,I/O密集型工作负载平均开销低于15.68%。

论文链接:https://www.ndss-symposium.org/ndss-paper/the-road-to-trust-building-enclaves-within-confidential-vms/

182、The Skeleton Keys: A Large Scale Analysis of Credential Leakage in Mini-apps

近年来,应用内应用(超级应用与小程序)模式在移动生态系统中日益普及。超级应用平台为小程序服务器提供了一系列强大且敏感的服务接口,包括支付处理和小程序分析功能。这种访问权限使小程序服务器能够通过增强功能更好地服务用户。为保护这些核心服务,平台采用了基于凭证的认证系统,以保障超级应用平台与小程序服务器之间的安全通信。然而,这一关键凭证机制的设计流程仍不透明,更重要的是,其安全性至今尚未得到全面认知与探究。

本文首次对应用内应用模式中的凭证系统进行系统性研究,揭示了凭证泄露风险的安全态势。研究发现,21个主流超级应用平台通过7类凭证向小程序服务器委派敏感服务。不幸的是,这些凭证可能因恶意小程序用户行为面临泄露威胁,对平台和小程序服务器均构成严重安全隐患。为此,我们设计并实现了新型凭证安全验证工具KeyMagnet,可有效评估凭证泄露的安全影响。该工具通过解析小程序中非结构化动态获取的凭证使用语义,实现安全验证。最终,我们在6个超级应用平台的413,775个真实小程序中检测出84,491例凭证泄露事件,涉及54,728个小程序。研究证实凭证泄露可导致严重危害,例如劫持所有小程序用户账户、窃取敏感数据等。我们已向相关开发者进行负责任的漏洞披露,并协助修复问题。截至撰写时,已有89个上报漏洞获得CVE编号。

论文链接:https://www.ndss-symposium.org/ndss-paper/the-skeleton-keys-a-large-scale-analysis-of-credential-leakage-in-mini-apps/

183、Time-varying Bottleneck Links in LEO Satellite Networks: Identification, Exploits, and Countermeasures

本文针对新兴低地球轨道(LEO)卫星网络(LSNs)中独特的时变瓶颈链路所带来的安全风险进行了多维度研究。我们通过三个步骤展开研究:首先,我们剖析了瓶颈链路的时空特征及其可能被用于链路识别的潜在途径,揭示出这类链路将导致卫星网络面临新型链路泛洪攻击(LFA)风险。其次,我们提出SKYFALL——一种新型LFA风险分析器,可使卫星网络运营商模拟各类LFA攻击行为,并全面评估其对LSN服务的综合影响。基于实际在轨卫星网络的真实数据,SKYFALL分析表明:当攻击者操控若干受控用户终端持续拥塞瓶颈链路时,合法背景流量的吞吐量最高可下降3.4倍。最后,我们在分析基础上探讨了传统LFA防御措施的局限性,并为卫星网络提出了新型缓解策略。

论文链接:https://www.ndss-symposium.org/ndss-paper/time-varying-bottleneck-links-in-leo-satellite-networks-identification-exploits-and-countermeasures/

184、Too Subtle to Notice: Investigating Executable Stack Issues in Linux Systems

数十年前,代码注入曾是攻击者利用缓冲区溢出漏洞的惯用手法。随着写异或执行(W⊕X)等轻量级解决方案的广泛采用,通过禁止内存同时可写可执行,这类攻击已得到有效遏制。然而,我们观察到多起令人担忧的案例:软件开发者在主流应用中意外禁用W⊕X机制,导致可执行堆栈重现。尽管每次违规行为最终都被修复,但核心问题依然存在——为何在当代软件开发实践中,开发者仍会反复犯这类错误?

本文通过两项研究深入探究Linux系统中正确实施W⊕X所面临的挑战。首先,我们对程序加固工具进行考察,检验资深安全开发者是否始终遵循避免可执行堆栈的关键步骤。其次,通过分析编译工具链、内核与加载器的源代码,系统评估Linux平台W⊕X机制的实现现状。研究发现:Linux系统要正确实施W⊕X,需要多个组件紧密协作。这些工具通过复杂的信任链与依赖关系共同守护程序堆栈安全。但开发者在编写汇编代码(包括安全研究人员)时,往往会忽略.note.GNU-stack这一关键而微妙的节区声明,从而意外引入可执行堆栈。例如,11款以内联引用监控器(IRM)形式实现的程序加固工具,竟为所有"受保护"应用都引入了可执行堆栈。基于这些发现,我们探讨了攻击者可能的利用场景,并提出了缓解建议。

论文链接:https://www.ndss-symposium.org/ndss-paper/too-subtle-to-notice-investigating-executable-stack-issues-in-linux-systems/

185、Towards Understanding Unsafe Video Generation

视频生成模型(VGMs)已展现出合成高质量内容的能力。理解其生成暴力、恐怖等有害视频的潜在风险至关重要。本研究首次系统揭示了有害视频生成的全貌。为验证模型生成有害视频的可能性,我们选取4chan和Lexica平台收集的有害内容提示词,结合三种开源前沿视频生成模型进行测试。

经过重复项剔除与低质量内容过滤后,我们从初始5607个视频中筛选出2112个有害视频构成初选集。通过聚类分析与主题编码,我们识别出五类有害视频:文本强调{扭曲/怪异}、文本强调{恐怖}、文本强调{色情}、文本强调{暴力/血腥}以及文本强调{政治}。在获得IRB伦理审查批准后,我们招募线上参与者对生成视频进行标注。基于403名参与者提交的标注结果,最终从初选集中确定937个有害视频。结合标注数据与对应提示词,我们构建了首个VGMs生成有害视频数据集。

针对防御机制研究,现有图像生成防御方案仅关注输入提示词或输出结果过滤。我们提出名为fullsysname(简称sysname)的新方法,通过介入模型内部采样过程实现防护。sysname在批量采样有害提示词时能达到0.90防御准确率,同时减少10倍时间与计算资源消耗。实验涵盖三种开源前沿视频扩散模型,其防御准确率分别达0.99、0.92和0.91。该方法在对抗性提示词测试及图生视频扩散模型中均表现优异,两种场景下准确率接近1.0。与其他防御方案结合时,本方法还展现出显著的协同增效特性。

论文链接:https://www.ndss-symposium.org/ndss-paper/towards-understanding-unsafe-video-generation/

186、TrajDeleter: Enabling Trajectory Forgetting in Offline Reinforcement Learning Agents

强化学习(RL)通过智能体与环境交互产生的经验进行训练。在在线交互不可行的场景下,利用预收集数据集训练智能体的离线强化学习逐渐兴起。尽管这一新范式在医疗、能源管理等现实领域展现出显著成效,但如何快速彻底消除特定轨迹对训练数据集及已训练智能体的影响,正成为日益迫切的需求。针对该问题,本文提出TRAJDELETER——首个面向离线强化学习智能体的轨迹遗忘实用方案。其核心思想是引导智能体在遇到待遗忘轨迹关联状态时表现恶化,同时确保其在面对其他保留轨迹时维持原有性能水平。此外,我们引入TRAJAUDITOR这一简洁高效的评估方法,用于验证TRAJDELETER是否成功消除了目标轨迹对离线强化学习智能体的影响。基于六种离线强化学习算法和三项任务的实验表明,TRAJDELETER仅需从头训练约1.5%的时间,即可有效遗忘平均94.8%的目标轨迹,且遗忘后在实际环境交互中仍表现良好。实验复现包及智能体参数已开源。

论文链接:https://www.ndss-symposium.org/ndss-paper/trajdeleter-enabling-trajectory-forgetting-in-offline-reinforcement-learning-agents/

187、Translating C To Rust: Lessons from a User Study

Rust致力于为程序提供完整的内存安全性保障,这是未经约束的C程序所不具备的特性。将现有C代码转换为Rust的难度究竟如何?为获取与自动化C转Rust工具不同的视角,我们开展了一项用户研究,邀请人类参与者对真实世界的C程序进行Rust翻译。研究表明参与者能够产出安全的Rust翻译版本,而当前最先进的自动化工具尚无法实现这一点。我们的分析揭示:用户采用的高级策略与我们研究的自动化工具存在显著差异。同时发现用户常选择零成本(静态)抽象来实现时序安全,这解决了其他完整内存安全防御方案中运行时开销的主要构成因素。用户提供的翻译版本展现出丰富多样的专业策略——通过不同方式将同一C程序转化为安全的Rust代码,这为未来自动化翻译工具提供了可借鉴的思路。

论文链接:https://www.ndss-symposium.org/ndss-paper/translating-c-to-rust-lessons-from-a-user-study/

188、Transparency or Information Overload? Evaluating Users’ Comprehension and Perceptions of the iOS App Privacy Report

苹果公司于2021年推出的"App隐私报告"(简称隐私报告)旨在向iOS用户披露应用程序对其数据和传感器(如通讯录、摄像头)的访问情况。与其他隐私仪表盘不同,该功能还会展示应用和网站所联系的具体域名。为评估隐私报告的实际效果,我们开展了半结构化访谈(样本量n=20),重点考察用户对披露信息的反应、对相关隐私影响的理解程度,以及可能采取的隐私保护行为调整。研究发现:参与者能轻松掌握手机中哪些应用在特定时间访问了数据或传感器,并知晓如何撤销异常访问权限;但在理解应用与网站的网络活动方面存在明显困难——他们对网络活动的发生机制与原因感到困惑,面对应用联系的大量域名不知所措,也不清楚针对潜在隐私威胁可采取哪些补救措施。研究表明,虽然隐私报告等工具通过展示数据处理细节提升了透明度,但我们建议对技术细节(如联系域名的目的)提供更多解释或聚合呈现,以帮助用户做出知情决策。

论文链接:https://www.ndss-symposium.org/ndss-paper/transparency-or-information-overload-evaluating-users-comprehension-and-perceptions-of-the-ios-app-privacy-report/

189、Truman: Constructing Device Behavior Models from OS Drivers to Fuzz Virtual Devices

虚拟设备是虚拟机监控程序(hypervisor)的一大攻击面。虚拟设备中的漏洞可能使攻击者突破虚拟机监控程序的隔离限制,甚至威胁到同主机上的其他虚拟机。尽管模糊测试技术已在开源和闭源虚拟机监控程序中发现了诸多虚拟设备漏洞,但由于现有模糊测试工具普遍缺乏对虚拟设备复杂行为的认知,其测试效率仍然受限。本文提出Truman——一种新型通用模糊测试引擎,它能通过分析开源操作系统驱动自动推断依赖关系,进而构建适用于虚拟设备模糊测试的设备行为模型(DBM),无论目标虚拟设备是开源实现还是二进制形式。该模型涵盖虚拟设备消息间的交互依赖与消息内部依赖,以及细粒度的状态依赖关系。基于DBM,Truman能生成并变异符合模型依赖关系的高质量测试用例。我们在最新版虚拟机监控程序上对Truman原型系统进行评估:在覆盖率方面,Truman对29个QEMU设备中的19个表现优于当前最先进的模糊测试工具,针对virtio设备的覆盖率较Morphuzz提升34%;此外,Truman在QEMU、VirtualBox、VMware Workstation Pro和Parallels中发现了54个新漏洞,其中6个获得CVE编号。

论文链接:https://www.ndss-symposium.org/ndss-paper/truman-constructing-device-behavior-models-from-os-drivers-to-fuzz-virtual-devices/

190、Try to Poison My Deep Learning Data? Nowhere to Hide Your Trajectory Spectrum!

在数据即服务(DaaS)模式下,诸如亚马逊众包平台(Amazon Mechanical Turk)、Appen和TELUS International等商业数据托管方通过汇聚大量贡献者提供的高质量数据,并将其售卖给深度学习(DL)模型供应商以获取利润。然而,恶意贡献者可能污染这些数据,在训练后的DL模型中植入后门。现有污染样本检测方法存在显著局限:通常依赖预留的干净数据;对投毒比例、触发器类型和后门类型敏感;且仅适用于分类任务。这些缺陷阻碍了数据托管方在实际场景中的采用。

本研究首次从频谱域角度分析污染样本的训练轨迹,揭示了其在原始非频谱域中不明显的、与良性样本的差异性。基于这一创新视角,我们提出TellTale方案,通过一次性检测净化操作,全面解决上述现有工作的所有局限。大量实验表明,TellTale无需任何预留干净数据即可抵御通用型及高难度的部分后门类型。该方案还被验证对各类触发器(包括CCS'2023提出的先进干净标签触发器攻击Narcissus)具有普适性。此外,TellTale在多种数据模态(如图像、音频和文本)及非分类任务(如回归)中均表现优异,成为目前唯一适用于非分类任务的训练阶段污染样本检测方案。所有评估中,TellTale的检测准确率(即正确识别污染样本)不低于95.52%,误报率(即误判良性样本)最高仅0.61%。与最先进方案ASSET(Usenix'2023)和CT(Usenix'2023)的对比进一步证实了TellTale的优越性:ASSET无法处理部分后门类型,且对实践中常见的干净/良性数据集产生难以承受的误报率;而CT对Narcissus触发器失效。相比之下,TellTale在现有方案失效的测试场景中均表现卓越。源代码已发布于https://github.com/MPaloze/Telltale。

论文链接:https://www.ndss-symposium.org/ndss-paper/try-to-poison-my-deep-learning-data-nowhere-to-hide-your-trajectory-spectrum/

191、Tweezers: A Framework for Security Event Detection via Event Attribution-centric Tweet Embedding

Twitter被视为传播和收集网络威胁情报(CTI)的关键平台。其实时提供可操作情报的能力,使其成为检测安全事件、帮助安全专业人员应对日益增长威胁的不可或缺工具。然而,海量推文及人工撰写内容固有的噪声,为准确识别安全事件带来了重大挑战。尽管许多研究尝试基于关键词筛选事件相关推文,但由于其理解推文语义的局限性,效果并不理想。  

另一个挑战在于安全事件检测的全面覆盖性。先前研究强调了安全事件早期检测的重要性,但忽视了事件覆盖范围的意义。为应对这些挑战,本研究提出了一种以事件归因为核心的新型推文嵌入方法,以实现高精度和广泛的事件覆盖。实验结果表明,该方法在识别安全事件方面优于现有基于文本和图结构的推文嵌入方法。  

基于这一创新嵌入技术,我们开发并实现了框架textit{Tweezers},适用于从Twitter检测安全事件以进行CTI收集。该框架展现出显著有效性,检测到的事件数量是现有基准方法的两倍。此外,我们还展示了两个基于textit{Tweezers}的应用案例:安全事件趋势分析和高价值安全用户识别,用于安全事件的整合与研判。

论文链接:https://www.ndss-symposium.org/ndss-paper/tweezers-a-framework-for-security-event-detection-via-event-attribution-centric-tweet-embedding/

192、UI-CTX: Understanding UI Behaviors with Code Contexts for Mobile Applications

许多移动应用通过UI控件与用户交互并触发特定操作逻辑,例如点击按钮发送消息。虽然UI控件设计初衷是直观易用,但也可能被滥用于实施违背用户预期的有害行为。为应对这些潜在威胁,近期研究致力于解析移动应用中UI控件的真实意图。然而现有方法要么仅关注UI控件的表层特征,无法捕捉其深层意图;要么混杂冗余错误信息,难以提炼核心意图。本文提出UI-CTX框架,通过简洁高效的表示方法揭示UI行为本质。对于每个UI控件,UI-CTX首先构建UI处理程序图(UHG)表征其意图,在保留控件背后代码上下文的同时剔除无关信息(如不可达代码块);随后通过图摘要技术,结合UHG的结构与语义信息建模UI控件的核心意图。为系统评估UI-CTX,我们从大规模数据集中提取登录、搜索等系列UI控件行为展开实验。结果表明:UI-CTX能有效表征控件意图,在UI行为建模上显著优于现有方案。例如在控件意图分类任务中,UHG相较最先进方案采用的权限集和调用序列表示法,分别实现95.2%和8.2%的平均F1值提升;通过精准定位控件代码上下文,UI-CTX在控件意图聚类性能上获得3.6倍提升。

论文链接:https://www.ndss-symposium.org/ndss-paper/ui-ctx-understanding-ui-behaviors-with-code-contexts-for-mobile-applications/

193、URVFL: Undetectable Data Reconstruction Attack on Vertical Federated Learning

纵向联邦学习(VFL)是一种为多客户端共享同一批数据样本不同特征场景设计的协作学习范式。尽管应用广泛,VFL仍面临数据重构攻击导致的隐私泄露风险。这类攻击通常分为两类:诚实但好奇型(HBC)攻击者遵守协议但窃取数据;恶意型攻击者则违反训练协议造成大规模数据泄露。现有研究多聚焦于HBC场景,对恶意攻击的探索仍显不足。

在VFL中实施有效恶意攻击存在独特挑战:1)由于客户端数据特征和模型的分布式特性,各客户端严格保护隐私并禁止直接查询,使数据窃取复杂化;2)现有恶意攻击会改变VFL底层训练任务,通过对比接收梯度与诚实训练梯度极易被检测。为突破这些限制,我们提出URVFL新型攻击策略,其核心是集成带辅助分类器的判别器:一方面充分利用标签信息优化不同类别样本嵌入表征,提升重构性能;另一方面基于标签信息计算的恶意梯度能高度模拟诚实训练,使攻击梯度难以区分且极具隐蔽性。实验表明URVFL显著优于现有攻击方案,并能成功规避最先进的恶意攻击检测方法。消融实验与防御评估进一步验证了该方案的鲁棒性和有效性。

论文链接:https://www.ndss-symposium.org/ndss-paper/urvfl-undetectable-data-reconstruction-attack-on-vertical-federated-learning/

194、Uncovering the iceberg from the tip: Generating API Specifications for Bug Detection via Specification Propagation Analysis

现代软件通常提供多样化的API以简化开发流程。某些API在使用时会影响特定变量并需要进行后续处理,例如错误检查与资源释放。开发者应严格遵循其使用规范,否则可能引发严重安全威胁,如内存破坏或系统崩溃。检测此类误用行为依赖于完备的API规范——任何违反规范的操作即构成API误用。现有研究尝试从API文档、使用模式和缺陷补丁等多种数据源提取规范,但这些资料往往存在缺失或不可获取的情况,导致大量未被覆盖的API因缺乏规范而产生漏报。

本文提出"API规范传播"的创新理念:规范会沿着层级化API调用链进行传播。现代软件普遍采用分层API设计,高层API基于底层API构建。当高层API封装底层API时,可能继承其对应规范。基于此,我们开发了APISpecGen工具:以已知规范为种子,通过双向传播分析生成新API规范。具体而言,给定种子规范后,APISpecGen会推断规范可能传播至或源自哪些API,进而结合API使用场景生成目标API规范,并基于种子规范进行数据流验证。此外,系统会将已生成规范作为新种子迭代传播以扩大覆盖范围。为提升分析效率与精度,APISpecGen仅聚焦与规范相关的代码语义。

实验评估表明,APISpecGen以6条种子规范为起点,最终生成7332条规范。由于数据源质量限制,当前最先进技术难以覆盖这些生成规范中的大部分。基于生成规范,该系统在Linux内核中发现186个新缺陷,其中113个获开发者确认,8个被分配CVE编号。

论文链接:https://www.ndss-symposium.org/ndss-paper/uncovering-the-iceberg-from-the-tip-generating-api-specifications-for-bug-detection-via-specification-propagation-analysis/

195、Understanding Data Importance in Machine Learning Attacks: Does Valuable Data Pose Greater Harm?

机器学习已彻底革新众多领域,在推动技术进步和实现数据驱动流程方面发挥着关键作用。数据对于训练模型及塑造其性能的重要性无论如何强调都不为过。近期研究揭示了单个数据样本的差异化影响,尤其是一类显著提升机器学习模型效用与效能的高价值数据。但一个关键问题尚未得到解答:这些高价值数据样本是否更易遭受机器学习攻击?本研究通过分析五种典型攻击类型,深入探究了数据重要性与机器学习攻击间的关联。我们的发现揭示了若干重要现象:例如,在成员推断和模型窃取等特定攻击中,高重要性数据样本表现出更强的脆弱性。这些发现亦具有实践意义,可启发研究者设计更高效的攻击方法。通过分析成员推断脆弱性与数据重要性的关联,我们证明通过引入样本特异性标准,可将样本特征融入成员推断指标,从而提升攻击性能。这些发现凸显了对新型防御机制的迫切需求——必须在最大化模型效用与保护高价值数据免遭潜在滥用之间实现平衡。

论文链接:https://www.ndss-symposium.org/ndss-paper/understanding-data-importance-in-machine-learning-attacks-does-valuable-data-pose-greater-harm/

196、Understanding Miniapp Malware: Identification, Dissection, and Characterization

超级应用作为集中管理用户信息并整合第三方小程序的一站式平台,虽革新了移动计算领域,却也因恶意小程序带来了重大安全风险。尽管内置小程序商店实施了强制审核机制,但不断进化的小程序恶意软件仍持续与平台安全措施展开攻防博弈。然而相较于移动端和网页计算等传统模式,学术界长期缺乏可供研究的小程序恶意软件数据集,阻碍了关键洞见的产生与鲁棒检测技术的开发。为此,本文深耕恶意小程序分析这一鲜少探索的领域,历时三年多对这些小程序的风险进行识别、剖析与验证,最终建成首个开源的小程序恶意软件数据集,以助力提升超级应用生态安全。

数据集构建以全球最大超级应用微信平台为核心研究对象,该平台承载数百万小程序并服务十亿级用户。通过长期监测,我们累计采集450余万个小程序,并采用双重验证流程精确定位19,905个恶意样本:1)应用来自真实案例的静态特征签名;2)确认样本已被平台下架清退。基于这些样本,我们系统刻画了其传播、激活及载荷执行等生命周期特征,并结合实际案例分析了其现实危害。

研究发现,这些恶意软件普遍存在三大危害:窃取用户隐私、滥用社交网络分享功能传播未授权服务、操纵广告分成模式非法牟利。这些行为对用户隐私和平台经济均造成了实质性损害。

论文链接:https://www.ndss-symposium.org/ndss-paper/understanding-miniapp-malware-identification-dissection-and-characterization/

197、Unleashing the Power of Generative Model in Recovering Variable Names from Stripped Binary

反编译旨在恢复二进制可执行文件的源代码形式,在恶意软件分析、漏洞检测和代码加固等安全领域具有广泛应用。变量名恢复是反编译过程中的核心挑战。我们提出了一种创新技术,既能发挥生成式模型的优势,又可缓解模型偏差问题。基于预训练生成模型CodeGemma-2B、CodeLlama-7B和CodeLlama-34B,我们构建了原型系统GenNm,通过对反编译函数进行微调,使模型学会利用上下文信息。GenNm在查询函数时会整合调用者与被调用者的名称,在模型输入标记限制范围内提供丰富的上下文信息。我们通过将模型输出分布与开发者的符号偏好对齐来缓解模型偏差。实验结果表明:在两个常用数据集上,GenNm将变量名恢复准确率提升了5.6-11.4个百分点;在最严苛的测试场景(训练数据未包含真实变量名)中,其性能较现有最佳水平提升32%(从17.3%提升至22.8%)。

论文链接:https://www.ndss-symposium.org/ndss-paper/unleashing-the-power-of-generative-model-in-recovering-variable-names-from-stripped-binary/

198、VeriBin: Adaptive Verification of Patches at the Binary Level

厂商常会收到修复已知安全漏洞的软件更新版本。然而,由于无法确保补丁软件不会破坏原始版本的功能,这往往阻碍了补丁的部署。当补丁软件仅以编译后的二进制形式提供时,这一问题尤为严重。这种情况下,无法手动分析补丁源代码,而依赖源代码的现有自动化补丁分析技术也不适用。即使源代码可获取,正如近期XZ Utils后门事件所凸显的,二进制层面的补丁验证仍至关重要。

为解决此问题,我们提出VeriBin系统,该系统能比较二进制文件与其补丁版本,并判定补丁是否"可安全应用"——即不会引入任何可能破坏原始二进制功能的修改。为实现这一目标,VeriBin会检查原始二进制与补丁二进制之间的功能等价性。具体而言,VeriBin首先使用符号执行系统化识别补丁引入的修改,随后验证这些修改是否符合特定属性,以确保不会破坏原始二进制功能。针对无源代码场景,VeriBin的设计解决了编译过程中语义信息缺失、以及精确符号执行大型函数复杂性等多项挑战。

我们在86个样本数据集上评估VeriBin,结果显示其准确率达93.0%且无误报,仅需分析师极少量输入。此外,我们还演示了如何利用VeriBin检测近期发现的XZ Utils后门。

论文链接:https://www.ndss-symposium.org/ndss-paper/veribin-adaptive-verification-of-patches-at-the-binary-level/

199、VoiceRadar: Voice Deepfake Detection using Micro-Frequency and Compositional Analysis

近年来,合成语音生成技术(包括文本转语音(TTS)和语音转换(VC)模型)取得了显著进展,能够生成以假乱真的合成语音,即所谓的音频深度伪造内容。这类伪造语音正构成日益严重的威胁——攻击者可利用它们在社交媒体上冒充特定人物(尤其是公众人物),或绕过声纹认证系统,从而产生广泛的社会影响。当前最先进的验证系统仍无法有效检测语音伪造内容,这一现状令人担忧。

我们提出了一种新型音频深度伪造检测方法VoiceRadar,该方法通过融合物理模型与机器学习来近似模拟音频样本中的频率动态与振荡特性,从而显著提升检测能力。VoiceRadar主要利用两大物理模型:(1)多普勒效应模型解析音频样本中的频率变化;(2)鼓膜振动模型将复杂音频信号分解为组成频率。通过应用这些模型,VoiceRadar能够识别音频信号中细微的微观频率变化。这些微观频率经聚合处理后生成观测频率,从而捕捉音频的独特特征。该观测频率被整合至机器学习算法的损失函数中,使算法能识别区分人类真实语音与AI生成语音的独特模式。

为全面评估VoiceRadar,我们构建了包含主流TTS和VC模型样本的多样化新数据集。实验结果表明,VoiceRadar在准确识别AI生成音频样本方面优于现有方法,展现出其作为音频深度伪造检测工具的强大潜力。

论文链接:https://www.ndss-symposium.org/ndss-paper/voiceradar-voice-deepfake-detection-using-micro-frequency-and-compositional-analysis/

200、VulShield: Protecting Vulnerable Code Before Deploying Patches

尽管软件漏洞频繁曝光,但修补这些漏洞的过程依然缓慢且充满挑战,这为攻击者留下了潜在的可乘之机。为缓解这一威胁,研究人员致力于寻找临时解决方案,以期在漏洞被官方修复前阻止其被利用或触发。然而,现有方法存在保护范围有限、常需修改目标漏洞程序代码、依赖最新系统特性等缺陷,这些局限性严重削弱了其实用价值。

本研究提出VulShield系统,这一自动化临时防护方案有效解决了上述问题。VulShield基于检测器报告自动生成描述漏洞触发条件的安全策略,并通过Linux内核模块实时拦截漏洞触发行为。通过精心设计的内核模块,该系统能同时保护存在漏洞的内核及运行其上的用户空间程序,且不依赖eBPF或Linux安全模块等新型系统特性。该系统具有即插即用、非侵入式特点,无需修改目标漏洞软件代码。

我们在9类漏洞场景中对VulShield进行全面评估,结果表明该系统能以自动化方式有效阻断所有漏洞利用案例。以Nginx为例,单次请求延迟增加不超过0.001毫秒,UnixBench测试中观测到的峰值性能损耗仅为1.047%。

论文链接:https://www.ndss-symposium.org/ndss-paper/vulshield-protecting-vulnerable-code-before-deploying-patches/

201、Vulnerability, Where Art Thou? An Investigation of Vulnerability Management in Android Smartphone Chipsets

安卓智能手机芯片组中的漏洞具有严重后果,正如近期现实攻击所表明的,攻击者可利用这些漏洞执行任意代码或窃取机密信息。尽管此类攻击影响深远,但芯片组漏洞的生命周期尚未得到研究,现有论文主要聚焦于安卓操作系统中的漏洞。本文首次对安卓生态系统中智能手机芯片组漏洞管理现状展开全面实证研究:我们构建了统一知识库,涵盖四大芯片制造商437款芯片型号的3,676个漏洞及6,866款智能手机型号。分析表明,相同漏洞常存在于多代芯片组中,这为"漏洞在芯片代际间遗传"提供了全新实证依据。此外,我们发现业界普遍接受的90天漏洞负责任披露周期鲜少被遵守,单个漏洞往往影响数百至数千款手机型号,而这些设备的补丁更新状态(如我们所示)常不明确或严重延迟。基于实证分析获得的新见解,我们提出芯片制造商可实施的若干改进方案以提升产品安全性。同时,本知识库将助力学术界更准确地评估芯片组漏洞影响、开展更具代表性的研究,并为未来研究方向提供指引。

论文链接:https://www.ndss-symposium.org/ndss-paper/vulnerability-where-art-thou-an-investigation-of-vulnerability-management-in-android-smartphone-chipsets/

202、WAVEN: WebAssembly Memory Virtualization for Enclaves

可信执行环境(TEE)的进步推动了机密计算范式的发展,并为WebAssembly(Wasm)创造了新的应用场景。"Wasm+TEE"设计通过强隔离性实现了安全飞地内的多租户架构,支持多用户不可信代码实例的并发执行。然而,Wasm的线性内存模型缺乏高效的跨模块数据共享与细粒度内存访问控制能力,这严重限制了其在需要安全数据共享的机密计算场景(如机密有状态FaaS和数据交易平台)中的应用。本文提出WAVEN(面向安全飞地的WebAssembly内存虚拟化方案),通过创新的WebAssembly内存虚拟化技术实现模块间内存共享与页级访问控制。我们在主流TEE Wasm运行时WAMR上实现了WAVEN,并通过实验验证了其高效性与实用性。据我们所知,这是首个在Wasm中实现跨模块内存共享且具备细粒度内存访问控制的研究成果。

论文链接:https://www.ndss-symposium.org/ndss-paper/waven-webassembly-memory-virtualization-for-enclaves/

203、Wallbleed: A Memory Disclosure Vulnerability in the Great Firewall of China

我们提出了textit{Wallbleed}漏洞,这是中国国家防火墙DNS注入子系统中存在的一个缓冲区越界读取漏洞。该漏洞导致某些全国性审查中间设备在处理特制DNS查询时,会泄露多达125字节的内存内容。这为研究防火墙内部架构和审查者操作行为提供了一个罕见视角,尤其针对其著名的DNS注入网络攻击。

为探究Wallbleed的成因与影响,我们自2021年10月起进行了为期两年多的纵向全网测量,具体包括:(1)逆向工程分析注入器的解析逻辑,(2)评估信息泄露内容及对国内外互联网用户的影响,(3)持续监测审查系统的修补行为。

我们识别出审查系统可能的内部流量,分析了其内存管理与负载均衡机制,并观测到注入器节点的进程级变化。研究中采用新型侧信道技术区分注入器的多进程以辅助分析。

监测显示审查系统于2023年11月实施了不完整的修补方案,最终在2024年3月完成彻底修复。Wallbleed案例表明,审查中间设备对互联网用户的危害远不止于对言论自由的明显侵犯。当实现存在缺陷时,还会对用户隐私和机密信息构成严重威胁。

论文链接:https://www.ndss-symposium.org/ndss-paper/wallbleed-a-memory-disclosure-vulnerability-in-the-great-firewall-of-china/

204、Was This You? Investigating the Design Considerations for Suspicious Login Notifications

许多在线平台通过监控用户的账户登录活动来检测未经授权的登录尝试。一旦发现异常活动,这些平台会向用户发送可疑登录通知。此类通知旨在提供足够详实的信息,帮助用户判断登录行为是否合法,并在必要时采取补救措施。尽管这类通知已被广泛采用,但关于用户如何与之互动以及如何优化其设计的研究却十分有限。

本文以现实场景为背景,研究了用户对基于电子邮件可疑登录通知的参与行为。我们收集并分析了当前实际使用的通知样本,为常见设计要素建立实证基础。本研究聚焦于在线平台实际采用的设计方案,而非探索所有潜在设计可能,因此这些设计方案均基于平台实际可提供的登录数据,具有现实可行性。随后,我们探究了这些设计要素如何促使用户阅读通知、验证真伪、诊断登录尝试并确定合适的补救措施。通过对20名美国受访者进行在线半结构化访谈,我们调查了其历史经验,并向其展示主流平台采用的设计要素,从而识别最优设计方案。研究结果揭示了能有效提升用户理解与参与度的实用设计方法,为部署高效通知提供建议,同时为安全社区指明未来研究方向。

论文链接:https://www.ndss-symposium.org/ndss-paper/was-this-you-investigating-the-design-considerations-for-suspicious-login-notifications/

205、Welcome to Jurassic Park: A Comprehensive Study of Security Risks in Deno and its Ecosystem

众所周知,Node.js及其生态体系npm存在严重安全隐患,助长了软件供应链攻击的泛滥。Deno作为新兴运行时环境,旨在为浏览器外运行不可信JavaScript代码提供更安全的替代方案。它汲取Node.js的教训,采用内存安全的Rust语言编写,并配备严格的权限系统,通过静态或运行时权限检查所有敏感API的访问。Deno还支持通过URL引入第三方代码,倡导完全去中心化的软件供应链,承诺实现更透明的依赖管理机制。

本文系统评估Deno是否兑现了其安全承诺。研究发现:虽然Deno确实比Node.js具备更小的攻击面,但既有的重DoS(ReDoS)攻击仍未解决,原型污染攻击仅得到部分缓解。更重要的是,我们发现Deno权限系统存在多处缺陷,使得复杂供应链攻击成为可能:其一,粗粒度权限使攻击者可滥用操作系统环境权限绕过检查;其二,URL导入豁免权限验证,导致非法网络请求得以执行;此外符号链接处理存在时间差漏洞,使细粒度文件系统访问控制失效。

我们进一步实证研究Deno核心生态deno.land,探究开发者使用第三方代码的模式及权限配置现状。研究发现:除经典的URL相关问题(如域名失效、依赖不安全传输协议)外,当代码分发涉及多域名时,难以保证版本控制的统一性与不可变性。证据还表明开发者普遍存在权限文档缺失问题,且倾向于滥用粗粒度权限,削弱了权限系统的防护价值。

基于研究成果,我们向Deno团队提交了两份安全通告,推动其导入机制重新设计。本文还提出具体改进建议以强化安全模型:增加导入权限、文件系统层级访问控制、支持沙箱隔离机制,以及记录细粒度权限的清单文件,从而进一步防范供应链攻击。

论文链接:https://www.ndss-symposium.org/ndss-paper/welcome-to-jurassic-park-a-comprehensive-study-of-security-risks-in-deno-and-its-ecosystem/

206、What’s Done Is Not What’s Claimed: Detecting and Interpreting Inconsistencies in App Behaviors

移动应用的广泛使用在满足用户需求的同时也引发了安全隐患。当前的安全分析方法往往难以有效解决用户关切,因其未能从用户视角解析应用行为,导致用户无法充分理解应用内部风险,在不知情下暴露隐私。一方面,现有方法的分析结果通常以代码层面呈现,对用户而言晦涩难懂;另一方面,这些方法忽视了用户对应用行为的感知差异。本文旨在从应用中提取与用户相关的行为,并以可理解的自然语言形式向用户阐释,使用户能感知预期行为与实际行为间的偏差,并自主评估不一致性中的风险。实验表明,我们的工具emph{InconPreter}能有效提取应用中的不一致行为并提供准确合理的解释。在标注数据集上,InconPreter实现了94.89%的不一致行为识别准确率;在广泛使用的安卓恶意软件数据集上,其风险分析准确率达94.56%。应用于真实场景应用时,InconPreter从Google Play抓取的10,878个应用中检测出413款应用存在1,664个风险性不一致行为,包括位置信息、短信、通讯录泄露以及未经授权的录音等,可能影响数百万用户。此外,InconPreter能检测出既往工具未识别的行为,如拍照、聊天、开启移动热点等多种场景下的非授权位置披露。我们对发现的行为进行了深入分析,以深化对不一致行为的理解,从而帮助用户更好地管理隐私,并为后续应用开发中的隐私设计提供洞见。

论文链接:https://www.ndss-symposium.org/ndss-paper/whats-done-is-not-whats-claimed-detecting-and-interpreting-inconsistencies-in-app-behaviors/

207、You Can Rand but You Can't Hide: A Holistic Security Analysis of Google Fuchsia's (and gVisor's) Network Stack

本研究首次对Google Fuchsia/gVisor网络堆栈的算法安全性进行了全面分析。Google Fuchsia是谷歌以"从零开始"方式开发的新操作系统,据推测最终将取代Android成为智能手机、平板电脑及物联网设备的操作系统。目前Fuchsia已在数百万台Google Nest Hub消费级产品中运行。Google gVisor是谷歌应用引擎(App Engine)、云函数(Cloud Functions)、云机器学习引擎(Cloud ML Engine)、云运行(Cloud Run)及谷歌Kubernetes引擎(GKE)所使用的应用内核。Fuchsia操作系统采用gVisor网络堆栈代码实现其TCP/IP协议。

我们发现了Fuchsia/gVisor在填充网络协议头字段时所用算法的多个漏洞,具体涉及TCP初始序列号、TCP时间戳、TCP/UDP源端口以及IPv4/IPv6分片ID字段。通过系统性分析,我们展示了如何组合多种攻击手段暴露用于生成上述字段的伪随机数生成器(PRNG)种子及哈希密钥。这使得攻击者能够预测字段未来值,进而实施多种网络攻击。本研究重点关注基于PRNG种子与哈希密钥稳定性及相对唯一性的网络设备追踪技术。我们通过在多个Fuchsia设备、多种浏览器模式(常规/隐私)、多种网络环境(包括IPv4与IPv6)下进行互联网实测,验证了Fuchsia设备追踪的可行性,并能生成可靠的设备标识符。

最后我们提出了缓解攻击及其根本原因的建议。研究结果已向谷歌报告,谷歌针对我们披露的安全漏洞发布了CVE编号及补丁程序。

论文链接:https://www.ndss-symposium.org/ndss-paper/you-can-rand-but-you-cant-hide-a-holistic-security-analysis-of-google-fuchsias-and-gvisors-network-stack/

208、YuraScanner: Leveraging LLMs for Task-driven Web App Scanning

Web应用扫描器作为高效的黑盒测试工具,通过自动探索和交互用户界面来检测漏洞。然而受限于对工作流的理解能力,这类工具难以发现现代Web应用中的深层状态。本研究提出任务驱动的YuraScanner扫描器,利用大语言模型(LLM)自主执行任务流以突破该局限。

YuraScanner采用目标驱动模式,通过解析网页语义信息来推荐动作以实现预设目标。与传统依赖用户提供操作轨迹的方法不同,该工具借助LLM消除语义鸿沟,实现与Web应用无关的通用扫描。结合Black Widow的XSS检测引擎,YuraScanner能对发现的输入点进行漏洞测试,显著提升扫描过程的全面性与准确性。

我们在20个多样化Web应用上评估了任务提取、执行准确率和漏洞发现能力。结果表明YuraScanner在发掘新攻击面和深层状态方面具有显著优势:相比Black Widow发现的3个零日XSS漏洞,YuraScanner成功识别出12个独特漏洞。这项研究证明了基于自动化任务驱动方法的Web应用扫描技术具有革命性潜力。

论文链接:https://www.ndss-symposium.org/ndss-paper/yurascanner-leveraging-llms-for-task-driven-web-app-scanning/

209、type++: Prohibiting Type Confusion with Inline Type Information

类型混淆(或称错误转型)是C++中常见的攻击手段。此类漏洞会导致程序将对象误判为其他类型,从而引发控制流劫持等高危攻击。由于C++仅在多态类中保留内联类型信息,其运行时类型检查仅适用于多态类。对象生命周期内缺乏持续的类型信息,使得在向下转型时难以实施连续检查来预防类型混淆。现有解决方案要么为所有对象单独记录类型信息导致过高运行时开销,要么仅对部分对象提供保护。

我们设计的C++方言type++贯彻以下原则:所有参与向下转型的分配对象在其整个生命周期携带类型信息,确保必要时可随时进行类型校验。由于不仅多态对象、而是所有对象都具备类型信息,所有向下转型操作均可实现动态验证。相较于现有方案,我们的策略大幅降低运行时开销,使type++既能用于测试也可作为防护措施。针对SPEC CPU2006和CPU2017基准测试,我们编译运行了204万行代码,仅需修改314行。配套的静态分析工具可提示开发者需要修改的代码位置。基准测试显示性能开销可忽略不计(SPEC CPU2006为1.19%,SPEC CPU2017为0.82%),共验证900亿次转型操作(相比现有最优方案的38亿次提升23倍)。type++在SPEC CPU测试集中发现122个类型混淆问题,其中62个为新发现。在Chromium项目中,我们仅修改35百万行代码中的229行,即保护了94.6%可能涉及向下转型漏洞的类,运行时开销仅增加0.98%。

论文链接:https://www.ndss-symposium.org/ndss-paper/type-prohibiting-type-confusion-with-inline-type-information/

210、“Where Are We On Cyber?” – A Qualitative Study On Boards' Cybersecurity Risk Decision Making

董事会日益需要监督所在组织的网络安全风险。为做出明智决策,董事会成员必须依赖所获得的信息,这些信息可能来自首席信息安全官(CISO)、高管报告、审计结果或监管要求。

然而,目前鲜有研究揭示董事会在接收此类信息后如何决策,以及他们与其他利益相关方的关系如何影响这些决策。本文通过深度访谈研究,呈现了18位来自英国大型企业的C级高管、董事会成员、CISO及高管顾问的实证结果。

研究发现存在权力失衡现象:董事会成员常因担心暴露自身技术短板而不敢向高管和CISO提出关键问题。这导致董事会高度依赖网络安全信息提供方,最终丧失监督职能。此外,网络安全风险被简化为预算决策问题,董事会未能深入参与网络安全战略制定。

我们探讨了强化董事会监督职能的可行路径,例如通过公共网络机构发布行业基准指标,或在企业内部建立常设(网络安全)风险与审计委员会等支持架构。

论文链接:https://www.ndss-symposium.org/ndss-paper/where-are-we-on-cyber-a-qualitative-study-on-boards-cybersecurity-risk-decision-making/

211、”Who is Trying to Access My Account?” Exploring User Perceptions and Reactions to Risk-based Authentication Notifications

基于风险的身份验证(RBA)正日益普及,其通知功能能及时警示用户以防范未授权访问。最新研究表明,用户可识别由自身触发的合法登录通知,但鲜有研究关注非账户持有者触发的RBA通知能否有效提升用户危机意识并阻止潜在攻击。本文邀请258名线上参与者和15名线下参与者,探究用户对三类RBA通知(正确密码触发、错误密码触发及密码重置触发)的认知、反应及期望。结果显示:超90%参与者认为RBA通知重要;用户对三类通知的情感反应与行为无显著差异,但对其预期存在明显区分。当收到非本人触发的RBA通知时,多数参与者会产生怀疑、紧张和焦虑情绪,并立即查看通知全文。46%用户怀疑RBA通知可能是钓鱼攻击,而将其归类为潜在钓鱼或垃圾信息可能导致账户保护失效。尽管如此,65%用户仍会登录账户检查异常活动,若未发现问题则不再采取行动。当前RBA通知形式既未能赢得用户信任,也未满足其期望。研究发现,RBA通知需提供更详尽的异常访问信息、补充安全措施及明确风险说明。最后,我们提出五项RBA通知设计建议,以更好地缓解潜在风险并增强账户安全。

论文链接:https://www.ndss-symposium.org/ndss-paper/who-is-trying-to-access-my-account-exploring-user-perceptions-and-reactions-to-risk-based-authentication-notifications/

评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值