REPLICANT: Learning Policies for Evading and Hardening Malware Detectors
作者: Shae McFadden, Ilias Tsingenopoulos, Mario D'Onghia, Alexander Herzog, Myles Foley, Chris Hicks, Lorenzo Cavallaro, Fabio Pierazzi
分类: cs.LG, cs.CR
发布日期: 2026-08-28
💡 一句话要点
提出Replicant框架以增强恶意软件检测的鲁棒性
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 恶意软件检测 深度强化学习 对抗训练 网络安全 黑箱模型
📋 核心要点
- 现有的恶意软件检测方法在面对强大对手时缺乏鲁棒性,无法有效模拟现实中的攻击场景。
- 本研究提出Replicant框架,通过深度强化学习在黑箱模型下学习恶意软件样本的规避策略。
- 实验结果表明,Replicant在七个Android恶意软件检测器上实现了78.8%的平均攻击成功率,显著优于现有方法。
📝 摘要(中文)
为了评估基于机器学习的恶意软件检测在现实世界中的有效性,必须检验其在面对强大对手时的鲁棒性。然而,现有的攻击方法往往假设对训练数据、特征空间或目标的置信度等特权信息的访问,从而未能有效模拟现实对手。在本研究中,我们提出了Replicant,这是一个深度强化学习框架,旨在在严格的标签黑箱威胁模型下学习规避任务。Replicant学习如何修改恶意软件样本及何时查询目标,且该策略可在样本、检测器和特征空间之间迁移。在七个Android恶意软件检测器和三个特征空间中,Replicant展现出最强的查询效率,平均攻击成功率达到78.8%,相较于现有技术提升了20.9%-39.2%。此外,作为对抗训练的一部分,Replicant也在生成更具泛化鲁棒性的检测器方面超越了现有技术。
🔬 方法详解
问题定义:本研究旨在解决现有恶意软件检测方法在面对强大对手时的鲁棒性不足问题。现有攻击方法通常依赖于对特权信息的访问,无法有效模拟真实攻击者的行为。
核心思路:Replicant框架通过深度强化学习在严格的标签黑箱威胁模型下学习恶意软件样本的规避策略,旨在提高攻击成功率并增强检测器的鲁棒性。
技术框架:Replicant的整体架构包括样本修改策略学习模块和查询时机决策模块。通过不断的训练,Replicant能够在不同样本和检测器之间迁移学习到的策略。
关键创新:Replicant的主要创新在于其在黑箱模型下的学习能力,能够在没有特权信息的情况下有效规避检测,与现有方法相比,具有更强的适应性和迁移能力。
关键设计:在技术细节上,Replicant使用了特定的损失函数来优化攻击成功率,并设计了适应不同特征空间的网络结构,以确保策略的通用性和有效性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,Replicant在七个Android恶意软件检测器上实现了78.8%的平均攻击成功率,相较于现有技术提升了20.9%-39.2%。此外,Replicant在对抗训练中生成的检测器表现出更强的泛化鲁棒性,进一步验证了其有效性。
🎯 应用场景
该研究的潜在应用领域包括网络安全、恶意软件检测和对抗机器学习等。通过提高恶意软件的规避能力,Replicant可以帮助安全研究人员更好地理解和强化检测系统,从而提升整体网络安全水平。未来,该框架可能在实际的安全防护系统中得到广泛应用,帮助应对日益复杂的网络威胁。
📄 摘要(原文)
To determine the real-world effectiveness of machine learning based malware detection, it is vital to evaluate its robustness against highly capable adversaries. However, state-of-the-art attacks do not effectively model realistic adversaries, as they often assume access to privileged information such as the training data, feature space, or confidence scores of the target. In this work, we present Replicant, a deep reinforcement learning framework that learns the realistic task of evasion under a strict label-only black-box threat model. Replicant learns a reusable policy on how to modify a malware sample and when to query the target, which transfers across samples, detectors, and feature spaces. Across seven Android malware detectors and three feature spaces, Replicant is the strongest and most query-efficient approach achieving a mean attack success rate of 78.8%, a relative improvement of 20.9%-39.2% over the state-of-the-art. Furthermore, when used for adversarial training, Replicant also outperforms the state-of-the art by producing detectors with more generalizable robustness. With Replicant we demonstrate that learning the task of evasion not only results in stronger attack performance but, crucially, provides a better signal for hardening malware detectors.