一、总体目标、问题与产出#
1.1 研究背景#
随着软件供应链规模持续扩大以及开源软件生态快速发展,漏洞发现与披露数量呈现快速增长趋势。美国国家漏洞数据库(NVD)在2025年收录漏洞超过4万个,较上一年增长约23%。与此同时,攻击者利用公开漏洞发起攻击的时间窗口不断缩短,平均利用时间已降至数天,而企业完成漏洞修复和补丁部署往往需要数周时间。在此背景下,如何快速理解漏洞机理、自动生成漏洞利用程序并评估其安全影响,已成为网络安全领域的重要研究方向。
自动化漏洞利用生成(Automatic Exploit Generation,AEG)旨在自动完成漏洞分析、利用构造和攻击验证等过程。早期研究主要依赖符号执行、约束求解和程序分析等技术,通过分析程序状态空间生成满足漏洞触发条件的输入。然而,这类方法普遍面临路径爆炸、环境依赖强以及跨项目迁移能力有限等问题,难以适应快速增长的真实漏洞场景。
近年来,大语言模型(Large Language Model,LLM)在代码理解、程序推理和自动生成方面展现出显著能力,为自动化漏洞利用生成带来了新的发展机遇。研究范式逐渐由传统程序分析驱动转向“LLM Agent驱动”。相关研究表明,基于GPT-4等模型构建的智能体能够自主完成漏洞分析、环境配置、PoC生成以及利用验证等任务。进一步地,多智能体协作框架被引入漏洞利用生成过程,通过任务分解和角色协同提高复杂漏洞的处理能力。代表性工作如HPTSA、CVE-GENIE、FORGE、Patch-to-PoC、PoC-Adapt以及CVE-Factory等,已经实现从漏洞情报解析到PoC验证的端到端自动化流程,并在大规模CVE数据集上取得了较高的漏洞复现成功率。与此同时,FaultLine、PoCGen、SmartPoC和PoCo等工作进一步探索了跨语言程序、开源软件包以及智能合约场景下的自动化漏洞利用生成能力,推动了AEG技术向更多应用领域扩展。
尽管现有研究在通用软件漏洞自动复现方面取得了显著进展,但其研究对象主要集中于操作系统、应用程序和智能合约等场景,对于DNS等网络协议漏洞的关注仍然有限。与传统软件漏洞相比,DNS漏洞通常涉及缓存机制、委派逻辑、递归解析过程以及协议实现差异等复杂语义问题,其攻击效果更多体现为缓存污染、资源耗尽和异常解析行为,而非程序崩溃等显式结果。因此,现有依赖代码执行状态或source-to-sink数据流分析的PoC生成方法难以直接适用于DNS漏洞场景。此外,公开DNS攻击流量数据集规模有限,缺乏与具体CVE漏洞对应的高质量攻击样本,导致后续检测模型训练和安全评估受到限制。
因此,面向DNS漏洞场景,研究基于大语言模型与多智能体协同的漏洞自动复现技术,构建高质量DNS攻击流量数据集,并进一步开展攻击流量扩展与智能识别研究,对于提升DNS安全分析自动化水平和未知攻击检测能力具有重要的理论意义和实际价值。
1.2 研究问题#
问题一:DNS 协议漏洞的自动化 PoC 复现几乎未被研究。 现有 PoC 生成工作的目标领域高度集中:CVE-Bench [arXiv 2025] 和 FORGE 聚焦 Web 应用漏洞,Patch-to-PoC 专注 Linux 内核,PoCGen 面向 NPM 包生态,SmartPoC 和 PoCo 针对智能合约。DNS 作为互联网基础设施的核心协议,其漏洞影响范围广、危害程度高——例如 RebirthDay Attack [HHXXSIQE, 2025] 利用生日悖论复活了 DNS 缓存投毒攻击,影响近十亿设备;CVE-2024-23017 中 nginx DNS 解析器的 off-by-one 错误可导致堆缓冲区溢出;CVE-2023-50387 (KeyTrap) 通过精心构造的 DNSSEC 记录可实现拒绝服务攻击。然而,DNS 漏洞的自动化复现面临独特挑战:首先,DNS 漏洞涉及协议层语义 (RFC 1035/6891/4035 合规性),而非单纯的代码级缺陷,FaultLine 的 source→sink 代码追踪方法难以直接适用;其次,DNS 服务实现异构 (BIND、Unbound、dnsmasq、PowerDNS 等),环境构建复杂度远高于 CVE-Factory 所处理的 Web 应用;再者,DNS 攻击的网络层行为 (UDP 源地址伪造、反射放大、缓存投毒) 需要网络级观测验证,而 PoC-Adapt 的 Semantic Oracle 仅对比代码执行前后的系统状态,无法捕获网络层面的攻击效果。因此,如何将现有 PoC 生成框架适配到 DNS 协议漏洞场景,是一个亟待解决的开放问题。
问题二:现有 PoC 生成工作止步于攻击实现,未研究攻击流量的检测规避。 当前工作的评估终点是 PoC 是否成功触发漏洞,而生成的攻击流量可被 Suricata、Snort 等入侵检测系统 (IDS) 通过签名规则直接识别。FORGE 虽然首次将 PoC 生成与检测规则工程桥接,但其方向是"从攻击生成检测规则",而非"从攻击规避检测规则"。在实际攻防场景中,攻击者有强烈动机变异攻击流量以规避 IDS 检测,而这一方向在 PoC 生成研究中几乎空白。流量变异面临一个核心矛盾:变异需同时满足两个对立目标——一方面要修改流量特征以规避 Suricata 的签名匹配、协议异常检查和行为统计告警,另一方面必须保持攻击的有效性,即变异后的流量仍能成功触发目标漏洞。PoC-Adapt 提出的 MDP 建模和 DDQN 策略学习为解决此类多目标优化问题提供了思路,但其应用于 PoC 代码生成而非网络流量变异;传统对抗样本研究多面向图像和文本领域,网络流量的离散性 (数据包字段、时序、分片) 使得 GAN 等连续空间方法难以直接适用。此外,Suricata 的多层检测机制 (签名规则 + RFC 协议异常 + 行为统计) 要求变异策略同时规避三层检测,进一步增加了问题复杂度。
问题三:攻击生成与检测识别之间缺乏对抗闭环。 现有研究呈现明显的单向特征:PoC 生成工作 (CVE-GENIE, FORGE, PoC-Adapt 等) 只关注攻击侧,IDS 检测工作只关注防御侧,两者之间缺少动态对抗机制。在真实攻防场景中,攻击者会根据检测反馈不断变异攻击手段,防御者也需要根据新型攻击持续更新检测能力。这种"军备竞赛"在学术研究中尚未被充分建模。CVE-Factory 的 Orchestrator 设计展示了多 Agent 系统的协调能力,PoC-Adapt 的持续学习机制展示了 RL 策略的在线优化能力,但二者均未构建攻击-检测的对抗闭环。如何设计一个变异引擎与识别引擎相互对抗、共同进化的闭环系统,使变异引擎通过 RL 不断发现新的规避路径,识别引擎通过对抗训练提升对变异流量的检测能力,最终趋于纳什均衡,是一个具有重要理论价值和实践意义的问题。
1.3 研究目标#
基于上述分析,本研究的总体目标是:构建一个基于多智能体的 DNS 漏洞攻击流量生成与识别系统 (DNS-VulnGen),实现从 DNS CVE 到自动化 PoC 复现、流量变异规避、再到鲁棒识别的完整对抗闭环。具体而言,系统需具备三项核心能力:第一,给定 DNS 相关 CVE,自动构建漏洞环境并生成可验证的 PoC 攻击脚本,同步采集网络流量 pcap 数据并标注攻击类型与利用深度;第二,对原始攻击流量进行智能变异,使其在保持攻击有效性的前提下规避 Suricata 等检测工具的签名规则、协议异常检查和行为统计告警;第三,训练识别引擎检测变异后的攻击流量,并与变异引擎形成对抗训练闭环,持续提升双方的攻防能力。
1.4 预期产出#
本研究预期产出以下成果。在数据集方面,构建一个 DNS 漏洞 PoC pcap 数据集,包含原始攻击流量和变异流量,覆盖缓存投毒、解析漏洞、放大攻击、隧道传输、协议畸形等五类 DNS 漏洞,每条数据标注 CVE ID、攻击类型、CWE 分类和利用深度等级 (参考 FORGE 的 L0-L3 分级体系)。在方法与模型方面,提出 DNS 漏洞 PoC 自动复现的多 Agent 框架 (借鉴 CVE-Factory 的解耦-耦合架构和 Patch-to-PoC 的工具集设计)、基于 RL+LLM 的流量变异引擎 (借鉴 PoC-Adapt 的 MDP+DDQN 框架和 CVE-Factory 的 LLM 微调方法)、以及变异流量识别模型。在系统方面,实现集成 Web 管理界面的 DNS-VulnGen 系统,支持 CVE 选择、环境配置、变异参数调整、结果可视化等全流程操作。在评估基准方面,建立 DNS 攻击流量的规避深度评估标准,为后续研究提供可对比的基准。
研究点#
研究点1:基于 CVE 漏洞自动化复现的 DNS 攻击流量构建方法研究#
难点#
DNS漏洞涉及BIND、Unbound、dnsmasq等多种解析器实现,不同漏洞往往依赖特定的软件版本、配置条件和运行环境,导致自动化复现难度较高。同时,DNS漏洞大量涉及缓存机制、委派逻辑、DNSSEC验证等协议层语义问题,仅依靠传统代码分析方法难以准确恢复漏洞触发条件。此外,DNS攻击效果通常表现为缓存污染、资源耗尽、异常解析等网络层现象,而非简单的程序崩溃或异常返回,因此需要构建面向DNS场景的自动化验证机制。在此基础上,还需同步完成攻击流量采集与标注,使生成的数据能够真实反映漏洞利用过程和攻击效果。
方法#
针对上述问题,拟构建面向DNS漏洞的自动化复现框架,通过多智能体协同完成漏洞情报分析、环境部署、PoC生成与修正、攻击执行以及效果验证等任务。结合CVE描述、漏洞分析报告、RFC协议规范以及DNS领域知识构建专用知识库,辅助智能体理解漏洞原理和攻击路径。针对不同攻击类型设计差异化验证策略,通过监测缓存状态变化、资源消耗情况以及解析行为异常等指标判断攻击是否成功。在攻击执行过程中同步采集网络流量,并结合攻击验证结果自动生成流量标签,从而构建覆盖多种DNS漏洞类型的攻击流量数据集。
评估方法#
研究将从漏洞复现成功率、PoC生成成功率、攻击验证准确率以及自动标注准确率等方面评估方法有效性,同时考察构建数据集所需时间成本和自动化程度。通过人工复核结果与系统自动判断结果进行对比分析,验证攻击效果判定和流量标注的可靠性,并统计覆盖漏洞类型数量和流量可重放率等指标评价数据集质量。
研究点2:基于攻击语义保持的DNS攻击流量扩展方法研究#
难点#
DNS攻击流量扩展需要在保持攻击效果不变的前提下生成具有差异性的攻击样本,而攻击有效性与流量多样性之间往往存在矛盾。由于DNS协议结构紧凑、字段数量有限,过度修改容易破坏协议格式或导致攻击失效。此外,攻击行为不仅受单个报文字段影响,还与会话过程、解析逻辑以及交互时序密切相关,因此难以建立统一的攻击语义表示模型。如何在庞大的变换空间中高效搜索既符合协议规范又能够保持攻击效果的扩展策略,是该研究面临的重要挑战。
方法#
针对上述问题,拟研究面向DNS攻击的语义保持机制,从攻击目标、漏洞触发条件和攻击效果三个层面刻画攻击语义特征,并构建相应约束模型。在此基础上,从报文字段、协议结构、流量行为和交互时序等多个层面对攻击流量进行扩展,生成具有不同表现形式但保持攻击本质一致的新样本。探索强化学习等智能优化方法自动搜索高质量扩展策略,并结合协议合规性检查和攻击有效性验证机制筛选有效样本,逐步形成覆盖更广攻击空间的DNS攻击流量集合。
评估方法#
研究将重点评估扩展样本的攻击保持能力、多样化程度以及协议合规水平,通过攻击保持率、扩展成功率和协议通过率等指标衡量样本质量。同时分析扩展流量对检测模型性能的影响,考察其对未知攻击场景和复杂网络环境的覆盖能力,并结合扩展效率评价方法的实际应用价值。
研究点3:基于流量生成与变异增强的DNS攻击分析系统设计与实现#
难点#
DNS攻击分析涉及漏洞复现、流量构建、流量扩展、模型训练和检测评估等多个环节,系统集成复杂度较高。随着攻击流量不断演化,传统依赖静态规则或固定数据集训练的检测模型容易出现性能退化,难以适应新型攻击变种。同时,攻击样本生成与检测模型优化之间存在动态博弈关系,如何构建稳定有效的对抗闭环机制,使攻击生成能力和检测识别能力同步提升,是系统设计中的关键问题。此外,系统还需要兼顾自动化程度、扩展能力和运行效率等工程要求。
方法#
针对上述问题,拟设计统一的DNS攻击分析系统,集成漏洞自动复现、攻击流量构建、流量扩展、攻击识别以及效果评估等功能模块,实现从CVE输入到检测结果输出的全流程自动化处理。系统通过统一调度框架协调各模块协同运行,并构建攻击生成模块与检测模块之间的对抗闭环机制。利用持续生成的新型攻击流量不断扩充训练数据,同时根据检测结果动态优化识别模型,实现攻防能力协同演化。最终形成集数据生成、样本扩展、模型训练和效果评估于一体的DNS攻击分析平台。
评估方法#
系统评估将从功能完整性、自动化水平、运行效率和检测性能等多个方面展开。通过端到端任务成功率、平均处理时间以及资源消耗等指标评价系统性能;通过准确率、召回率、F1值等指标评价检测能力;通过未知攻击检测率和跨漏洞类型泛化能力评价系统鲁棒性;同时结合新漏洞接入成本和模块扩展难度等指标分析系统的可扩展性与工程应用价值。
相关工作#
POC自动化生成相关
[arXiv, 2024] Fang 等人提出 LLM Agents can Autonomously Exploit One-day Vulnerabilities,首次证明 LLM Agent 可自主利用真实世界一日漏洞,仅用 91 行代码的 ReAct Agent 在 15 个 CVE 上实现 87% 成功率,但无 CVE 描述时成功率降至 7%。
[arXiv, 2024] Zhu 等人提出 HPTSA (Teams of LLM Agents can Exploit Zero-Day Vulnerabilities),首次证明多 Agent 团队可利用零日漏洞,通过层级规划 Agent 探索网站、分发任务给专门的漏洞利用 Agent,在 15 个真实漏洞上实现 42% 的 pass@5 成功率。
[ACM, 2025] Simsek 等人提出 PoCGen,首次将 LLM 与静态动态分析结合生成 NPM 包 PoC 漏洞利用,从非正式漏洞报告出发,通过 generate-validate-refine 循环生成可执行 PoC,弥补了 SecBench.js 数据集中仅 32% CVE 有 PoC 的缺口。
[arXiv, 2025] Nitin 等人提出 FaultLine,基于 LLM Agent 的分层推理自动生成 PoV (Proof-of-Vulnerability) 测试,通过 source→sink 数据流追踪和分支条件推理构造测试输入,在 Java/C/C++ 的 100 个漏洞上生成 16 个正确 PoV,比 CodeAct 2.1 提升 77%。
[arXiv, 2025] Zhao 等人提出系统性研究,评估 LLM 生成 Web 漏洞 PoC 的能力,覆盖漏洞披露的三个阶段 (仅描述、有补丁、有源码),揭示了现有方法在不同披露阶段的表现差异。
[arXiv, 2025] Liu 等人提出 LLM Agent 自动化 Web 漏洞复现的评估研究,系统调查 LLM Agent 在 Web 漏洞复现中的能力边界,指出当前方法尚未达到实用水平。
[arXiv, 2025] Cheng 等人提出基于 Agent 的 Bug 复现方法,用于有效的自动化程序修复,通过 LLM Agent 从 issue 描述自动复现 bug 以辅助修复验证。
[arXiv, 2025] Ahmed 等人提出 Otter,从 issue 生成测试以验证 SWE 补丁,通过 LLM 理解 issue 描述并生成回归测试,辅助评估补丁正确性。
[arXiv, 2026] Ullah 等人提出 CVE-GENIE,基于 LLM 多 Agent 的端到端 CVE 重现框架,从 CVE 条目出发自动收集资源、重建漏洞环境、生成可验证利用,在 841 个 CVE 上实现 51% (428 个) 的重现率,单个 CVE 成本仅 $2.77。
[arXiv, 2026] Pu 等人提出 Patch-to-PoC (K-Repro),首次系统评估 LLM Agent 在 Linux 内核漏洞复现中的能力,开发了配备代码浏览、VM 管理、VM 交互和 GDB 调试四类工具的 Agent 系统,在 100 个 KernelCTF 漏洞上实现 50%+ 成功率,显著优于定向灰盒模糊测试 SyzDirect。
[arXiv, 2026] Lau 等人提出 ZeroDayBench,构建 22 个新型零日漏洞基准评估 LLM Agent 的防御能力,测试 GPT-5.2、Claude 4.5 和 Grok 4.1 等前沿模型,发现当前 LLM 尚无法自主解决零日漏洞。
[arXiv, 2026] Li 等人提出执行状态感知的 LLM 推理方法用于自动 PoV 生成,指出 LLM 在 PoV 生成中的失败源于缺乏运行时行为感知,通过将 PoV 生成建模为交互式调试过程,结合执行反馈进行语义推理。
[arXiv, 2026] Chen 等人提出 SmartPoC,针对智能合约 bug 报告自动生成可执行且经验证的 PoC,采用 generate-repair-execute 循环和差分验证机制,精确率达 98.3%,单个 bug 成本仅 $0.03。
[arXiv, 2026] Duy 等人提出 PoC-Adapt,基于语义感知的自动化漏洞复现框架,引入 Semantic Oracle 通过对比执行前后系统状态可靠区分真实利用和偶然行为,并用 DDQN 离线学习利用策略,验证可靠性提升 25%,单个 PoC 成本 $0.42。
[ACM TOSEM, 2026] Andersson 等人提出 PoCo,基于 Agent 的智能合约 PoC 漏洞利用自动生成,采用 Reason-Act-Observe 循环自主与代码执行工具交互,生成兼容 Foundry 测试框架的可执行利用,在 23 个真实漏洞报告上显著优于 Zero-shot 和 Workflow 基线。
[arXiv, 2026] Luo 等人提出 CVE-Factory,多 Agent 框架自动将 CVE 元数据转化为可执行的 Agent 任务,通过三阶段解耦生成和三阶段渐进验证,解决方案在专家环境上达 95% 通过率,重现 454 个近期 CVE (66.2% 通过验证),并微调 Qwen3-32B 在 LiveCVEBench 上实现 6.8 倍提升。
[arXiv, 2026] Shaikh 等人提出 FORGE,多 Agent 分级利用与检测工程框架,通过五 Agent 流水线实现 L0-L3 四级利用深度评估,同时产出 Sigma/Snort 检测规则,在 603 个 CVE 上达到 L1+ 67.8% 的利用率,首次桥接 PoC 生成、漏洞优先级排序和检测规则工程三个孤立社区。
[arXiv, 2026] Sun 等人提出 SemFuzz,面向网络协议实现的语义感知黑盒模糊测试框架,利用 LLM 从 RFC 文档提取结构化语义规则,通过语义建模、意图驱动变异和响应验证检测深层语义漏洞,在 7 个协议实现上发现 16 个潜在漏洞 (10 个真实,含 5 个未知漏洞和 4 个 CVE)。
Reply by Email