Large Language Model-Based Reward Design for Deep Reinforcement Learning-Driven Autonomous Cyber ...
一、文章主要内容总结该研究聚焦于复杂动态网络环境中自主网络攻防的奖励设计难题,提出了一种基于大语言模型(LLM)的奖励设计方法,结合深度强化学习(DRL)构建自主网络防御策略。核心内容如下:研究背景:传统网络攻防奖励设计依赖领域专家(SMEs),但随着网络状态空间扩大和攻防行为复杂化,专家面临巨大认知负担;而LLM的知识合成与上下文推理能力为解决该问题提供了可能。核心框架:以Cyberwheel为高保真仿真环境,利用Claude Sonnet 4(具备先进编码和推理能力的LLM),根据不同攻防主体的异质行为特征(如激进型/隐蔽型攻击者、两种主动型防御者)生成上下文感知的奖励结构,再通过近端策略优化(PPO)算法训练DRL防御代理。实验设计:设计9组攻防主体组合实验,对比LLM生成的奖励结构与专家基线奖励结构的效果,通过“首次攻击影响时间”“防御行为分布”等指标评估防御策略性能。关键发现:LLM引导的主动型DRL防御代理能有效延迟激进型和隐蔽型攻击者的攻击影响;混合防御策略(根据攻击者类型切换防御主体模式)对多样化攻击行为具有更强适应性。二、文章创新点LLM赋能奖励设计:将LLM(LLM4RL范式)应用于网络攻防的奖励结构生成,将攻防主体的定性行为特征(如“激进”“隐蔽”“主动”)转化为定量奖励指标,减轻专家认知负担,提升奖励设计的针对性。