1. 从“盲人摸象”到“心有灵犀”无信道状态信息毫米波波束赋形的挑战与机遇想象一下在一个拥挤的火车站你和你的朋友走散了。你们俩都没有手机只能靠喊话。但周围人声鼎沸你的声音被淹没朋友根本听不见。这时如果你们能各自找到一块“智能反光板”通过调整板子的角度把你们的声音精准地“反射”到对方耳朵里是不是就能高效沟通了这个场景正是无信道状态信息毫米波波束赋形技术试图解决的通信难题的一个生动比喻。在毫米波通信领域尤其是在高频段信号传输极易受遮挡路径损耗巨大。传统的解决方案比如波束赋形需要通信双方基站和用户设备先进行复杂的“握手”过程——也就是获取信道状态信息。这个过程就像在嘈杂的火车站里你先得花时间大喊“测试测试”根据回声判断朋友的位置和周围环境才能调整你的喊话方向。这不仅消耗宝贵的通信资源导频开销在高速移动或环境快速变化时这种“回声定位”还常常来不及更新就失效了导致通信链路中断。而“无信道状态信息”这个方向其核心追求就是摆脱对传统信道估计的依赖让通信系统能像两个默契的伙伴一样无需频繁的“测试喊话”就能快速、精准地建立连接。近年来可重构智能超表面技术的兴起为解决这个问题提供了全新的硬件基础。RIS可以被看作是由大量低成本、可编程的“智能反光板”单元组成的平面通过软件控制每个单元的电磁特性就能动态地塑造无线环境将信号“聚焦”到目标用户。那么如何指挥这成百上千个“智能反光板”协同工作在不知道精确信道信息的情况下快速找到最优的波束聚焦方向呢这正是我们标题中“分层多智能体强化学习”大显身手的地方。本文将深入拆解这个前沿课题从毫米波通信的痛点出发一步步剖析如何将复杂的波束赋形问题转化为一个多智能体协作的“游戏”并利用分层强化学习策略让智能体们学会“反思”与协作最终实现高效、鲁棒的无信令波束对准。无论你是通信领域的研究者还是对强化学习应用感兴趣的工程师这篇文章都将为你提供从理论到实践落地的完整视角。2. 毫米波通信的“阿喀琉斯之踵”为何CSI获取如此棘手要理解“无CSI”的价值我们必须先直面传统毫米波波束赋形中CSI获取的固有难题。毫米波频段通常指30-300 GHz拥有丰富的频谱资源是5G及未来6G实现超高速率的关键。然而其物理特性也带来了严峻挑战波长极短毫米量级导致信号绕射能力极差极易被人体、墙壁甚至树叶遮挡同时自由空间路径损耗与频率的平方成正比使得信号衰减非常严重。为了对抗巨大的路径损耗毫米波通信系统必须采用大规模天线阵列通过波束赋形技术将发射能量集中在一个极窄的波束内像探照灯一样指向接收端从而获得极高的阵列增益。这个过程的核心输入就是CSI。它描述了信号从发射端经过复杂环境反射、折射、散射到达接收端的完整“旅程”信息包括幅度衰减和相位变化。2.1 传统CSI获取的“三重门”获取精确的CSI在毫米波系统中是一个昂贵且脆弱的过程主要体现在以下三个方面第一重门高昂的导频开销。为了估计一个大规模天线阵列的信道系统需要发送一系列已知的导频信号。天线数量越多需要估计的信道参数就越多所需的导频符号数量也呈线性甚至指数增长。这占用了本可用于传输数据的时频资源直接降低了系统的频谱效率。在用户密集或高速移动场景下为每个用户频繁执行这一过程开销更是难以承受。第二重门算法复杂性与时延。高维信道估计本身就是一个计算密集型任务。经典的估计算法如最小二乘、最小均方误差在面对大规模天线时其矩阵求逆等运算复杂度极高。虽然有一些压缩感知等降复杂度算法但它们往往对信道稀疏性有假设在实际非理想稀疏环境中性能会下降。从发送导频、接收反馈到完成计算并生成波束赋形权重这一连串操作引入了不可忽视的处理时延对于低时延应用如工业控制、XR是致命的。第三重门CSI的快速时效性。毫米波信道极其脆弱环境中的微小变化如行人走动、车辆经过都可能导致信道突变。尤其在用户移动速度较快时信道相干时间信道保持基本不变的时间长度非常短。可能你刚刚花费巨大开销估计出的CSI在下一刻就已经过时了。使用过时的CSI进行波束赋形会导致波束指向错误信号接收功率骤降链路质量急剧恶化甚至中断。2.2 RIS引入的新维度与挑战可重构智能超表面的加入让问题变得更加复杂也更有趣。RIS不是一个简单的反射器而是一个由大量可独立调控单元组成的二维电磁表面。每个单元可以通过PIN二极管、变容二极管或微机电系统动态调整其对入射信号的幅度和相位响应。通过编程控制所有单元的响应RIS可以合成任意的波前实现异常反射、波束聚焦、波束分裂等复杂功能。然而RIS的引入也极大地扩展了需要优化的参数空间。一个包含N个单元的RIS其配置状态空间是离散且巨大的例如每个单元有4种相位状态总状态数就是4^N。传统的基于CSI的优化方法需要获取从发射端到RIS、再从RIS到接收端的级联信道信息这比直接链路的信道估计还要困难得多因为RIS通常是被动设备难以直接进行测量和反馈。因此“无CSI波束赋形”的核心思想就是绕过显式的信道估计过程通过智能算法直接学习从可观测的环境状态如接收信号强度指示、粗略角度信息等到最优波束/RIS配置的映射关系。这就像让一个经验丰富的投手不靠测量风速和风向的精密仪器而是通过观察旗帜飘动、皮肤感觉等综合信息直接调整投掷角度和力度一样。强化学习特别是多智能体强化学习因其强大的序贯决策和从交互中学习的能力成为实现这一目标的理想工具。3. 将波束赋形建模为一场多智能体协作“游戏”理解了问题的本质后下一步就是为它设计一个合适的“游戏规则”让智能体AI算法能够在其中学习。在RIS辅助的无CSI毫米波通信场景中我们面临的是一个典型的高维、离散动作空间、部分可观测的序贯决策问题。多智能体强化学习框架能够非常自然地对此进行建模。3.1 智能体、状态与动作的定义首先我们需要定义游戏中的“玩家”智能体、“游戏画面”状态和“玩家操作”动作。一种直观且有效的建模方式是将RIS的每个可调控单元或者将RIS划分成的每个子区域视为一个独立的智能体。智能体 (Agent):例如将一个包含256个单元的RIS划分为16个簇每个簇包含16个相邻单元并共享相同的相位配置。那么这16个簇就可以被建模为16个协作的智能体。这样做的好处是大幅降低了动作空间的维度从256维降到16维同时保留了RIS的空间调控能力。每个智能体i负责管理其对应簇内所有单元的相位偏移。状态 (State):智能体观察到的环境信息。在无CSI设定下状态不能包含真实的信道矩阵。通常状态可以包括历史动作序列智能体自身及邻居智能体过去几步所采取的动作相位配置。局部性能反馈接收端反馈的宽带接收信号强度指示或信噪比。这是所有智能体动作共同作用下的全局结果但可以共享给每个智能体作为其状态的一部分。局部环境信息可选如果部署了辅助传感器可以提供智能体对应RIS区域的粗略入射角信息等。 对于智能体i其状态s_i可以表示为s_i [a_i^{t-1}, a_{N(i)}^{t-1}, RSRP^t, ...]其中a_i^{t-1}是自己上一时刻的动作a_{N(i)}^{t-1}是邻居智能体的历史动作RSRP^t是当前时刻接收端反馈的全局RSRP值。动作 (Action):每个智能体在其动作空间中做出的选择。对于相位可调的RIS单元动作通常是离散的。例如假设每个簇的相位可以在 {0°, 90°, 180°, 270°} 四个值中选择那么每个智能体的动作空间大小就是4。动作a_i即代表为该簇选择的相位值。奖励 (Reward):驱动智能体学习的“胡萝卜”。奖励函数的设计至关重要它直接决定了智能体学习的目标。在这个问题中最直接的奖励就是通信链路的瞬时频谱效率或可达速率其与接收信噪比正相关。因此奖励r^t可以设计为r^t log2(1 SNR^t)其中SNR^t是在时刻t所有智能体采取联合动作a^t [a_1^t, a_2^t, ..., a_N^t]后在接收端测量得到的信噪比。所有智能体共享这个全局奖励这鼓励它们为了共同的目标最大化通信速率而协作。3.2 为何是多智能体挑战何在你可能会问为什么不把整个RIS当作一个“超级智能体”用一个高维动作向量来控制所有单元这确实是一种集中式强化学习的思路。但这样做会面临“维度灾难”动作空间随单元数量指数增长导致学习极其缓慢甚至无法收敛。多智能体建模的优势在于分解复杂度将高维全局动作分解为多个低维局部动作每个智能体只需学习一个简单的策略。分布式执行学习完成后每个智能体可以仅根据局部观测或少量共享信息独立做出决策非常适合RIS这种分布式硬件的实时控制。隐式协作通过共享全局奖励智能体能在学习过程中自发地发现协作模式。然而多智能体强化学习也引入了新的核心挑战——非平稳性。从单个智能体的视角看环境包括其他智能体是不断变化的。当一个智能体改进其策略时对其他智能体而言环境就发生了改变这破坏了传统单智能体强化学习所依赖的马尔可夫平稳性假设使得学习过程不稳定、难以收敛。4. 分层架构与注意力机制让智能体学会“反思”与高效协作为了解决多智能体协作的挑战特别是让智能体在部分观测下能有效协调论文标题中提到的“分层”和“注意力机制”是关键。这里我们结合当前前沿的Actor-Attention-Critic for Multi-Agent Reinforcement Learning框架来阐述如何实现“Learning to Reflect”。4.1 分层策略设计从宏观目标到微观动作“分层”思想的核心是将复杂的决策过程分解为两个或多个层次。在RIS波束赋形场景中一个典型的两层结构可以设计如下高层管理器 (Manager):这是一个“慢速”思考的模块其工作周期较长例如每T个时间步运行一次。它基于一段较长时间内的全局状态观测如用户位置的统计趋势、业务需求变化制定一个抽象的“目标”或“子任务”。例如高层管理器可能输出一个“将波束主瓣方向调整至方位角30°附近”的宏观指令。这个目标通常用一个低维的、连续的目标向量g来表示。底层执行器 (Worker):这是多个“快速”反应的智能体每个时间步都运行。每个底层智能体对应RIS的一个簇接收高层管理器下达的当前目标g并结合自己当前的局部观测s_i来决策具体的相位动作a_i。高层目标g为所有底层智能体提供了一个共同的、一致的协作导向极大地缓解了底层智能体盲目探索的难度。这种分层结构模仿了人类的协作方式项目经理高层制定季度目标工程师们底层根据这个目标各自完成每周的具体任务。高层目标的变化频率低于底层动作使得学习过程更加稳定。4.2 注意力机制智能体间的“高效沟通”即使有了高层目标的指引底层智能体之间仍然需要协调彼此的微观动作以避免波束图案出现旁瓣过高或零点对准用户等问题。让每个智能体都关注所有其他智能体是不现实的通信开销大且信息冗余。注意力机制的作用就是让每个智能体学会“关注”对其决策最重要的伙伴。在Actor-Attention-Critic框架中Critic网络用于评价动作价值会使用注意力机制。具体来说每个智能体i的Critic网络在估计其动作价值Q_i(s, a_i)时并不是简单地将所有智能体的观测和动作拼接起来而是先对其它智能体的信息进行加权聚合智能体i将自己的观测编码e_i作为“查询”。将其他智能体j的观测编码e_j和动作编码a_j的组合作为“键”和“值”。计算查询与所有键的相似度通常用点积后softmax得到一组注意力权重α_{ij}。α_{ij}越大表示智能体j的信息对智能体i当前的决策越重要。用注意力权重对所有的“值”进行加权求和得到一个浓缩的上下文向量c_i。最后Critic网络将c_i与智能体i自身的观测和动作一起处理输出Q_i值。这个过程使得每个智能体能够动态地、有选择地聚焦于与其协作最紧密的少数其他智能体实现了高效的隐式通信。在RIS场景中一个位于RIS边缘的簇可能更需要关注其相邻的簇来形成连续的波前而两个物理位置相距较远但功能上需要协同形成多波束的簇也能通过注意力机制建立联系。4.3 整合分层注意力多智能体强化学习框架将分层结构与注意力机制结合我们可以构建一个强大的学习框架高层管理器网络周期性地分析全局历史状态输出目标向量g。每个底层智能体拥有自己的Actor网络策略网络和Critic网络价值网络。底层智能体的Actor网络输入包括自身的局部观测s_i、高层目标g、以及通过注意力模块从其他智能体聚合来的上下文信息c_i。基于这些信息Actor网络输出选择各个相位动作的概率分布。底层智能体的Critic网络同样接收s_i,a_i,g,c_i来估计当前状态动作对的价值Q_i用于指导Actor网络的更新。通过端到端的训练高层管理器学会制定有利于全局长期回报的目标底层智能体则学会在目标指引和彼此关注下采取协调一致的具体动作。整个系统共同“学会”了如何“反射”Learning to Reflect——即如何配置RIS在无需知道精确CSI的情况下将信号完美聚焦。5. 从仿真到现实训练、部署与实战挑战设计好了算法框架接下来就是如何让它从理论走向实践。这个过程充满了工程细节上的挑战。5.1 训练环境构建信道模型与交互仿真由于无法直接在真实物理环境中进行海量试错训练构建一个高保真的仿真环境是第一步。这个环境需要模拟毫米波信道的核心特性信道模型采用几何信道模型如3GPP TR 38.901中定义的UMi或UMa场景。信道由多条路径组成每条路径包含增益、时延、出发角、到达角等信息。对于RIS需要模拟发射端-RIS和RIS-接收端两条链路并考虑RIS的相位响应矩阵对信号的调制作用。核心公式可以简化为y h_{ru}^H * Θ * h_{tr} * x n其中h_{tr}是发射端到RIS的信道Θ是RIS的相位响应矩阵对角阵元素由智能体动作决定h_{ru}是RIS到接收端的信道n是噪声。状态-动作-奖励循环仿真器根据当前所有智能体的联合动作a^t决定Θ结合当前信道实现计算接收信号功率和SNR进而得到奖励r^t。同时它为每个智能体生成下一时刻的局部观测s_i^{t1}可能加入观测噪声。信道本身可以根据用户移动模型随时间演化。并行采样为了加速训练通常会运行多个环境实例并行采集经验数据存入一个共享的经验回放池中。5.2 分布式训练流程与技巧训练采用经典的AC框架如MADDPG、MAPPO的变种结合前述的分层注意力结构。初始化随机初始化所有网络参数高层管理器、所有Actor和Critic。交互与存储在每个仿真时间步高层管理器按周期输出目标g。每个智能体根据其Actor网络输入s_i, g, c_i采样动作a_i。执行联合动作a环境返回奖励r和新的观测s。将整个转移(s, a, r, s, g)存入经验回放池。采样与更新定期从回放池中采样一批经验数据。更新Critic对于每个智能体计算其目标Q值使用目标网络和下一个状态的动作然后最小化其Critic网络的时序差分误差损失。这里的关键是在计算目标Q值时其他智能体的下一个动作需要使用它们各自的目标Actor网络来生成这在一定程度上稳定了训练。更新Actor对于每个智能体使用其Critic网络估计的Q值作为信号通过策略梯度方法如确定性策略梯度或近端策略优化更新其Actor网络以最大化期望回报。梯度会通过注意力机制反向传播。更新高层管理器高层管理器的更新周期更长。其目标是最大化长期累积回报可以通过底层Critic网络提供的梯度或者使用专门的高层Critic来更新。软更新目标网络缓慢更新目标网络的参数以进一步提升稳定性。实战经验与技巧奖励塑形直接使用频谱效率作为奖励可能在学习初期信号很弱时梯度稀疏。可以加入塑形奖励例如对RSRP的增量给予正奖励鼓励任何形式的信号提升。参数共享由于RIS的各个簇在物理上是对称的可以让所有底层智能体共享同一个Actor和Critic网络参数这能极大减少参数量加速学习并提升泛化能力。网络输入中需要包含智能体的身份编码如位置编码以作区分。探索策略在训练初期需要在Actor网络的输出动作概率上添加足够的噪声如高斯噪声来鼓励探索。随着训练进行可以逐渐衰减噪声幅度。应对非平稳性除了使用注意力机制和目标网络采用“中心化训练去中心化执行”的模式是关键。训练时Critic网络可以获取全局信息用于计算注意力和其他智能体的信息但执行时每个智能体的Actor网络仅需局部观测和目标g即可行动。5.3 实际部署考量与挑战当训练出一个表现良好的策略模型后将其部署到真实的RIS硬件上还需要跨越最后几道鸿沟仿真到现实的差距仿真信道模型再精确也无法完全复现真实环境的复杂性和随机性。策略可能在真实场景中性能下降。解决方案包括1在仿真中使用更丰富的、包含多种障碍物和移动模式的场景进行训练2采集少量真实环境数据对模型进行微调3设计具有更强泛化能力的网络结构如引入域随机化。状态观测的获取算法依赖接收端反馈的RSRP作为核心状态。在实际系统中这需要设计低开销的反馈链路。可以考虑使用更粗粒度的反馈如量化后的RSRP等级并在训练时就将这种量化噪声考虑进去。实时性要求RIS的配置需要在信道相干时间内完成。整个“观测-决策-配置”流程必须满足严格的时延约束。这要求Actor网络必须非常轻量推理速度极快。通常需要使用小型神经网络或进行模型剪枝、量化。硬件非理想特性真实的RIS单元存在相位量化误差、幅度响应不均匀、单元间耦合等非理想特性。训练时应在仿真中注入这些误差模型使学习到的策略对硬件瑕疵具有鲁棒性。一个可行的部署流水线是在云端或边缘服务器利用仿真环境和历史数据训练策略模型将训练好的轻量化Actor网络和高层管理器下载到RIS的嵌入式控制器中系统在线运行时控制器接收周期性的用户反馈RSRP高层管理器按需更新目标各底层控制器根据本地观测和目标实时运行Actor网络生成相位控制码字并配置到RIS的驱动电路上。通过这种方式RIS真正具备了在复杂未知环境中“学习反射”的智能。