ICLR 2026 | 面向序列决策的贝叶斯集成方法
文章转自“京东零售技术”公众号本文导读本文提出了Bayesian EnsembleBE它可以理解为加在现有 ensemble 方法之上的一个轻量级贝叶斯层除了更新每个 base model 的参数我们还通过观测到的 reward动态更新“该抽哪个 ensemble 成员”的索引分布。换句话说成员选择本身不再是固定随机的而是一个随着反馈不断校正的贝叶斯过程。基于这个统一框架我们进一步提出了面向 bandit 的Bayesian Ensemble BanditBEB以及面向强化学习的Bayesian Ensemble DQNBE-DQN。在合成环境和真实环境上的大量实验都表明这种做法既有效也足够高效。基于本工作的论文已被 ICLR2026 接收欢迎阅读交流。· 链接https://openreview.net/pdf?ids2hxd8JghB· 论文Bayesian Ensemble for Sequential Decision-Making01摘要在这篇工作中我们关注的是不确定性下的序列决策问题典型场景包括推荐系统里的在线决策以及强化学习中的探索与利用。已有很多 ensemble-based 方法会用多个模型来近似后验分布再从中随机选一个成员做决策。但这些方法通常有一个共同限制它们默认 ensemble 成员的采样分布是固定的比如简单地均匀采样。这样做忽略了一个事实——不同 ensemble 成员本身的质量、偏好和有效性可能会随着训练过程逐渐拉开差异。因此我们提出了Bayesian EnsembleBE。它可以理解为加在现有 ensemble 方法之上的一个轻量级贝叶斯层除了更新每个 base model 的参数我们还通过观测到的 reward动态更新“该抽哪个 ensemble 成员”的索引分布。换句话说成员选择本身不再是固定随机的而是一个随着反馈不断校正的贝叶斯过程。基于这个统一框架我们进一步提出了面向 bandit 的Bayesian Ensemble BanditBEB以及面向强化学习的Bayesian Ensemble DQNBE-DQN。在合成环境和真实环境上的大量实验都表明这种做法既有效也足够高效。02引言这篇文章的出发点来自一个经典问题在不确定环境中智能体该如何平衡 exploration 和 exploitation。这个问题在推荐系统和强化学习里都非常核心。最经典的建模方式之一是Thompson Sampling维护一个关于奖励分布参数的后验每一轮从后验里采样一个参数再基于这个参数去选动作。它的优势在于探索是由不确定性自然驱动的。但问题在于一旦我们用神经网络去建模复杂的 context–reward 关系精确维护后验分布几乎是不可行的。因此实际工作里大家往往使用各种近似贝叶斯方法比如 variational inference、MCMC、dropout、gradient-based posterior sampling以及 ensemble-based 方法。其中ensemble 方法之所以特别受欢迎是因为它实现简单、泛化性强而且在很多实际任务中效果稳定。不过现有 ensemble-based Thompson Sampling 还有一个被忽视的问题大家通常只在更新 ensemble 成员的参数却不更新成员索引本身的采样分布。也就是说模型在学但“抽谁来做决策”这件事没学。可在实际中不同成员由于随机初始化、prior function 等因素表现并不等价。基于这个观察我们的核心主张是不确定性不仅存在于模型参数中也存在于 ensemble 成员之间因此索引分布也应该被纳入贝叶斯更新。这正是本文想补上的那一块。03方法统一框架Bayesian Ensemble一个关键点在于对于 ensemble 参数 θ我们依然沿用现有方法常见的做法用 surrogate loss 做经验风险最小化但对于索引分布 p我们不再借助 surrogate loss而是直接围绕长期累积 reward 去更新。原因很简单相比庞大的网络参数索引分布的参数量通常很小更适合直接做精确或近似的贝叶斯推断。这个设计是本文相较于已有 ensemble-based TS 方法最本质的区别。面向 BanditBayesian Ensemble Bandit在 contextual bandit 场景中我们用一个 ensemble 网络来输出 reward 的概率分布。每轮先从当前索引分布里采样一个成员再由该成员在候选动作集合上挑选期望 reward 最大的动作。动作执行后我们利用新样本同时更新 ensemble 参数和索引分布。这个算法就是Bayesian Ensemble BanditBEB。它不是替代现有 ensemble bandit而是可以增强现有方法。为了说明这一点文中给了两个代表性实例。第一个是ensemble。原始 ensemble 使用均匀分布在多个 ensemble 成员中随机选一个。我们在 BEB 下把每个成员对应一个 Beta 分布参数用 Beta-Bernoulli 的共轭关系根据实际 reward 对成员选择分布做精确贝叶斯更新。直觉上它等于让“哪个成员更值得被抽到”这件事随着反馈自动学出来。第二个是hypermodel。原始 hypermodel 使用标准高斯分布采样连续索引再通过 hypernetwork 映射成模型参数。我们则进一步把这个连续索引分布做成可学习的高斯分布学习每个维度的均值和方差并用 variational inference 去近似后验。换句话说我们不仅保留了 hypermodel 的连续索引表达能力还把索引本身也变成一个可自适应更新的贝叶斯对象。面向强化学习Bayesian Ensemble DQN除了 bandit我们还把这一思想扩展到了强化学习提出了BE-DQN。它维护 k 个独立的 Q-network每个网络对应一个 Beta 分布。每一轮先从这些 Beta 分布里采样出权重再选出当前最优的那个 Q-network 负责动作选择但在 target Q 的构造时并不是只用单个网络而是对所有 Q-network 做加权聚合。这个设计有两个好处。第一它继承了 ensemble 方法降低方差、稳定训练的优点第二它不像传统 Ensemble DQN 或 Random Ensemble DQN 那样使用固定或随机的组合方式而是让“哪个估计器更值得信”也能随着 reward 自适应变化。文中进一步给出了理论分析在一个单向 MDP 环境里BE-DQN 的 Q-value 方差上界与标准 DQN 一致下界与 Ensemble DQN 一致。这说明它至少不会比 DQN 更不稳定同时又保留了比纯平均 ensemble 更强的探索能力。04实验合成环境Neural Testbed 和 Mushroom我们先在两个 bandit 风格环境里验证方法。一个是Neural Testbed它通过神经网络生成 ground-truth reward 分布可以精确计算 regret另一个是Mushroom把蘑菇可食用性数据集转化成一个二元决策问题智能体需要决定是否选择当前蘑菇。在 Neural Testbed 上我们设置动作维度 (d2,10,50)时间跨度为 20,000 步。结果显示无论问题简单还是复杂BEB 版本都在全程显著优于原始 baseline。到最后一步时ensemble(BEB) 相对 ensemble 的 regret 分别下降37.0%、12.8%、42.2%hypermodel(BEB) 相对 hypermodel 的 regret 分别下降69.8%、22.8%、30.3%。在 Mushroom 数据集上BEB 版本同样始终更优最终 ensemble(BEB) 和 hypermodel(BEB) 分别带来8.7%和4.8%的提升。换句话说不管是离散索引还是连续索引只要把索引分布也学起来探索效率就会更高。我们还专门分析了时间开销。对于 ensemble因为 Beta-Bernoulli 更新是共轭的几乎没有额外耗时而对于 hypermodel由于需要 variational inferenceBEB 版本比原始方法大约多20%的计算时间。这个结果也说明BE 的额外成本主要取决于索引分布的更新方式本身而不是框架设计带来的硬性负担。真实推荐环境Yahoo!R6B为了验证方法在真实序列决策场景中的表现我们进一步在Yahoo!R6B新闻推荐数据集上做了实验。这个数据集包含 2800 万次用户访问日志每条样本包括用户特征、展示文章、候选文章集合以及点击标签。由于真实最优奖励不可见我们用累计点击数作为评价指标。在这个实验里我们主要评测 hypermodel 系列因为 ensemble 的计算开销更大。结果显示hypermodel(BEB)达到了50,322.1 ± 1,487.2次点击高于原始 hypermodel 的49,676.8 ± 1,355.7也明显优于 Random、Greedy、ϵ-Greedy、MC Dropout 和 Gradient TS 等方法。这个结果说明BE 并不只是一个合成环境里的技巧而是能够在真实推荐任务中带来更强的探索效率和更好的点击收益。强化学习环境MiniGrid在强化学习部分我们选择了MiniGrid中五个任务FourRooms、Empty-6x6、LavaGapS5、GoToDoor-5x5 和 MultiRoom-N2-S4用来评测BE-DQN。对比方法包括 vanilla DQN、Ensemble DQN、Random Ensemble DQN以及 UAAC。整体结果表明BE-DQN 在这些任务上表现最强或最稳健。例如在 Empty-6x6、LavaGapS5、GoToDoor-5x5 和 MultiRoom-N2-S4 上BE-DQN 的平均 reward 都是表中最优在 FourRooms 上也优于其余多数 baseline。论文里对此的解释是传统 DQN 依赖单一 Q-value estimator鲁棒性差E-DQN 和 RE-DQN 虽然有所缓解但由于权重机制静态或随机无法持续偏向更优的 Q-estimator而 BE-DQN 能动态更新不同 Q-network 的重要性分布从而更好地兼顾探索、利用和训练稳定性。另外附录里还补充了更多实证结论比如在 Yahoo!R6B 的 100 万样本子集上ensemble(BEB) 比 ensemble 再提升约3%随着 ensemble size 从 25 增大到 100ensemble(BEB) 相对 ensemble 的 regret reduction 从28.23%提升到47.97%这也说明我们的框架在更大的 ensemble 上反而更能发挥优势。05参考文献本文的参考文献大致可以分成四条主线。第一条是Thompson Sampling 与 bandit 理论。这里包括 Thompson (1933)、Russo et al. (2018)、Li et al. (2010)、Chapelle Li (2011)、Lattimore Szepesvari 等工作它们奠定了“基于后验采样做探索”的基本范式也是我们将 ensemble 成员选择视作贝叶斯决策问题的理论起点。第二条是深度不确定性建模与 ensemble posterior sampling。比如 deep ensembles、randomized prior functions、hypermodel、Epistemic Neural Networks、Ensemble Sampling 等工作共同构成了我们方法的直接技术背景。我们的工作与这些方法的关系不是推翻而是前进一步它们主要学模型参数我们进一步去学索引分布。第三条是强化学习中的 ensemble 方法。包括 DQN、Ensemble DQN、Random Ensemble DQN、Reset Deep Ensemble、HyperDQN、HyperAgent 等。这些工作说明 ensemble 在 RL 中确实可以帮助稳定训练、增强探索而我们的 BE-DQN 可以理解为在此基础上加入一个“贝叶斯化的动态成员选择机制”。第四条是实验基准与应用背景。例如 Neural Testbed、Yahoo!R6B、MiniGrid、Mushroom 数据集等这些基准分别对应了合成 bandit、真实推荐、强化学习与经典决策数据集使我们能够从多个角度验证方法的有效性与泛化性。