引用本文:
唐可意,李志刚. 基于SAC的低轨卫星光网络负载均衡路由优化算法[J]. 光通信技术,2026,50(3):36-40
唐可意,李志刚
(中国电子科技集团公司 第三十四研究所,广西 桂林,541004)
【下载PDF全文】 【下载Word】摘要:针对卫星动态性与复杂环境因素导致的网络负载不均衡及通信延迟问题,设计了基于深度强化学习(DRL)中Soft Actor-Critic(SAC)的低轨卫星光网络负载均衡路由优化算法。通过模拟卫星网络环境并动态调整决策策略,实现路由路径的动态优化,旨在合理分配网络资源并提升网络性能。仿真结果表明:该算法模型在优化数据流分配与提高系统可靠性方面具有显著优势;在50%和100% 2种流量强度下,链路平均负载率分别优化29.9%和42.0%,同时路由延迟亦得到有效改善。
关键词:负载均衡;深度强化学习;低轨卫星光网络;路由优化;卫星互联网
中图分类号:TN927.2 文献标志码:A 文章编号: 1002-5561(2026)03-0036-05
DOI:10.13921/j.cnki.issn1002-5561.2026.03.006
本文提出了一种基于 Soft Actor-Critic(SAC)的低轨卫星光网络负载均衡路由优化算法(SAC-RLRA),旨在解决低轨(LEO)卫星光网络中因拓扑动态变化和复杂环境导致的负载不均衡及通信延迟问题。
以下是该论文的核心内容简要总结:
1. 核心创新点:基于 SAC 的路由优化机制
全网链路权重动态调整:摒弃传统固定路由策略,通过动态调整链路传输优先级来合理分配网络资源,实现路由路径的实时动态优化。
最大熵强化学习引入:采用 SAC 算法作为核心,通过最大化期望奖励与策略熵共同优化智能体策略。该机制具备优异的“探索-利用”平衡能力,能完美适配低轨卫星光网络的高维动态状态与连续动作空间。
2. 算法设计与模型架构
状态与动作空间构建:将卫星网络的实时状态定义为节点间的流量矩阵,动作空间定义为链路路由权重分配矩阵,从而实现对全局流量态势的精准感知与调度。
多维综合奖励机制:综合考量传输延迟、链路负载均衡度、通信阻塞率以及算法收敛性来设计奖励函数,并引入链路负载率优化奖励,引导智能体向低负载、低延迟的最优路由策略收敛。
离线训练与在线决策:利用经验回放池和软更新目标网络参数机制,通过策略网络与价值网络的联合训练,实现路由策略的高效离线学习与在线实时决策。
3. 关键实验结果
负载均衡显著优化:在包含 60 颗卫星的 LEO 光网络仿真中,相较于传统 Dijkstra 算法,SAC-RLRA 在 50% 和 100% 流量强度下,链路平均负载率分别大幅优化了 29.9% 和 42.0%。
延迟与阻塞率有效降低:在高负载(100%流量强度)场景下,平均路由延迟降低约 7.45%;同时,网络阻塞链路数量显著减少(100%流量下平均阻塞链路从 5 条降至 1 条),极大缓解了网络拥塞。
高负载场景优势突出:随着网络流量强度的增大,SAC-RLRA 的负载均衡与延迟优化效果更加明显,展现出极强的动态资源调度与抗压能力。
4. 研究结论与应用前景
该算法通过联合训练策略网络与价值网络,在满足业务时延要求的前提下,实现了更均衡的流量分配与更高效的资源利用,尤其在高负载场景下优势极为突出。
研究成果可为大型复杂低轨卫星光网络的路由决策提供可靠优化方案,对未来空天地一体化光通信网络的性能提升与工程落地具有重要的参考价值。