引用本文:
王庆福,康丽峰,冯英伟,等. 一种结合DRL与OTN-OSU的节点索引排名路由优化算法[J]. 光通信技术,2026,50(3):113-118.
王庆福1,康丽峰2*,冯英伟2,王兴国1
(1.辽宁行政学院,沈阳 110161;2.河北建筑工程学院,河北 张家口 075000)
【下载PDF全文】 【下载Word】摘要:针对传统启发式路由方案在网络性能上的局限,以及现有深度强化学习(DRL)方法在大规模软件定义卫星光网络(SDSON)中面临的可扩展性不足和拓扑敏感性高等挑战,提出了一种结合DRL与光传送网光业务单元(OTN-OSU)的节点索引排名路由优化(NIR2OD)算法。该算法通过定义节点索引排名(NIR)指标筛选驱动节点(DN),并将深度确定性策略梯度(DDPG)框架引入路由决策过程,利用智能体学习流量负载与网络性能的关联,动态调整链路权重以逼近最优解。实验结果表明,相较于Scaledeep算法,NIR2OD算法在抑制链路拥塞方面表现优异,将端到端时延降低了约25.09%,同时吞吐量提升了22.54%。
关键词:软件定义卫星光网络;深度强化学习;节点索引排名;路由优化
中图分类号:TN256 文献标志码:A 文章编号:1002-5561(2026)03-0113-06
DOI:10.13921/j.cnki.issn1002-5561.2026.03.019
本文提出了一种结合深度强化学习(DRL)与光传送网光业务单元(OTN-OSU)的节点索引排名路由优化(NIR2OD)算法,旨在解决大规模软件定义卫星光网络(SDSON)中传统启发式路由性能受限,以及现有DRL方法面临的可扩展性不足、拓扑敏感性高和链路拥塞严重等挑战。
以下是该论文的核心内容简要总结:
1. 核心创新点:NIR2OD算法架构
节点索引排名(NIR)筛选驱动节点(DN):针对大规模网络中DRL状态空间爆炸的问题,提出基于NIR指标筛选局部最大度节点作为DN。这种“分而治之”策略将全网路由优化解耦,聚焦高影响力节点,显著压缩了状态空间维度,提升了算法的可扩展性与拓扑鲁棒性,并有效减少了路由重叠。
结合OTN-OSU的轻量级带宽调整:利用OSU技术的支路端口承载机制,实现轻量级的无损带宽调整。DRL智能体仅需向控制平面的DN下发带宽调整指令,DN即可通过OSU带内开销与跟随节点自动交互,将复杂的端到端配置简化为单点指令下发,大幅降低了运维复杂度与信令开销。
2. 算法设计与模型架构
基于DDPG的智能路由决策:将路由优化建模为马尔可夫决策过程(MDP),采用深度确定性策略梯度(DDPG)算法。智能体以多维网络状态为输入,通过Actor网络对DN的链路权重进行连续微调,动态学习流量负载与网络性能的关联,从而逼近最优路由策略。
多维综合奖励机制:综合考量传输延迟、链路负载均衡度、通信阻塞率等指标设计奖励函数,并引入链路负载率优化奖励,引导智能体在复杂时变业务负载下自主生成高效且鲁棒的路由决策。
3. 关键实验结果
收敛与训练优势:在类ABILENE(12节点)和类GEANT(40节点)两种卫星光网络拓扑仿真中,NIR2OD算法均获得了比基准Scaledeep算法更高的累积训练奖励,且收敛速度更快、曲线更平稳,有效克服了离散式权重更新带来的策略振荡问题。
网络性能大幅提升:相较于Scaledeep算法,NIR2OD算法通过DN流量隔离机制与连续权重微调,将平均端到端时延降低了约 25.09%,同时网络平均吞吐量提升了 22.54%。
拥塞抑制效果显著:在训练完成后,NIR2OD算法在类ABILENE和类GEANT网络中的丢包率分别降至1%和2%,显著优于对比算法,有效解决了大规模网络路由优化中的拥塞难题。
4. 研究结论与应用前景
该研究通过融合节点重要性评估与深度强化学习,并结合底层光网络硬件机制,成功突破了现有DRL路由方法在大规模SDSON中可扩展性差、收敛困难的核心瓶颈。
研究成果为大型复杂空天地一体化光网络、卫星互联网的动态流量调度与精细化路由决策提供了高效、智能的优化方案,对未来卫星光通信网络的资源分配与性能提升具有重要的工程应用价值。