中国移动研究院智算网络GSE相关论文在网络领域顶会SIGCOMM Workshops发表

2026/08/18 责任编辑:Hanson 访问:1036

近日,中国移动研究院智算网络方向三篇论文在ACM SIGCOMM 2026 NAIC Workshop和MOSAIC Workshop发表,分别是《Dragonfly-Ultra: A Scalable, Low-Cost Network Architecture for High-Performance AI Clusters》《Delphinus: Ultra-Fast Link Failure Detection and Recovery for AI Data Center Networks》和《Evaluating Link-level Lossless Mechanisms in AI Networks》。SIGCOMM是CCF A类计算机网络领域顶级会议,具有广泛的行业影响力。

《Dragonfly-Ultra: A Scalable, Low-Cost Network Architecture for High-Performance AI Clusters》面向大规模智算网络的扩展性挑战,解决现有主流Clos拓扑和直连拓扑在规模扩展时面临的成本超线性增长及性能瓶颈问题。提出Dragonfly-Ultra架构,通过组间全连接消除组内路径绕行,并结合双水线自适应路由实现快速拥塞缓解、统一亲和编排实现跨组流量均衡,有效缩短集合通信完成时间。两层网络即可支撑超26万GPU规模,网络成本与功耗仅为三层Clos的80%左右。未来团队将基于原型验证平台对Dragonfly-Ultra开展大规模集群部署测试,持续优化架构在真实业务场景下的性能表现。

(论文链接:https://dl.acm.org/doi/10.1145/3789240.3828737)

提出新型智算网络远端故障通告和快速恢复机制,实现业务无感的亚毫秒级网络故障自愈

《Delphinus: Ultra-Fast Link Failure Detection and Recovery for AI Data Center Networks》面向智算网络高可靠需求,解决现有链路故障恢复机制探测速度慢、覆盖范围窄的问题,提出了基于交换机数据面的链路故障快速探测与恢复机制。核心设计包括:基于数据面对端口状态的微秒级感知能力,实现链路故障的快速探测;基于远端故障通告与中继机制,实现远端故障的快速恢复,扩大设备快速恢复能力覆盖范围。该机制在可编程交换机上实现,经系统测试,可实现端侧透明、业务无感的亚毫秒级网络故障快速自愈,显著提升链路故障恢复速度和故障恢复能力覆盖范围,为智算业务提供高可靠保障。中国移动研究院积极推动核心机制标准化,牵头IETF相关文稿立项与工作组成立。

(论文链接:https://dl.acm.org/doi/10.1145/3789240.3828741)

业内首次发布基于硬件平台的链路层可靠机制CBFC和LLR的定量评估结果,为后续卡间和机间网络的应用奠定基础

《Evaluating Link-level Lossless Mechanisms in AI Networks》针对智算网络中为保障智算业务稳定高性能常采用的基于信用的流量控制(CBFC)与链路层重传(LLR)机制,首次基于硬件实验平台对二者进行系统评估。结果表明,CBFC能显著降低接收缓冲区占用,LLR能大幅缓解数据包损坏导致的性能劣化,为智算网络链路层无损设计提供了重要参考。

(论文链接:https://dl.acm.org/doi/10.1145/3789240.3829346)

中国移动研究院在智算网络领域已取得多项核心技术突破,形成自主GSE技术体系,成果获国内外同行广泛认可。本次三篇论文发表,是团队近期研究成果的集中体现。中国移动研究院将持续深耕智算网络方向,瞄准AI算力集群核心网络痛点,攻坚前沿技术,为公司智算业务提能增效注入技术动能。

本文来源:中国移动研究院

扩展阅读

  • 扫码关注微信公众号