2022年7月,在山东济南举行的2022中国算力大会上,紫金山实验室研究员高新平作了“基于无损数据中心的ai训练网络均衡技术实践”的主题演讲。
紫金山实验室是江苏省和南京市共同推进建设的重大科技创新平台。紫金山实验室面向网络通信与安全领域国家重大战略需求,以引领全球信息科技发展方向、解决行业重大科技问题为使命,通过聚集全球高端人才,开展前瞻性、基础性研究,力图突破关键核心技术,开展重大示范应用,促进成果在国家经济建设中落地。紫金山实验室力图成为国家科技创新的重要力量,建成具有世界一流水平的战略科技创新基地。
紫金山实验室与华为依托紫金山实验室无损数据中心展开面向ai训练场景的网络均衡技术的联合创新,解决ai集群中网络负载不均而导致的ai训练任务性能下降的问题。
高新平研究员指出ai训练使用的集合通信算法,当前主流的有ring算法、tree算法和halving doubling算法等,在运行时通信流量都呈现出了共同的特征:周期性、流数量少、长连接,并行任务间有强实时同步性要求,通信效率取决于最慢的节点。同时,ai训练时,各节点之间传输的数据量大。以上这些流量特性使计算集群网络容易出现负载不均导致ai训练任务性能下降的问题。
现有网络均衡的主流技术大体分为三种,逐流ecmp均衡、基于子流flowlet均衡和逐包的负载分担均衡。逐流ecmp均衡技术,是当前最为常用的负载均衡算法,适用于流链接较多场景,它优势在于无乱序,劣势在于流数量较少时,例如ai训练场景下,存在hash冲突问题,网络均衡效果不佳。基于子流flowlet均衡技术,它依赖于子流之间的时间间隔gap值的正确配置来实现均衡,但全局路径级时延信息不可知、无法配置,且存在接收端侧乱序的问题。逐包的负载分担均衡技术,理论均衡度最好,但实际在接收端侧存在大量报文乱序问题,现实中几乎无使用案例。
发表“基于无损数据中心的ai训练网络均衡技术实践”主题演讲
在紫金山实验室无损数据中心ai训练集群中验证了华为创新的网络均衡技术nslb(network service load balance)。基于华为交换芯片高精度telemetry能力,采集流量矩阵作为路由算法输入,用以控制ai流量的转发路径,避免负载不均,提升ai训练效率。
ring算法场景,运行单个计算任务下,使用nslb技术对比典型ecmp负载分担技术,网络实现100%均衡、平均链路利用率34%、比ecmp提升35%,ai训练集性能最高提升113.41%;
ring算法场景,同时运行两个计算任务下,使用nslb技术对比典型ecmp负载分担技术,网络实现100%均衡、平均链路利用率29%、比ecmp提升15.6%,ai训练集性能最高提升57.29%;
tree算法场景下,运行单个计算任务下,使用nslb技术对比典型ecmp负载分担技术,网络实现100%均衡、平均链路利用率13.8%、比ecmp提升1%,ai训练集性能最高提升6.50%;
tree算法场景下,运行两个计算任务下,使用nslb技术对比典型ecmp负载分担技术,网络实现100%均衡、平均链路利用率14%、比ecmp提升10.5%,ai训练集性能最高提升15.81%。
未来,紫金山实验将与华为在无损数据中心网络领域就网络新拓扑、dcn高性能互联等方向展开持续的联合创新,推动无损数据中心网络在低时延、高吞吐等方向进一步的发展,为高算力提供强有力的底座。
vivo APEX全面屏概念手机亮相 首发半屏指纹
DTU连接不稳定的解决办法是什么
节能灯为啥节能不省钱?偷工减料是主因
复旦微电子集团携智能卡芯片产品系列亮相Trustech 2023
澎湃微电子主打32位MCU产品,立足市场需求
基于无损数据中心的AI训练网络均衡技术实践
华为在西安发布会上发布了畅享9S、9e和平板M5青春版
Gecko Robotics筹得4000万美元资金 加快机器人及相关技术的研发
工业4.0 成功的条件解析
医疗级穿戴式装置市场规模 2021年可达105亿美元
mcu未来发展方向及前景
八大平台均下架互联网存款产品
华大电子授权代理_MCU芯片CIU32L0_CIU32F0系列产品
隔水式恒温培养测试仪的产品特点说明
防止压力传感器出现问题需要关注的六大因素
BIM技术在城市地下综合管廊机电施工中的应用
甲醇检测仪的仪器特点和功能介绍
螳螂扑蝉黄雀在后?小米6下月发布:曲面+双镜头+搭载骁龙835
赋能政企深度用云,华为云数据库大咖有话说
3G:增值业务狂欢 手机竞争残酷