浪潮网络助力打造 面向AIGC的"三超"网络

发布时间:2023-08-18  

从内容生成、游戏开发、到自动化助手、机器人控制……AIGC这项"黑科技",正在更多领域发挥着作用,并逐渐向行业渗透。例如,在数字政府场景,通过融合AIGC和数字人技术,可以提供个性化的政务服务和咨询,优化政府与公民的互动方式,提升政务服务的质量和效率。目前,AIGC主要聚焦在大模型训练、MaaS模型服务、AIGC推理三大应用场景,其中大模型训练是各新兴企业竞相争逐的主要场景。

"没有好网络,别玩大模型。" 要建设大规模训练模型集群,除了需要GPU服务器、网卡等基础组件,也需要解决网络搭建的问题。网络对于大模型集群的算力释放和可靠运行至关重要,如何构建符合大模型集群计算要求的网络系统,是推进AIGC发展的关键之一。

AIGC大模型训练 对网络系统的"三超"要求

在大模型训练过程中,有三种流量模型,分别是张量并行、流水线并行、数据并行。人们熟知的ChatGPT3,采用128台A100服务器,共计1024个A100卡训练,这样单服务器节点需要4个100G网络通道;而ChatGPT4、ChatGPT5等其它大模型,对于网络的需求会更高。浪潮网络认为大模型训练对于网络的要求可用"三超"网络来概括,即:超大规模、超高带宽、超强可靠,以保障网络稳定、可靠运行,为大模型训练提供强有力的支持。

而要解决"三超"网络的挑战,就需要着重思考如何建设符合大规模训练的组网方案。从组网架构上看,当前AIGC组网一般多采用胖树架构,具有高带宽、低延迟的特性,以及较好的可拓展性。而在组网协议上,当前业界主流的是基于IB、及RoCE两种无损网络技术,两种技术都可以很好的满足大规模训练高带宽、低延迟的要求。IB的延迟足够低,而RoCE在开放性、性价比、及易维护性几方面更胜一筹。

浪潮网络融合趋势与驱动 打造基于RoCE的智能无损网络解决方案

浪潮网络作为云边协同智慧网络引领者,密切关注市场发展及变化,推出了基于RoCE的智能无损网络解决方案,助力AIGC"三超"网络的打造,其具备如下优势:

一是多协议、多场景的融合。在大规模集群中,往往存在通用计算集群、AI/HPC集群、存储等多种场景,传统方案是部署以太网、IB、FC等多套网络及多种协议,各协议之间互不兼容,大大增加了管理和维护的难度。而浪潮网络基于RoCE的智能无损网络解决方案,可以适配通用计算、AI/HPC、存储等多种场景,并实现以太/IB/FC三网融合。这样从维护多张网络到维护一张网络,大大降低了整体建设和维护成本。

二是智能弹性、动态调整。在大规模集群训练中,要求整个集群可以快速部署与交付,在节约训练时间的同时,尽可能减少宕机等故障的发生。在浪潮网络基于RoCE的智能无损网络解决方案中,通过数字化网络引擎IDE可以实现集群网络的自动化部署,加速业务上线。并实时监控设备与链路的负载和健康状态,如CRC错包,端口带宽百分比、队列缓存,CNP及Pause反压帧等,完成故障的快速定位及智能分析,实现基于业务的网络跟踪。此外,还可以提供北向标准API接口,能够与上层计算平台进行对接,实现算网联动,更好的释放集群算力。

此前,浪潮网络基于RoCE的智能无损网络解决方案,已在教科研客户项目中得以应用,方案可充分满足通用计算集群、GPU加速集群、异构计算集群、分布式存储集群、全闪存存储集群等多场景,对于网络的高带宽、低延迟连接需求,帮助客户构建满足AIGC发展的整体网络架构。

未来,浪潮网络将持续优化基于RoCE的智能无损网络产品方案能力,同时深入研究基于UEC的网络并创新引领支持UEC的产品,帮助客户成功。

稿源:美通社

文章来源于:电子创新网    原文链接
本站所有转载文章系出于传递更多信息之目的,且明确注明来源,不希望被转载的媒体或个人可与我们联系,我们将立即进行删除处理。

相关文章

    阿里云创始人王坚:云计算和GPT的关系,就是电和电机的关系;10月31日,在2023云栖大会,中国工程院院士、阿里云创始人王坚以《云计算的第三次浪潮》为主题发表演讲,他认为人工智能......
    阿里云创始人王坚:云计算和GPT的关系,就是电和电机的关系;在2023云栖大会,中国工程院院士、阿里云创始人王坚以《云计算的第三次浪潮》为主题发表演讲,他认为人工智能和云计算的结合,带来云计算的第三次浪潮......
    阿里云创始人王坚:云计算和GPT的关系,就是电和电机的关系;10月31日,在2023云栖大会,中国工程院院士、阿里云创始人王坚以《云计算的第三次浪潮》为主题发表演讲,他认为人工智能......
    阿里云创始人王坚:云计算和GPT的关系,就是电和电机的关系;10月31日,在2023云栖大会,中国工程院院士、创始人王坚以《的第三次浪潮》为主题发表演讲,他认为人工智能和的结合,带来的第三次浪潮......
    阿里云创始人王坚:云计算和GPT的关系,就是电和电机的关系; 10月31日,在2023云栖大会,中国工程院院士、创始人王坚以《的第三次浪潮》为主题发表演讲,他认为人工智能和云计算的结合,带来云计算的第三次浪潮......
    区正努力通过数字化推进制造业高质量发展,以"中国视谷"为核心增长极,重点发展自动驾驶、工业视觉、医学影像、智能生活及办公这四大标志性产业链。 今年,萧山还实施了"AI+新制造"行动,部署......
    研究报告及共识文件》。IBM大中华区CTO谢东博士以世界互联网大会人工智能特设工作组副组长的身份,与来自企业、研究机构、国际组织等各方代表,共同发布了该研究报告及共识文件。该文件是此次世界互联网大会发布的标志性成果......
    服务三大核心领域为突破方向的“333”发展路径,将湖北打造成为我国人工智能技术创新、应用示范和产业发展高地。 到2025年,我省人工智能产业规模超过1500亿元,在多个重点领域取得重大标志性成果......
    英特尔人工智能“帮派”; 人工智能的概念被提出是1956年的夏天,从那以后,人工智能一共经历了三次浪潮。在进入21世纪,并催生第三次浪潮的正是“计算力+算法+数据......
    为数据时代提供最好的支撑。” 比如在人工智能领域,这是一个由算力大爆炸而掀起第三次浪潮的产业。对于这个产业,英特尔在芯片端有着自己的算力构想:“对于AI下一步发展,单一芯片是远远不能满足该趋势的,不管你是GPU、CPU或者FPGA......

我们与500+贴片厂合作,完美满足客户的定制需求。为品牌提供定制化的推广方案、专属产品特色页,多渠道推广,SEM/SEO精准营销以及与公众号的联合推广...详细>>

利用葫芦芯平台的卓越技术服务和新产品推广能力,原厂代理能轻松打入消费物联网(IOT)、信息与通信(ICT)、汽车及新能源汽车、工业自动化及工业物联网、装备及功率电子...详细>>

充分利用其强大的电子元器件采购流量,创新性地为这些物料提供了一个全新的窗口。我们的高效数字营销技术,不仅可以助你轻松识别与连接到需求方,更能够极大地提高“闲置物料”的处理能力,通过葫芦芯平台...详细>>

我们的目标很明确:构建一个全方位的半导体产业生态系统。成为一家全球领先的半导体互联网生态公司。目前,我们已成功打造了智能汽车、智能家居、大健康医疗、机器人和材料等五大生态领域。更为重要的是...详细>>

我们深知加工与定制类服务商的价值和重要性,因此,我们倾力为您提供最顶尖的营销资源。在我们的平台上,您可以直接接触到100万的研发工程师和采购工程师,以及10万的活跃客户群体...详细>>

凭借我们强大的专业流量和尖端的互联网数字营销技术,我们承诺为原厂提供免费的产品资料推广服务。无论是最新的资讯、技术动态还是创新产品,都可以通过我们的平台迅速传达给目标客户...详细>>

我们不止于将线索转化为潜在客户。葫芦芯平台致力于形成业务闭环,从引流、宣传到最终销售,全程跟进,确保每一个potential lead都得到妥善处理,从而大幅提高转化率。不仅如此...详细>>