全球权威数据中心专业媒体Datacenter Dynamics (DCD) 近日专访了康普战略高级总监Rudy Musschebroeck。他深入剖析了网络技术演进的核心逻辑,并阐述了康普如何从多个维度支持端到端的可扩展性,以应对行业挑战。
AI 正在从根本上重塑数据中心架构
智算中心不仅规模更大,而且更智能、更快、密度更高、演进速度也更快。
每一次技术革新的浪潮,都会在整个数据中心生态系统中引发连锁反应。而作为运营的基石,物理连接必须第一时间响应。
AI带来的变革极其复杂且影响深远,仅仅靠纵向扩展容量已无法满足需求。相反,连接必须向所有方向扩展:数据中心内部、设施之间,以及生产区之内。
为了阐释这一变化的本质,康普战略高级总监 Rudy Musschebroeck 分享了他对网络为何以及如何变化的见解,并介绍了康普如何在多个层面支持端到端的可扩展性。
向上与向外扩展:密度的提升
过去,在智算中心普及之前,传统的基于CPU的服务器提供了所需的算力。Rudy 解释说:“一个机柜顶部的叶交换机汇聚了10到30台服务器的流量,将机柜的连接简化为单对光纤,这足以充分利用这些资源来完成它们所承担的任务。”
“然而,现代面向AI的设施及其装满GPU的机柜,其架构已使这种密度提升了十倍甚至更多,而每一代新的GPU平台都会将密度推得更高。此外,数据中心的骨干网络必须将每一个单独的GPU与所有其他GPU完全连接起来。”
这意味着光纤网络的密度大幅提升,以便在机柜之间、集群之间甚至多个站点之间建立这些高速的“点对点”式连接。单个机柜内就有成百上千个连接点,这一趋势仍在持续上扬。
“我们需要更多的GPU来构建更大规模的数据中心,并训练基础大语言模型以及特定应用的模型。为了让模型性能更强大,就需要更复杂的模型,使用更多参数,并用更多数据进行训练——因此在现实世界中就需要更多的GPU。”
这种向上扩展的过程,会将机柜内更多的GPU连接起来,使其作为一个单一的计算资源来工作。但即便如此,也依然无法满足需求;还必须通过InfiniBand或超以太网交换网络连接多个机柜,从而实现向外扩展。
市场对AI应用的需求正推动这一转变加速。随着越来越多的行业、企业和个人开始使用AI,这项技术正从大语言模型迅速向下一代代理式AI演进。
“现在对灵活性的需求越来越大。客户希望利用已投入的资本,在同一套基础设施上处理不同的工作负载。而对于AI推理能力来说,部署在更靠近最终用户的位置也更合理。”
网状网络(Meshing)是一种网络设计方法,它创建了一个稳健的互联架构,在节点之间提供多条光纤路径,从而支持一致的性能、内置的冗余以及快速、可扩展的增长。这一策略已成为提供现代运营所需的高密度光纤连接的首选方案。
密度与效率的关系
数据中心(尤其是智算中心)巨大的电力需求,意味着网络效率通常与网络性能同等重要。能否获得足够且成本可控的电力,是全球许多数据中心建设项目面临的重大制约因素——其约束力甚至超过了获取建筑许可或筹集资金。
“AI使用量的上升,必然要求加强基础设施和电力供应。一个常见的瓶颈是特定地点的可用电力有限。但行业正开始通过采用地理多样性策略来应对这一挑战——将多个站点分布在低延迟基础设施上,形成一个分布式数据中心。与单个大型站点相比,这种分布式数据中心可以更经济、更节能地运行。”
具体到单个站点,目前已有一些创新技术进入市场,可以降低与冷却相关的能耗,而冷却正是运行一个满载高密度GPU机架的AI数据中心的重要组成部分。
例如,直接芯片液冷(DTC)相比传统风冷方法具有显著的运营优势,能大幅提高效率并帮助控制运营成本。此外,直接芯片液冷具有良好的可扩展性,还能降低数据中心的背景噪音。
不过,直接芯片液冷会占用机柜内更多空间,因此机柜系统必须做得更大、更深才能容纳这些设备,同时还需将连接端口从机柜后部庞大的冷却装置旁移开。传统的光纤配线架并非为这种规模或灵活性而设计。
“人们往往忽略的正是这类细微的实际问题。布线不一定是运营商想要的系统一体化设计中的必要组成部分——而康普的价值就在于,引导客户思考如何从结构层面融入布线拓扑,使其能够高效地跨机柜、机柜组、数据大厅,甚至跨数据中心间工作。”
“这些项目真正需要做的,就是把数据大厅里的人力工作全部转移到准备区——这些准备区可以在数据中心内部,也可以(如果使用预装机架级系统的话)直接设在制造现场。我们与客户合作,为他们的项目提供量身定制的解决方案:无论是合适长度的线缆、适配其机架的系统,还是最佳的物流服务,以确保每个人都能在正确的时间、正确的地点进行建设。”
“另一种方法是浸没式冷却。它将服务器浸入不导电液体中,旨在进一步提高数据中心的能效。虽然直接接触式芯片液冷能显著提升冷却能力和效率,但浸没式冷却会将这种优势推向更高层次。”
两种“速度”
网络设计对速度的需求体现在两个方面:一是数据链路之间的通信速率必须提升,以满足AI工作负载的复杂需求;二是部署速度,这一点同样关键。
当前 400G 的速率正迅速向 800G、1.6T 及更高迈进。康普正在提供灵活的解决方案,无需更换整个基础设施,即可实现从串行光传输向并行光传输的过渡。
考虑到技术更新的速度,部署合适的网络基础设施以应对当前需求并为未来发展留出扩展空间,对于推动持续增长至关重要。答案在于降低复杂性。
点对点方式的布线既复杂又耗时,且存在很高的人为错误风险。此类系统在准备启用前,可能需要数周时间进行连接器清洁、标记、检查和故障排除,在此期间,资金被占用,也无法产生收入。光纤密度、光学性能和部署速度,如今已与GPU数量一样,对AI产出至关重要。
“我们现在看到的是,机柜本身就相当于一台计算机。因此,我们正在寻找有效的方法,在机柜组装和测试阶段进行预布线,以便在那个时间点就能验证关键连接的可靠性。架构本身决定了这一点。”
经过预布线和验证后,机柜便可推入安装位置,并使用多芯光纤连接器解决方案更高效地连接在一起。这种“推入即连接”的方法简化并精简了部署流程,同时减少了对人工干预的需求。无论是通过在调试间完成的预制解决方案,还是通过现场准备区,以可靠且快速的方式完成布线的验证与安装,都能带来宝贵的战略优势。
扩展供应:全球能力与本地适配
要驾驭这个复杂连接的新时代,需要同样广泛的覆盖能力。“在当今市场,供应产品的能力是一项显著优势。正因如此,康普在创新和制造能力两方面都进行大量投资,并用经过验证的解决方案,满足全球客户的实际需求。”
无论是否为AI工厂,交付面向未来的连接基础设施的构建要素都是相同的。康普的全球制造和物流布局,对于快速、灵活地交付当今数据中心所需的解决方案至关重要。
这种灵活性,再辅以量身定制的客户服务和现场协作,而这一切的起点,是了解客户当前及未来的目标,以及了解设施本身的情况。
“数据中心存在‘上线第一天’的状况,也存在其整个生命周期中可能出现的各种状况。对于布线而言,了解全局至关重要,只有这样,我们才能基于对成熟可靠方案的深刻理解,采取正确的策略。我们不只是制造产品;我们从最初的概念阶段,到安装、培训、升级规划乃至场地扩建,全程为客户提供支持。”
在 AI 驱动的数据中心时代,连接架构已成为决定系统可扩展性和长期竞争力的关键基础。康普凭借全球制造能力与本地化交付经验,持续帮助客户构建面向未来、可持续演进的网络连接基础设施。