频道:网站首页 > 科技信息 > >文章内容

面向未来的磐久AL144 ScaleUp万卡NPO光互连超节点

时间:2026-09-24 17:02   来源: 网络   阅读量:11990   

9月23日,在2026云栖大会"AI Native 磐久超节点服务器与硬件工程创新"分论坛上,阿里云首次系统展示面向下一代AI业务场景的旗舰超节点服务器——磐久AL144 ScaleUp万卡NPO光互连超节点。作为磐久超节点家族的新一代形态,AL144在单柜ScaleUp域规模、供电密度、散热能力与光互连扩展上实现代际跃升:单柜ScaleUp域最大144卡,通过二级SNPO光互连可扩展至千卡/万卡(Max 10368);单柜功耗650kW,最大支持单GPU功耗3500W,单柜ScaleUp带宽达Pb/s级。尤为关键的是,AL144首次将单一ScaleUp域的最大规模从千卡推向万卡级,让MoE万亿参数、长上下文KV Cache与Agentic AI等下一代AI负载可以在同一ScaleUp语义下直接互访,为AI Infra的下一轮代际跃迁奠定工程底座。

磐久AL144:阿里云下一代超节点服务器

当前AI负载正在被新的业务形态重塑,MoE万亿参数成为主流,KV Cache成为主角,Agentic AI让CPU重回舞台中央,训练与推理的重心加速迁移。四重趋势叠加,超节点必须同时跨过互联墙、散热供电墙、内存墙、拓扑与部署墙四道工程墙——任何单点优化都无法同时作答,答案必须是服务器系统工程。磐久AL128发布一年已在阿里云数据中心规模部署,超节点范式从承诺走向兑现;AL144则在此基础上,面向下一代AI负载提前完成系统级重构。

磐久AL144采用"柜内正交铜互连+跨柜光扩展"的整机架构,兼容产业计算和互连芯片,避免绑定单一芯片体系;IT Rack与Side Car解耦设计,模组化支持分钟级更换;系统层面提供6个9的供电可靠性,以及芯片—节点—机柜三级漏液监测,为大规模AI集群的稳态运行提供高可靠底座。相较AL128,AL144在单柜ScaleUp域规模、单柜功耗、最大支持GPU 功耗三个维度分别实现2×、1.86×、1.75×的跃升,同时通过二级光互连首次打通跨柜ScaleUp能力,将ScaleUp单域算力规模从百卡级推向万卡级。

真正让AL144区别于其他超节点的,是其ScaleUp到10368卡的两级全互连扩展能力。单柜内,144颗GPU通过正交铜互连构成一级ScaleUp域,享受铜在短距下的高带宽、低功耗与低成本;跨柜时,通过基于SNPO光互连的ALink Switch组成二级ScaleUp域,无收敛扩展至288卡、1024卡乃至10368卡,柜内铜的高密度与跨柜光的长距能力在同一ScaleUp语义下无缝衔接。这意味着MoE万亿参数模型的Expert Parallel可以放在一个ScaleUp域内、长上下文推理的KV Cache可以在万卡级共享、Agentic AI的多智能体协同可以直接以内存语义互访,而不再被迫走慢一个数量级的ScaleOut网络——单一ScaleUp域从数百卡到万卡,是超节点从"更大整机"迈向"更大计算机"的关键一跃。

供电与散热上,AL144引入800V PDB in Server与800V Cap Shelf垂直供电架构,配合UAM通用加速器模组(Universal Accelerator Module,最大支持单GPU功耗 3500W)、垂直喷射微通道冷板、浮动接头UQD、新型流变稳定型液态金属等关键技术,全液冷原生,为3500W级GPU与650kW单柜功耗提供稳态散热与高效供电保障。

系统工程:以开放架构共建超节点生态

与部分传统硬件厂商将超节点视为封闭整机、以垂直整合构建商业护城河的路径不同,阿里云磐久AL144从架构定义之初就选择开放路线:ScaleUp互连对齐UALink开放协议和SNPO光互连开放规范,散热与部件采用液冷原生、浮动接头UQD、垂直喷射微通道冷板等可复用工程能力,供电侧统一800V HVDC与垂直供电封装。UAM计算模组与模块化整机设计使代际平滑演进成为可能,产业GPU、CPU、ScaleUp Switch、连接器、液冷部件、电源等生态伙伴均可基于开放接口参与定义,共享超节点时代的AI基础设施红利。这其中,ScaleUp到万卡的关键,正在于开放协议与开放光互连规范的协同——UALink提供跨厂商统一的ScaleUp内存语义与低延迟保障,SNPO定义NPX铜光共Socket的封装形态、3.2T/6.4T/12.8T的带宽演进路径与百ns级延迟预算,两者结合才让AL144把ScaleUp单域从144卡扩展到10368卡具备工程可实现性。

此外,围绕AL144,阿里云同步展示了磐久CXL内存扩展超节点与磐久Agentic AI CPU服务器,形成"一个家族、三种形态"的未来AI Infra 全景:CXL内存扩展超节点通过CXL 3.1内存池化与冷热分级,把HBM放不下的KV Cache沉入百ns级CXL DDR,并已在PolarDB三层分离架构落地瑶池1.0;Agentic AI CPU服务器架构能力支持单柜288CPU、1U 8CPU,正交架构、800V HVDC集中供电、全液冷,为长上下文、多工具调用、高频状态交互的Agent负载打造专属执行底座。三种形态多Rack协同,让"Rack即计算机"从单柜走向跨柜、从千卡走向万卡。

阿里云智能集团资深技术专家郭锐表示:"超节点不是一颗更大的芯片,也不是一台更密的整机,而是一整套跨芯片、部件、整机、协议与运维的系统工程。当ScaleUp域从数百卡走向10368卡,靠任何一家厂商的封闭方案都无法完成——磐久AL144的答案是开放,把接口打开、把规范公开、把生态做厚,与产业伙伴一起把新一代的AI Infra底座建起来。"未来,阿里云将持续以开放架构与生态共建推动超节点技术演进,为Agentic AI与超大模型时代提供可持续的算力底座。

免责声明:该文章系本站转载,旨在为读者提供更多信息资讯。所涉内容不构成投资、消费建议,仅供读者参考。

ad

关于我们 | 联系我们 | 投稿合作 | 网站地图 | RSS订阅
 

版权所有©IT产业网
 

所载文章、数据仅供参考,使用前务请仔细阅读网站声明。本站不作任何非法律允许范围内服务!
 

联系我们: jokerdeyouxiang@sina.com
 

备案号:皖ICP备2023005497号