过去两年,大模型行业的算力军备竞赛路径正被重新审视。近日,智谱首次公开了一项在生产集群中验证过的架构创新——ZCube组网架构,在GPU一张未加、服务器一台未换、应用代码一行未动的情况下,集群推理吞吐直接提升15%,TTFT(首Token响应时间)P99尾延迟下降了40.6%。这些数字来自真实生产流量,而非实验室仿真推演。
ZCube由智谱联合驭驯网络与清华大学共同攻关提出,已在GLM-5.1线上生产集群中完成规模化落地。技术层面,ZCube采用完全扁平化的GPU互联方式,通过“单轨+多轨”混合接入的扁平化拓扑设计,确保全网任意两张GPU有且仅有一条存在唯一最优路径,从架构层面实现了网络流量的理想负载均衡。该创新已被网络领域顶会ACMSIGCOMM2025评价为“显著改变整个行业对网络的认知方式”。
对服务上百万开发者的大模型API平台而言,15%的吞吐提升意味着同一套硬件基础设施每秒能多扛15%的并发请求,流量洪峰下的排队等待时间大幅缩短;而P99尾延迟40%的降幅,则直接决定了终端用户感知到的“卡顿感”能减少多少。
更令行业关注的是成本结构的变化。ZCube架构所需的交换机和光模块数量比原有方案少了三分之一,规模越大,这笔节省的绝对值越可观。据测算,在万卡规模下,仅网络硬件一项即可节省投资约2.1亿至6.4亿元。
在推理需求持续高增长、算力供给整体偏紧的市场背景下,“不动硬件、只动组网”的效率挖潜,相当于对存量算力资产进行了一次极低成本效率重估。整个过程中GPU不换、服务器不换、软件代码不改,纯粹是组网架构的替换,边际成本接近于零。
值得关注的是,几乎在同一时间窗口,OpenAI联合NVIDIA、AMD、Intel、Microsoft、Broadcom五大巨头正式发布了MRC(多路径可靠连接)网络协议,这是一套面向超大规模AI集群的开放网络协议,目前已部署在OpenAI所有最大规模超算集群中。与MRC在协议层优化“交通规则”不同,ZCube选择在架构层重构“路网”,从拓扑设计上消除拥塞产生的结构性根源。
两件事放在一起看,指向的判断是一致的:当GPU集群从万卡级向十万卡级跃进,网络早已不是被动的“连接件”,而是制约整体效率的核心变量。在大模型竞争日趋激烈的背景下,智谱此次提供的思路颇为清晰——与其堆更多GPU,不如让现有GPU跑得更顺,从系统架构层面释放硬件潜能,这或许正成为算力效率竞赛的新方向。