去中心化GPU云底层是怎么搭的——去中心化云算力全景·第二章:技术架构
专辑说明本文是《去中心化云算力全景》系列的第二章。系列共十章每章独立成文。上一章市场总览覆盖了Neocloud的市场规模、定价结构和商业模式本章深入技术底层拆解GPU集群的三个核心技术层互联网络、散热架构、GPU调度系统。一、为什么技术架构决定了谁能真正做AI基础设施AI大模型训练不是把GPU堆在一起就能工作的。这句话听起来像废话但它指向一个经常被忽视的事实GPU集群的性能瓶颈往往不在GPU本身而在连接GPU的网络、为GPU散热的冷却系统以及调度GPU工作的软件栈。一个配置不当的集群昂贵的GPU可能一半时间都在等待——等网络同步梯度等散热系统降温等调度器分配任务。理解这三层技术架构是判断一个GPU云平台是否真正适合AI工作负载的基础——无论它是超大云厂商、中心化Neocloud还是去中心化GPU网络。二、互联网络InfiniBand还是以太网这是GPU集群技术选型里争议最多的话题之一也是最容易被过度简化的话题之一。先把数字放出来再讨论InfiniBand HDR实现了稳定的0.6微秒端口到端口延迟。100Gbps以太网的基线延迟为1.2微秒在拥塞情况下可以劣化到50微秒以上。 3exhostingInfiniBand带宽效率约95%——200Gbps的InfiniBand实际吞吐维持在190Gbps。以太网的效率因配置而异标准以太网约85%经过调优的RoCE v2可达92%。 3exhosting这两个数字背后的工程含义需要结合分布式训练的工作原理来理解。分布式训练为什么对网络这么敏感在训练一个大型语言模型时有一个操作会被执行数百万次AllReduce。AllReduce是NCCLNVIDIA集体通信库的核心操作具体分两个阶段首先是Reduce-Scatter每块GPU将自己的梯度张量的一个分块发送给所有其他GPU同时从其他GPU接收分块最终每块GPU持有完整梯度的一个完全求和切片然后是AllGather每块GPU将自己的切片广播给所有其他GPU最终所有GPU都拿到完整的平均梯度。这个操作的频率与模型层数和训练批次密切相关——一个1000亿参数的模型在一次完整的训练迭代里可能需要数千次这样的集合通信操作。在分布式训练中梯度同步发生数百万次微秒级的差距会在跨越数千次迭代中积累成小时级的额外训练时间。 Invenia更关键的是拥塞行为的差异拥塞行为是关键区别——InfiniBand在拥塞下性能平稳下降以太网在入向拥塞incast下会崩溃。 3exhosting入向拥塞incast是AI训练里的常见场景AllReduce的AllGather阶段所有GPU同时向同一个节点发送数据形成多对一的流量模式以太网在这种场景下的延迟会从正常的1.2微秒劣化到50微秒以上而InfiniBand能优雅地降级处理。2026年的真实格局不是非此即彼InfiniBand在2023年主导AI训练集群市场份额约80%。到2025年中期以太网在AI后端网络中取得领先驱动因素是超以太网联盟UEC规范成熟以及超大云厂商公开验证了大规模RoCE的可行性。对于二线和三线公司这意味着存在可行的生产级替代方案替代过去200,000美元以上的InfiniBand交换机。 Energy-solutions市场正在走向双轨未来InfiniBand用于超大规模性能以太网用于广泛可及性和具有成本效益的AI计算。 tech plus trendsNVIDIA Spectrum-X 800G以太网现已出货并经过Blackwell部署验证缩小了InfiniBand在特定工作负载上的优势。NDR 400G InfiniBand仍主导训练集群XDR 800G正在推出。AI集群网络越来越混合——InfiniBand用于训练以太网用于推理。 3exhosting实际选型的决策框架集群规模 32节点 → 经过调优的RoCE v2以太网通常已经足够 → 成本优势明显运维复杂度更低 集群规模 32-256节点中等规模训练 → 需要评估工作负载的通信占比 → 如果AllReduce时间 总训练时间的20%计算受限网络影响有限 → 如果AllReduce时间 20%通信受限InfiniBand的优势开始显现 集群规模 256节点超大规模训练 → InfiniBand仍是黄金标准 → 延迟一致性和拥塞处理能力是决定因素 → GPT、LLaMA、Claude这类模型的训练首选 推理工作负载所有规模 → 以太网通常已经足够 → 推理的GPU间通信需求远低于训练 → 成本效率优先延迟要求相对宽松InfiniBand的成本真相InfiniBand硬件成本是以太网的2倍但运营成本低40%。 3exhostingInfiniBand交换机的采购价格确实高出很多但有两个抵消因素一是InfiniBand的自动化管理能力降低了运维人力成本二是更高的带宽效率意味着同样的训练任务需要更少的GPU小时在大规模训练里这个节省可以超过网络本身的成本差。对于去中心化GPU网络网络互联是最大的工程挑战之一去中心化节点分布在全球各地节点间通过公网连接无法部署物理的InfiniBand互联只能通过高性能公网连接和软件优化来弥补这个差距。这意味着去中心化网络更适合推理这类GPU间通信需求低的工作负载而超大规模训练仍然需要中心化的专属集群来提供物理层面的高速互联。三、散热架构液冷为什么成了必选项AI GPU的功耗密度从根本上改变了数据中心散热的规则。NVIDIA的GPU热设计功耗演进A1002020年400W TDP风冷可管理约15kW/机架H100 SXM2023年700W TDP达到风冷极限约40kW/机架B2002025年1000W TDP强烈建议液冷GB200 NVL722025年每GPU托盘1400W液冷强制要求约120kW/机架。 SitePoint空气冷却在超过50 W/cm²热通量或约35kW每机架时变得不足。现代AI GPU如H100的86 W/cm²已超过这个阈值。机架密度超过35kW时直接液冷是必要的。机架密度超过100kW时浸没冷却是唯一可行方案PUE可低至1.02。 Markaicode2026年行业转变标准机架正在从15kW移向30kW以上。GB200 NVL72以72块GPU在单一机架配置达到120kW每机架。 Mlops三种冷却技术的PUE对比PUE电力使用效率因技术而异传统风冷1.50-1.80带节能器的风冷1.30-1.50直接液冷1.10-1.25单相浸没冷却1.02-1.10两相浸没冷却可达1.01-1.05。 MarkaicodePUE的含义是每消耗1单位IT设备用电数据中心总共消耗多少电。PUE 1.50意味着数据中心每消耗1.5度电只有1度用于GPU计算0.5度用于散热、照明等基础设施。PUE 1.02意味着基础设施开销只有2%。水的导热能力约是空气的3500倍。通过液冷运营商能够维持更稳定的内部温度减少对昂贵GPU的机械应力并延长其寿命。 arxiv一个真实的性能案例一个研究计算总监有一个H100集群在运行一个70亿参数的微调任务每周24小时×5天运行。每次运行到第六小时GPU结温就会达到83°C时钟频率降低。一个22小时的任务需要31小时才能完成。更换冷却回路后——相同的GPU相同的工作负载——结温降至44°C。用液冷做同样的工作GPU性能提升了约30%不是因为换了更好的GPU而是因为GPU终于可以在设计频率下持续运行而不降频。 arxiv这个案例精准说明了散热架构的本质价值GPU在高温下会自动降频保护自己冷却系统不够好你买了最贵的GPU但跑不出最高性能。散热技术选型矩阵三个阈值决定正确的冷却架构选择机架密度超过20kW时ASHRAE TC 9.9建议直接液冷有散热物理学依据不是厂商偏好。冷板安装在GPU芯片上冷却液通过封闭或开放回路流动PUE约1.10-1.20。这覆盖了2026年基于H100和H200硬件构建的大多数AI部署。超过50kW每机架B200、GB200 NVL72及以上浸没或专用高密度液冷基础设施是唯一可行方案。 arxiv机架密度分级与冷却方案选择 15kW/机架传统服务器密度 → 标准风冷热通道/冷通道隔离 → 成本最低但不适合现代AI GPU 15-30kW/机架H100单机架 → 带后门热交换器的高密度托管 → 风冷极限区间建议评估液冷 30-60kW/机架多块H100或单块B200配置 → 液冷为必要选项 → 直接液冷直冷板是主流方案 → 安装成本$15K-$25K/机架 CDU基础设施 60-120kW/机架B200全配置或NVL72 → 直接液冷或浸没冷却 → 需要设施层面的改造 → 安装成本$20K-$40K/机架 设施改造 120kW/机架GB200 NVL72 → 浸没冷却是推荐方案 → PUE可达1.02与风冷的1.50-1.80相比 → 节省30-40%冷却能耗高电价地区ROI明显液冷对去中心化GPU网络意味着什么对于部署在全球各地的去中心化GPU节点散热是一个特别重要的约束。不同地理位置的气候条件、电力成本、设施条件差异极大。高端AI GPUB200及以上对液冷的强制要求意味着去中心化网络中能够承接这类硬件的节点必须具备相应的冷却基础设施。这实际上对节点运营商设定了更高的准入门槛也是去中心化网络在管理节点质量时必须解决的工程问题。四、GPU调度实现95%利用率的软件栈硬件再好如果调度软件不行GPU依然会大量空闲。GPU调度解决的核心问题是如何在动态变化的工作负载训练任务、推理请求、微调任务之间最大化GPU的实际计算时间最小化等待时间。分布式训练调度NCCL与并行策略大规模训练的调度本质上是多个并行策略的组合选择数据并行Data Parallelism - 每块GPU持有完整的模型副本 - 不同GPU处理不同的数据批次 - 通信AllReduce同步梯度 - 适合中等规模模型GPU数量较少的场景 张量并行Tensor Parallelism - 单个权重矩阵被切分到多块GPU - 通常是节点内并行通过NVLink直接通信 - 通信量大依赖超高速互联NVLink - 适合超大模型的单层无法放入单块GPU 流水线并行Pipeline Parallelism - 模型不同层分配到不同GPU - 通过点对点通信传递激活值 - 不使用集合通信NCCL影响小 - 适合超大模型跨节点并行对于vLLM推理的张量并行主导设置是NCCL_P2P_LEVELSYS以使用NVSwitch进行AllReduce。TP进程组使用与DP进程组分离的NCCL通信器。不要在并行维度之间共享通信器初始化顺序对避免死锁很重要。生产推理调度vLLM与PagedAttention对于推理工作负载调度问题更加复杂你需要在同一时间处理来自不同用户的请求每个请求的上下文长度不同需要的KV Cache大小不同完成时间不确定。vLLM的核心创新是PagedAttention它以非连续块管理KV缓存内存类似操作系统的虚拟内存分页。这大幅减少了朴素KV缓存分配中的内存碎片化允许引擎从相同的VRAM预算中服务显著更多的并发请求。2025-2026年vLLM发布中引入了解耦预填充/解码架构将计算密集的提示处理预填充阶段与内存带宽密集的Token生成解码阶段分离。这允许对每个阶段采用不同的硬件或调度策略提升整体GPU利用率。KV缓存被低估的推理瓶颈vLLM GPU集群生产事故的最大单一原因是在节点间错误地调整KV缓存大小——导致在负载下出现级联抢占和P99延迟峰值飙升8倍。KV Cache是推理时存储注意力计算中间结果的内存区域。对于长上下文推理KV Cache的内存需求可能超过模型权重本身。正确的KV Cache管理是生产推理服务P99延迟稳定性的核心保障。GPU利用率的三种优化机制MPS多进程服务 - 让多个进程共享同一块GPU的SM流式多处理器 - 适合推理任务单个请求无法填满GPU计算资源 - 注意需要隔离内存访问避免进程间干扰 时间切片Time-slicing - GPU在不同任务间轮流切换 - 最简单但上下文切换有开销 - 适合低优先级的后台任务对延迟不敏感 MIG多实例GPU - 在NVIDIA A100/H100上可用 - 将单块GPU物理分割为最多7个独立实例 - 每个实例有专属的SM、内存、带宽 - 适合需要严格隔离的多租户环境GPU共享MPS、时间切片、MIG、NUMA感知调度和RDMA数据传输最大化GPU利用率减少空闲周期。Kubernetes在GPU集群调度中的角色Kubernetes自动化GPU资源管理确保跨多台机器高效调度和扩展实现在大规模数据集上更快的训练。在vLLM GPU集群架构中使用Ray作为分布式调度器结合Karpenter进行自动扩缩容在p4d.24xlarge8×A100 80GB上测试处理每秒1200个请求的场景中通过Ray调度器实现自动故障恢复——当一个GPU worker失败时Ray调度器将其标记为不健康Karpenter扩缩容器旋转替换Pod。五、去中心化GPU网络的技术挑战与解题思路把上面的三层技术架构网络互联、散热、调度放到去中心化GPU网络的背景下会发现一些独特的工程挑战。挑战一节点间无法部署物理高速互联中心化Neocloud可以在数据中心内部署InfiniBand交换机实现GPU间0.6微秒延迟。去中心化网络的节点分散在全球节点间只能通过公网连接。解题思路针对不同工作负载分配不同的节点组合。推理工作负载GPU间通信需求低 → 全球分布式节点地理就近调度 → 公网延迟对推理性能影响有限 → 去中心化网络的优势故障容忍、低成本 大规模训练GPU间通信密集 → 专属集群模式在同一数据中心集中部署 → 节点内仍可使用高速互联如Axe Compute的B300集群 → 去中心化网络提供的是硬件储备和调度能力 不是把2304块GPU分散到全球各地跑训练Aethir为Axe Compute配置的2304块NVIDIA B300集群部署在美国Tier 3数据中心物理层面集中满足高速互联要求——这正是去中心化网络支撑专属集群部署的正确实现方式。挑战二节点质量参差不齐去中心化网络的节点由不同运营商在不同地点运行硬件型号、散热条件、网络质量都可能差异极大。解题思路建立节点质量评估和分层机制。节点质量分层 A级节点企业级 - 专业数据中心环境 - 液冷或高密度散热基础设施 - SLA保证的网络连接 - 可承接大规模训练和生产推理 B级节点半专业 - 良好但非专业数据中心环境 - 风冷为主适合H100及以下 - 稳定但不保证最低延迟 - 适合实验性训练和弹性推理 C级节点社区级 - 家庭或小型办公室环境 - 散热条件受限 - 网络稳定性不保证 - 适合非关键工作负载挑战三故障处理与任务迁移中心化集群的故障处理依赖数据中心的统一运维体系。去中心化节点的故障更难预测需要软件层面的自动恢复机制。解题思路无状态任务设计 自动检查点 快速迁移。推理任务的故障处理相对简单 - 推理是无状态的单次请求失败直接重试 - 路由层自动将请求切换到健康节点 - 用户感知单次请求延迟增加无服务中断 训练任务的故障处理复杂 - 需要定期保存检查点Checkpoint - 节点失败时从最近的检查点恢复 - 检查点频率是容错能力和额外开销的平衡 - 去中心化训练需要更高频率的检查点来降低损失六、不同工作负载的基础设施选型指南基于以上三层技术分析给出一个面向实际决策的工作负载-基础设施匹配矩阵工作负载类型互联需求散热需求调度复杂度推荐架构超大规模训练1000B参数InfiniBand必须液冷必须高多维并行中心化专属集群中等规模训练7B-70BRoCE以太网足够液冷建议中Neocloud保留实例生产推理低延迟API以太网足够取决于GPU型号中KV Cache管理去中心化专属混合AI Agent持续运行以太网足够取决于GPU型号低单任务流去中心化高可用优先微调LoRA/QLoRA以太网足够风冷或液冷低弹性实例实验开发以太网足够风冷足够低现货实例或本地OllamaAethir Claw的技术实现Aethir Claw是运行在Aethir GPU基础设施上的AI Agent托管平台它的技术设计与上述工作负载特性高度匹配每个Agent实例分配完全隔离的VPS环境有独立的内存、API密钥和会话状态避免多租户环境中的资源竞争坑点七中提到的噪音邻居问题。Aethir Mesh提供开源模型的统一推理接口DeepSeek V4、Kimi K2.6等推理在Aethir网络内完成不出圈。ClawHub到2026年中已积累超过44,000个社区构建的技能和150万个活跃Agent印证了这套架构在实际生产负载下的可行性。七、2026年技术路线图接下来会发生什么网络层以太网继续追赶但未来是双轨制超以太网联盟UEC于2024年发布UEC 1.0规范合规产品预计2025-2026年推出。1.6T光学接口开始出现在2026-2027年的路线图上。AI集群网络越来越混合——InfiniBand用于训练以太网用于推理。 3exhosting这意味着未来的GPU集群将越来越多地采用混合网络架构节点内intra-node使用NVLink高速互联节点间inter-node训练流量走InfiniBand推理流量走高性能以太网。单一网络技术统治一切的时代正在被更细粒度的分工所取代。散热层浸没冷却走向主流2026-2027年单相浸没冷却在超大规模AI基础设施中实现主流认可。浸没冷却的普及将允许更高的机架密度进而允许在同等数据中心面积内部署更多GPU。这对去中心化网络的节点容量有直接影响——支持浸没冷却的节点可以在相同物理面积内提供更多算力。调度层推理优化成为主战场随着推理工作负载的权重持续上升推理调度技术成为最热门的工程方向KV Cache的管理和优化PagedAttention已经是标准配置、预填充和解码的解耦vLLM的disaggregated架构、跨节点的推理流量智能路由——这些技术正在快速成熟并将直接影响去中心化GPU网络在推理场景下的性能表现。八、常见问题FAQInfiniBand和以太网用于AI训练到底该选哪个对于32节点以上的集群InfiniBand通常提供更好的延迟和扩展性。对于较小或实验性的设置以太网可能已经足够。具体来说如果你的AllReduce通信时间占总训练时间不足20%你的工作负载是计算受限的InfiniBand的网络延迟优势影响有限。如果超过20%InfiniBand的优势开始显现尤其是超过32节点的大型集群。推理工作负载通常以太网已经足够。 tech plus trendsB200 GPU为什么强制要求液冷直接液冷是GB200 NVL72系统的强制要求。风冷无法消散140kW每机架的热量。部署Blackwell的设施必须安装直接液冷基础设施包括冷却液分配单元CDU、泄漏检测和兼容的机架设计。后门热交换器在这种密度下是不够的。B200的1200W液冷TDP在8GPU配置下整台服务器功耗在16-20kW范围内远超风冷能处理的上限。 arxiv什么是PUEAI数据中心的目标PUE是多少PUE电力使用效率 数据中心总用电 ÷ IT设备用电。PUE越接近1能源效率越高。传统风冷数据中心PUE约1.50-1.80直接液冷1.10-1.25浸没冷却1.02-1.10。Google等超大云厂商的最优PUE约1.08-1.10。单相浸没冷却在优化部署中实现1.03-1.08的PUE两相浸没可达1.02-1.05。与风冷基线相比节省30-40%的冷却能耗在高电价地区超过$0.12/kWh或高占空比设施AI训练每年超过8500小时中有显著的TCO优势。去中心化GPU网络如何处理大规模训练的高速互联需求去中心化网络无法在分散的全球节点之间部署物理InfiniBand。正确的解法是大规模训练采用专属集群模式在同一数据中心集中部署节点保证高速互联去中心化网络提供的是硬件储备和调度能力。Aethir为Axe Compute配置的B300集群部署在美国Tier 3数据中心正是这种模式的实际案例。去中心化网络的优势体现在推理和Agent工作负载上而不是要求极高GPU间通信带宽的超大规模训练。vLLM的PagedAttention解决了什么问题vLLM的核心创新PagedAttention以非连续块管理KV缓存内存类似操作系统的虚拟内存分页大幅减少了朴素KV缓存分配中的内存碎片化允许从相同VRAM预算中服务显著更多的并发请求。简单说在没有PagedAttention的系统里不同长度的推理请求会导致大量显存碎片同一时间能并发处理的请求数量受限PagedAttention让显存利用率大幅提高相同硬件可以服务更多并发用户。去中心化GPU网络如何保证节点质量节点质量管理是去中心化网络面临的核心工程挑战。通常的解法是建立节点质量分层机制——通过持续的性能测试和监控将节点分为不同等级路由不同类型的工作负载到匹配质量等级的节点。高价值工作负载企业级推理、长期训练任务被路由到经过验证的高质量节点弹性工作负载则可以使用更广泛的节点池。Aethir网络长期维持95%以上的GPU利用率是节点质量管理有效性的一个侧面验证。数据来源· Introl: InfiniBand vs Ethernet for GPU Clusters 2026· Arc Compute: Network Fabric for AI Clusters· SLYD: AI Data Center Cooling Requirements 2026· Adam Silva Consulting: Data Center Cooling Economics 2026· vLLM Production Architecture Guide 2026· Spheron: NCCL Tuning for Multi-GPU LLM Training 2026 3exhosting 3下一章预告第三章将从技术架构转向商业逻辑——Neocloud这门生意的成本结构是什么利润从哪里来不同规模的玩家如何竞争以及当GPU价格持续下降时Neocloud的护城河在哪里