30 · 上游 / Upstream

整机、集群与网络

单卡只是零件;机架、液冷与高速互联才把算力连成训练集群。

服务器整机、机柜、液冷、NVLink/InfiniBand/以太网与调度软件,决定大模型训练能否在合理时间内跑完。本层连接芯片商与云厂商,也是“有卡无集群”的常见卡点。

角色

这一层谁在干活

AI 服务器与 ODM

把 GPU/加速器做成可上架的训练/推理节点。

  • 超微 Supermicro
  • 戴尔/HPE
  • 浪潮等

高速互联

多机多卡通信带宽与拓扑,直接影响大模型并行效率。

  • NVIDIA NVLink/Spectrum-X
  • InfiniBand
  • 以太网 RoCE

数据中心工程

电力、散热与机房密度是扩容的物理上限。

  • 液冷方案
  • 电力配套
  • 选址与能耗
馆内机构

可点进档案的公司

NVIDIA以 CUDA 与 GPU 成为现代深度学习默认算力层,并发布 Nemotron、Cosmos 等模型。 Amazon / AWS以 Amazon Nova 自研模型与 Bedrock 多厂商托管平台服务企业生成式 AI。 Microsoft以 Azure、Copilot 与 Phi 小模型把前沿与端侧 AI 写入操作系统与办公套件。 Google以 Gemini 与 Gemma 覆盖闭源旗舰与开放轻量,并把模型嵌入搜索与云。 阿里巴巴 / Alibaba通过通义千问(Qwen)家族把中文与多语言开放模型做成持续迭代的云与开发者生态。 华为 / Huawei以盘古大模型与昇腾算力服务政企与行业,强调全栈自主与行业落地。
概念

读懂这一层

GPU(图形处理器)原本为图像渲染设计的并行芯片,后来成为训练与推理神经网络的主力算力。
专题

相关主题路线

AI Infra AI 硬件

试试搜索