第 30 · 上游 / Upstream
整机、集群与网络
单卡只是零件;机架、液冷与高速互联才把算力连成训练集群。
服务器整机、机柜、液冷、NVLink/InfiniBand/以太网与调度软件,决定大模型训练能否在合理时间内跑完。本层连接芯片商与云厂商,也是“有卡无集群”的常见卡点。
依赖
角色
这一层谁在干活
AI 服务器与 ODM
把 GPU/加速器做成可上架的训练/推理节点。
- 超微 Supermicro
- 戴尔/HPE
- 浪潮等
高速互联
多机多卡通信带宽与拓扑,直接影响大模型并行效率。
- NVIDIA NVLink/Spectrum-X
- InfiniBand
- 以太网 RoCE
数据中心工程
电力、散热与机房密度是扩容的物理上限。
- 液冷方案
- 电力配套
- 选址与能耗
馆内机构
可点进档案的公司
NVIDIA以 CUDA 与 GPU 成为现代深度学习默认算力层,并发布 Nemotron、Cosmos 等模型。
Amazon / AWS以 Amazon Nova 自研模型与 Bedrock 多厂商托管平台服务企业生成式 AI。
Microsoft以 Azure、Copilot 与 Phi 小模型把前沿与端侧 AI 写入操作系统与办公套件。
Google以 Gemini 与 Gemma 覆盖闭源旗舰与开放轻量,并把模型嵌入搜索与云。
阿里巴巴 / Alibaba通过通义千问(Qwen)家族把中文与多语言开放模型做成持续迭代的云与开发者生态。
华为 / Huawei以盘古大模型与昇腾算力服务政企与行业,强调全栈自主与行业落地。
概念
读懂这一层
专题