分布式训练负责把大模型训练拆分到多 GPU / 多节点执行,包括数据并行、张量并行、流水线并行、sequence/context parallel、ZeRO、FSDP 和 Megatron。

建议阅读顺序:

  1. torch.distributed:理解 process group、rank、backend 和通信原语。
  2. Data Parallel:理解最基础的数据切分和梯度同步。
  3. ZeROFSDP:理解 data parallel 冗余状态如何切分。
  4. Tensor Parallel:理解单层矩阵和 attention/MLP 如何切分。
  5. Pipeline Parallel:理解层级切分、micro-batch 和 pipeline bubble。
  6. Sequence ParallelContext Parallel:理解 activation 与长上下文 attention 如何沿 sequence 维度切分。
  7. Megatron 与 3D 并行:理解 TP × PP × DP 及长上下文并行的组合。

Notes