分布式训练负责把大模型训练拆分到多 GPU / 多节点执行,包括数据并行、张量并行、流水线并行、sequence/context parallel、ZeRO、FSDP 和 Megatron。
建议阅读顺序:
- torch.distributed:理解 process group、rank、backend 和通信原语。
- Data Parallel:理解最基础的数据切分和梯度同步。
- ZeRO 与 FSDP:理解 data parallel 冗余状态如何切分。
- Tensor Parallel:理解单层矩阵和 attention/MLP 如何切分。
- Pipeline Parallel:理解层级切分、micro-batch 和 pipeline bubble。
- Sequence Parallel 与 Context Parallel:理解 activation 与长上下文 attention 如何沿 sequence 维度切分。
- Megatron 与 3D 并行:理解 TP × PP × DP 及长上下文并行的组合。