本页研究统一 worker contract 如何落到不同 training backend。第一遍以 FSDP 为主,第二遍再映射 Megatron,不同时展开所有 engine implementation。
本页问题
TrainingWorker与ActorRolloutRefWorker对 trainer 暴露哪些稳定接口?- BaseEngine 如何统一 initialize、forward/backward、optimizer、checkpoint 和 parameter export?
- FSDP 与 Megatron 在 batch dispatch、loss scaling、parallel group 和 checkpoint 上有哪些不可隐藏差异?
- actor、critic、reference model 是否复用相同 engine abstraction?
- backend-specific config 如何进入 engine registry?
Source Anchors
Comparison Frame
trainer request
-> worker method
-> engine contract
-> backend-specific batch layout
-> forward/backward schedule
-> optimizer step
-> metrics / parameter shardCompletion Criteria
- 对同一个 actor update 画出 FSDP 和 Megatron 调用链;
- 记录 global batch、mini-batch、micro-batch 与 DP size 的关系;
- 说明 mixed precision、gradient accumulation 和 loss normalization 在哪个层处理;
- 与 FSDP、Megatron 与 3D 并行 互相回链。