本页研究统一 worker contract 如何落到不同 training backend。第一遍以 FSDP 为主,第二遍再映射 Megatron,不同时展开所有 engine implementation。

本页问题

  1. TrainingWorker 与 ActorRolloutRefWorker 对 trainer 暴露哪些稳定接口?
  2. BaseEngine 如何统一 initialize、forward/backward、optimizer、checkpoint 和 parameter export?
  3. FSDP 与 Megatron 在 batch dispatch、loss scaling、parallel group 和 checkpoint 上有哪些不可隐藏差异?
  4. actor、critic、reference model 是否复用相同 engine abstraction?
  5. backend-specific config 如何进入 engine registry?

Source Anchors

Comparison Frame

trainer request
  -> worker method
  -> engine contract
  -> backend-specific batch layout
  -> forward/backward schedule
  -> optimizer step
  -> metrics / parameter shard

Completion Criteria

  • 对同一个 actor update 画出 FSDP 和 Megatron 调用链;
  • 记录 global batch、mini-batch、micro-batch 与 DP size 的关系;
  • 说明 mixed precision、gradient accumulation 和 loss normalization 在哪个层处理;
  • 与 FSDP、Megatron 与 3D 并行 互相回链。