本页在同一 V1 trainer 中对比 PPO 与 GRPO。比较对象不是算法名,而是实际启用的 role、batch field、forward pass、loss 和 resource cost。

Shared Path

prompt
  -> rollout
  -> reward
  -> old/reference log-prob
  -> advantage
  -> actor update

Expected Differences

PPO:
  critic role
  -> values
  -> GAE / returns
  -> critic update
  -> actor update
 
GRPO:
  repeated responses per prompt
  -> group reward statistics
  -> group-relative advantages
  -> actor update without critic

Source Anchors

Comparison Dimensions

  • required models and GPU memory;
  • rollout count and prompt grouping;
  • advantage bias/variance;
  • reward scale sensitivity;
  • sequence/token normalization;
  • compute and communication cost;
  • metrics required for debugging;
  • suitability for long-horizon Agent trajectories。

Completion Criteria

  • 使用同一模型和数据构造两份最小 resolved config;
  • 生成 role/field/call/metric 四张差异表;
  • 运行 Lab 03;
  • 将算法级结论回填 PPO 和 GRPO。