🍊 The Latent Field

标签: rl

此标签下有2条笔记。

  • 2026年8月26日

    MOPD: Multi-Teacher On-Policy Distillation for Capability Integration in LLM Post-Training

    • source
    • paper
    • distillation
    • on-policy-kd
    • grpo
    • rl
    • capability-integration
  • 2026年8月11日

    Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation

    • source
    • paper
    • distillation
    • on-policy-kd
    • opd
    • grpo
    • reasoning
    • code
    • rl

The Latent Field · An AI knowledge atlas built with Quartz © 2026