🍊 The Latent Field

标签: preference-optimization

此标签下有1条笔记。

  • 2026年8月27日

    Direct Preference Optimization: Your Language Model is Secretly a Reward Model

    • source
    • paper
    • dpo
    • preference-optimization
    • alignment
    • reward-model

The Latent Field · An AI knowledge atlas built with Quartz © 2026