🍊 The Latent Field
Search
搜索
暗色模式
亮色模式
学习
探索
标签: preference-optimization
阅读模式
Hide sidebars
Show sidebars
此标签下有1条笔记。
2026年8月27日
Direct Preference Optimization: Your Language Model is Secretly a Reward Model
source
paper
dpo
preference-optimization
alignment
reward-model