本页连接三类执行对象:rollout backend 负责生成,AgentLoop 负责多轮交互,RewardLoop 负责把结果转换成训练信号。
本页问题
- LLMServerManager 如何创建并路由 rollout replicas?
- single-turn 与 multi-turn rollout 在数据结构和终止条件上有何不同?
- rule-based reward、model-based reward 和 remote reward 如何接入统一数据流?
- reward 是 sequence-level、token-level 还是 trajectory-level,如何写回
rm_scores? - tool failure、timeout、truncation 和 invalid response 如何影响 sample status 与最终 reward?
Source Anchors
- LLMServerManager
- rollout base
- vLLM rollout
- SGLang rollout
- AgentLoop
- RewardLoop
- reward score functions
Expected Flow
raw prompt
-> sampling request
-> assistant tokens
-> optional tool call / observation loop
-> terminal response or failure
-> rule / verifier / reward model
-> rm_scores and reward metadataCompletion Criteria
- 分别画出 single-turn 和 tool-use trajectory;
- 说明 rollout log-prob 的生成位置与 temperature 处理;
- 记录 reward 写回 TransferQueue 的字段与时机;
- 解释 validation reward 与 training reward 的差异;
- 与 Reward Model 和 Tool Calling 建立边界清晰的回链。