Objective
实现一个最小 function-based reward,验证 data source routing、response decoding、score shape、extra metadata、failure handling 和 validation behavior。
Planned Cases
- 正确答案返回正 reward;
- 格式错误与答案错误得到可区分结果;
- 超时、异常和空 response 有明确 fallback;
- batch 内不同长度 response 的 score 正确写回;
- reward 不依赖本不应可见的 future information。
Source Anchors
Acceptance Criteria
- reward function 有单元测试;
- score 与 extra info 可在 rollout dump 中审计;
- 异常不会静默变成高 reward;
- 结果回填 04 Rollout, Reward and AgentLoop。