Objective

实现一个最小 function-based reward,验证 data source routing、response decoding、score shape、extra metadata、failure handling 和 validation behavior。

Planned Cases

  1. 正确答案返回正 reward;
  2. 格式错误与答案错误得到可区分结果;
  3. 超时、异常和空 response 有明确 fallback;
  4. batch 内不同长度 response 的 score 正确写回;
  5. reward 不依赖本不应可见的 future information。

Source Anchors

Acceptance Criteria

  • reward function 有单元测试;
  • score 与 extra info 可在 rollout dump 中审计;
  • 异常不会静默变成高 reward;
  • 结果回填 04 Rollout, Reward and AgentLoop。