Bio-Audit Reward 协议(阶段 4 · 窗口 E + F)

版本:v1(2026-08-16,与映射定稿 docs/reward-mapping.md 绑定)+ 批 2 更新(窗口 F,2026-08-16):实测表升级至 60 任务(taskset v1.1.0), 批 1 旧值留档(§7.1) 依据:refactor-plan-v1.1 F1-F7 + 拍板 #1(F4 不进 reward)+ 拍板 #2(验收方式)


一、目标与范围

reward 是外围输出层:把引擎 level 判定变换为训练信号(step_rewards + trajectory_reward),不改变任何评分路径(golden 20 轨迹 137 决策 0 差异 为硬验收)。本文档固定配方、验收统计量与锚点协议;映射数值见 reward-mapping.md(宪法)。

二、配方定义(E2.5/E2.6)

配方 定义 与 A 的差
A 纯规则分:mean(未 mask 步骤 reward) 基线
B A × γ=0.30,当且仅当存在未 mask L0(二元) 硬惩罚效应
C 加权 mean(PRM 预留接口;占位权重=1.0 均匀) PRM 加权效应

三、mask 语义(F1 + B4 纪律)

条件 mask 原因 处理
level = -1(无法评估) level_minus_one 不参与分子与分母
verdict = revoked revoked 只消费 final(B4)
verdict = provisional provisional_not_final 只消费 final(B4)
有会话但无 verdict 记录 no_verdict_record 只消费 final(B4)
全步骤 mask trajectory_reward = None(不给 0 虚假信号)

无采集会话(legacy/benchmark)→ 全部视为 final(meta.verdict_mode=all_final)。

四、验收统计量(E3.7,拍板 #2 预注册)

放弃 Spearman 点估计门槛(F5 改验收)。预注册统计量:

  1. 排序一致性(弱锚点方向):reward 排序 vs gold 质量排序
    • gold 质量 q = correct / (correct + error)(edge 中立;全 edge → 剔除);
    • 统计量:Spearman ρ + Kendall τ_b,如实报告(含任务级重采样 percentile bootstrap CI,B=2000,seed=42);不做通过/失败阈值;
  2. 分层均值检验(验收主判据):
    • 预注册分组:good = n_gold_error == 0;bad = n_gold_error ≥ 1
    • 统计量:mean(good) − mean(bad)(期望 > 0)+ 两样本置换 bootstrap p (B=2000 双尾)+ 均值差 CI;显著分离 = diff > 0 且 p < 0.05
  3. 多种子稳定性(F6):ρ/τ 点估计跨种子恒定(reward 无随机源 → 确定性)+ bootstrap CI 边界跨种子偏差 ≤ 0.05(种子集 {42, 1, 7, 123, 2026})。

五、校准锚点(E3.9,F7 拍板)

六、reward-validate 五闸(E4.13,CI 双矩阵)

  1. 映射健全(单调非降、-1 mask、天花板 0.85);
  2. 确定性(同输入两次 reward 逐字节一致);
  3. spike-in 强锚点(drop ≥ 0.30 + 注入判 L0 自校验);
  4. 三组消融可运行(同输入、同任务数);
  5. golden 0 差异(评分路径保护)。

排序一致性/分层检验结果随五闸输出为证据(人工验收用),不作门禁阈值。

七、实测结果

7.1 批 1 留档(2026-08-16,30 任务冻结,taskset v1.0.0)

配方 Spearman ρ [CI] Kendall τ_b [CI] 好组均值 坏组均值 diff [CI] p
A 0.6279 [0.2916, 0.8380] 0.4949 [0.2099, 0.7182] 0.7692 0.6592 +0.110 [0.036, 0.183] 0.007
B 0.6091 [0.2894, 0.8335] 0.4898 [0.2131, 0.7213] 0.6611 0.2862 +0.375 [0.195, 0.536] 0.001
C 0.6279 [0.2916, 0.8380] 0.4949 [0.2099, 0.7182] 0.7692 0.6592 +0.110 [0.036, 0.183] 0.007

7.2 批 2 实测(2026-08-16,60 任务冻结,taskset v1.1.0;新预注册 benchmark-pr-2026-08-16-02)

配方 Spearman ρ [CI] Kendall τ_b [CI] 好组均值 坏组均值 diff [CI] p
A 0.6686 [0.4628, 0.8202] 0.5505 [0.3767, 0.7002] 0.7726 0.6394 +0.133 [0.073, 0.196] 0.000
B 0.6179 [0.4042, 0.7830] 0.5033 [0.3219, 0.6618] 0.6775 0.3160 +0.361 [0.229, 0.472] 0.000
C 0.6686 [0.4628, 0.8202] 0.5505 [0.3767, 0.7002] 0.7726 0.6394 +0.133 [0.073, 0.196] 0.000

八、遗留与变更流程

  1. 批 2 任务集(30→60)已落地:校准重跑完成(本文档 §7.2 新表 + 新预注册 记录 benchmark-pr-2026-08-16-02,批 1 旧值留档 §7.1);分层检验随任务集 变化已如实重新评估;
  2. PRM 落地后:配方 C 占位权重替换为真实模型输出,走 reward-mapping.md §10 变更流程;
  3. 报告/reward 字段均标注 experimental_uncalibrated(C3 语义不变)—— 任何消费方不得把 reward 当校准信号用于生产决策。