Bio-Audit Benchmark 协议(阶段 3 / 窗口 D + F)

版本:v1(2026-08-16,与任务集 taskset v1.0.0 绑定)+ 批 2 扩展 (窗口 F,2026-08-16):taskset v1.1.0(60 条),预注册记录升级为 benchmark-pr-2026-08-16-02(批 1 记录 benchmark-pr-2026-08-16-01 留档, 见 benchmark/protocol.pypre_registration_v1_archived.json)。 依据:refactor-plan-v1.1 E1-E8(评测方法论裁决)+ audit-report E 组 + execution-plan §六.七(D1-D6)+ §六.九(F1-F4) 预注册记录src/bioaudit/benchmark/pre_registration.json(机器可读副本) 数据src/bioaudit/data/tasks/(60 条,批 1 30 + 批 2 30)+ src/bioaudit/data/annotation/


一、目标与范围

benchmark 是外围层:评测确定性审计引擎(engine 0.1.3)对带已知错误注入的 Agent 轨迹(gold)的错误检出能力与分数行为。它不改变任何评分路径 (golden 20 轨迹 137 决策 0 差异为硬验收,D6.14)。

评测对象口径(预注册):

二、任务集(D1)

三、生成器与防泄漏(D1.2/D1.3;E6)

管线:变体规格(LLM,generator_prompt.md)→ 确定性变换 (generator.transform.v1)→ 人工审核 → 任务草稿 → 独立标注管线

E6 要求 落地
生成器提示词不含规则内容 generator_prompt.md 为纯过程性指令;测试守卫(规则标识/标题扫描 0 命中)
生成器与评测 Agent 不同模型 生成器 LLM(deepseek-v4-flash)vs 评测 Agent = 确定性引擎(模型信息记录在 taskset.model_info)
标注者与规则作者角色分离 标注者只读 annotation_rubric.md + 任务文件;禁止读取规则库(标注提示词明确纪律)
错误注入素材来自真实 Agent 语料 每条任务 provenance 记录 base_trajectories + error_pattern_sources(20 条 legacy 轨迹 + CellVoyager 轨迹 scrna_melanoma_cellvoyager);禁止规则反推

错误注入示例(全部有语料先例):no_integration/no_doublet_detection/ wilcoxon_rank_sum(11 患者,伪重复)/PCA_fixed_10/manual_marker/ not_checked(scrna_error);no_ph_test/univariate_Cox_claiming_independent/ EPV_less_than_5/GO_all_genes_no_filter(pan_error);no_correction/ p_raw <= 0.05(deg_error);PCA_arbitrary/Kruskal_Wallis_cell_level/ LogNormalize(CellVoyager 真实轨迹)。 6 个语料零触发类型的决策(qc_mito_threshold/pca_dimension/annotation_validation/ trajectory_validation/annotation_deg_consistency/trajectory_annotation_consistency) 以 capture 签名词汇(阶段 2 真实代码模式)构造;其中正确样例无语料先例 (诚实声明:新类型仅含”未验证/跳过”类错误模式,来自语料 neglect 模式迁移)。

四、难度分层(D2.5;E4)

难度标签不得由审计分数定义(防循环)。预注册 rubric difficulty.v1benchmark/difficulty.py,有测试守卫:难度计算代码不引用引擎分数路径):

  1. hard(3):n_decisions ≥ 17 或 n_errors ≥ 3 或 n_subtle_errors ≥ 2;
  2. easy(1):n_decisions ≤ 10 且 n_errors ≤ 1;
  3. 其余 → medium(2)。

特征 = {n_decisions, n_errors, n_edge, n_subtle_errors, n_consistency_family} (subtle = 一致性族 + 方法学细节类型,预注册定义)。难度在 gold 冻结后由 特征确定性计算并写入任务文件;审计分数不参与任何一步。

五、公开/隐藏集与 gap 容忍区间(D2.6;E1)

六、真值标注(D3;E3)

七、评测运行与功效分析(D4;E7)

八、覆盖审计与评审(D5;E5/E8)

九、排期与遗留

  1. 批 2(30 条 → 60 条)已完成(窗口 F,2026-08-16);流程不变 (语料扩展 + generator_prompt.md v1 规格 → 校准批 IRR → 放量); 新预注册记录 benchmark-pr-2026-08-16-02(批 1 旧值留档)。
  2. 同模型双标注局限:两个标注员为同族 LLM(独立上下文)——IRR 可能 高估;跨模型标注(如人工 + LLM)仍未落地(批 2 保持同族双标,如实声明)。
  3. CellVoyager 真实运行语料随阶段 2 遗留(hook 未实测);批 2 语料扩展 以现有语料库为准(如实声明),bmd_scrna_020 直接使用真实 CellVoyager 轨迹(scrna_melanoma_cellvoyager)作为错误模式素材。