Agent 真实评测协议(宪法)v1.0

状态:2026-08-16 冻结(窗口 G 开工前);冒烟结果(模型映射实测)以「修订记录」追加,不改变协议条款。 对应:execution-plan-v1 §六.十(G0 执行设计 + G0.5 数据与流程优化);benchmark-protocol.md(运行器/功效)。 性质:本评测花钱(DeepSeek API)、不可完全复现(LLM 随机)、环境风险(hook 首次真实运行、CellVoyager 依赖首次安装)。

1. 评测目标与问题

  1. 主问题:真实 CellVoyager Agent(LLM 驱动)在 GSE115978 黑色素瘤 scRNA 数据上的完整分析中,会产生哪些方法学决策(34 类型本体视角),其质量如何(audit 分数/verdict 分布)?
  2. 采集链路验证:M1 hook(真实 NotebookSession 上)→ M3 解析(notebook 产物)→ 交叉验证(四类判定)→ verdict 状态位,是否端到端可用——闭环 C 窗口遗留(hook 从未真实运行)。
  3. 对比问题:真实 Agent 轨迹 vs benchmark 任务集(60 条)的检出/分数对比(benchmark-run 口径),如实呈现差异,不做排名(n=1 不具统计意义,见 §9 局限)。
  4. 成本-效率问题:一次真实 Agent 评测的 API 成本与耗时(报告必含指标)。

2. 对象选择与运行次数

依据
评测对象 CellVoyager(D:\C-file\scRNA-audit\CellVoyager,只读参考,不 fork 不改码 C 窗口遗留闭环
运行次数 1 次(注明随机性:LLM 采样 + 时序差异,结果不可逐字节复现) G0.1
数据集 D:\C-file\fullflow-demo\data\scRNA_datasets\GSE115978_raw.h5ad(485.5MB,7186 cells,Melanoma) G0.3;与 C 窗口样例同源
数据策略 全量载入;h5ad 只读(预检发现问题转副本到临时目录处理,绝不修改原文件) G0.5-A1/A2
运行参数 num-analyses=1max-iterations=5--no-deepresearch、execution-mode=claude G0.4/G0.5-B2/C3
max-iterations 依据 标准 scRNA 主流程 ≈ QC→归一化→HVG→PCA/UMAP→聚类→注释→DEG ≈ 5-6 步;5 次迭代覆盖主流程。这是预算决策(成本控制),不是质量妥协——宪法明示,报告如实声明 G0.5-B2
模型 DeepSeek(anthropic 兼容端点);具体模型名冒烟实测后回填(§8 修订记录) G0.4
端点 https://api.deepseek.com/anthropic(ANTHROPIC_BASE_URL 环境变量注入) 密钥纪律
执行日期 2026-08-16 G0.1

3. 环境声明

4. 采集接入方式(hook 部署)

  1. 运行入口脚本(cellvoyager-outputs/scripts/run_cellvoyager_with_hook.py):
    • from cellvoyager.execution.claude import NotebookSession
    • 包装 NotebookSession.__init__(monkey-patch,不动 CellVoyager 源码):实例化后立即 hook.attach(session)(包装 execute_cell / insert_execute_code_cell);
    • hook = make_cellvoyager_hook(paradigm="scrna", session_id="cv_gse115978_...")(session 白名单注册 + M1Reporter + WAL 崩溃恢复 + M3Parser 预解析)。
  2. 方法签名若与 _CODE_EXTRACTORS 不匹配 → 仅需扩展 _CODE_EXTRACTORS(C 遗留闭环),仍不改 CellVoyager。
  3. 异常隔离验证:hook 任何异常只记日志(n_errors 计数),绝不影响分析继续(C1.2,F6 教训);真实运行前在真实 NotebookSession 上再验一次。
  4. 采集三通道:M1(hook 上报,WAL+verdict 落盘)→ M3(bio-audit parse-notebook 解析产物 notebook)→ 交叉验证(bio-audit cross-validate,四类判定 + verdict 联动,final-only)。

4.1 declared 注入(G-2 修订,2026-08-16)

5. 报告必含指标

  1. 运行环境(数据/模型/端点/日期/venv/依赖版本);
  2. API 成本与耗时(成本按 DeepSeek 实际定价核算,输入/输出分开;token 从 CellVoyager 日志 usage 提取;耗时按阶段记录);
  3. 分数(trajectory_score 口径、avg_score 辅助口径)与 verdict(L0-L4/-1 计数);
  4. M1/M3/交叉验证统计(n 决策、四类判定计数、verdict 状态分布);
  5. 检出 vs 任务集表现(benchmark-run 对比口径 + 局限);
  6. 诚实局限(n=1 无统计功效、LLM 随机性、hook 首次实测、工具默认行为 vs Agent 决策的区分等)。

6. 诚实声明要求

7. 停止条件(硬约束)

条件 阈值 动作
成本上限 ¥5(DeepSeek 账户扣费口径;预/后余额差 + 用量换算双核算) 立即停止,如实报告已发生成本
超时上限 60 分钟(Phase1 正式运行启动起算) 停止进程,报告部分完成产物
API 重试 错误重试 1 次(指数退避 5s/15s);连续失败 3 次 停止并如实报告(G0.5-C2)
hook/采集失败 hook 挂掉 分析继续(隔离),报告注明采集缺口
数据异常 h5ad 预检发现问题 副本修复策略(G0.5-A1),不改原文件

8. 冒烟前置(Phase 0,30 分钟内三件事全通才允许正式运行)

  1. DeepSeek anthropic 端点连通 + model 名映射实测(1 次最小调用,候选:deepseek-chat / claude-sonnet-4-6 / deepseek-reasoner——记录实测结果,决定 –model-name 与 –execution-model 取值);
  2. hook attach 在真实 NotebookSession 上验证(方法签名匹配 + n_reports>0 + n_errors==0 + 异常隔离);
  3. M3 解析器对已有 notebook(C 窗口 fixture / 旧产物)预跑。

修订记录(冒烟后追加)

9. 局限与解读纪律(预注册)

10. L 窗口修订记录(2026-08-16,窗口 L「真实短评测」追加)

性质:宪法追加条款(不改变既有条款语义);对应 execution-plan-v1 §六.十六 L2。 背景:G 窗口已取得”真实 LLM Agent 低分”证据(30.0 / L1×19,K 后口径); L 窗口补”聚焦短分析”(决策点少 → 高分概率高)的真实 LLM 证据——高分不保证, 如实呈现(宪法 §6)。

10.1 任务设计(L2.5)