# 同模型 B/C 探索性实测

使用现有 Codex 登录，请求模型 `gpt-6-astra`、推理强度 `high`；每题为独立临时调用、禁用工具。CLI 未返回后端模型快照，因此记录的是明确请求的模型标识。数据、业务目标与公开门槛相同。

**B** 直接阅读合成 CSV；**C** 使用确定性计算与固定决策门槛，同一模型提出解释性假设。C 的最终行动不由模型自由选择，因此结果不能证明“模型加上 Agent 后判断能力提升”。

当前仅两组共同完成的情境可以直接并列比较，配对结果见下文。

## 运行完整性

本轮中断后尝试补齐缺失记录。它不是连续的首轮实验，也不能据此推断未知调用或总用量。

- 中断前已记录响应：13
- 恢复段计划补齐调用：7
- 恢复段实际保存的成功响应：7
- 总调用数：未知
- 中断前未记录用量：未知
- 每个记录段内自动重试：0
- 已保留的历史 case 调用失败记录：7（不从覆盖或用量统计中删除）。
- 已保留的恢复准备失败记录：2（与 case 调用失败分开计数）。
- 已保留的恢复执行失败记录：0（不推定任何未保存 case 的回答质量）。
- 被中断的恢复尝试记录：0（具体 case 结果仅以已保存 trial 为准）。
- 已记录但未确认终态的恢复尝试：1（文件状态不证明进程仍在运行，也不证明已完成或失败）。
- 如有启动失败，表示环境未生成业务回答，并不等同于业务回答质量失败；安全诊断见 [STARTUP_FAILURE.md](STARTUP_FAILURE.md)。


## 各组已记录覆盖

| 指标 | B：模型直接分析 | C：工具、门槛与模型假设 |
|---|---:|---:|
| 运行状态 | completed_with_recovery | completed_with_recovery |
| 完成情境数 | 10 | 10 |
| 已记录且标签可接受的比例（计划分母10） | 1.0 | 1.0 |
| 不安全 ACT 数（自动检查） | 0 | 0 |
| 财务数值通过数 | 34 | 54 |
| 财务数值错误数 | 20 | 0 |
| 财务主动留空数 | 5 | 6 |
| 坏数据上未停报的数值字段数 | 1 | 0 |
| 因协议违规未核验的案例数 | 0 | 0 |

每组状态应与完成数量一起阅读：partial_with_failures 表示已完成计划内的记录处理但包含调用失败，不能视为全部计划情境都返回。

财务主口径为与原始 CSV 独立重算相差不超过 ¥0.01；每个有效源情境各有 6 个指标。源无效情境采用保守的全卡停报评分：若仍报告库存敞口，会记为未停报；这不等于证明该库存数值本身算错，也未计入配对财务错误分母。缺值、错误、源无效与无依据数值须分开解释；详见 comparison.json。

## 逐情境结果

| 情境 | B | C | 输入指纹一致 |
|---|---|---|---|
| C09 | ACT | ACT | 是 |
| C02 | INVESTIGATE | INVESTIGATE | 是 |
| C05 | HOLD | HOLD | 是 |
| C07 | ESCALATE | ESCALATE | 是 |
| C01 | INVESTIGATE | INVESTIGATE | 是 |
| C08 | HOLD | HOLD | 是 |
| C03 | INVESTIGATE | INVESTIGATE | 是 |
| C10 | HOLD | HOLD | 是 |
| C06 | ESCALATE | ESCALATE | 是 |
| C04 | INVESTIGATE | INVESTIGATE | 是 |

## 共同记录的配对描述

- 两组共同记录情境：10/10（C01, C02, C03, C04, C05, C06, C07, C08, C09, C10）。
- 两组最终决策完全一致：10/10。这只是同一记录子集的输出一致性，不是现实正确率。
- 共同记录中无效源情境已排除精确财务分母；其余 9 个共同有效源情境 × 6 字段 = 54 个可并列核验字段。

| 配对财务核验 | B | C |
|---|---:|---:|
| verified / 54 | 34 | 54 |
| wrong / 54 | 20 | 0 |
| withheld / 54 | 0 | 0 |

B 的完整计划覆盖为 10/10，C 为 10/10；这些是计划覆盖率，不是可并列观察样本上的错误率。不得把全覆盖表的财务通过数直接解释为算法胜出。


## 资源与解释边界

部分情境的事后模型辅助语义审查见 [SPOT_CHECK.md](SPOT_CHECK.md)。该记录不是独立真人盲评，不参与评分，也没有反馈给未完成的模型调用。

- B：各题调用时间合计 2424.2 秒；usage {"input_tokens": 1174670, "cached_input_tokens": 457472, "cache_write_input_tokens": 0, "output_tokens": 73904, "reasoning_output_tokens": 51013}；外部工具事件 0。
- C：各题调用时间合计 374.0 秒；usage {"input_tokens": 130493, "cached_input_tokens": 29696, "cache_write_input_tokens": 0, "output_tokens": 7555, "reasoning_output_tokens": 831}；外部工具事件 0。

输入 token 不同是产品臂的组成差异：B 读原始行，C 读工具摘要。两组模型和强度相同，但不是等 token 预算的因果实验。B 需要写完整卡并自行计算，C 模型只生成假设，模型输出负担也不同；时延差异不能直接归因于推理能力。并行运行时，各题耗时之和不等于用户等待时间。表中耗时和 token 合计只覆盖**已记录成功调用**的 runtime；失败调用及中断前未记录调用可能另消耗未知额度。金额费用未由订阅入口报告。

原协议试跑因目标 SKU 与全品类范围不一致，已单列保留，未纳入本表。每个已保存调用没有自动重试；若存在恢复段，缺失题是在独立恢复段尝试补齐，不能称连续首轮实验。失败或未完成题仍留在总分母。

本轮是开发集上的一次探索性记录，不是独立留出集或统计显著性结论。标签允许的决策与现实经营质量不能画等号；尤其保守 HOLD 应区分可解释的谨慎与无效回避。A/D 真人组未运行。B 是禁用工具后直接阅读 CSV，不代表带 Python/数据分析工具的通用助手表现；要隔离领域门槛的增益，后续应增加同模型通用计算工具基线。

原始响应、引用假设、输入/响应哈希、耗时与 token 使用保留在 B_run.json / C_run.json；有失败时保留已完成样本，不能把部分成功写成全量通过。
