# 本次验证记录

- 本次 Python 3.12.14 测试环境：141 项通过，0 项跳过，0 失败；完整记录在 `artifacts/test_results.txt`。SDK 环境已安装固定可选依赖，不能把该次运行称为零依赖测试。
- 离线真实入口成功生成 10 张固定协议决策卡、双看板、证据与盲测包。开发 Golden 的参考决策匹配 10/10，仅证明已编写情境的回归行为。
- 已实际调用 Codex 现有登录，明确请求 `gpt-6-astra/high`。CLI 未独立报告后端模型快照，不把请求标识冒充后端验证。
- 初始试跑因目标 SKU / 全品类范围不一致而排除，原始记录保留在 `artifacts/protocol_pilot/`。
- 修正共同财务范围后的调用记录按 `execution.json` 解释：计划覆盖 B/C 各 10 题；失败、协议违规、主动留空与错误分别记录。

记录覆盖如下。

- 中断前已记录响应：13；恢复段计划补齐：7。
- 这不是连续的 20 次首轮实验。每个保存段内没有自动重试，但中断前未记录的尝试数和用量均未知。
- 总调用数与中断前未记录用量：未知。
- 最初恢复段的 7 份调用记录均为环境启动失败；后续独立尝试见 `artifacts/live_experiment/attempts/`，安全诊断见 `STARTUP_FAILURE.md`。

- 恢复尝试 001：状态 `preflight_failed_no_case_calls`；已记录派发 0，成功记录 0。
- 恢复尝试 002：状态 `preflight_failed_no_case_calls`；已记录派发 0，成功记录 0。
- 恢复尝试 003：状态 `completed_recovery_segment`；已记录派发 7，成功记录 7。
- 恢复尝试 004：状态 `preflight_pending`；已记录派发 0，成功记录 0。
- 恢复入口先核对记录和输入，再做最小连接预检；预检未通过不会派发业务情境。未完成的 manifest 不是进程仍存活的证明。


| 正式探索组 | 返回决策卡 | 状态 |
|---|---:|---|
| B | 10/10 | completed_with_recovery |
| C | 10/10 | completed_with_recovery |

- 共同记录配对：10/10；最终决策完全一致：10/10。
- 共同有效源财务字段：54（C07 无效源排除）。B verified 34/54；C verified 54/54。
- 配对结果仅描述同一开发情境上的已记录输出；覆盖数量、单次标签一致性与财务通过数不能证明算法总体优劣或现实错误率。

## 实测后的证据变化复核

- 在原有 C09 上改变证据或授权，经当前编排器重新计算：9/9 项局部行为检查符合预期；新增模型调用为 0。
- 修正了两处已复现缺口：自报文件新鲜度无法掩盖已过期的观察周；单周处理、基期/对照促销污染及渠道分组冲突不能继续报告完整四周试验增量。
- 重新恢复有效输入后仍可建议限定试点。实际经营动作仍需人工批准，系统没有执行。
- 这次改动发生在原 20 份同模型记录冻结之后；历史模型响应和源码快照保持不变，旧实测分数不能视为补丁后的新模型结果。
- [查看复核结果及各份完整决策卡](artifacts/evidence_review/REPORT.md)。它们是已知案例的局部回归，不是独立留出集或经营价值证明。

## 新业务情境的定向复核

- 三份另行编写的合成数据，原始行的独立 Decimal 数字核验 9/9 通过。产品运行新增模型调用为 0，真人参与为 0。
- 实际修复前三例均因局部门店异常而给出 INVESTIGATE。修复后：X01 定位末周贡献转负并要求财务补证；X02 定位单个门店/商品/渠道末周 20% 缺货并要求补货核查；X03 稳定正向参照可建议有限试点。
- 末周风险不被四周平均掩盖；实际试点内的正向门店差异只有满足窄条件时才不再单独否决，其它授权与经营门槛保留，所有建议均未执行。
- [查看前后卡片、原始数据与复算](artifacts/business_review/REPORT.md)。这些题目已参与补丁设计，只证明已知案例的诊断行为变化，不是独立留出集、模型增益或真人经营效果证据。
- 原 20 份模型回答与冻结源码保持不变；本次离线结果不并入历史模型成绩。

## 生鲜方案与补证后更新

- 新增单店单品三天批次方案：维持订货、减少订货、首日折价。成本按已售、报损、期末库存分别勾稽；采购现金不重复扣除。
- F01–F04 是同一合成案例的信息状态与冲突变体：需求区间宽时调查，补证后交人复核候选订货，模拟复盘缺货后重新评估，来源冲突时暂停精确测算。
- 外部开发子任务未读实现而另编的两份数值案例：修正作者参考答案后 48/48 字段通过；原 45/48 首次记录保留。输入与被测计算实现没有为迎合答案更改。
- 来源工具只核对给定记录的日期、范围、角色和事实一致性，external_authenticity 仍为 not_verified；模型问题只验证引用 ID，不验证业务结论。
- 新组件模型比较状态 partial_or_blocked，成功响应 0/4；通用模型获相同预计算结果，不是可自由使用计算工具的通用助手。真人价值评分仍未进行。
- [生鲜完整案例与复核表](artifacts/fresh_case/REPORT.md)。没有真人、真实经营执行或 ROI，也不补齐任职年限。

- 财务核验从原始 CSV 以 Decimal 独立重算。主标准为绝对误差不超过 ¥0.01；1% 仅是近似诊断。C07 的无效源应停止精确财务声明。
- 权限、库存池护栏、无效输入、模型伪造引用、协议范围、调用失败诊断和子进程清理均有测试。
- 主看板此前已在浏览器检查 C01/C09 内容、切换与布局；本轮三案例看板由同一渲染器生成，未完成新的浏览器视觉复核。
- Seed 43/44 的既有回归结果仍保留；它们来自同一生成器，不算独立留出集。

## 解释边界

C 的最终行动由固定政策决定，模型只补充有引用的假设。B 是禁工具的 CSV 直接分析，不能代表带计算工具的通用助手。财务工具的计算收益、领域门槛的收益和模型解释的收益尚未被完整分离。

没有真人 A/D 组、真实零售经营数据、独立留出集、重复试验或经营 ROI。不能证明 C > B 或 D > C，也不能用本项目声称两年以上生鲜管理经验。

完整探索结果：[同模型报告](artifacts/live_experiment/REPORT.md)；四组状态：`artifacts/comparison_status.json`。

## 成熟组件接入验证

- PydanticAI 的原生单 Agent 工具循环已接入显式 CLI；Pydantic Evals 实际执行既有 C/F fixtures 的合同回归。
- 14 个既有案例通过；其中 F01–F04 是同一业务案例的信息变体，非四个独立场景。
- 上述离线合同回归的模型回应均由 FunctionModel 脚本给定，真实模型请求为 0。不能据此证明模型业务能力、诊断质量或经营增益；单独的真实调用见后节。
- 新 SDK 轨迹、依赖版本与当前源码指纹见 [SDK 验证报告](artifacts/sdk_validation/REPORT.md)。原 20 份真实模型记录与旧组件失败记录没有改写。

## SDK 首个真实案例

- F01 状态：completed；请求 gpt-6-astra/high，SDK 报告模型请求 2 轮，业务工具 3 次。
- 模型正确呈现条件方案取舍并给出具体补证；同时暴露工具未返回来源类型与分析必需性的问题，导致过度升级。
- 后续修复只补回来源语义，保留原始回答与冻结源码；修复后进展见后节或独立复测报告。
- [真实运行记录与逐项业务复核](artifacts/sdk_live/F01_001/REPORT.md)。这一个已知合成案例不构成对比胜出、真人效果或 ROI。

## 来源语义修复后的真实复测

- F01_002 状态 completed；57.445 秒，2 轮模型请求、3 次业务工具。
- 只补回来源类型和分析必需性，其他工具内容相等。本次回答明确区分条件分析可用与执行需授权，数值、风险与未知项保留。
- 模型 HOLD 与程序 INVESTIGATE 不同，不用标签一致性替代业务复核。只有一对已知案例的前后观察，尚未验证稳定改善或同工具比较优势。
- [修复后复测与控制记录](artifacts/sdk_live/F01_002/REPORT.md)。

## 同工具条件下的角色提示对比

- 三个既有开发案例、两种角色，完成 6/6 份首轮提案；请求模型与工具、规则、格式和调用上限相同，只改角色描述第一句。
- 评分对象是模型原始提案，最终程序门禁没有计入模型效果。两名匿名审阅任务均为 AI 助手，没有零售从业者参与。
- 本轮三个案例未观察到“品类角色”措辞带来的额外收益；两组表现相当，并共同暴露了试验检查结果传递不完整的问题。
- 随后只补充了促销工具已完成的本地行检查与外部未验证事项；数学、门槛、C09 的决策/行动/P&L 未变。补丁后没有再次调用真实模型。
- 新对比 HTML 的链接与内容已作本地检查；自动浏览器预览被 URL 安全策略阻止，未完成浏览器视觉验收。
- [完整结果、原始回答与预先固定的评分标准](artifacts/same_tools_001/REPORT.md)。这是角色提示的探索性对比，不能代表整套产品优劣或真实经营价值。

## 同一案例的补证与复核闭环

- 新增本地交互入口，跟踪补证问题、负责人、材料、复核状态与决定历史；继续使用现有确定性编排器。
- F01 同一合成案例经过三版有效证据，决定依次为 INVESTIGATE → ESCALATE → INVESTIGATE。提交材料尚未采纳时，当前卡保持不变；折价问题没有被其他材料自动关闭。
- 完整前后卡、输入指纹、操作时间与理由持久保存。已采纳旧快照不能作为新材料回退，问题与可改字段的映射由应用明确配置。
- 真实本地 HTTP 入口覆盖创建、提交、采纳、退回、重开、版本冲突、持久保存及越界拒绝。所有参与者均为合成演练标记；新增真实模型请求为 0。
- 更新后的卡由程序重算，没有把旧模型观点伪装成新的模型分析。本地复核姓名不构成身份认证，采纳不构成经营授权。
- [演练报告](artifacts/followup_demo/REPORT.md) · [工作台运行说明](docs/FOLLOWUP.md)。它证明上述功能行为，不证明真人效率、真实采用或经营收益。
