# 决策政策：何时有资格建议行动

## 决策不是预测

`ACT` 的门槛高于“指标变好”：必须同时满足数据有效、行动属于已声明的模拟授权、实验可识别、增量贡献为正、范围有界且复盘/撤销条件清楚。除这些条件外，本系统默认给出调查、保持或升级，而不是把相关性包装为因果性。

| 条件 | 默认决策 | 原因 |
|---|---|---|
| 数据缺失、损坏或关键勾稽失败 | `ESCALATE` | 证据基础不成立 |
| 严重未知库存差异 | `ESCALATE` | 先核实账实与风险归属 |
| 收入上升但贡献下降 | `INVESTIGATE` | Goodhart 风险：单看收入会误导 |
| 销量下降同时缺货/可用性恶化 | `INVESTIGATE` | 不能把受限供给当成需求下滑 |
| 单店/小簇异常拉低整体 | `INVESTIGATE` | 应先定位门店、渠道和执行问题 |
| `need_coverage` 商品被提议下架 | `HOLD` | 低销量不等于可替代；需要人类复核结构角色 |
| 未验证竞品信号触发调价 | `HOLD` | 外部事实与可比性未成立 |
| 促销缺少可信反事实却要求扩大 | `INVESTIGATE` | 促销期收入不等于增量 |
| 有可信、无外溢的预注册对照实验，贡献增量为正，且有明确模拟授权 | `ACT` | 仅建议受限试点，不能自动执行 |
| 数据干净、表现稳定、无明确可靠机会 | `HOLD` | 不为“有建议”而制造行动 |

多项命中时保留所有证据和未知项。当前实现的优先级依次为：数据质量/时效 `ESCALATE`，未知库存差异 `ESCALATE`，结构性商品下架 `HOLD`，保留的下架/定价权利，Goodhart，门店异常或缺货可售性，促销可识别性，模型提案检查，最后才评估受限试点。时效门禁独立核对声明的 `data_freshness_days` 和当前期每行 `week + 6 天` 所代表的最新完整周：两者任一无效、未来周、缺日期或距 `as_of` 超过 7 天均不能以“文件刚更新”绕过。局部门店异常与缺货并存时先限定门店诊断范围，避免外推。模型假设不能覆盖此顺序。同一请求若首先触及保留商业权利，会先停在该权利边界；它不会借后续指标自动获得执行资格。

## Goodhart resistance

系统同时检查收入、毛利/贡献、库存与可用性、商品角色和预算偏差，并要求残差、范围和局限进入证据。禁止仅用 GMV、销量、单一 KPI 或模型自信度决定行动。促销评估要求随机设计、对照、平行趋势、无外溢及预注册等 context 声明；缺少时只能标为未识别，不能估计因果回报。即使具备这些声明，v0.1 也只在合成的固定四周前、四周后窗口计算 DiD：每个 `store × SKU × channel` 池必须具有完整窗口，基期不得有处理或促销污染，本期四周内处理与促销状态必须固定且彼此一致，并且同一 `store × SKU` 跨渠道不得在处理/对照之间交叉。任一条件不满足即 `not_identified`，不从看似干净的子池挑选估计。它仍不独立验证随机分配、平行趋势或外溢。

## 试点周度复核

`pilot_weekly_review` 是同一单 orchestrator 的确定性证据，不新增决策卡字段，也不把周度波动当作因果结论。仅在实际试点 `store × SKU × channel` 池上复核末周：若任一池末周贡献为负、而前三周平均贡献为正，或末周缺货率超过既有 5% 护栏，系统必须给出 `INVESTIGATE`，限定核查成本或补货；它不自动推断根因，也不自动永久停止试点。

`ACT` 仍须先满足全部既有门禁：`bounded_pilot`、完整可信且正向的增量证据、全品类贡献变化不为负，以及其他库存、时效、授权与人类审批条件。局部门店差异只有在所有异常店均属于实际处理门店、增长为正且高于同簇，并且这些异常店的试点池及全店四周贡献变化均不为负时，才不再单独否决；这些条件不替代其它行动资格。周度复核的作用是撤回或收窄已建议行动的资格，而不是宣布永久业务结论。

## 人类决策权

系统只产生建议卡，不能写入订单、价格、陈列或商品清单。以下始终由人类批准：下架、价格变更、预算调整、跨部门资源调度、损耗定责和试点执行。`OWNER` 指建议的复核责任方，不等于自动派单。模拟授权中的门店数和金额只是试点建议的上限，不是未来成本、预算占用或收益的预测。每张卡必须说明复盘时间、所需观察数据和撤销条件；当新数据推翻关键前提、贡献转负、损耗/缺货超阈值或授权失效时，应停止或回撤试点。

## 证据边界与置信度

置信度说明的是当前合成数据与门禁覆盖程度，不是正确概率，更不是业务授权。当前实现只输出 `LOW` 或 `MEDIUM`：前者表示数据无效/时效不合格或模型提案检查失败，后者表示规则和算术证据足以形成受限建议。它不是统计校准概率。因果、竞品事实、消费者替代、供应根因与未来利润若无专门可验证数据，列为 `UNKNOWN`。离线规则输出可复现，但不等于对真实零售场景有效。


## 协议版本与历史实测

时效、促销识别和授权金额边界属于当前公共业务合同的一部分。下一轮 A/B/C/D 比较必须向所有组重新冻结同一版本的合同、数据包、门禁和评测口径；补丁后的人工或模型结果不能直接并入旧的 20 份 live 实测。旧实测的 source snapshot 与原始回答保持不变，补丁复核只用于提出是否撤回既有建议的证据，不是重新计分或新一轮模型实验。
