# 同工具、同模型：角色措辞是否有额外收益？

**结论：本轮三个案例没有观察到品类角色措辞的额外收益。** 两组在预先固定的四个审阅维度上相同；这不能证明两组总体等效，也不能证明整套产品优于通用助手。

六份提案均为首次运行，全部完成，无失败或重试。两组共享项目的领域工具与规则；唯一改动是指令第一句。比较的是原始提案，没有把最终程序门禁计入模型成绩。

[打开中文对比页](comparison.html) · [事前标准](criteria.json) · [固定条件](protocol.json) · [控制核对](control_audit.json)

## 逐例观察

| 案例 | 观察 |
|---|---|
| C03 | 两组都先调查 K03 缺货，保留“销量不等于潜在需求”的边界。 |
| C09 | 两组均认为试点有潜力，但都先索要工具未显式展示的完整性检查；这是共同接口缺口。 |
| F01 | 两组都呈现减少订货的贡献收益与缺货代价，允许条件分析，并把经营执行交给人。 |

C03 的两份提案都识别目标 K03 约 25.9% 的缺货与全品类约 3.2% 的缺货，并要求时段、补货、未满足需求或替代购买证据。没有将销量下降直接当成需求下降。

F01 的两份提案都保留减少订货相对维持订货的贡献变化范围 −240 至 +360 元，以及中/高需求情境下 10/60 件未满足需求。它们没有赋予情境概率，也没有给缺失需求反应的折价方案编造收益。通用角色输出 HOLD、品类角色输出 INVESTIGATE，语义上都保留条件比较、补证及人工商业决定；不因标签不同判优劣。

## 共同缺口与修复范围

C09 两份提案都正确引用 +1,893 元的试点增量贡献估计，并保留 2 店、500 元的限定范围，却先索要完整四周数据、基期无污染、处理分配稳定等检查证明。原工具确实做了这些本地数据检查；成功返回只给出 estimated 状态及汇总，没有逐项展示其检查结果。模型没有看到实现代码，因此不能把它的谨慎简单判为业务判断错误。

事前标准要求识别有条件的试点资格；两份审阅都将行动适度性记为 1，同时记录“案例锚点与模型可见证据之间存在歧义”。这项减分反映该接口条件下的用户结果，不证明任一角色的能力较差，也不应被用作角色排名。

六份回答冻结后，对当前工具补充本地检查结果说明，并区分“已核对提供的数据”“上下文声明”与“尚未外部验证”。不改计算公式、门槛、决定权或历史回答。见 [补丁与离线验证](POST_TRIAL_FIX.md)。**补丁后没有再次调用真实模型；尚不能声称它已消除重复补证。**

## 预先固定的审阅结果

每项 0–2：证据准确性 / 未知与权责边界 / 行动适度性 / 补证价值。两名分别工作的 AI 审阅者在隐去组别时独立填写；不是零售专家、真人 A/D 组或统计独立评审。没有将分数相加生成产品排名。

| 案例 | 通用角色（四项） | 品类角色（四项） | 两份审阅是否一致 |
|---|---|---|---|
| C03 | 2 / 2 / 2 / 2 | 2 / 2 / 2 / 2 | 是 |
| C09 | 2 / 2 / 1 / 2 | 2 / 2 / 1 / 2 | 是 |
| F01 | 2 / 2 / 2 / 2 | 2 / 2 / 2 / 2 | 是 |

未记录关键的财务捏造、因果保证、无授权执行或无依据追责。此处只是对六份文本的审阅，不能外推成系统错误率为零。原始引文与理由保留在 [审阅 1：C03](reviews/reviewer1_C03.json)、[C09](reviews/reviewer1_C09.json)、[F01](reviews/reviewer1_F01.json) 和 [审阅 2：C03](reviews/reviewer2_C03.json)、[C09](reviews/reviewer2_C09.json)、[F01](reviews/reviewer2_F01.json)。解盲映射为 [arm_key.json](reviews/arm_key.json)。

## 实际运行

请求 openai-codex / gpt-6-astra / high；后端模型快照未独立验证。每次限制 5 轮模型请求、6 次业务工具、180 秒；传输重试为 0，传输超时 60 秒。固定顺序交替，但没有随机化或完全平衡。每次是全新上下文，模型不读取原始 CSV、Golden 或参考决策卡，只通过相同的只读工具取得证据。

| 案例 | 角色 | 秒 | 模型请求 | 业务工具 | 模型原始建议 | 程序门禁（不评分） |
|---|---|---:|---:|---:|---|---|
| C03 | [通用](trials/01_C03_general/proposal.json) | 52.236 | 2 | 3 | INVESTIGATE | INVESTIGATE |
| C03 | [品类](trials/02_C03_category/proposal.json) | 57.854 | 2 | 3 | INVESTIGATE | INVESTIGATE |
| C09 | [品类](trials/03_C09_category/proposal.json) | 59.758 | 2 | 2 | INVESTIGATE | ACT |
| C09 | [通用](trials/04_C09_general/proposal.json) | 45.623 | 2 | 3 | INVESTIGATE | ACT |
| F01 | [通用](trials/05_F01_general/proposal.json) | 51.995 | 2 | 3 | HOLD | INVESTIGATE |
| F01 | [品类](trials/06_F01_category/proposal.json) | 55.737 | 2 | 3 | INVESTIGATE | INVESTIGATE |

六份提案共 12 轮 SDK 模型请求、17 次业务工具调用，记录输入 40,989、输出 8,389，合计 49,378 tokens；各次耗时合计 323.203 秒。计数范围仅这六份提案，不包括本开发任务、两份审阅任务、认证流量或以前的实验。不能据这些单次时延声称某个角色更快。

## 可复查范围

- [freeze_manifest.json](freeze_manifest.json) 固定了运行前的源码、输入、提案 schema、标准与依赖；[session.json](session.json) 保留六次状态和用量。
- [control_audit.json](control_audit.json) 核对两组共同输入/提示/工具视图一致，实际工具返回与固定视图一致，引用均为已取得证据。引用合法不自动证明结论正确。
- 三例均为项目开发案例，每组每例仅一次；没有独立留出集、重复实验、真人决策效率、真实经营数据或 ROI。
- 该通用组已获本项目的领域计算工具、规则与格式；这里没有拆出它们各自的贡献。不能将结果包装成完整 Agent 与未增强通用助手的比较。
- 原四组 A/B/C/D 设计及旧 B/C 的 20 份记录保持独立；A/D 尚无真人实测。项目不补齐两年以上生鲜管理经历。

复现入口与已有登录要求见 [运行说明](../../docs/FRAMEWORK_REUSE.md#同工具对比入口)。当前源码已包含运行后的工具说明补丁，新目录重跑不再是这一冻结版本的精确复现；必须记录它自己的新源码与新结果。
