AI CATEGORY DECISION SYSTEM / v0.1

外贸自营,
选什么、备多少?

企业从代理服务走向自营持货,经营判断会延伸到选什么、备多少、何时调整。我把销售、商品结构、库存与经营贡献组织成可比较、可复盘的决策流程。

外贸经营的延伸研究个人项目 · AI 协作开发零售模拟案例 · 2026.09

代理经营

承接与报价

核对费用与责任,形成可推进的经营方案。

自营经营

选品与备货

把需求、库存和经营贡献放进同一方案比较。

共同能力

从分析到行动

明确下一步、负责人和调整条件,随新材料修订判断。

一个备货问题,三次经营判断。

生鲜合成案例 · S01 门店 / K06 商品 / 三天三轮决策回放

本轮证据

先确认需求,再谈减量

需求区间较宽;折价对需求的影响尚未给定。

减量相对维持的贡献变化−¥240 ~ +¥360三种条件情境,无概率权重
高需求下未满足数量60 件减量方案,合成情境

收益方向随需求改变,不能只取最乐观的结果。

INVESTIGATE

继续调查

减少订货的收益随需求情境变化,尚不能形成稳健的候选方案。

三种条件情境:贡献额与未满足需求
需求维持贡献减量贡献变化减量未满足
低需求−¥220¥140+¥3600 件
中需求¥180¥440+¥26010 件
高需求¥980¥740−¥24060 件

贡献额 = 收入 − 已售成本 − 到期报损成本 − 操作费用;不是净利润。金额 CNY,范围仅为单店单品三天。

01 / 我的设计判断

把经营问题
做成可用的决策流程。

避免指标诱导

营收上升不等于盈利改善,销量下降也可能来自缺货。以这些误判设计对抗案例,要求判断回到具体证据。

数字可以复算

收入、毛利、库存与方案成本由程序计算;模型提出解释和补证问题,不能改写权威数字。

补证要改变下一步

材料先提交、再复核采纳,之后才重算决定。未回答的问题保持开放,原判断可以被撤回。

让协作有明确交付

每次建议都带上负责人、下一步、复核时间和调整条件,让采购、门店与财务可以接续处理。

02 / 能力全貌

从销售表现,
走到经营取舍。

围绕销售、商品组合、库存和预算,把数据分析接到具体经营问题。

从业务问题到产品能力
业务问题当前原型能做什么与自营业务的联系
POS 与渠道表现按 SKU、门店、周和渠道核对数据,拆解收入与贡献变化,识别同簇门店异常。比较商品、渠道与仓点表现,先分清整体趋势和局部问题。
商品结构筛查低销量商品,保护承担独特需求覆盖角色的 SKU;下架保留人工决定。选品不能只看销量排名,还要说明商品在组合中的作用。
库存与损耗区分已知报损与未解释盘亏,检查可售率及目标商品缺货,不擅自归因或追责。把需求下降与供给不足分开,再判断是否减少采购。
预算与经营贡献计算收入、毛利、贡献和预算偏差,未知库存差异单列为待核暴露。把收入、成本与损耗放在一起比较,识别增长背后的经营代价。
促销、KPI 与竞品检查促销增量是否可识别;抵抗营收指标诱导;未核实的竞品信号不触发跟价。市场线索先核实,折扣和增长同时检查成本与库存代价。
批次备货单店单品三天的先到期先售测算,比较维持、减量与折价的条件;需求反应未知时不硬算收益。比较不同需求情境下的订货数量,明确何时重新估计。
跨部门补证记录负责人、待补材料、采纳或退回、复盘与重开;保留前后决定。把采购、供应与财务需要核对的事项写成可接续任务。
查看 8 类量化工具
销售分解 sales_decomposition
总量 → SKU 组合 → 价格的顺序会计分解,显示残差;不把会计分解当作因果解释。
毛利与贡献分解 margin_decomposition
数量、价格、单位成本、已知损耗和促销费用逐项对账。
库存异常 inventory_anomaly
账实差、全局及目标 SKU 可售时长与门店明细;异常原因保持待查。
促销增量 promo_incrementality
仅在完整固定的 4+4 周匹配池、处理与对照条件成立时估计双重差分,否则返回“不可识别”。实验可信性依赖输入声明。
门店簇比较 store_cluster_compare
与同簇其他门店的中位数及 MAD 比较,保留同行样本量,避免由单店推断整个区域。
商品结构 assortment_analysis
低销量筛查与需求覆盖角色保护;没有实现全局最优选品或需求转移模型。
预算偏差 budget_variance
收入、毛利的实际对预算偏差;不自动制定预算。
试点周度复盘 pilot_weekly_review
检查实际试点池末周贡献和缺货,触发成本或补货核查,避免四周平均掩盖近期风险。

另有数据质量、时效与来源检查,以及生鲜批次情境计算。历史贡献 = 毛利 − 已知损耗 − 促销费用;它不是净利润或完整 P&L。未知盘亏不能直接计作已确认损失。

03 / 从判断到行动

建议必须带条件,
决定必须能撤回。

ACT · 限定建议

证据和合成授权条件齐备时提出小范围试点,仍需人工批准,系统不执行。

INVESTIGATE · 补证

问题存在,但根因或比较依据不足;明确由谁补什么、何时复核。

HOLD · 保持

改变策略的依据不足,或无需干预;说明什么新证据会改变判断。

ESCALATE · 升级

数据完整性、未解释损耗或人工保留权限需要对应负责人处理。

收入增长不能覆盖贡献恶化;整体平均不能掩盖局部缺货;有效引用不等于推理正确。阈值是合成演示参数,CONFIDENCE 表示证据充分性,不是校准后的概率。

查看每张决定卡的 11 个固定字段
业务状态 / 主要驱动
BUSINESS STATE · PRIMARY DRIVER
证据 / 未知 / 经营影响
EVIDENCE · UNKNOWN · P&L IMPACT
决定 / 行动 / 负责人
DECISION · ACTION · OWNER
复核 / 撤回条件 / 置信依据
REVIEW · REVERSAL CONDITION · CONFIDENCE

项目资料

从页面摘要,
追到原始记录与代码。

可下载代码和模拟数据,在本机复现工具计算与补证流程,也可直接查看案例看板。

技术与验证资料10 类业务情境、系统流程、评测与完整适用范围

03 / 对抗案例

让容易犯的错,
进入验证材料。

10 个独立合成数据包,每包 6 门店 × 8 SKU × 8 周 × 2 渠道,共 7,680 行。

案例同时检查冒进和过度保守:既不应凭薄弱证据扩张,也不应一律 HOLD。下表展示已保存的离线参考结果。

情境要阻止的误判参考输出
C01 Goodhart 指标诱导把营收上涨当成功,忽略贡献恶化继续调查INVESTIGATE
C02 促销虚假繁荣把促销前后增长直接当作净增量继续调查INVESTIGATE
C03 销量下降与缺货把可售不足误判为需求下降继续调查INVESTIGATE
C04 局部门店异常把一家门店的问题外推到全部门店继续调查INVESTIGATE
C05 低销量结构性商品忽略独特需求覆盖,仅凭销量下架保持HOLD
C06 未解释损耗把账实差异直接归因或用于追责交负责人复核ESCALATE
C07 财务坏数据在缺失与不一致数据上继续精确归因交负责人复核ESCALATE
C08 未核实竞品信号未经核实、可比性检查就跟价保持HOLD
C09 证据齐备的限定试点一律拒绝行动,忽略可控的有界建议限定建议ACT
C10 稳定经营为了输出动作而无依据干预保持HOLD

这些案例参与了开发和规则设计,不是独立留出集。Golden 允许部分案例有多个合理决定;这里展示的是实际参考卡,不是唯一正确答案。

补充验证:最近一周的风险、批次数量冲突

另有 X01–X03 三份业务挑战:末周贡献转负、局部缺货,以及稳定正向参照。修复后,前两者明确了财务或供应补证任务,稳定参照不再被一律拦截;三例参与补丁设计,未新增真实模型调用。

生鲜 F01–F04 是同一业务案例的四种信息状态,覆盖需求变化、补证、复盘与批次数量来源冲突;不能当作四个独立样本。它们与上方三轮回放属于同一案例族。

05 / 系统与协作

工具负责数字,
人负责采纳和取舍。

  1. 模型

    通过单 Agent 工具循环选择业务证据,提出带引用的假设、候选行动与补证问题。

  2. 程序

    复算权威数字,检查质量、时效、范围与行动条件,保存并重算决定卡。

  3. 人

    核对材料真实性与业务意义,采纳或退回证据,保留采购、调价与执行决定权。

问题分派 → 提交材料 → 检查变化 → 人工采纳或退回 → 重算决定 → 复盘或重开

本地工作台已实现这条补证流程。材料提交后不会提前改变决定;未回答的问题继续开放;更新后的规则计算不会冒用旧模型回答。上方回放摘自一次完整 F01 演练。

工作台是本地功能原型,复核身份自行填写,尚无身份认证或真实审批接入。公开网页展示已保存结果;下载后可在本机操作补证。该演练没有新模型调用,也不是 D 组真人实验。

采用了哪些现成工具和行业方法?

模型工具循环采用 PydanticAI,评估组件采用 Pydantic Evals;默认离线核心使用 Python 标准库。先保持单一编排器,只有评估证明额外收益,才考虑拆分 specialist agents。

项目记录了 BCG、McKinsey、Blue Yonder、SymphonyAI 与 Anthropic 的方法启发及未实现部分。这些是设计参考,不是产品背书;未声称已实现知识图谱、实时零售网络或自主经营。

06 / 评测与反证

记录结果,
也保留反证。

四组比较:设计相同任务,明确实际完成范围
组别如何完成任务当前状态
A · Dashboard only人阅读数据看板后填写决策卡。看板与模板已完成;真人实验未开展。
B · LLM direct模型直接读原始 CSV,自行计算并回答。已保存 10 个开发案例响应。
C · Category Agent确定性工具与门槛生成最终决定;模型补充假设。已保存相同 10 个开发案例响应。
D · Human + Agent人复核 Agent 的证据和决定,保留修改前后记录。模板已完成;真人实验未开展。

B/C:数字更可核对,仍不是业务胜率

B · 直接读 CSV34 / 54

C · 工具与固定门槛54 / 54

共同有效源的 9 个案例 × 6 项财务字段,以原始 CSV 独立重算,误差须不超过 ¥0.01。坏数据案例 C07 不进入这 54 项分母,另检查应停报而未停报的数值。

两组最终决定一致 10/10,仅表示开发案例中的标签一致性。C 的数字来自程序、最终行动由固定门槛决定,模型承担的任务与 B 不同;B 也没有 Python 等计算工具。因此不能据此证明模型判断提升或整套产品胜过通用助手。

响应分中断前与恢复段保存,两组最终各覆盖 10 个案例;总调用数与未记录用量未知。旧协议范围不一致的试跑已排除,未把后续代码修复混入旧成绩。

核对 B/C 逐案结果 ↗

同模型、同工具:角色措辞没有显示额外收益

C03、C09、F01 三个开发案例,共六份首轮提案;唯一改动是指令中的角色称呼。两项 AI 审阅任务在隐藏组别后分别评分,未观察到额外收益,并共同指出工具没有清楚呈现已完成的促销检查。

项目据此补充工具返回说明,离线核验通过,尚未真实模型复测。该试验不是零售专家评价,也不能估计整套领域工具的收益。

查看六份原始提案与审阅 ↗
真实 SDK 接入、Golden 与评分方法

单 Agent 原生工具循环在 F01 上完成修复前后各一次真实调用:修复来源语义后,模型能区分“条件分析可用”与“真实执行需要授权”。这是一个已知案例的前后观察,不是稳定提升证明。

Golden 与运行输入分开保存。评分分别检查证据与行动是否对应、数值可核验性、未知项、人工权利、复盘与无效保守;公平跨组比较不要求 B 生成 C 专有的工具轨迹。开发参考模式的 10/10 和均分 100 只属于内部回归。

07 / 验证范围

原型已可检查,
业务价值待验证。

已完成

  • 7,680 行基础合成 POS、10 类误判情境、8 类量化工具及批次扩展。
  • 固定决策卡、证据与行动边界、本地补证和决定历史。
  • 保存 B/C 探索性结果、SDK 前后记录及同工具角色试验。
  • 原项目记录 141 项软件测试通过,0 失败、0 跳过。

仍待验证

  • 真实经营数据、零售或外贸从业者任务测试、效率与 ROI。
  • 来源真实性、身份认证、正式审批及跨设备多人协作。
  • 外贸到岸成本、汇率、起订量、补货周期和资金占用适配。
  • 独立未见案例上的稳定性、完整四组比较与多 Agent 的额外收益。

软件测试通过、合成数值核对和原型可操作,分别证明其覆盖范围内的行为;不能替代真实业务结果或任职经历。

04 / 我的贡献

定义业务问题,
推动产品实现。

我定义了销售、商品结构、损耗、预算与促销的业务范围,确定方案比较、数值复算、补证与复盘的产品要求,并将选品备货与外贸经营连接成完整的作品主线。与 AI 协作完成代码、数据、测试和文档。

项目说明:独立开发的能力作品,页面使用零售模拟数据与已保存结果;与外贸 Agent 分别运行。跨境成本与采购条件的适配详见技术资料。