一组具有代表性的 B2B 线索发现情境,展示 AI 如何从典型业务交流中识别值得人工核实的销售机会。
库存既缺又积压?零售企业引入 AI 预测前必须做的功课
围绕零售库存规划的 AI 预测选型场景,分析商品规划负责人应如何先建立人工预测准确性基线,再在相同数据上评估 AI 方案的精度提升,不为黑箱模型的高精度牺牲可解释性。
以下是一个典型场景演示,用于说明产品的判断逻辑,不代表真实客户案例、客户证言、合同、收入结果或转化数据。
01场景描述
02Signal 判断
03可信度与优先级
04人工下一步
判断时关注的线索
- 人工预测缺货率和滞销率同时双高
- SKU 数量增长超过人工经验可覆盖范围
- 促销活动前后的预测偏差显著放大
- 补货计划频繁需要紧急调整
典型场景演示。 本文用于解释业务信号的判断与人工核实方法,不代表真实客户、对话、合同、收入结果或转化数据。
具体业务情境
你是商品规划负责人。公司的库存管理正在陷入一个尴尬的循环:热销品频繁缺货——不是因为采购预算不够,而是因为预测偏低,备货不足;与此同时,部分长尾 SKU 的周转天数居高不下——不是因为产品不好,而是因为预测偏高,采购过量。缺货和滞销并存,库存周转率一直在恶化。
目前的预测流程是:每个品类负责人根据自己对该品类的经验、最近几周的销售趋势、以及即将到来的促销计划,手工填写下一周期的需求预测。这套方式在 SKU 数量较少、品类相对集中的时候勉强能维持。但随着品类扩张和 SKU 数量增长——从几百个增长到数千个——人工经验已经无法覆盖所有商品的预测粒度。品类的预测偏差开始分化:高频爆品的预测偏低,长尾慢品的预测偏高,季节性和促销驱动品的预测几乎每次都偏差巨大。
IT 部门提议引入 AI 驱动需求预测,财务部门支持——因为他们希望降低库存持有成本。你的挑战是:在引入 AI 之前,你有没有办法证明现在的人工预测到底有多不准?如果不能建立人工预测的基线,你就无法衡量 AI 带来的实际改进——也无法解释 AI 预测什么时候该信、什么时候该人工覆盖。
为什么先建基线比选模型更重要
在 AI 预测的选型过程中,最常见的错误是跳过基线直接比较模型精度。
没有基线,就没有改进的度量。 假设候选 AI 方案在测试集上做到了某个程度的预测精度——这个数字是高了还是低了?你无法判断,因为你不知道人工预测在同样的测试集上是什么水平。如果人工预测的精度实际上与 AI 方案接近,那么引入 AI 的巨大迁移成本——数据整理、系统集成、团队培训——可能并不划算。反过来,如果人工预测在特定品类或季节上的偏差远超预期,AI 方案的改进空间就可能很大。但无论哪种情况,你都需要先测出人工基线。
没有基线,就没有“该信谁”的判断规则。 即使引入了 AI 预测,在实际运营中仍然需要保留人工覆盖机制——这是共识。但什么时候该覆盖、什么时候该信模型?如果你知道人工预测在促销品的偏差方向和幅度,你就可以设定一条规则:当 AI 预测与人工预测的偏差超过一个阈值时触发审核,否则默认采纳 AI。如果不知道人工在哪个场景下偏哪边,你就没有规则可以设。
基线的另一个价值:暴露数据质量问题的来源。 在建立人工预测基线的过程中,你需要拉出历史人工预测值和实际销售值做对比。这个对比本身会暴露很多数据问题:促销期间的实际销售是不是受库存限制被压缩了(缺货导致销量看起来低,但实际上需求更高)?历史数据中是否记录了促销事件的时间和力度?新品的预测依据是什么——是类比老品还是有独立的判断逻辑?在你能回答这些问题之前,任何 AI 模型都是在垃圾数据上训练。
先核实哪些证据
在评估任何 AI 方案之前,先完成以下七项数据核实:
-
历史人工预测的准确性测量。 拉出过去四个季度所有 SKU 的人工预测值和对应周期的实际销售值。计算关键指标——按 SKU 维度、按品类维度、按时间维度(促销周 vs 非促销周、季初 vs 季末)。不要只看一个总体的 MAPE(平均绝对百分比误差),那个总体平均值可以掩盖巨大的品类间差异。画出每个品类的预测偏差分布——哪些品类系统性高估、哪些系统性低估、哪些偏差波动巨大。
-
缺货对历史销售数据的干扰。 历史销售数据不等于历史需求数据——如果某个 SKU 在某个周期缺货了,它的实际销售值被人为压低了。在建立基线时,需要标记出缺货期间,对这些期间的数据做需求归因处理——即估算如果不缺货销量应该是多少。如果不做这一步,你用缺货期间的销量当作需求,AI 模型会学到“这个 SKU 需求低”的错误结论——形成自我实现的预测循环。
-
促销事件的记录完整性。 促销是需求预测的最大干扰源。检查历史数据中促销事件的记录情况——促销开始和结束日期、折扣力度、促销渠道、是否参与平台大促活动。如果促销记录不完整或格式不一致,促销对需求的影响就无法被模型学习。先完善促销事件的数据字典,再训练模型。
-
季节性与外部因素的识别。 不同品类有不同的季节性模式——羽绒服和凉鞋的旺季是相反的。但除了自然的季节性外,还有外部事件的影响——天气异常、竞品促销、品类趋势变化。梳理出每个品类的已知季节性和已知外部影响因子。如果这些因子没有被标记在数据中,你需要在特征工程中手动补上。
-
SKU 生命周期阶段。 一个上市三个月的新品和一个上市三年的成熟品——它们的需求模式完全不同。新品的需求在爬坡期、历史数据少、波动大;成熟品的需求相对稳定、历史数据充足。在建立基线时,需要按 SKU 生命周期阶段分组测量——不能把新品和老品的预测精度混在一起算平均。
-
现有补货系统的数据接口。 AI 预测的最终输出需要进入补货系统才能产生库存决策。检查现有补货系统接收预测数据的格式、频率和接口限制。如果补货系统只能接收周级别的预测而 AI 方案输出的是日级别,那么粒度对齐就是一个实施障碍。如果补货系统不接受概率预测(只接受点预测),那么 AI 方案的概率输出能力就暂时用不上。
-
人工预测员的判断逻辑。 在淘汰人工预测之前,先理解人工预测员是怎么做判断的——他们看什么数据、依赖什么经验规则、在什么情况下会调整公式计算结果。这些隐性知识是 AI 建模的重要输入。如果直接替换人工而不保留这些判断逻辑,你可能会丢失模型无法从历史数据中学到的业务因果关系。
人工下一步
基线建立后,按三步走:
第一,用基线确定 AI 的切入品类和场景。 不是所有品类都需要 AI——对于那些人工预测已经比较准、波动小的品类,AI 的增量价值有限。用基线数据画一个四象限:横轴是预测难度(人工偏差大小),纵轴是业务重要性(销售额或毛利贡献)。优先在“高难度 × 高重要”象限引入 AI——这部分是 AI 投入产出比最高的区域。对于“低难度 × 低重要”象限,维持人工预测即可,不值得为这些 SKU 支付 AI 的系统迁移成本。
第二,在相同数据上做 AI 与人工的公平对比。 使用相同的时间窗口和相同的评估指标,分别计算人工预测和候选 AI 方案的预测精度。但不止看总体精度——要看品类维度和时间维度的细分对比:AI 在哪些品类上显著优于人工、在哪些品类上反而更差?AI 在促销期间的预测是否比人工更稳健?如果 AI 在促销品的预测上仍然偏差大,那么问题可能出在促销数据的记录质量上,而非模型本身。
第三,设定人工覆盖规则。 基于对比结果,设计一套覆盖规则:在什么条件下采用 AI 预测、在什么条件下触发人工审核、在什么条件下以人工预测为准。规则的参数——偏差阈值、品类范围、时间条件——从对比数据中推导,不为拍脑袋。上线后持续追踪人工覆盖的发生频率和覆盖后的预测准确度变化,如果覆盖频率持续升高,说明 AI 方案的适用场景可能被高估了。
不能从群消息确认什么
群里可能有人说“XX 公司用了 YY 方案效果好”“某个开源模型在 Kaggle 零售预测比赛上排名很高”“直接买一个现成的预测 API 就行”——这些是方向参考,不是你的选型依据。群消息不能确认以下任何一项:
- 你的历史销售数据中缺货干扰的程度
- 你的促销数据是否完备到可以用于模型训练
- 你的品类中人工预测的实际偏差水平
- 候选 AI 方案在你的数据上比人工预测好多少
- 在哪个品类和场景下 AI 预测不可信需要人工介入
上述每一项都必须来自你自己的历史数据分析和人工预测基线测量。AI 预测选型的核心问题不是“哪个模型最先进”,而是“在你的数据、你的品类、你的运营约束下,AI 能比现状好多少且好在哪里”。回答这个问题不需要 AI 厂商的演示——它需要你先把人工预测的账算清楚。
本文为业务场景演示,旨在说明零售企业 AI 需求预测选型中的典型证据核实与决策顺序。文中不涉及具体企业名称、AI 厂商品牌、合同金额、预测精度数据或结果承诺。实际操作请以企业实际销售数据、系统能力及采购审批流程为准。
常见问题
AI 预测比人工预测好在哪,是不是精度一定更高?
不一定。AI 预测的真正优势不在于'一定比人准',而在于'一致性'和'可规模化'。一个有经验的买手可能对他熟悉的品类预测很准,但他的判断难以复制到新品类或新市场——而且他在疲劳、时间紧迫或信息不全时的判断质量会波动。AI 模型不会疲劳,但它的精度上限取决于训练数据的质量和特征的完备性。如果历史数据中促销事件的记录不全、缺货期间的销量被人为压缩在数据中表现为'低需求'而非'缺货',那么任何 AI 模型都会学到错误的模式。所以第一步不是比谁更准——而是比谁的预测偏差可以追溯原因。
要不要追求精度最高的模型?
不一定。在一定精度水平之上,可解释性比额外的精度提升更有价值。如果一个模型告诉你'下个月这个 SKU 要备多少件'但不告诉你为什么,当预测出错时你无法判断是数据问题、特征遗漏还是模型局限——你只能盲目调整库存。而一个可解释的模型可以告诉你'因为去年同期这个 SKU 有促销而今年没有,所以预测下调了某个比例'——这样即使预测不准,你也能决定是否人工覆盖。在实际运营中,一个可解释且精度尚佳的模型比一个黑箱高精度模型更安全。